глоссарий

N-gram

N-gram

N-gram — это последовательность из n подряд идущих элементов текста: слов, букв или даже символов. Например, для фразы «ИИ учится» биграммами (n=2) будут «ИИ учится», а триграммами (n=3) — «ИИ учится» и так далее. Проще говоря, это способ нарезать язык на короткие кусочки, которые можно посчитать и проанализировать.

Зачем это нужно? Большинство моделей ИИ не понимают текст как человек, но они отлично умеют работать со статистикой. N-gram позволяет уловить контекст и вероятности сочетаний слов: если в тексте часто встречается «горячий кофе», модель запоминает эту связь. Это база для многих систем автодополнения, проверки орфографии и машинного перевода, особенно в классических подходах, где не требуются огромные нейросети.

Как это работает интуитивно? Представьте, что вы читаете книгу, но запоминаете не смысл, а только пары или тройки соседних слов. Собирая такую статистику из миллионов книг, вы можете угадывать следующее слово: после «чёрный» скорее всего пойдёт «кофе» или «кот», а не «ракета». Чем больше n, тем длиннее контекст, который учитывается, но тем сложнее собрать достаточно примеров: последовательность из семи редких слов может вообще не встретиться ни разу.

Прикладной пример — клавиатура смартфона. Когда вы печатаете «я сегодня», система предлагает варианты «ел», «спал», «пойду». Она строит триграммы из ваших сообщений и общих текстов, считает, какое слово чаще всего следует за «я сегодня», и ставит самый вероятный вариант на первое место. Это тот же принцип, что и у поисковых систем при подсказках запроса.

Кратко: n-gram — простой и мощный инструмент, который позволяет ИИ работать с последовательностями без понимания смысла. Он ловит частотные закономерности языка, а его главный компромисс — баланс между длиной контекста и доступностью данных. Даже в эпоху сложных нейросетей n-gram остаётся полезным для быстрых и лёгких решений.