N-gram
Зачем это нужно? Большинство моделей ИИ не понимают текст как человек, но они отлично умеют работать со статистикой. N-gram позволяет уловить контекст и вероятности сочетаний слов: если в тексте часто встречается «горячий кофе», модель запоминает эту связь. Это база для многих систем автодополнения, проверки орфографии и машинного перевода, особенно в классических подходах, где не требуются огромные нейросети.
Как это работает интуитивно? Представьте, что вы читаете книгу, но запоминаете не смысл, а только пары или тройки соседних слов. Собирая такую статистику из миллионов книг, вы можете угадывать следующее слово: после «чёрный» скорее всего пойдёт «кофе» или «кот», а не «ракета». Чем больше n, тем длиннее контекст, который учитывается, но тем сложнее собрать достаточно примеров: последовательность из семи редких слов может вообще не встретиться ни разу.
Прикладной пример — клавиатура смартфона. Когда вы печатаете «я сегодня», система предлагает варианты «ел», «спал», «пойду». Она строит триграммы из ваших сообщений и общих текстов, считает, какое слово чаще всего следует за «я сегодня», и ставит самый вероятный вариант на первое место. Это тот же принцип, что и у поисковых систем при подсказках запроса.
Кратко: n-gram — простой и мощный инструмент, который позволяет ИИ работать с последовательностями без понимания смысла. Он ловит частотные закономерности языка, а его главный компромисс — баланс между длиной контекста и доступностью данных. Даже в эпоху сложных нейросетей n-gram остаётся полезным для быстрых и лёгких решений.
Поделиться