Next token prediction
Зачем это важно? На первый взгляд задача выглядит тривиальной: угадать следующее слово. Но, обучаясь на миллиардах страниц текста, модель вынуждена усваивать грамматику, факты о мире, логические связи и стиль рассуждений. Так из простого угадывания вырастает способность писать сочинения, переводить языки, отвечать на вопросы и программировать.
Как это работает интуитивно? Представьте автоподстановку в смартфоне, но безмерно усовершенствованную. Когда вы печатаете «сегодня на улице», телефон подсказывает «хорошая погода». Языковая модель делает то же самое, однако учитывает весь предыдущий контекст и оценивает десятки тысяч возможных токенов. Она рассчитывает вероятность каждого варианта и выбирает наиболее вероятный. В отличие от телефона, модель опирается не на заученные фразы, а на внутренние «знания» о языке и мире, сформированные за время обучения.
Прикладной пример — автодополнение кода. Когда программист вводит имя функции, модель предсказывает аргументы, типы данных и даже логику тела. Это экономит часы рутинной работы и помогает тем, кто не помнит синтаксис наизусть.
Итак, next token prediction — простая идея, которая породила современную генеративную революцию. Многократное угадывание следующего токена на огромных данных приводит к тому, что выглядит как настоящее понимание языка и мира.
Поделиться