глоссарий

Attention

Attention

Attention — механизм в нейросетях, позволяющий выборочно сосредотачиваться на значимых фрагментах входных данных, вычисляя веса важности для каждого элемента. До его появления текстовые модели сжимали предложение в один вектор фиксированной длины, из-за чего терялись детали и связи между удалёнными словами. Attention решило эту проблему, разрешив модели в каждый момент обращаться напрямую к любому слову исходного контекста. Этот принцип лежит в основе трансформеров и больших языковых моделей, включая GPT.

Интуитивно это похоже на прожектор: при чтении фразы «Банк выдал кредит под залог недвижимости» для понимания слова «кредит» важен «банк», а для «недвижимости» — «залог». Технически модель строит для каждого слова три вектора: запрос, ключ и значение. Запросы «спрашивают» у ключей других слов, насколько те релевантны, оценки превращаются в вероятности, которые взвешивают значения. Так формируется контекст, обогащённый нужными деталями.

Классический пример — перевод английского «He saw her duck». Обрабатывая «saw», модель сопоставляет его с «He», а для «duck» выясняет по глаголу «saw», относится ли оно к птице или к действию «пригнуться». Без attention связь могла потеряться, и получилось бы «Он увидел её утку»; с механизмом система держит в фокусе всю фразу, перестраивая акценты для каждого нового слова перевода.

Итог: attention превратил нейросети из «чёрных ящиков», сжимающих данные, в гибкие системы, которые выборочно управляют фокусом — подобно тому, как человек переводит взгляд с одной детали на другую для понимания целого.