Longformer
Главная идея — сделать внимание умным. Читатель не смотрит на все слова страницы одновременно: он видит соседние слова и ключевые места — заголовок, имя героя, повторяющийся термин. Longformer для каждого слова вычисляет внимание только к ближайшим словам в окне (например, 15 слева и справа). Это дёшево. Но чтобы не потерять общий смысл, модель выделяет несколько «глобальных токенов» — например, [CLS] в начале текста, — которые притягивают внимание всей последовательности. В итоге сложность линейна, а не квадратична: сколько слов, столько операций. Поэтому Longformer обрабатывает документы в десятки раз длиннее обычных моделей.
Представьте, что юристу нужно найти противоречия в двух договорах по сто страниц каждый. Longformer может прочесть оба документа целиком за один проход, учитывая связи между далёкими пунктами, и подсветить, где условия меняются с «обязан» на «не вправе». Раньше приходилось разбивать текст на куски и собирать выводы вручную — теперь модель видит всё сразу и даёт точный анализ. В итоге Longformer — это шаг к тому, чтобы искусственный интеллект понимал не только короткие реплики, но и целые книги, научные работы и юридические акты. Это не магия, а инженерное решение, которое делает обработку длинных текстов быстрой и доступной.
Поделиться