глоссарий

Longformer

Longformer

Longformer — это архитектура нейросетей для обработки естественного языка, разновидность трансформера, которая умеет работать с очень длинными текстами — до нескольких тысяч слов. Обычные трансформеры (например, BERT) читают текст не целиком, а по кусочкам, потому что с каждым новым словом объём вычислений растёт в квадрате. Если в тексте тысяча слов, им нужно миллион операций внимания — это медленно и требует огромной памяти. Поэтому классические модели ограничены абзацем или небольшим фрагментом, а целую книгу или судебный иск обработать не могут. Longformer решает эту проблему кардинально.

Главная идея — сделать внимание умным. Читатель не смотрит на все слова страницы одновременно: он видит соседние слова и ключевые места — заголовок, имя героя, повторяющийся термин. Longformer для каждого слова вычисляет внимание только к ближайшим словам в окне (например, 15 слева и справа). Это дёшево. Но чтобы не потерять общий смысл, модель выделяет несколько «глобальных токенов» — например, [CLS] в начале текста, — которые притягивают внимание всей последовательности. В итоге сложность линейна, а не квадратична: сколько слов, столько операций. Поэтому Longformer обрабатывает документы в десятки раз длиннее обычных моделей.

Представьте, что юристу нужно найти противоречия в двух договорах по сто страниц каждый. Longformer может прочесть оба документа целиком за один проход, учитывая связи между далёкими пунктами, и подсветить, где условия меняются с «обязан» на «не вправе». Раньше приходилось разбивать текст на куски и собирать выводы вручную — теперь модель видит всё сразу и даёт точный анализ. В итоге Longformer — это шаг к тому, чтобы искусственный интеллект понимал не только короткие реплики, но и целые книги, научные работы и юридические акты. Это не магия, а инженерное решение, которое делает обработку длинных текстов быстрой и доступной.