Needle in a haystack
Почему это важно? Современные нейросети умеют обрабатывать целые книги за раз, но на практике, если спросить модель о конкретном предложении на пятидесятой странице, она может его проигнорировать. Это критично для юристов, аналитиков и медиков, работающих с объёмными документами. Если модель неспособна вытащить редкую строчку, доверие к ней падает.
Как работает интуитивно? Представьте, что вы читаете двухсотстраничный отчёт, но ищете только одно число — процент брака. Человек быстро скользит глазами, отбрасывая всё лишнее. Нейросеть же, подобно рассеянному читателю, сильнее реагирует на начало и конец текста, а середина для неё «замыливается». Поэтому исследователи специально вставляют «иголку» — случайный факт в середину длинного контекста, чтобы проверить, заметит ли модель его среди «сена» из остальных слов.
Пример: в одной из тестовых задач модели дают огромный лог-файл на сто тысяч строк, где в строке 77 777 спрятана фраза «секретный ключ: ABC123». Хорошая модель должна найти ключ и ответить на вопрос о нём. Ранние версии ИИ терялись, но современные, с улучшенным механизмом внимания, справляются всё лучше. Этот тест стал бенчмарком для разработчиков.
Вывод: «иголка в стоге сена» — тест на фокусировку.
Поделиться