Overlapping chunks
Чтобы понять принцип, представьте, что вы читаете длинный свиток через узкое окошко. Окончание каждой порции вы запоминаете, а потом сдвигаете окно не на всю ширину, а на половину — так вы видите и уже знакомый хвост, и новый участок. Именно это и делает overlapping chunks: берёт последние, скажем, сто токенов предыдущего фрагмента и добавляет их к началу следующего. Стыки оказываются внутри контекста, а не на его границе.
Классический пример — обработка договора на пятьдесят страниц. Модель ИИ должна найти противоречия в разных разделах. Без перекрытия она прочитает раздел «Обязательства» и забудет, что было в разделе «Ответственность». С перекрытием каждый новый фрагмент содержит хвост предыдущего, и нейросеть «помнит» ключевые формулировки даже на большом документе. На практике перекрытие в 10–20% длины фрагмента почти устраняет потерю смысла.
Вывод прост: overlapping chunks — дешёвый и эффективный приём, который не даёт искусственному интеллекту терять нить рассуждения при работе с любыми длинными материалами.
Поделиться