Overlapping chunks
глоссарий

Overlapping chunks

Overlapping chunks

Перекрывающиеся фрагменты, или overlapping chunks, — это способ разбить длинный текст на части так, чтобы соседние куски немного заходили друг на друга. Зачем так делать? У нейросетей есть жёсткий лимит на количество слов, которое они могут прочитать за раз. Если просто резать документ по этому лимиту, смысл на стыках потеряется: начало предложения останется в одном куске, а конец — в другом. Модель увидит обрывки и начнёт выдумывать.

Чтобы понять принцип, представьте, что вы читаете длинный свиток через узкое окошко. Окончание каждой порции вы запоминаете, а потом сдвигаете окно не на всю ширину, а на половину — так вы видите и уже знакомый хвост, и новый участок. Именно это и делает overlapping chunks: берёт последние, скажем, сто токенов предыдущего фрагмента и добавляет их к началу следующего. Стыки оказываются внутри контекста, а не на его границе.

Классический пример — обработка договора на пятьдесят страниц. Модель ИИ должна найти противоречия в разных разделах. Без перекрытия она прочитает раздел «Обязательства» и забудет, что было в разделе «Ответственность». С перекрытием каждый новый фрагмент содержит хвост предыдущего, и нейросеть «помнит» ключевые формулировки даже на большом документе. На практике перекрытие в 10–20% длины фрагмента почти устраняет потерю смысла.

Вывод прост: overlapping chunks — дешёвый и эффективный приём, который не даёт искусственному интеллекту терять нить рассуждения при работе с любыми длинными материалами.