Mamba
Интуитивно это можно представить так: читая книгу, трансформер каждый раз листает назад все прочитанные страницы, чтобы связать их с новой. Mamba же ведёт краткий конспект в голове. Она сжимает ключевую информацию из всего прочитанного в компактное внутреннее состояние, а когда встречает новую страницу, обновляет этот конспект и использует его для ответа. При этом Mamba не перебирает историю заново, а делает вычисления постоянно — по мере поступления данных. Такой подход напоминает рекуррентные нейросети, но с хитрым механизмом избирательного внимания: модель сама решает, какую информацию сохранять, а какую забыть, в зависимости от текущей задачи.
Практический пример: нужно проанализировать многолетнюю историю котировок акций или сгенерировать код из миллиона строк. Трансформер часто «выдыхается» уже на нескольких тысячах токенов, а Mamba способна обрабатывать последовательности длиной в миллионы символов, не теряя нить рассуждений и не требуя сверхдорогих серверов. Это открывает путь к ИИ, который понимает целые книги, длинные видео или полные геномы. В итоге Mamba — не просто новый термин, а важный шаг к по‑настоящему масштабным и автономным системам, хотя для окончательного триумфа ей ещё нужно доказать себя в сложных задачах творчества и многослойного вывода.
Поделиться