Кронекером по Фишеру: новый метод сжатия LLM учитывает связи
новости
17.08.2026

Кронекером по Фишеру: новый метод сжатия LLM учитывает связи параметров

Кронекером по Фишеру: новый метод сжатия LLM учитывает связи параметров

Сжатие больших языковых моделей (LLM) — обязательный этап на пути к их практическому использованию. Когда вычислительных ресурсов мало, модель нужно уменьшить так, чтобы она по-прежнему давала корректные ответы, а потери качества были минимальными. Чтобы понять, какие параметры можно отбросить, разработчики обращаются к матрице Фишера (FIM) — математическому объекту, который содержит информацию о важности каждого параметра и о том, как параметры взаимодействуют друг с другом.

Проблема в том, что у современных LLM матрица Фишера для каждого слоя чудовищно велика. Работать с ней напрямую невозможно ни по памяти, ни по времени вычислений. Поэтому многие исследователи идут на упрощение: они предполагают, что FIM диагональна, то есть параметры независимы. Такой подход резко сокращает объём требуемой памяти, но теряет корреляции между параметрами. А ведь именно эти корреляции часто определяют, как модель ведёт себя в нестандартных ситуациях.

Специалисты команды мультимодального ИИ в AIRI предложили метод, который не требует таких компромиссов. Их решение позволяет параметризовать полную недиагональную матрицу Фишера быстро, с минимальными вычислительными затратами, и при этом сохранить всю информацию о связях между параметрами. Ключевая идея — использовать кронекеровскую аппроксимацию, то есть представить большую матрицу как произведение нескольких небольших матриц. Это делает задачу практичной даже для очень больших слоёв.

Разработка основана на учёте кривизны второго порядка. Если упрощённые методы опираются только на диагональные элементы матрицы Фишера, то новый подход учитывает ещё и недиагональные члены, которые отвечают за взаимное влияние параметров. В результате сжатие становится более «ювелирным»: модель уменьшается без существенного ущерба для точности. Это особенно важно для деплоя LLM на устройствах с ограниченными ресурсами — от мобильной периферии до серверов с жёсткими бюджетами на память.

Источник: habr.com