IQuest Research: новый метод интерпретации LLM — разложение
новости
15.08.2026

IQuest Research: новый метод интерпретации LLM — разложение весов при данных <1%

IQuest Research: новый метод интерпретации LLM — разложение весов при данных <1%

Понимание внутреннего устройства больших языковых моделей традиционно требовало обучения дополнительной сети: методы вроде Transcoder или разреженных признаков сначала строили новое представление, приближающее поведение исходной модели, а затем анализировали его. Это дорого и создает риск, что исследователь изучает не саму модель, а ошибки замены. Исследователи из IQuest Research (至知研究院), Safe AI Forum, Оксфорда, Стэнфорда и Университета Цинхуа предложили другой путь — извлекать интерпретируемые единицы напрямую из уже обученных весов. Метод получил название Sparse Weight Decomposition (SWD): плотная матрица весов разлагается на две разреженные матрицы, а их общее промежуточное измерение образует узкие места-бутылочные горлышки, которые можно оценивать, удалять или модифицировать. Это похоже на организацию пересадочных узлов в плотной транспортной сети: каждый такой узел соединяет лишь небольшое число входов и выходов.

В отличие от SVD, где сингулярные векторы обычно плотные, SWD накладывает разреженность на каждое соединение, поэтому для вмешательства в поведение модели требуется меньше активных связей. В экспериментах на GPT-2, Qwen2.5 и Qwen3.5-27B новый метод достигал сопоставимой точности с обучаемыми базами, используя менее одного процента данных: если Transcoder требовал порядка миллиона токенов, SWD хватало нескольких тысяч. Метод протестирован на всех 48 матрицах внимания и MLP в GPT-2 Small, а также на моделях до 27 миллиардов параметров. Существует и полностью бесданная версия, которая минимизирует ошибку Фробениуса без калибровочных текстов.

Особенно важно, что полученные единицы проходят каузальные проверки: при сохранении только выбранных узлов способность решать задачу сохраняется, при удалении — падает. Например, в задаче GreaterThan несколько узлов оказались связаны с числами, годами и количествами, а направленное редактирование весов через один такой узел сдвигало ответ модели с «up» на «down» с минимальными побочными эффектами. По мнению авторов, SWD открывает путь к отслеживанию внутренних вычислений моделей без необходимости обучать новые вспомогательные сети.

Источник: www.qbitai.com