IQuest Research: новый метод интерпретации LLM — разложение весов при данных <1%
В отличие от SVD, где сингулярные векторы обычно плотные, SWD накладывает разреженность на каждое соединение, поэтому для вмешательства в поведение модели требуется меньше активных связей. В экспериментах на GPT-2, Qwen2.5 и Qwen3.5-27B новый метод достигал сопоставимой точности с обучаемыми базами, используя менее одного процента данных: если Transcoder требовал порядка миллиона токенов, SWD хватало нескольких тысяч. Метод протестирован на всех 48 матрицах внимания и MLP в GPT-2 Small, а также на моделях до 27 миллиардов параметров. Существует и полностью бесданная версия, которая минимизирует ошибку Фробениуса без калибровочных текстов.
Особенно важно, что полученные единицы проходят каузальные проверки: при сохранении только выбранных узлов способность решать задачу сохраняется, при удалении — падает. Например, в задаче GreaterThan несколько узлов оказались связаны с числами, годами и количествами, а направленное редактирование весов через один такой узел сдвигало ответ модели с «up» на «down» с минимальными побочными эффектами. По мнению авторов, SWD открывает путь к отслеживанию внутренних вычислений моделей без необходимости обучать новые вспомогательные сети.
Источник: www.qbitai.com
Поделиться