Attention transfer
Зачем это нужно? Обычная дистилляция знаний передаёт ученику только итоговые вероятности или признаки, но не объясняет, на чём основан вывод. Attention transfer добавляет к этому важный канал: ученик перенимает сам способ фокусировки. Это особенно полезно, когда ученик меньше и слабее учителя — он может достичь сопоставимой точности, извлекая из карт внимания то, что учитель считает существенным.
Как это работает на интуитивном уровне? Представьте опытного врача, который обучает стажёра. Просто сказать «диагноз — пневмония» недостаточно. Намного полезнее показать: «Обрати внимание на затемнение в нижней доле лёгкого и на характерный фон». Стажёр учится не столько запоминать ответы, сколько видеть важные признаки. Точно так же нейросеть-ученик получает от учителя не только ответ, но и карту значимости пикселей, токенов или временных шагов, и старается сделать свою карту похожей.
Прикладной пример: при распознавании объектов на фотографиях компактную сеть обучают с помощью большой предобученной модели. Учитель выделяет на изображении силуэт автомобиля, а ученик, подражая этой карте внимания, быстро учится игнорировать фон и шум. В результате маленькая модель достигает точности тяжёлой, но работает в десятки раз быстрее на мобильном устройстве.
Итог: attention transfer — это способ передать не только «что», но и «куда смотреть», что делает обучение более эффективным. Он помогает создавать быстрые и точные модели для реальных применений.
Поделиться