Global average pooling
Раньше использовали полносвязные слои: они расплющивали карты в огромный вектор, давая миллионы параметров, переобучение и ломкость — малое смещение объекта меняло активации. Усреднение не имеет обучаемых параметров, устойчиво к сдвигам и заставляет сеть искать паттерн по всему изображению, а не цепляться за яркие пиксели.
Интуитивно: каждая карта — чёрно-белая фотография, где яркие пиксели показывают найденные элементы (глаз, колесо, перо). Усреднение вычисляет среднюю яркость: если объект есть — балл высокий, нет — почти ноль. Так пространственная информация («где глаз») превращается в уверенность («есть ли глаз»).
Пример: классификация хаски и мопса. У хаски активируется карта вытянутой морды и ушей, у мопса — складок и носа. После усреднения сравниваются средние баллы. Благодаря этому можно построить тепловую карту внимания и объяснить, на что смотрела сеть.
В итоге глобальное усредняющее объединение уменьшает параметры, борется с переобучением и делает сеть понятнее. Оно стало стандартом в ResNet и GoogLeNet, давая выигрыш в надёжности за несколько строк кода.
Поделиться