FID
Зачем это нужно? Человеческий глаз — плохой измеритель. Во-первых, он устает, во-вторых, мы легко обманываемся. Объективная численная метрика позволяет автоматически сравнивать десятки моделей и выбирать лучшую без длительной ручной проверки. FID коррелирует с восприятием больше, чем старые метрики вроде попиксельного сравнения, поэтому на него опираются исследователи.
Как это работает интуитивно? Возьмем нейросеть Inception, обученную распознавать тысячи объектов. Для каждого изображения она выдает вектор признаков — компактное описание содержимого. Представим, что все вектора реальных фотографий образуют облако в многомерном пространстве, и у сгенерированных — свое облако. FID измеряет расстояние между этими облаками, учитывая их форму, сдвиг и разброс. Если облака совпадают, значит, сгенерированные изображения статистически неотличимы от реальных. Чем меньше значение, тем лучше.
Пример из практики. Допустим, команда тренирует GAN для создания фотореалистичных портретов. Одна архитектура дает картинки, которые люди оценивают «вслепую» как настоящие, но у нее FID выше 30. Другая — немного размытые, но с FID 18. Метрика подсказывает, что вторая модель лучше отражает разнообразие и характерные черты лиц, хотя визуально разница не очевидна. Это помогает принять решение.
Вывод: FID — мощный инструмент, но не истина в последней инстанции. Он оценивает распределения, а не отдельные снимки, и может не замечать локальные артефакты. Однако именно благодаря таким метрикам прогресс в генерации изображений стал измеримым и воспроизводимым.
Поделиться