Wasserstein distance
Термин так важен потому, что многие классические меры различия между вероятностными распределениями, например KL-дивергенция, ведут себя странно: они несимметричны, а когда распределения вообще не перекрываются, превращаются в бесконечность. Вассерштейн лишён этих недостатков. Он всегда конечен, симметричен и, главное, учитывает геометрию пространства: если два распределения слегка сдвинуты, расстояние будет небольшим, а не скачком в бесконечность. Это делает его надёжным компасом для машинного обучения.
Интуитивно это работает так. Пусть у вас есть распределение «холма» А и «холма» Б. Вы начинаете пересыпать песок из А в Б. У каждой песчинки есть масса и длина пути. Умножаете массу на расстояние, суммируете по всем песчинкам — получаете стоимость трансформации. Вассерштейн ищет оптимальный план перевозки, при котором эта суммарная стоимость минимальна. Чем ближе распределения друг к другу, тем меньше приходится таскать песок.
Классический пример — генерация изображений. Обучая нейросеть, мы сравниваем распределение сгенерированных картинок с распределением реальных фотографий. Если модель рисует размытые пятна, пересекающиеся с настоящими снимками лишь частично, KL-дивергенция может «зашкалить» и не дать обучаться. Расстояние Вассерштейна же плавно покажет, насколько картинки «недотянуты» по яркости или контурам, и как именно их стоит подправить.
Итог: это геометрически осмысленная, гладкая и универсальная мера близости распределений, которая активно применяется в generative-моделях и не только.
Поделиться