KL-дивергенция
Интуитивно KL-дивергенцию можно представить как «цену удивления». Если вы ожидали, что монетка выпадет орлом с вероятностью 50%, а она выпадает орлом в 90% случаев, ваше удивление велико. Дивергенция измеряет среднее количество лишней информации, которую приходится получать, когда вы используете приблизительное распределение вместо истинного. При этом мера несимметрична: расхождение от правды к приближению не равно расхождению от приближения к правде, что отражает асимметрию процесса обучения.
Классический пример — вариационные автокодировщики, модели для генерации изображений. Во время обучения сеть пытается сжать картинку в скрытое представление, а затем восстановить её. Чтобы скрытое пространство было упорядоченным, KL-дивергенция заставляет распределение этого представления приближаться к стандартному нормальному распределению. В результате модель учится создавать новые изображения, похожие на обучающие, без риска «зазубрить» данные.
Таким образом, KL-дивергенция — это не просто формула, а язык, на котором модели сообщают нам, насколько они уверены в своих оценках. Она помогает находить компромисс между точностью и сложностью, делая искусственный интеллект более гибким и интерпретируемым. Понимание этой меры открывает окно во внутреннюю механику современных нейросетей.
Поделиться