глоссарий

KL-дивергенция

KL-дивергенция

KL-дивергенция — это математическая мера того, насколько одно вероятностное распределение отличается от другого. Проще говоря, она показывает, насколько сильно наше предположение о событии расходится с тем, что происходит на самом деле. Это понятие лежит в основе многих алгоритмов машинного обучения, потому что позволяет моделям количественно оценивать ошибку своих предсказаний. Без неё было бы невозможно понять, где именно модель ошибается и как её улучшить.

Интуитивно KL-дивергенцию можно представить как «цену удивления». Если вы ожидали, что монетка выпадет орлом с вероятностью 50%, а она выпадает орлом в 90% случаев, ваше удивление велико. Дивергенция измеряет среднее количество лишней информации, которую приходится получать, когда вы используете приблизительное распределение вместо истинного. При этом мера несимметрична: расхождение от правды к приближению не равно расхождению от приближения к правде, что отражает асимметрию процесса обучения.

Классический пример — вариационные автокодировщики, модели для генерации изображений. Во время обучения сеть пытается сжать картинку в скрытое представление, а затем восстановить её. Чтобы скрытое пространство было упорядоченным, KL-дивергенция заставляет распределение этого представления приближаться к стандартному нормальному распределению. В результате модель учится создавать новые изображения, похожие на обучающие, без риска «зазубрить» данные.

Таким образом, KL-дивергенция — это не просто формула, а язык, на котором модели сообщают нам, насколько они уверены в своих оценках. Она помогает находить компромисс между точностью и сложностью, делая искусственный интеллект более гибким и интерпретируемым. Понимание этой меры открывает окно во внутреннюю механику современных нейросетей.