глоссарий

Cross-entropy

Cross-entropy

Cross-entropy — это мера расхождения между предсказанным распределением вероятностей и истинным. В машинном обучении её используют как функцию потерь: чем меньше значение, тем точнее модель угадала ответ. Без чёткого численного сигнала нейросеть не понимает, насколько ошиблась и как менять веса. Перекрёстная энтропия стала стандартом для задач классификации, потому что напрямую связана с вероятностной природой моделей и даёт сильный градиент, в отличие от квадратичной ошибки.

Интуиция проста. Модель выдаёт вероятность для каждого варианта ответа. Если верный ответ получил 0,95, вклад в ошибку мал: −log(0,95) ≈ 0,051. Если модель уверенно ошиблась и дала правильному ответу 0,05, наказание велико: −log(0,05) ≈ 2,996. Логарифм почти не штрафует за хорошее угадывание, резко бьёт за самоуверенную ошибку, а умеренные сомнения (0,4) наказываются средне — это поощряет честную оценку неуверенности.

Пример: нейросеть классифицирует фото кота. Она выдала (кошка 0,8, собака 0,2), истинное распределение — (1,0). Cross-entropy = −[1·log(0,8) + 0·log(0,2)] = 0,223 — хороший результат. Если бы она выдала (0,05, 0,95), ошибка составила бы 2,996, и градиент резко исправил бы веса. При (0,6, 0,4) ошибка 0,511 — умеренный шаг коррекции.

Итого: cross-entropy — умная линейка для измерения несоответствия предсказаний и фактов. Она наказывает за излишнюю самоуверенность в неверных ответах и позволяет эффективно обучать современные классификаторы. Знать это понятие полезно каждому, кто изучает машинное обучение.