Категориальное распределение
Это понятие лежит в основе многих алгоритмов ИИ. Любая задача классификации — определение спама, породы собаки по фото, следующего слова в тексте — сводится к вычислению категориального распределения. Модель оценивает вероятности для всех возможных категорий, а затем выбирает наиболее вероятный вариант или, если нужно, случайную категорию.
Интуитивно это работает как колесо фортуны с секторами разного размера: чем больше сектор, тем выше вероятность выпадения. При многократных повторениях частоты исходов примерно соответствуют размерам секторов. В машинном обучении модель подстраивает вероятности так, чтобы правильные ответы получали наибольшую долю.
Пример — спам-фильтр почты. Для каждого письма он строит распределение с тремя исходами: «спам», «обычное», «социальное». По тексту фильтр назначает вероятности, например 0,85, 0,10 и 0,05. Затем автоматически выбирается самый вероятный вариант, а если вероятности близки — письмо помечается сомнительным.
Коротко: категориальное распределение — это базовый язык для описания дискретного выбора. Понимание этого термина помогает увидеть, что даже сложные нейросети просто работают с вероятностями вариантов, аккуратно превращая данные в осмысленный выбор.
Поделиться