Long-tail distribution
Пример — книжный магазин. Несколько бестселлеров продаются тысячами, а тысячи книг — единицами. График продаж даёт крутой рост и длинный низкий «хвост». Парадокс: суммарная выручка хвоста нередко больше, чем у хитов. В интернете миллионы малоизвестных статей, песен и товаров вместе привлекают больше внимания, чем топ-десятка. Для ИИ это значит: нельзя игнорировать редкое лишь из-за его единичной частоты.
Классический случай — рекомендации в кино. Основные просмотры приходятся на популярное, но интересы зрителя часто лежат в хвосте: артхаус, старое кино, иностранные ленты. Если советовать только хиты, пользователь заскучает. Учёт хвоста даёт точные и неожиданные варианты, удерживает внимание и мешает «пузырю фильтров», когда человек видит лишь массово популярное.
Длинный хвост напоминает: реальные данные редко уравновешены. ИИ, честно работающий с редкими событиями, становится умнее и человечнее — замечает меньшинства, уникальные случаи, нестандартные запросы. Хорошая модель не гонится за средним, а уважает «хвост»; иначе она годится только для предсказуемого мира.
Поделиться