глоссарий

MoE

MoE

Mixture of Experts (MoE) — архитектура нейросети, где вместо одного гигантского «мозга» работает команда узких специалистов, а маршрутизатор решает, к кому обратиться. Вместо активации всех параметров на каждый запрос включается лишь небольшая часть экспертов, экономя ресурсы. Это позволяет строить очень большие модели, остающиеся практичными.

Подход бьёт главное ограничение ИИ — конфликт масштаба и стоимости. Обычная модель требует полного пересчёта всей сети на запрос, а MoE добавляет экспертов без пропорционального роста затрат: для задачи нужны лишь несколько. Модель может быть огромной, но работать быстро и дёшево — платите только за нужных специалистов.

Интуитивно это больница: вместо врача-универсала — кардиолог, дерматолог, невролог. Медсестра (маршрутизатор) слушает жалобы и направляет к нужному специалисту. Так и в MoE: входные данные оценивает маршрутизатор и выбирает 2–3 лучших эксперта из сотен, их ответы взвешиваются и объединяются. Остальные спят, не тратя энергию.

Практический пример — машинный перевод. Эксперты специализируются на юридических текстах, разговоре, технике. Короткое сообщение другу активирует разговорных экспертов, контракт — юридических. Качество сравнимо с моделью вдвое большего размера, но при меньших затратах на серверы и электричество.

В итоге MoE — не алгоритм, а философия эффективного распределения усилий. ИИ становится умнее за счёт умного разделения труда, а не бесконечного наращивания «мышц». Это даёт мощные модели, способные работать на обычных видеокартах и даже смартфонах, приближая будущее, где ИИ повсюду, но не сжигает планету.