ByteDance против дистилляции: сначала медленно, потом быстро
новости
15.08.2026

ByteDance против дистилляции: сначала медленно, потом быстро?

ByteDance против дистилляции: сначала медленно, потом быстро?

Основатель ByteDance (字节跳动) Чжан Имин, обычно избегающий публичности, неожиданно выступил на внутренней встрече команды Seed в конце июля. Он заявил, что компания не станет использовать дистилляцию как способ быстро улучшить свои модели, даже если это означает временное отставание от главных конкурентов в Китае. Почти сразу после этого появились новости о структурных переменах: ByteDance создала новый отдел «AI Data and Security», объединив более тысячи специалистов по данным, а также обсуждает обучение модели с параметрами свыше пяти триллионов — самой крупной из известных в Китае.

Под дистилляцией понимают метод, при котором более слабая модель учится на ответах сильной модели, как ученик, который сидит рядом с отличником и перенимает его решения. Это не пиратство в прямом смысле: веса и полные данные учителя не копируются, но такой подход позволяет заметно ускорить прогресс. В китайской индустрии дистилляция давно стала обычной практикой, однако западные компании видят в ней угрозу. Например, Anthropic обвиняла DeepSeek, Kimi и MiniMax в «промышленной» дистилляции своей модели Claude.

В ByteDance к этому методу относились настороженно еще с 2023 года, когда внутренние правила запретили использовать данные, сгенерированные GPT, для обучения своих моделей. Когда в январе 2025 года DeepSeek-R1 продемонстрировал мощь при скромных затратах, внутри Seed возникла дискуссия — не прибегнуть ли к дистилляции американских моделей. Идею отклонили на уровне руководства. Однако давление продолжало расти, особенно после появления Kimi K3, который почти вплотную приблизился к закрытым зарубежным флагманам. Теперь Чжан Имин сказал твердое «нет»: после его выступления в Seed якобы ввели запрет на дистилляцию открытых моделей и начали проверки на предмет нарушений.

Почему же компания, известная своей ставкой на «грубую силу», добровольно выбирает более медленный путь? Ответ лежит в корнях ByteDance. Ее первый продукт «Тоутяо» не был прорывным по форме, но успех принес алгоритм рекомендаций, который перевернул представление о новостных приложениях. Компания усвоила, что копирование чужих решений позволяет лишь догонять, но не обгонять. В случае с большими моделями дистилляция означает заимствование чужого «фундамента» и потерю возможности строить собственную мультимодальную архитектуру с нуля.

Вместо этого ByteDance делает ставку на данные, и здесь у нее явное преимущество. Десять лет работы платформ дали компании колоссальный объем реального пользовательского контента — текстов, видео, комментариев, поведенческих сигналов. Эти данные сложно воспроизвести, и они становятся главным сырьем для уникальной модели. По оценкам, уже в ближайшие годы качественные текстовые данные могут закончиться, поэтому контроль над собственным потоком данных превращается в стратегический ресурс.

Коммерческая сторона тоже проясняется. Чат-бот Doubao (豆包) уже собрал почти 382 миллиона активных пользователей в месяц и начинает монетизацию: появились платные подписки, а также комиссия с заказов, которые пользователи совершают через этот сервис. Видеогенератор Seedance, по слухам, приносит около двух миллиардов долларов годовой выручки. Вся эта конструкция — от базовой модели до прикладных сервисов — выстраивается в единый замкнутый цикл, где данные питают модели, а модели улучшают пользовательский опыт.

Пока ByteDance может проигрывать конкурентам в скорости развития языковых моделей, но она сознательно готова к этому. Ее цель — не просто выпустить очередную мощную нейросеть, а построить экосистему, в которой искусственный интеллект становится полноценным каналом для бизнеса. Это амбициозная ставка на «долгую игру», и успех в ней будет зависеть от того, сможет ли компания превратить свое терпение в технологическое и коммерческое лидерство, когда наступит время ускоряться.

Источник: www.tmtpost.com