ByteDance против дистилляции: сначала медленно, потом быстро?
Под дистилляцией понимают метод, при котором более слабая модель учится на ответах сильной модели, как ученик, который сидит рядом с отличником и перенимает его решения. Это не пиратство в прямом смысле: веса и полные данные учителя не копируются, но такой подход позволяет заметно ускорить прогресс. В китайской индустрии дистилляция давно стала обычной практикой, однако западные компании видят в ней угрозу. Например, Anthropic обвиняла DeepSeek, Kimi и MiniMax в «промышленной» дистилляции своей модели Claude.
В ByteDance к этому методу относились настороженно еще с 2023 года, когда внутренние правила запретили использовать данные, сгенерированные GPT, для обучения своих моделей. Когда в январе 2025 года DeepSeek-R1 продемонстрировал мощь при скромных затратах, внутри Seed возникла дискуссия — не прибегнуть ли к дистилляции американских моделей. Идею отклонили на уровне руководства. Однако давление продолжало расти, особенно после появления Kimi K3, который почти вплотную приблизился к закрытым зарубежным флагманам. Теперь Чжан Имин сказал твердое «нет»: после его выступления в Seed якобы ввели запрет на дистилляцию открытых моделей и начали проверки на предмет нарушений.
Почему же компания, известная своей ставкой на «грубую силу», добровольно выбирает более медленный путь? Ответ лежит в корнях ByteDance. Ее первый продукт «Тоутяо» не был прорывным по форме, но успех принес алгоритм рекомендаций, который перевернул представление о новостных приложениях. Компания усвоила, что копирование чужих решений позволяет лишь догонять, но не обгонять. В случае с большими моделями дистилляция означает заимствование чужого «фундамента» и потерю возможности строить собственную мультимодальную архитектуру с нуля.
Вместо этого ByteDance делает ставку на данные, и здесь у нее явное преимущество. Десять лет работы платформ дали компании колоссальный объем реального пользовательского контента — текстов, видео, комментариев, поведенческих сигналов. Эти данные сложно воспроизвести, и они становятся главным сырьем для уникальной модели. По оценкам, уже в ближайшие годы качественные текстовые данные могут закончиться, поэтому контроль над собственным потоком данных превращается в стратегический ресурс.
Коммерческая сторона тоже проясняется. Чат-бот Doubao (豆包) уже собрал почти 382 миллиона активных пользователей в месяц и начинает монетизацию: появились платные подписки, а также комиссия с заказов, которые пользователи совершают через этот сервис. Видеогенератор Seedance, по слухам, приносит около двух миллиардов долларов годовой выручки. Вся эта конструкция — от базовой модели до прикладных сервисов — выстраивается в единый замкнутый цикл, где данные питают модели, а модели улучшают пользовательский опыт.
Пока ByteDance может проигрывать конкурентам в скорости развития языковых моделей, но она сознательно готова к этому. Ее цель — не просто выпустить очередную мощную нейросеть, а построить экосистему, в которой искусственный интеллект становится полноценным каналом для бизнеса. Это амбициозная ставка на «долгую игру», и успех в ней будет зависеть от того, сможет ли компания превратить свое терпение в технологическое и коммерческое лидерство, когда наступит время ускоряться.
Источник: www.tmtpost.com
Поделиться