После вычислений — данные: новый дефицит ИИ меняет расстанов
новости
17.08.2026

После вычислений — данные: новый дефицит ИИ меняет расстановку сил в контент-индустрии?

После вычислений — данные: новый дефицит ИИ меняет расстановку сил в контент-индустрии?

В августе 2026 года на китайском фондовом рынке неожиданно взлетели акции компаний, владеющих библиотеками контента и данными для искусственного интеллекта. Инвесторы бросились скупать бумаги издательств и сервисов данных после того, как заговорили о новой проблеме ИИ: моделям становится нечем питаться. Если раньше главным ресурсом считались вычислительные мощности, то теперь все чаще говорят о нехватке качественных текстов для обучения.

Прогнозы выглядят тревожно для всей отрасли. По оценкам Epoch AI, запасы высококачественных публичных текстовых данных могут иссякнуть уже в конце этого десятилетия. Глава Национального управления данных Китая Лю Лихун на промышленной выставке в Тяньцзине сформулировал мысль точно: ИИ работает как очистной завод, и его эффективность зависит не от размера печи, а от качества руды. С каждым годом модели становятся больше, параметров — все больше, а значит, им нужно все больше данных. Если GPT-2 обучалась на десятках гигабайт текста, то современные модели поглощают уже сотни гигабайт, а переход к мультимодальности требует совсем других объемов. Например, для полезных роботов нужно около десяти миллионов часов данных о реальных взаимодействиях, но в Китае сейчас есть лишь пятьсот тысяч часов — дефицит более чем в девяносто девять процентов.

Еще один риск — самоотравление моделей. Когда созданный ИИ контент попадает в интернет и затем используется для обучения новых алгоритмов, модели могут постепенно терять связь с реальностью. Ученые называют это коллапсом модели: словно копия с копии, каждое следующее поколение становится все более блеклым. Впрочем, проблема решаема — если аккуратно фильтровать данные и не забывать подмешивать «человеческий» контент. Технологические гиганты уже охотятся за чистыми источниками. Так, компания Anthropic запустила секретный проект «Панама» по массовому сканированию книг, а ранее использовала пиратскую библиотеку LibGen для обучения своих моделей. Авторы подали в суд, и в итоге компания согласилась выплатить полтора миллиарда долларов — крупнейшее соглашение по авторским правам в истории США. Однако суд в Калифорнии не стал создавать обязательный прецедент: он лишь заметил, что сканирование законно купленных книг для внутреннего обучения может считаться добросовестным использованием в американском праве. Для других стран этот аргумент не работает.

На этом фоне начинается тихая перестройка рынка. Крупные издатели, например HarperCollins и Taylor & Francis, заключают с технологическими компаниями соглашения на использование своих архивов для обучения ИИ. Но не стоит ждать, что все владельцы контента внезапно разбогатеют. У AI-компаний есть разные способы использования текстов: одно дело — обучать модель, другое — просто подключать книги к системе поиска ответов. Цены и правовые риски тут совершенно разные. Сегодня большинство сделок предполагает лишь использование контента для уточнения ответов, а не для обучения, так что продать свою библиотеку по цене золота удастся немногим. В Китае к тому же запутанная ситуация с правами: у издательств часто нет прав на тексты для обучения ИИ, их нужно получать у авторов, а многие авторы старых книг просто недоступны.

При этом нейросети вовсе не обязаны скупать библиотеки. Они могут генерировать синтетические данные, использовать более эффективные архитектуры, подключать внешние источники знаний на лету и нанимать людей для разметки специфических данных. Поэтому настоящая ценность — не в старых архивах, а в потоке нового качественного контента, особенно профессионального, отраслевого и уникального. Те, кто способен постоянно создавать такой контент и превращать его в проверенные, чистые данные, и получат реальное преимущество. Обычные же массовые тексты, древние книги и энциклопедии вряд ли станут дефицитом. Так что «голод данных» — это скорее про качество и эксклюзивность, а не про количество напечатанных страниц.

Источник: www.tmtpost.com