Хранение данных стало главным вызовом для внедрения ИИ
новости
01.09.2026

Хранение данных стало главным вызовом для внедрения ИИ

Хранение данных стало главным вызовом для внедрения ИИ

Развитие ИИ столкнулось с узким местом — памятью и системами хранения. Нагрузка смещается с обучения на инференс: запросы в диалогах заставляют GPU пересчитывать уже знакомые данные. Самый ресурсоемкий элемент — кэш ключ-значение (KV Cache), хранящий промежуточные состояния. Его объем может достигать сотен гигабайт, превышая HBM на чипе. Когда видеопамять заполнена, новые запросы блокируются.

Отрасль ищет выход в сжатии кэша или переносе на дешевые носители — DRAM, SSD и распределенные хранилища. Проекты LMCache и Google Cloud Managed Lustre снижают задержки, но работают в пределах одного узла, создавая «острова» ресурсов. Распределенные системы из-за высоких задержек не участвуют в оперативной работе.

Компания Sugon (中科曙光) представила ParaCache, объединяющий четыре уровня памяти — HBM, DRAM, SSD и распределенное хранилище — в единый пул с динамическим планированием. Для SSD используется FlashNexus Neo, вдвое ускоряющий доступ. Для распределенного уровня изменены протоколы: добавление вместо перезаписи, облегченные блокировки, передача только изменений. Упреждающая выборка сокращает простои GPU.

Тесты показали: в многоходовых диалогах задержка первого токена упала на 89%, пропускная способность выросла в 26 раз. В реальном проекте TTFT снизилась на 77%, кэш-попадания — в 5,7 раза. Вместо закупки дорогих GPU оптимизация повышает эффективность существующего оборудования.

Роль хранилища меняется: KV Cache становится активом. При планировании ЦОД учитывают память, сеть и кэш. Для китайских вендоров это шанс — у них есть спрос и опыт. Но ParaCache не панацея: короткие запросы и транзакции выигрывают меньше. Главные бенефициары — многосессионные диалоги, RAG и агенты.

Источник: www.tmtpost.com