Хранение данных стало главным вызовом для внедрения ИИ
Отрасль ищет выход в сжатии кэша или переносе на дешевые носители — DRAM, SSD и распределенные хранилища. Проекты LMCache и Google Cloud Managed Lustre снижают задержки, но работают в пределах одного узла, создавая «острова» ресурсов. Распределенные системы из-за высоких задержек не участвуют в оперативной работе.
Компания Sugon (中科曙光) представила ParaCache, объединяющий четыре уровня памяти — HBM, DRAM, SSD и распределенное хранилище — в единый пул с динамическим планированием. Для SSD используется FlashNexus Neo, вдвое ускоряющий доступ. Для распределенного уровня изменены протоколы: добавление вместо перезаписи, облегченные блокировки, передача только изменений. Упреждающая выборка сокращает простои GPU.
Тесты показали: в многоходовых диалогах задержка первого токена упала на 89%, пропускная способность выросла в 26 раз. В реальном проекте TTFT снизилась на 77%, кэш-попадания — в 5,7 раза. Вместо закупки дорогих GPU оптимизация повышает эффективность существующего оборудования.
Роль хранилища меняется: KV Cache становится активом. При планировании ЦОД учитывают память, сеть и кэш. Для китайских вендоров это шанс — у них есть спрос и опыт. Но ParaCache не панацея: короткие запросы и транзакции выигрывают меньше. Главные бенефициары — многосессионные диалоги, RAG и агенты.
Источник: www.tmtpost.com
Поделиться