ИИ-дата-центры упираются в сеть: главный тормоз — не чипы
новости
17.08.2026

ИИ-дата-центры упираются в сеть: главный тормоз — не чипы

ИИ-дата-центры упираются в сеть: главный тормоз — не чипы

Ещё недавно мощность ИИ-инфраструктуры оценивали по числу GPU и их вычислительной производительности. Но к 2026 году логика гонки изменилась: когда тренировочные кластеры выросли до десятков тысяч и даже ста тысяч чипов, решающим фактором оказалась сеть. Это как шоссе: можно расширить полосы, но если затор на пункте оплаты, движение всё равно встанет. Сеть стала тем самым затором для ИИ-дата-центров — к такому выводу приходит китайский отраслевой обзор (оригинальное название — AI时代的数据中心,正在被网络“卡脖子”).

Показатели, озвученные на конференции Keysight World, подтверждают серьёзность проблемы. При обучении моделей компьютерного зрения GPU более 60% времени проводят в ожидании данных и коммуникациях, а на сами вычисления приходится лишь около 20%. В наиболее ресурсоёмких задачах с большими языковыми моделями 21% тренировок прерывается из-за сетевых сбоев. Каждая пятая попытка может стоить нескольких часов или даже дней расчётов. Усугубляет ситуацию скачок требований к сетевой ёмкости: вместо одной сетевой карты на узел теперь нужно восемь и более, а общий трафик вырос в 10–20 раз.

Традиционные механизмы балансировки, такие как ECMP, не справляются с одновременными потоками от тысяч GPU. Одни каналы перегружены, другие простаивают, а из-за «хвостовой задержки» страдает весь кластер. Новые методы балансировки повышают утилизацию полосы до 38%, а время обучения сокращают на 3%. В кластере на сто тысяч чипов эти проценты оборачиваются миллионами долларов экономии и неделями сокращения цикла разработки.

Индустрия поняла: тупое наращивание скоростей не решает проблему. Нужны умные механизмы управления потоками. Технологии LLR и CBFC призваны снизить задержки и предотвратить потери пакетов. LLR позволяет коммутатору самостоятельно обнаруживать и ретранслировать потерянные данные, сокращая восстановление до микросекунд. CBFC действует как сетевой регулировщик: передатчик подтверждает наличие буфера у получателя перед отправкой. В марте Keysight и Broadcom провели первую публичную демонстрацию этих технологий на скорости 800GE в рамках альянса Ultra Ethernet — шаг от лаборатории к реальным сетям.

Но даже самые продвинутые протоколы бесполезны без правильной проверки. По данным Keysight, 95% операторов считают критически важным тестирование на реальной рабочей нагрузке, однако на практике многие ограничиваются стандартными бенчмарками. Особенно недооценён сегмент Scale-Up — соединения внутри стойки, через которые идёт самый интенсивный обмен данными между GPU. Любая ошибка здесь снижает производительность всего кластера. С ростом восточно-западного трафика в десять раз в ближайшие пять лет прежние методы тестирования окончательно устареют.

В итоге сеть из вспомогательной подсистемы превращается в определяющий фактор. Если не выстроить сквозную систему мониторинга и управления трафиком, самые мощные чипы будут простаивать в ожидании данных. Дата-центрам придётся мыслить не в категориях железа, а в категориях сетевой физиологии — иначе ИИ-инфраструктура так и останется дорогой, но неэффективной.

Источник: www.tmtpost.com