ИИ-дата-центры упираются в сеть: главный тормоз — не чипы
Показатели, озвученные на конференции Keysight World, подтверждают серьёзность проблемы. При обучении моделей компьютерного зрения GPU более 60% времени проводят в ожидании данных и коммуникациях, а на сами вычисления приходится лишь около 20%. В наиболее ресурсоёмких задачах с большими языковыми моделями 21% тренировок прерывается из-за сетевых сбоев. Каждая пятая попытка может стоить нескольких часов или даже дней расчётов. Усугубляет ситуацию скачок требований к сетевой ёмкости: вместо одной сетевой карты на узел теперь нужно восемь и более, а общий трафик вырос в 10–20 раз.
Традиционные механизмы балансировки, такие как ECMP, не справляются с одновременными потоками от тысяч GPU. Одни каналы перегружены, другие простаивают, а из-за «хвостовой задержки» страдает весь кластер. Новые методы балансировки повышают утилизацию полосы до 38%, а время обучения сокращают на 3%. В кластере на сто тысяч чипов эти проценты оборачиваются миллионами долларов экономии и неделями сокращения цикла разработки.
Индустрия поняла: тупое наращивание скоростей не решает проблему. Нужны умные механизмы управления потоками. Технологии LLR и CBFC призваны снизить задержки и предотвратить потери пакетов. LLR позволяет коммутатору самостоятельно обнаруживать и ретранслировать потерянные данные, сокращая восстановление до микросекунд. CBFC действует как сетевой регулировщик: передатчик подтверждает наличие буфера у получателя перед отправкой. В марте Keysight и Broadcom провели первую публичную демонстрацию этих технологий на скорости 800GE в рамках альянса Ultra Ethernet — шаг от лаборатории к реальным сетям.
Но даже самые продвинутые протоколы бесполезны без правильной проверки. По данным Keysight, 95% операторов считают критически важным тестирование на реальной рабочей нагрузке, однако на практике многие ограничиваются стандартными бенчмарками. Особенно недооценён сегмент Scale-Up — соединения внутри стойки, через которые идёт самый интенсивный обмен данными между GPU. Любая ошибка здесь снижает производительность всего кластера. С ростом восточно-западного трафика в десять раз в ближайшие пять лет прежние методы тестирования окончательно устареют.
В итоге сеть из вспомогательной подсистемы превращается в определяющий фактор. Если не выстроить сквозную систему мониторинга и управления трафиком, самые мощные чипы будут простаивать в ожидании данных. Дата-центрам придётся мыслить не в категориях железа, а в категориях сетевой физиологии — иначе ИИ-инфраструктура так и останется дорогой, но неэффективной.
Источник: www.tmtpost.com
Поделиться