глоссарий

Tensor parallel inference

Tensor parallel inference

Тензорный параллелизм ускоряет инференс нейросети, разбивая умножение матриц на части, которые одновременно считаются на разных GPU. В отличие от параллелизма данных, где каждая карта видит свою порцию примеров, здесь делится сама модель: вес матрицы разрезается, и каждый ускоритель считает свой столбец результата.

Зачем нужно: современные языковые модели содержат сотни миллиардов параметров — одна видеокарта не может даже загрузить их целиком или считает слишком долго. Тензорный параллелизм распределяет веса по нескольким GPU и позволяет получить ответ за то же время, что и на одной карте, но для модели в десять раз больше.

Как работает: матрица делится на вертикальные полосы. Каждая карта умножает свою полосу на тот же самый вектор и получает частичный результат. Затем операция AllReduce соединяет эти части — итог математически идентичен вычислению без разделения. Эквивалентность сохраняется на уровне отдельных слоёв, поэтому поведение модели не меняется.

Пример: модель на 100 млрд параметров не помещается в GPU с 80 ГБ. Берём четыре карты и распределяем веса между ними. При запросе «напиши стихотворение» каждая карта параллельно считает свою часть каждого слоя, обмениваясь данными. В итоге пользователь получает ответ за две секунды вместо двадцати, и доступен весь масштаб модели.

Итог: тензорный параллелизм — ключевой приём для запуска гигантских нейросетей на обычных серверах без потери скорости. Вместо «одна карта думает одна» — «четыре карты думают вместе, как одна». Именно так работают самые мощные коммерческие системы искусственного интеллекта.