глоссарий

Multi-GPU inference

Multi-GPU inference

Multi-GPU inference — это способ заставить несколько видеокарт одновременно выполнять работу нейросети при ответе пользователю. В отличие от обучения, инференс должен быть быстрым: каждая миллисекунда задержки тормозит сервисы.

Зачем это нужно? Модели с сотнями миллиардов параметров не помещаются в память одной карты, даже 80 ГБ недостаточно. К тому же одна карта обрабатывает лишь один поток запросов — как один кассир. Поэтому приходится либо разрезать модель по слоям, либо распределять запросы между картами.

Есть два подхода. Первый — «конвейер»: модель делится на части, каждая карта отвечает за свой блок слоёв, данные идут по цепочке. Второй — «копии»: каждая карта хранит полную модель, но получает свой запрос. Для скорости чаще используют второй способ, для гигантских моделей — первый.

Пример — ChatGPT. Ваш запрос попадает не на один суперкомпьютер, а на пул из сотен видеокарт. Балансировщик отправляет его на свободную карту, а другие карты параллельно отвечают другим людям. Без этого одновременная работа миллионов была бы невозможна.

Итак, multi-GPU inference — мост между «слишком большой моделью» и «слишком многими пользователями». Технология требует тонкой настройки баланса памяти, скорости обмена и сложности кода, но именно она делает ИИ быстрым, доступным и масштабируемым — незаметной, но вездесущей частью жизни.