Multi-GPU inference
Зачем это нужно? Модели с сотнями миллиардов параметров не помещаются в память одной карты, даже 80 ГБ недостаточно. К тому же одна карта обрабатывает лишь один поток запросов — как один кассир. Поэтому приходится либо разрезать модель по слоям, либо распределять запросы между картами.
Есть два подхода. Первый — «конвейер»: модель делится на части, каждая карта отвечает за свой блок слоёв, данные идут по цепочке. Второй — «копии»: каждая карта хранит полную модель, но получает свой запрос. Для скорости чаще используют второй способ, для гигантских моделей — первый.
Пример — ChatGPT. Ваш запрос попадает не на один суперкомпьютер, а на пул из сотен видеокарт. Балансировщик отправляет его на свободную карту, а другие карты параллельно отвечают другим людям. Без этого одновременная работа миллионов была бы невозможна.
Итак, multi-GPU inference — мост между «слишком большой моделью» и «слишком многими пользователями». Технология требует тонкой настройки баланса памяти, скорости обмена и сложности кода, но именно она делает ИИ быстрым, доступным и масштабируемым — незаметной, но вездесущей частью жизни.
Поделиться