Weight streaming
Это критически важно: большие языковые модели содержат сотни миллиардов параметров и не помещаются в память одного процессора или видеокарты. Приходится постоянно перемещать гигабайты чисел, и скорость этих перемещений становится «бутылочным горлышком» — вычисления быстрее, чем успевают подгружаться веса. Weight streaming превращает память в бесперебойный конвейер, а не склад.
Интуитивно это работает как приготовление блюда из тысячи ингредиентов: обычно выкладывают всё на стол, но если стол мал, нужен помощник, который подаёт продукты ровно к нужному шагу. Так и нейросеть: каждый слой получает свои веса только тогда, когда начинает его обрабатывать.
Пример — генеративные модели вроде ChatGPT. При вопросе модель проходит через миллиарды параметров. Без потоковой подачи ответ занял бы минуты из-за загрузки слоёв с диска. С weight streaming система непрерывно подкачивает нужные числа, обрабатывает слои друг за другом и отвечает за пару секунд.
Итог: weight streaming «кормит» нейросеть её памятью маленькими порциями, преодолевая аппаратные ограничения. Эта незаметная технология позволяет огромным моделям работать на обычных компьютерах, делая ИИ быстрым и масштабируемым.
Поделиться