Масштабирование LLM: от одного чипа до ЦОДа. Глава 4. Тренировка трансформера
В главе рассматриваются четыре вида параллелизма, их сильные и слабые стороны, а также возможные комбинации. Анализ выполнен в предположении, что работа ведется внутри одного вычислительного кластера и учитываются только связи между ускорителями. Кроме того, введены обозначения, используемые в дальнейшем: D — размерность входных эмбеддингов, F — размерность скрытого MLP-слоя, на который приходится основная доля параметров и вычислений трансформера.
Источник: habr.com
Поделиться