глоссарий

Diffusion Transformer

Diffusion Transformer

Диффузионный трансформер — архитектура ИИ, объединяющая диффузионные модели (постепенное превращение шума в картинку) и трансформеры (поиск закономерностей в данных). Это нейросеть, которая создаёт изображения, видео или 3D-объекты, шаг за шагом убирая случайный «мусор» и анализируя процесс через механизм внимания, как в GPT.

Раньше диффузионные модели строились на свёрточных сетях: они хорошо работают с пикселями, но хуже видят глобальные связи. Трансформеры видят картину целиком и понимают, как далёкие фрагменты влияют друг на друга. Их объединение дало более качественную и гибкую генерацию, особенно для больших разрешений и сложных сцен. Эта архитектура лежит в основе многих современных моделей генерации изображений.

Интуитивно это похоже на работу скульптора с глыбой мрамора. Берётся «глыба» — чистый случайный шум. Нейросеть с помощью трансформера оценивает заготовку целиком и решает, какие части больше похожи на будущий объект. На каждом шаге шум ослабляется, трансформер снова окидывает взглядом всё изображение и уточняет детали. Так, от размытой массы до чёткой картинки, проходит сотня шагов.

Например, по запросу «космический корабль в стиле киберпанк над неоновым городом» модель сначала создаёт шум, затем постепенно проявляет формы корабля, зданий, огней, а механизм внимания следит, чтобы корабль соответствовал описанию, а город не сливался. Получается осмысленная сцена, а не просто красивая картинка.

Итог: диффузионный трансформер — шаг вперёд в генеративном искусстве. Сочетая очистку шума и глобальное понимание, технология делает синтетические изображения точнее и творчески богаче, помогая людям визуализировать смелые идеи.