Diffusion Transformer
Раньше диффузионные модели строились на свёрточных сетях: они хорошо работают с пикселями, но хуже видят глобальные связи. Трансформеры видят картину целиком и понимают, как далёкие фрагменты влияют друг на друга. Их объединение дало более качественную и гибкую генерацию, особенно для больших разрешений и сложных сцен. Эта архитектура лежит в основе многих современных моделей генерации изображений.
Интуитивно это похоже на работу скульптора с глыбой мрамора. Берётся «глыба» — чистый случайный шум. Нейросеть с помощью трансформера оценивает заготовку целиком и решает, какие части больше похожи на будущий объект. На каждом шаге шум ослабляется, трансформер снова окидывает взглядом всё изображение и уточняет детали. Так, от размытой массы до чёткой картинки, проходит сотня шагов.
Например, по запросу «космический корабль в стиле киберпанк над неоновым городом» модель сначала создаёт шум, затем постепенно проявляет формы корабля, зданий, огней, а механизм внимания следит, чтобы корабль соответствовал описанию, а город не сливался. Получается осмысленная сцена, а не просто красивая картинка.
Итог: диффузионный трансформер — шаг вперёд в генеративном искусстве. Сочетая очистку шума и глобальное понимание, технология делает синтетические изображения точнее и творчески богаче, помогая людям визуализировать смелые идеи.
Поделиться