глоссарий

U-Net диффузии

U-Net диффузии

U-Net диффузии — это нейросетевая архитектура, которая лежит в основе современных генеративных моделей изображений, таких как Stable Diffusion. Её задача — научиться восстанавливать зашумлённую картинку шаг за шагом, превращая случайный набор пикселей в осмысленное изображение. Понимать этот термин важно, потому что именно U-Net определяет качество и детализацию результатов, которые мы видим в работе множества AI-сервисов для рисования.

Как это работает на интуитивном уровне? Представьте, что фотографию засыпали снегом — сначала крупными хлопьями, потом мелкими. Нейросеть обучают обратному процессу: от сильно заснеженной картинки переходить к всё более чистой. Но просто «убрать шум» недостаточно, нужно понять, что на изображении. Поэтому U-Net устроена в форме буквы «U». На левом спуске сеть сжимает картинку, выделяя глобальные черты: очертания предметов, композицию. На правом подъёме она расширяет это представление до полного разрешения, добавляя мелкие текстуры, тени и детали. Прыжки-связи между симметричными слоями помогают не потерять тонкую информацию, например края волос или контуры зданий. Именно сочетание «общего плана» и «микроскопа» делает U-Net столь эффективной.

Прикладной пример: вы вводите запрос «кот в шляпе в стиле Ренуара». Модель превращает текст в вектор, затем берёт чистый шум и через серию итераций просит U-Net предсказать, как убрать порцию шума с учётом этого текстового описания. На каждом шаге архитектура видит и шумный образ, и подсказку, всё точнее прорисовывая уши, усы и мазки краски. В итоге за пару десятков шагов получается готовое изображение.

Вывод: U-Net диффузии — это рабочая лошадка генеративного моделирования, которая позволяет балансировать между правдоподобием и творческой свободой. Без неё мы бы не видели ни фотореалистичных портретов, ни художественных абстракций — остались бы только размытые пятна. Простая по идее, но мощная по исполнению, она остаётся ключевым кирпичиком в здании диффузионных моделей.