Генерация изображений при ограниченных ресурсах: интервью с Аникетом Роем
Рой работает на стыке генеративного ИИ, мультимодального обучения и few-shot learning. Он разработал методы для адаптации больших моделей к дефициту данных и вычислений: фреймворк FeLMi для few-shot обучения, Cap2Aug для аугментации данных с помощью текстовых описаний, а также DiffNat — регуляризатор на основе статистики естественных изображений, улучшающий качество диффузионных моделей. В области персонализации он предложил DuoLoRA и MultiLFG для гибкой композиции низкоранговых адаптеров, а также zero-shot подход без дополнительного обучения.
Самым интересным проектом Рой называет DiffNat, опубликованный в TMLR 2025. Метод использует свойство естественных изображений: после вейвлет-разложения значения куртозиса в частотных полосах близки, тогда как у сгенерированных картинок они сильно расходятся. Регуляризация сокращает этот разрыв, делая изображения более реалистичными. Это подтверждается улучшением метрик FID и MUSIQ.
В итоге его работа направлена на то, чтобы сделать генеративный ИИ эффективным, контролируемым и пригодным для реальных задач, даже когда данных и вычислительных мощностей не хватает.
Источник: robohub.org
Поделиться