Открытая 8B-модель SenseNova U1.5 Lite догнала GPT-Image-2
Модель научилась выполнять длинные и сложные инструкции до четырех тысяч символов, одновременно учитывая объекты, их количество, положение, текст, стиль и расположение. Существенно улучшилось качество визуального вывода: композиция, цвет, материалы, свет и детали стали естественнее. Отдельно отмечают надежное редактирование изображений: модель меняет только указанные фрагменты, сохраняя структуру, людей и остальные части картинки без искажений. Она также справляется с аккуратной версткой текста, плакатов, инфографики и многостраничных макетов, поддерживает выделение рамкой, метки и несколько эталонных изображений.
SenseNova U1.5 Lite, как и прежде, остается моделью с 8B параметров, но в сложных сценариях, требующих точной компоновки и правок, она способна соперничать с закрытым GPT-Image-2. Секрет в архитектуре NEO-unify: понимание изображения, генерация и редактирование объединены в единую модель. Чтобы улучшить результат, SenseTime сначала раздельно обучала специализированных экспертов для работы с текстом, эстетикой и редактированием, а затем объединила их знания через технологию многокомпонентной дистилляции MOPD. Пользователь получает один компактный файл без внешних модулей и маршрутизаторов.
В демонстрациях модель успешно превратила девять отдельных фотографий еды в единый аккуратный рецептурный постер, отредактировала спальню по точечной инструкции и переработала чужую инфографику, сохранив исходный каркас. Она также заменила данные на афише и вписала пять участников Radiohead в постер с черно-белой винтажной обработкой, не нарушив общий стиль. Для коротких запросов предусмотрен дополнительный модуль улучшения промптов. Модель уже доступна на GitHub, Hugging Face и в онлайн-демо SenseNova Studio.
Источник: www.qbitai.com
Поделиться