QwenTeam (Alibaba) представила Qwen-Image-2.0 — модель генерации изображений для прикладных задач: слайдов, постеров, инфографики и комиксов. Ключевая идея — объединить генерацию и редактирование в одной модели и повысить качество типографики до рабочего уровня.
Что нового
Длинные инструкции.
Модель принимает описания до ~1000 токенов и собирает сложные макеты: таймлайны, таблицы, блоки текста и подписи в одной композиции.
2K-разрешение.
Поддержка 2048×2048 без дополнительных апскейлеров — для сцен с высокой детализацией.
Одна модель для gen и edit.
Генерация и редактирование объединены. Улучшения качества текста и фотореализма работают в обоих режимах.
Работа с текстом.
Заявлены:
-
точность рендеринга,
-
устойчивость к сложным ТЗ,
-
аккуратный лэйаут,
-
корректная перспектива и освещение текста на поверхностях,
-
ровное выравнивание в сетках (календарь, инфографика, комиксы).
Производительность.
Модель стала компактнее и быстрее по сравнению с предыдущей версией.
Blind-тесты.
По данным команды, в тестах на AI Arena модель показывает лучшие результаты и в text-to-image, и в image-to-image — без разделения на разные контуры.
Почему это важно
Большинство image-моделей хорошо рисуют «красивые картинки», но плохо справляются с читаемым текстом и сложной версткой. Qwen-Image-2.0 нацелена именно на рабочие материалы: «сделай слайд и потом отредактируй его тем же инструментом».
Если типографика и редактирование действительно стабильны, это снижает стоимость производства презентаций, маркетинговых материалов и обучающих визуалов.