Luma показала UNI-1 — свою первую модель, которая совмещает анализ и генерацию внутри одной архитектуры. В компании называют это следующим шагом к мультимодальному ИИ общего назначения.
Если раньше Luma двигалась от реконструкции сцен к 3D и генерации видео, то теперь делает ставку на более широкий подход: не просто создавать визуальный контент, а одновременно понимать его. В этом и состоит основная идея UNI-1.
В основе модели — decoder-only autoregressive transformer, где текст и изображения объединены в одну последовательность и могут быть и входом, и выходом. За счёт этого модель должна работать не как связка отдельных инструментов, а как единая система.
В Luma утверждают, что UNI-1 умеет проводить структурированное рассуждение до и во время генерации изображения: разбирать инструкцию, учитывать ограничения, планировать композицию и только потом собирать итоговый результат. По данным компании, модель показала лучшие результаты на бенчмарке RISEBench, который оценивает reasoning-informed visual editing — редактирование изображений с опорой на причинно-следственные, пространственные, временные и логические связи.
Отдельно в Luma подчёркивают и обратную идею: обучение генерации изображений улучшает визуальное понимание. По их словам, это даёт модели более сильные способности в распознавании объектов, областей и взаимного расположения элементов сцены. Для этого компания ссылается на результаты в ODinW-13 — тесте на open vocabulary detection.
По сути, Luma предлагает модель, которая должна не просто рисовать по запросу, а одновременно понимать сцену, логику изменений и визуальный контекст. Пока UNI-1 выглядит скорее как заявка на новое направление, чем как готовый массовый продукт, но сама ставка понятна: индустрия всё активнее движется от отдельных генераторов и анализаторов к единым мультимодальным системам.