FLUX 3 вышел в ранний доступ как единая мультимодальная базовая модель для работы с изображениями, видео, аудио и действиями.
Модель обучалась одновременно на трёх типах данных и использует архитектуру Self-Flow. Она поддерживает создание видео по тексту, анимацию изображений, преобразование видео, продолжение видео и аудио, генерацию по ключевым кадрам и многоязычные диалоги.
FLUX 3 Video создаёт ролики со звуком длительностью до 20 секунд. В ранних тестах модель чаще выбирали вместо Grok Imagine Video, Kling v3 Pro, Runway Gen-4.5 и Luma Ray 3.2. Результаты предварительные.
FLUX 3 Image предназначен для генерации и редактирования изображений, сложных запросов и многоязычного текста.
Отдельные версии FLUX 3 будут использоваться для прогнозирования действий и робототехники. Среди партнёров — mimic robotics и Audi. Позже планируются API, закрытые веса и открытая модель FLUX 3 Dev.