Tencent выпустила HY-World 2.0 — мультимодальную world model, которая умеет строить 3D-миры из текста, одной картинки, набора изображений или видео. На выходе модель создает не ролик, а полноценные 3D-ассеты — mesh и Gaussian Splattings.
У системы два основных режима. Первый — генерация 3D-сцены из текста или одной картинки через цепочку из панорамы, планирования траектории, расширения мира и финальной сборки сцены. Второй — реконструкция 3D по фото или видео через WorldMirror 2.0, который за один проход предсказывает глубину, нормали, параметры камеры, point cloud и атрибуты 3DGS.
Главная ставка Tencent — на переход от “видео-миров” к постоянным 3D-средам. Такие сцены можно свободно исследовать, редактировать и импортировать в Blender, Unity, Unreal Engine и Isaac Sim, а рендерить — в реальном времени даже на потребительских GPU.
Сейчас компания уже открыла техрепорт, часть кода и веса WorldMirror 2.0. Полный inference-код для генерации мира, HY-Pano 2.0, WorldNav и WorldStereo 2.0 обещают выложить позже.