NVIDIA представила модель C-RADIOv4. Это новый виток в серии RADIO. Система объединяет три разные модели зрения.
Раньше требовались отдельные модели. SigLIP2 для работы с текстом. DINOv3 для плотных признаков. SAM3 для сегментации.
Теперь всё в одном флаконе. C-RADIOv4 учится у трёх учителей одновременно. Это как три в одном.
Модель обучают на разных разрешениях. От 128 до 1152 пикселей. Это улучшает работу на низких разрешениях.
Например, на ADE20k модель показывает 55.20 mIoU при 512 пикселях. При 1024 пикселях — уже 57.02. Результат растёт с разрешением.
При этом модель компактна. Она в десять раз меньше DINOv3-7B. Но результаты сопоставимы.
Разработчики боролись с артефактами. Большие модели копируют свои шумы. C-RADIOv4 учит структуру, а не помехи.
Для этого используют сдвиг. Учитель и ученик видят разные части изображения. Система не может запомнить шум.
Это важный шаг. Одна модель заменяет несколько. Упрощается развёртывание и работа.