NVIDIA объединила три модели зрения в одну - AI Founder

NVIDIA объединила три модели зрения в одну

NVIDIA создала модель C-RADIOv4. Она объединяет три разные системы зрения в одну. Теперь не нужно выбирать между ними.

NVIDIA представила модель C-RADIOv4. Это новый виток в серии RADIO. Система объединяет три разные модели зрения.

Раньше требовались отдельные модели. SigLIP2 для работы с текстом. DINOv3 для плотных признаков. SAM3 для сегментации.

Теперь всё в одном флаконе. C-RADIOv4 учится у трёх учителей одновременно. Это как три в одном.

Модель обучают на разных разрешениях. От 128 до 1152 пикселей. Это улучшает работу на низких разрешениях.

Например, на ADE20k модель показывает 55.20 mIoU при 512 пикселях. При 1024 пикселях — уже 57.02. Результат растёт с разрешением.

При этом модель компактна. Она в десять раз меньше DINOv3-7B. Но результаты сопоставимы.

Разработчики боролись с артефактами. Большие модели копируют свои шумы. C-RADIOv4 учит структуру, а не помехи.

Для этого используют сдвиг. Учитель и ученик видят разные части изображения. Система не может запомнить шум.

Это важный шаг. Одна модель заменяет несколько. Упрощается развёртывание и работа.

Елена Петрова
Автор: Елена Петрова

Продуктовый дизайнер с фокусом на AI-инструментах. Тестирует и сравнивает нейросети для креативных профессий.

Подпишись на наш Telegram-канал

чтобы не упустить главные AI-новости

Подписаться
0
Оставьте комментарий! Напишите, что думаете по поводу статьи.x