Исследователи Apple представили тест AMUSE. Он проверяет, как ИИ понимает диалоги в видео. Модели должны отслеживать, кто говорит и о чём.
Тест включает шесть типов задач. Например, определение говорящего во времени и пространстве. Или краткий пересказ диалога.
Современные модели GPT-4o и Qwen3-Omni провалили тест. Они путаются, когда в кадре несколько человек. Их рассуждения слабы и непоследовательны.
Учёные также предложили метод обучения RAFT. Он использует внутреннюю самооценку модели как награду. Это экономит данные и вычислительные ресурсы.
Метод RAFT показал отличный результат. Точность моделей на тесте выросла почти на 40%. Это серьёзный прорыв в понимании видео.
Теперь у разработчиков есть практический инструмент. Они могут проверять и улучшать свои модели. Это важно для видеоассистентов и анализа встреч.