Исследователи из Meta показали TRIBE v2 — три-модальную foundation-модель, которая предсказывает активность человеческого мозга при обработке видео, аудио и текста. Система обучена на более чем 1000 часах fMRI-данных, собранных у 720 человек.
Модель использует представления из ИИ-систем для видео, звука и языка, а затем прогнозирует высокодетализированные fMRI-ответы на новые стимулы, задачи и новых испытуемых. В работе говорится, что она превосходит традиционные линейные модели кодирования и дает прирост точности в несколько раз.
Авторы отдельно подчеркивают возможность in silico-экспериментов: TRIBE v2 смогла воспроизвести ряд классических результатов из исследований зрения и языка, включая области, связанные с распознаванием лиц, мест, слов и языковой обработкой.
Кроме предсказаний, модель позволяет изучать, как в мозге сочетаются визуальные, звуковые и текстовые сигналы. Код, веса модели и демо опубликованы для исследовательского использования.