Исследователи Apple изучили проблему. Большие языковые модели плохо понимают устную речь. Они отстают от своих текстовых версий.
Разрыв в качестве достигает 20-30%. Это показали тесты на понимании языка. Модели на 3 и 7 миллиардов параметров ошибались.
Проблема имеет две причины. Модель забывает текст, когда учится слушать. Речь и текст плохо согласованы между собой.
Учёные создали метод SALAD. Он сочетает два подхода. Это дистилляция знаний и целенаправленные синтетические данные.
Метод требует в десять раз меньше речевых данных. Он использует только открытые корпусы. Результаты сопоставимы с лучшими открытыми моделями.
Модели стали лучше в знаниях, понимании и рассуждениях. Разрыв между текстом и речью сократился. Это важный шаг к настоящему мультимодальному ИИ.