Исследователи Google Сьёрд ван Стейнкисте и Тал Линзен провели эксперимент. Они научили большие языковые модели байесовскому выводу.
Модели имитировали предсказания оптимального байесовского алгоритма. Это улучшило их работу с персонализацией.
ИИ часто использует простые эвристики. Например, считает, что все хотят самый дешёвый вариант.
Байесовский подход учит обновлять убеждения. Каждое новое взаимодействие с пользователем меняет внутреннюю модель.
Учёные создали упрощённую задачу. ИИ-ассистент рекомендовал авиабилеты смоделированному пользователю.
Пользователь имел скрытые предпочтения. Он любил утренние рейсы или короткие перелёты.
Ассистент предлагал три варианта за раунд. Всего было пять раундов взаимодействия.
После каждого выбора ИИ получал обратную связь. Он узнавал, угадал ли предпочтения пользователя.
Идеальный байесовский ассистент постоянно обновлял распределение вероятностей. Он применял правило Байеса к новым данным.
Обычные языковые модели отставали от этого идеала. Они делали неоптимальные предположения.
Обученные же модели стали работать лучше. Они точнее угадывали желания виртуальных пользователей.
Главное — навык переносится на другие задачи. Модель учится не конкретному сценарию, а способу мышления.
Это меняет подход к обучению ИИ. Теперь можно учить рассуждению, а не просто заучиванию.