Исследователи представили простой метод обучения моделей. Он называется прямой оптимизацией предпочтений. Метод обходится без модели вознаграждения.
Технология использует набор данных UltraFeedback. Каждый запрос содержит хороший и плохой ответ. Модель учится на контрасте.
Обучение проводят с помощью QLoRA. Это позволяет экономить память. Процесс запускают на одном графическом процессоре.
Модель настраивают на стиль и поведение. Это важнее простого запоминания фактов. Такой подход делает ИИ понятнее.