Языковые модели научили понимать людей без наград - AI Founder

Языковые модели научили понимать людей без наград

Языковые модели научили понимать людей без наград

Большие языковые модели теперь можно обучать человеческим предпочтениям напрямую. Для этого не нужна сложная система вознаграждений. Метод работает даже на обычном ноутбуке.

Исследователи представили простой метод обучения моделей. Он называется прямой оптимизацией предпочтений. Метод обходится без модели вознаграждения.

Технология использует набор данных UltraFeedback. Каждый запрос содержит хороший и плохой ответ. Модель учится на контрасте.

Обучение проводят с помощью QLoRA. Это позволяет экономить память. Процесс запускают на одном графическом процессоре.

Модель настраивают на стиль и поведение. Это важнее простого запоминания фактов. Такой подход делает ИИ понятнее.

Дмитрий Волков
Автор: Дмитрий Волков

Продакт-менеджер. Пишу о том, как ИИ меняет подходы к развитию продуктов и масштабированию стартапов.

Подпишись на наш Telegram-канал

чтобы не упустить главные AI-новости

Подписаться
0
Оставьте комментарий! Напишите, что думаете по поводу статьи.x