Рейтинги языковых моделей оказались ненадёжными - AI Founder

Рейтинги языковых моделей оказались ненадёжными

Рейтинги языковых моделей оказались ненадёжными

Рейтинги языковых моделей в интернете оказались хрупкими. Уберите несколько голосов — и лучшая модель станет худшей.

Учёные из MIT провели исследование. Они изучили популярные рейтинговые платформы. Результаты оказались тревожными.

Рейтинги меняются от нескольких голосов. Иногда хватает двух или трёх. Это на фоне десятков тысяч оценок.

Компании выбирают модели по этим спискам. Это важно для отчётов или работы с клиентами. Ошибка выбора стоит дорого.

Исследователи создали быстрый метод проверки. Он находит голоса, которые влияют на результат. Их можно изучить отдельно.

Тамара Бродерик — автор работы. Она говорит о неожиданной хрупкости. Лучшая модель в рейтинге не значит лучшую в деле.

Работу представят на конференции. Учёные предлагают собирать больше данных. Это сделает платформы устойчивее.

Елена Петрова
Автор: Елена Петрова

Продуктовый дизайнер с фокусом на AI-инструментах. Тестирует и сравнивает нейросети для креативных профессий.

Подпишись на наш Telegram-канал

чтобы не упустить главные AI-новости

Подписаться
0
Оставьте комментарий! Напишите, что думаете по поводу статьи.x