Apple усомнилась в качестве данных для обучения ИИ - AI Founder

Apple усомнилась в качестве данных для обучения ИИ

Apple усомнилась в качестве данных для обучения ИИ

Учёные из Apple обнаружили странный парадокс. Популярный метод очистки данных для ИИ не делает их лучше. Он лишь создаёт обманчивую иллюзию качества.

Исследователи Apple изучили метод фильтрации данных. Его называют Classifier-based Quality Filtering. Метод отбирает лучшие тексты для обучения нейросетей.

Он работает через бинарный классификатор. Тот отличает «хорошие» документы от «плохих». В итоге отбирается только верхняя часть рейтинга.

Но анализ показал неожиданное. Метод улучшает результаты на сторонних задачах. При этом языковое моделирование на качественных данных не растёт.

Парадокс объяснили просто. Классификатор неявно фильтрует и эталонный набор. Он отсекает тексты, непохожие на преобладающие в нём шаблоны.

Учёные сравнили CQF с синтетическими данными. Их портили через перестановку случайных токенов. Тренды оказались совершенно разными.

Вывод исследования прост. Метод не улавливает смысловое качество. Он лишь создаёт удобную для обучения выборку. Это иллюзия.

Александр Чернов
Автор: Александр Чернов

Редактор с бэкграундом в продуктовом менеджменте и разработке. Специализируется на материалах о применении ИИ в EdTech и B2B-сегменте.

Подпишись на наш Telegram-канал

чтобы не упустить главные AI-новости

Подписаться
0
Оставьте комментарий! Напишите, что думаете по поводу статьи.x