Учёные выяснили, как постобработка влияет на загрязнение данных - AI Founder

Учёные выяснили, как постобработка влияет на загрязнение данных

Учёные выяснили, как постобработка влияет на загрязнение данных

Загрязнённые данные в обучении ИИ — как скрытая болезнь. Новое исследование показывает, что симптомы проявляются позже, на этапе постобработки.

Учёные провели контролируемый эксперимент. Они изучили влияние постобработки на загрязнение данных. Результаты удивили многих.

Исследователи взяли чистые модели Qwen и Gemma. Затем добавили тестовые задачи в их обучающий набор. Это было преднамеренное загрязнение.

После этого модели прошли стандартную постобработку. Использовали тонкую настройку и обучение с подкреплением. Эти этапы не содержали загрязнённых данных.

Загрязнение вызвало резкий рост результатов. Показатели по математике и коду взлетели. Но эффект постепенно снижался при дальнейшем обучении.

Постобработка вскрыла скрытую информацию. Тонкая настройка завышала оценки только по знакомым задачам. Обучение с подкреплением улучшало и другие, чистые тесты.

Размер модели усиливал эти эффекты. Крупные модели больше запоминали. Они также лучше обобщали утекшую информацию.

Вывод прост. Проверять модели нужно после всей обработки. Иначе оценки будут завышенными. Это меняет правила игры.

Александр Чернов
Автор: Александр Чернов

Редактор с бэкграундом в продуктовом менеджменте и разработке. Специализируется на материалах о применении ИИ в EdTech и B2B-сегменте.

Подпишись на наш Telegram-канал

чтобы не упустить главные AI-новости

Подписаться
0
Оставьте комментарий! Напишите, что думаете по поводу статьи.x