Учёные провели контролируемый эксперимент. Они изучили влияние постобработки на загрязнение данных. Результаты удивили многих.
Исследователи взяли чистые модели Qwen и Gemma. Затем добавили тестовые задачи в их обучающий набор. Это было преднамеренное загрязнение.
После этого модели прошли стандартную постобработку. Использовали тонкую настройку и обучение с подкреплением. Эти этапы не содержали загрязнённых данных.
Загрязнение вызвало резкий рост результатов. Показатели по математике и коду взлетели. Но эффект постепенно снижался при дальнейшем обучении.
Постобработка вскрыла скрытую информацию. Тонкая настройка завышала оценки только по знакомым задачам. Обучение с подкреплением улучшало и другие, чистые тесты.
Размер модели усиливал эти эффекты. Крупные модели больше запоминали. Они также лучше обобщали утекшую информацию.
Вывод прост. Проверять модели нужно после всей обработки. Иначе оценки будут завышенными. Это меняет правила игры.