Добавьте признак — получите проблему. Так говорят исследователи. Каждый признак зависит от данных.
Пропустится поле — упадёт качество. Изменится схема — сломается модель. Это происходит тихо.
Главная проблема — нестабильность весов. Модель путается в коррелированных признаках. Коэффициенты скачут.
Слабые признаки кажутся важными. Это просто шум. Модель выглядит умно на бумаге.
В реальности она ведёт себя странно. Предсказания становятся ненадёжными. Это производственная хрупкость.
Учёные провели эксперимент. Взяли данные о ценах на жильё. Создали синтетический набор.
Добавили настоящие признаки. Площадь, число комнат, район. Это сильные сигналы.
Добавили производные признаки. Они коррелируют с основными. Это создаёт мультиколлинеарность.
Добавили слабые признаки. Цвет двери, возраст остановки. Это почти шум.
Добавили чистый шум. Девяносто случайных столбцов. Модель пытается их осмыслить.
Сравнили две модели. Первая — «кухонная раковина». В ней все признаки. Вторая — простая и строгая.
Результат предсказуем. Большая модель кажется точной. На тестах она хорошо работает.
В продакшене она ломается. Коэффициенты не имеют смысла. Предсказания пляшут.
Простая модель стабильнее. Она игнорирует шум. Она опирается на суть.
Вывод простой. Не гонитесь за признаками. Лучше меньше, да лучше.
Каждый новый столбец — это новый шанс на ошибку. Это лишняя зависимость. Это скрытая угроза.
Стройте модели бережно. Отбирайте признаки жёстко. Цените стабильность выше точности.