Учёные из Apple и Стэнфорда пересмотрели базовый шаг. Они извлекают текст из HTML для обучения языковых моделей. Оказалось, один метод — это ошибка.
Разные инструменты дают разный результат. Страницы, прошедшие через один фильтр, сильно отличаются. Это как смотреть на мир через одно окно.
Простое решение — объединить несколько методов. Так можно получить на 71% больше данных. Качество моделей при этом не страдает.
Для таблиц и блоков кода разница критична. Производительность на тестах может упасть на 10 процентных пунктов. Это меняет правила игры.
Работа опубликована в феврале 2026 года. Она ставит под сомнение устоявшуюся практику. Теперь каждый набор данных нужно проверять заново.