Apple переосмыслила извлечение текста из HTML для обучения ИИ - AI Founder

Apple переосмыслила извлечение текста из HTML для обучения ИИ

Apple переосмыслила извлечение текста из HTML для обучения ИИ

Исследователи из Apple и Стэнфорда обнаружили старую проблему. Один инструмент для извлечения текста из интернета теряет огромные объёмы данных.

Учёные из Apple и Стэнфорда пересмотрели базовый шаг. Они извлекают текст из HTML для обучения языковых моделей. Оказалось, один метод — это ошибка.

Разные инструменты дают разный результат. Страницы, прошедшие через один фильтр, сильно отличаются. Это как смотреть на мир через одно окно.

Простое решение — объединить несколько методов. Так можно получить на 71% больше данных. Качество моделей при этом не страдает.

Для таблиц и блоков кода разница критична. Производительность на тестах может упасть на 10 процентных пунктов. Это меняет правила игры.

Работа опубликована в феврале 2026 года. Она ставит под сомнение устоявшуюся практику. Теперь каждый набор данных нужно проверять заново.

Александр Чернов
Автор: Александр Чернов

Редактор с бэкграундом в продуктовом менеджменте и разработке. Специализируется на материалах о применении ИИ в EdTech и B2B-сегменте.

Подпишись на наш Telegram-канал

чтобы не упустить главные AI-новости

Подписаться
0
Оставьте комментарий! Напишите, что думаете по поводу статьи.x