Исследователи Apple представили новый метод. Он называется Complete(d)P. Метод переносит настройки обучения между моделями.
Раньше настройки искали для каждой модели отдельно. Это занимало недели и требовало огромных мощностей. Теперь процесс стал проще.
Сначала настройки находят для модели в 50 миллионов параметров. Потом их переносят на модель в 14 тысяч раз больше. Это работает без дополнительной подгонки.
Метод учитывает ширину и глубину сети. Также он работает с размером батча и длительностью обучения. Это основные оси масштабирования.
Настройки можно оптимизировать для каждого модуля отдельно. Это даёт лучший результат. Глобальные настройки требуют в 2,3 раза больше времени обучения.
Метод проверяли на больших языковых моделях. Скорость их обучения значительно выросла. Это экономит время и деньги.
Работа опубликована на конференции ICLR. Её дата — февраль 2026 года. Исследование провели учёные из Apple и Кембриджа.