Исследователи из MIT нашли простой способ. Они используют время простоя процессоров. Это ускоряет обучение сложных моделей.
Скорость обучения выросла в два раза. Точность моделей не пострадала. Энергии и денег теперь нужно меньше.
Большие модели учатся решать задачи по шагам. Это требует огромных мощностей. Часть процессоров при этом простаивает.
Новый метод задействует эти простые. Он автоматически обучает маленькую модель. Та предсказывает ответы большой.
Большая модель лишь проверяет эти ответы. Так она работает меньше. Обучение идёт быстрее.
Метод уже протестировали. Результаты подтвердились. Технология готова к применению.