Исследователи из Hugging Face обучили GPT-OSS новым навыкам. Они применили агентное обучение с подкреплением. Модель учится планировать действия.
Раньше ИИ просто давал ответ на вопрос. Теперь он строит цепочку решений. Он выбирает инструменты и наблюдает за результатом.
Это похоже на обучение человека. Сначала пробуешь, потом анализируешь, потом пробуешь снова. Так рождается стратегия.
Эксперименты провели на задачах по математике и коду. Использовали популярный фреймворк Verl. Сравнивали с другими моделями.
GPT-OSS показал себя хорошо. Его можно использовать как основу для умных помощников. Такие помощники будут решать сложные задачи.