Исследователи IBM создали тест AssetOpsBench. Он оценивает работу ИИ-агентов в промышленности.
Тест использует 2,3 миллиона точек данных с датчиков. В нём 140 сценариев и 4200 рабочих заданий.
Обычные тесты проверяют простые задачи. Промышленность требует сложной координации.
Новый тест оценивает шесть критериев. Важны ясность решений и понимание ошибок.
Многие агенты хорошо рассуждают поверхностно. Сложные задания с временными связями вызывают проблемы.
Тест анализирует, как и почему агент ошибается. Это важнее простого сигнала об успехе.
Разработчики выделили 53 типовых сбоя. Эксперты помогли создать сценарии.
Тест уже используют в IBM. Он открыт для других исследователей.