Исследователи создали новый тест для ИИ-агентов. Он проверяет их способность работать в офисе. Результаты оказались неутешительными.
Агенты часто не понимали простых инструкций. Они путались в логике и делали ошибки. Иногда они вообще не могли начать задачу.
Тест моделирует реальную рабочую среду. Это не абстрактные вопросы, а конкретные дела. Например, планирование встреч или анализ данных.
Разработчикам есть над чем работать. Тест станет новым ориентиром. Гонка за умных помощников продолжается.