Исследователи Salesforce представили метод TEX. Он проверяет ИИ-агентов перед запуском. Метод предсказывает их поведение в реальных условиях.
Работу выполнили Акаш Гокул и Сриян Бансал. К ним присоединился ещё один автор. Статья вышла 14 января 2026 года.
Проблема известна. Агенты отлично работают в лаборатории. В реальности они часто дают сбой.
Новый метод похож на перекрёстную проверку. Но он использует реальное выполнение задач. Это даёт более точный прогноз.
Теперь можно оценить надёжность агента. Это снижает риски для бизнеса. Внедрение станет безопаснее.