Исследователи построили нового ИИ-агента. У него есть внутренний критик. Критик проверяет каждый ответ.
Система генерирует несколько вариантов ответа. Потом оценивает их по трём критериям. Это точность, связность и безопасность.
Агент измеряет собственную неуверенность. Он считает энтропию и дисперсию. Это как уровень сомнения в своих силах.
Алгоритм выбирает ответ не самый уверенный. Он ищет баланс между уверенностью и риском. Так решения становятся надёжнее.
Эксперименты показали улучшения. Поведение агента стало стабильнее. Ошибок стало меньше.