Агент NVIDIA AI-Q занял первое место. Он победил в двух главных тестах для исследовательских систем. Это DeepResearch Bench и DeepResearch Bench II.
Результаты — 55.95 и 54.50 балла. Это высшие оценки на обеих платформах. Система анализирует корпоративные данные и информацию из сети.
Тесты проверяют разное. Первый оценивает качество и структуру итогового отчёта. Второй смотрит на точность фактов и глубину анализа.
Победа в обоих случаях — важный шаг. Она показывает силу открытой и настраиваемой архитектуры. Разработчики могут менять систему под свои задачи.
В основе лежит модульная схема. Она включает планировщика, исследователя и координатора. Каждый модуль может работать на своей языковой модели.
Система строит план, собирает данные и синтезирует выводы. Она ищет информацию в интернете и научных базах. Все утверждения в отчёте подтверждаются цитатами.
Для максимального качества можно добавить ансамбль моделей. Несколько агентов работают параллельно. Их ответы затем объединяются в один итоговый документ.
Используется открытый инструментарий NeMo Agent Toolkit. Модели семейства Nemotron 3 специально доработаны для исследований. Всё это можно развернуть на своих серверах.