MiniMax представила флагманскую модель M2.5 для агентных сценариев: программирования, поиска, работы с инструментами и офисных задач. Компания заявляет о SOTA на SWE-Bench Verified (80,2%) и BrowseComp (76,3% с управлением контекстом), а также заметном ускорении по сравнению с M2.1.
Что внутри
Масштабирование RL.
Обучение с подкреплением проходило в сотнях тысяч реальных сред. Инфраструктура Forge и алгоритм CISPO обеспечили стабильность MoE-архитектуры и ускорение обучения до ~40×.
Инженерный подход.
Перед генерацией кода модель декомпозирует задачу и формирует спецификацию. Поддерживает более 10 языков: Go, C++, Rust, Python, Java, TypeScript и другие.
Полный цикл разработки.
Проектирование, настройка среды, масштабирование, ревью и тестирование. Работает с full-stack (Web, Android, iOS, Windows).
Поиск и инструменты.
На BrowseComp, Wide Search и RISE модель показывает лидерские результаты и использует примерно на 20% меньше поисковых раундов, чем M2.1.
Офисные задачи.
Обучение включало кейсы из финансов, права и социальных наук. На внутреннем бенчмарке GDPval-MM — средний win-rate 59% в задачах Word, Excel и PowerPoint.
Скорость и цена
-
До 100 токенов/с (версия M2.5-Lightning).
-
SWE-Bench Verified: 22,8 мин против 31,3 мин у M2.1 (−37%).
-
Сопоставимо по времени с Claude Opus 4.6.
Стоимость (Lightning):
-
$0,3 за млн входных токенов
-
$2,4 за млн выходных
-
Около $1 за час непрерывной работы при 100 токенах/с
-
Заявленная цена вывода в 10–20 раз ниже Opus, Gemini 3 Pro и GPT-5.
Почему это важно
MiniMax делает ставку на продуктивность на доллар и на минуту. Если заявленные показатели подтвердятся, M2.5 может ускорить массовое внедрение агентных систем — от разработки ПО до финансового моделирования.