Google представил Gemini 3 Deep Think. Это не просто обновление. Модель теперь умеет рассуждать.
Она набрала 84,6% на тесте ARC-AGI-2. Люди в среднем показывают лишь 60%. Прежние модели ИИ едва достигали 20%.
Тест проверяет способность к обобщению. Нужно решать задачи, которых нет в обучающих данных. Это проверка на интеллект, а не на память.
Модель прошла и «Последний экзамен человечества». Она ответила на 48,4% сложных вопросов. Вопросы были из права, философии, математики.
Gemini 3 стал легендарным гроссмейстером в программировании. Его рейтинг на Codeforces — 3455 баллов. Такой уровень у единиц среди людей.
Модель выиграла бы золото на олимпиадах. По физике, химии, математике. Она работает на уровне профессиональных исследователей.
Google нацелил систему на науку. Она поможет в работе с неполными данными. Это инструмент для открытий.