Google выпустил Android Bench. Это рейтинг и система оценки для языковых моделей. Они проверяют работу в Android-разработке.
Данные и методика открыты. Их выложили на GitHub. Любой может проверить модель.
Обычные тесты не учитывают специфику Android. Новый рейтинг исправляет это. Он использует реальные задачи с GitHub.
Задачи разного уровня сложности. Например, исправление ошибок после обновления Android. Или работа с Wear OS.
Модель должна исправить проблему в коде. Затем решение проверяют тестами. Это стандартная практика разработчиков.
Есть риск, что модель уже знает ответы. Google добавил защиту. В данные встроили специальную метку.
Эта метка предупредит сборщиков данных. Они исключат задачи из обучения. Так сохранится честность рейтинга.
Пока оценивают только базовые возможности моделей. Не учитывают сложные сценарии с инструментами.
Лучший результат у Gemini 3.1 Pro Preview. Он решил 72% задач. Худший — у Gemini 2.5 Flash, всего 16%.
Разброс результатов большой. Это показывает сложность Android-разработки. Общие модели здесь слабее.
Рейтинг уже работает в Android Studio. Разработчики могут тестировать модели через API. Это упростит выбор инструмента.