Google представил рейтинг ИИ для Android-разработки - AI Founder

Google представил рейтинг ИИ для Android-разработки

Google представил рейтинг ИИ для Android-разработки

Google представил открытый рейтинг для языковых моделей. Он оценивает их работу в Android-разработке.

Google выпустил Android Bench. Это рейтинг и система оценки для языковых моделей. Они проверяют работу в Android-разработке.

Данные и методика открыты. Их выложили на GitHub. Любой может проверить модель.

Обычные тесты не учитывают специфику Android. Новый рейтинг исправляет это. Он использует реальные задачи с GitHub.

Задачи разного уровня сложности. Например, исправление ошибок после обновления Android. Или работа с Wear OS.

Модель должна исправить проблему в коде. Затем решение проверяют тестами. Это стандартная практика разработчиков.

Есть риск, что модель уже знает ответы. Google добавил защиту. В данные встроили специальную метку.

Эта метка предупредит сборщиков данных. Они исключат задачи из обучения. Так сохранится честность рейтинга.

Пока оценивают только базовые возможности моделей. Не учитывают сложные сценарии с инструментами.

Лучший результат у Gemini 3.1 Pro Preview. Он решил 72% задач. Худший — у Gemini 2.5 Flash, всего 16%.

Разброс результатов большой. Это показывает сложность Android-разработки. Общие модели здесь слабее.

Рейтинг уже работает в Android Studio. Разработчики могут тестировать модели через API. Это упростит выбор инструмента.

Александр Чернов
Автор: Александр Чернов

Редактор с бэкграундом в продуктовом менеджменте и разработке. Специализируется на материалах о применении ИИ в EdTech и B2B-сегменте.

Подпишись на наш Telegram-канал

чтобы не упустить главные AI-новости

Подписаться
0
Оставьте комментарий! Напишите, что думаете по поводу статьи.x