Google представил рейтинг ИИ для Android-разработки
Google представил открытый рейтинг для языковых моделей. Он оценивает их работу в Android-разработке.
Google представил открытый рейтинг для языковых моделей. Он оценивает их работу в Android-разработке.
Вышел InferenceX v2 — самый масштабный тест для ИИ-чипов. Он сравнивает почти тысячу видеокарт NVIDIA и AMD нового поколения.
Искусственный интеллект для офиса оказался не таким умным. Новый тест развеял иллюзии о его готовности.
Исследователи представили новый бенчмарк ReEfBench, который оценивает не результат, а сам процесс рассуждения больших языковых моделей, выявляя ключевые ограничения современных методов.
Исследователи представили бенчмарк SpatialBench, чтобы проверить, могут ли современные ИИ-агенты извлекать биологические знания из сложных пространственных данных. Результаты первых тестов оказались низкими.