Архивы мультимодальная модель - AI Founder

Gemma 4 12B

Google DeepMind представила Gemma 4 12B — мультимодальную модель для локального запуска на ноутбуках. Она занимает промежуточное место между E4B и 26B MoE и впервые в линейке mid-size Gemma поддерживает native audio input. Главная особенность модели — unified architecture без отдельных multimodal encoders. Изображения и аудио передаются напрямую в LLM backbone: для vision используется легкий … Читать далее

Qwen3.7-Plus

Alibaba представила Qwen3.7-Plus — мультимодальную агентную модель для работы с текстом, изображениями, видео, GUI и CLI. Она умеет читать экраны, управлять приложениями, писать код по визуальным референсам, искать информацию в интернете и выполнять многошаговые задачи. Модель показывает сильные результаты в coding- и agentic-бенчмарках: 70,3 на Terminal Bench 2.0, 62,3 на Deep-Planning и 91,7 на MRCR-v2 … Читать далее