Gemma 4 12B - AI Founder

Gemma 4 12B

Google DeepMind представила Gemma 4 12B — мультимодальную модель для локального запуска на ноутбуках. Она занимает промежуточное место между E4B и 26B MoE и впервые в линейке mid-size Gemma поддерживает native audio input.

Главная особенность модели — unified architecture без отдельных multimodal encoders. Изображения и аудио передаются напрямую в LLM backbone: для vision используется легкий embedding-модуль, а raw audio проецируется в пространство text tokens.

Gemma 4 12B показывает результаты, близкие к 26B MoE, но требует менее половины памяти. Модель можно запускать локально на устройствах с 16 ГБ VRAM или unified memory. Также она поддерживает Multi-Token Prediction для снижения задержки.

Максим Черняк
Автор: Максим Черняк

Эксперт AI Founder. Слежу за последними новостями в мире искусственного интеллекта.

Подпишись на наш Telegram-канал

чтобы не упустить главные AI-новости

Подписаться
0
Оставьте комментарий! Напишите, что думаете по поводу статьи.x