Google DeepMind представила Gemma 4 12B — мультимодальную модель для локального запуска на ноутбуках. Она занимает промежуточное место между E4B и 26B MoE и впервые в линейке mid-size Gemma поддерживает native audio input.
Главная особенность модели — unified architecture без отдельных multimodal encoders. Изображения и аудио передаются напрямую в LLM backbone: для vision используется легкий embedding-модуль, а raw audio проецируется в пространство text tokens.
Gemma 4 12B показывает результаты, близкие к 26B MoE, но требует менее половины памяти. Модель можно запускать локально на устройствах с 16 ГБ VRAM или unified memory. Также она поддерживает Multi-Token Prediction для снижения задержки.