Большие модели требуют много памяти. Их работа замедляется. Обучение становится слишком дорогим.
Архитектура MoE меняет подход. Она заменяет плотные слои на набор экспертов. Эксперты — это просто обучаемые подсети.
Для каждого слова роутер выбирает несколько экспертов. Обычно два или четыре. Остальные эксперты молчат.
Модель gpt-oss-20b содержит 21 миллиард параметров. Но для обработки слова она использует только 3,6 миллиарда. Это в шесть раз меньше.
На компьютере M3 Ultra такая модель генерирует 115 слов в секунду. Это скорость маленькой модели. Но качество остаётся высоким.
Эксперты не специализируются на темах. Они не знают математику или код. Они просто обучаются на разных паттернах.
Разные слова активируют разных экспертов. Это зависит от скрытого представления слова. Так работает роутер.
Архитектура MoE — это естественный путь к параллелизации. Эксперты можно распределить по разным устройствам. Это ускоряет вычисления.
Тренд начался с модели Mixtral-8x7B в 2023 году. Его ускорил успех DeepSeek R1 в январе 2025 года. Теперь все выпускают MoE-модели.
Недавно вышли Qwen 3.5, MiniMax M2, GLM-5. Закрытые лаборатории тоже используют MoE. ChatGPT давно ходят такие слухи.
Библиотека transformers уже поддерживает MoE. Это упрощает работу с моделями. Инженеры могут быстрее экспериментировать.