Трансформеры учатся выбирать экспертов. Это ускоряет работу в 6 раз. - AI Founder

Трансформеры учатся выбирать экспертов. Это ускоряет работу в 6 раз.

Трансформеры учатся выбирать экспертов. Это ускоряет работу в 6 раз.

Большие языковые модели стали слишком дорогими. Новая архитектура MoE решает эту проблему. Она заставляет модель выбирать экспертов для каждого слова.

Большие модели требуют много памяти. Их работа замедляется. Обучение становится слишком дорогим.

Архитектура MoE меняет подход. Она заменяет плотные слои на набор экспертов. Эксперты — это просто обучаемые подсети.

Для каждого слова роутер выбирает несколько экспертов. Обычно два или четыре. Остальные эксперты молчат.

Модель gpt-oss-20b содержит 21 миллиард параметров. Но для обработки слова она использует только 3,6 миллиарда. Это в шесть раз меньше.

На компьютере M3 Ultra такая модель генерирует 115 слов в секунду. Это скорость маленькой модели. Но качество остаётся высоким.

Эксперты не специализируются на темах. Они не знают математику или код. Они просто обучаются на разных паттернах.

Разные слова активируют разных экспертов. Это зависит от скрытого представления слова. Так работает роутер.

Архитектура MoE — это естественный путь к параллелизации. Эксперты можно распределить по разным устройствам. Это ускоряет вычисления.

Тренд начался с модели Mixtral-8x7B в 2023 году. Его ускорил успех DeepSeek R1 в январе 2025 года. Теперь все выпускают MoE-модели.

Недавно вышли Qwen 3.5, MiniMax M2, GLM-5. Закрытые лаборатории тоже используют MoE. ChatGPT давно ходят такие слухи.

Библиотека transformers уже поддерживает MoE. Это упрощает работу с моделями. Инженеры могут быстрее экспериментировать.

Мария Соколова
Автор: Мария Соколова

Журналист и аналитик с фокусом на AI-инструменты для стартапов. Пишу о том, как основатели компаний внедряют ИИ для автоматизации и роста выручки.

Подпишись на наш Telegram-канал

чтобы не упустить главные AI-новости

Подписаться
0
Оставьте комментарий! Напишите, что думаете по поводу статьи.x