Microsoft представила новую версию архитектуры Transformer - AI Founder

Microsoft представила новую версию архитектуры Transformer

Microsoft представила новую версию архитектуры Transformer

Исследователи из Microsoft представили вторую версию архитектуры Diff-Transformer. Она работает быстрее и проще.

Microsoft опубликовала код Diff-Transformer V2. Архитектура улучшает механизм внимания. Это ускоряет работу моделей.

Новая версия вдвое увеличивает число голов запроса. Количество голов ключа и значения остаётся прежним. Это экономит память.

Дифференциальная операция сводит размерность обратно. Проекция выхода не меняется. Параметров становится меньше.

Главное преимущество — скорость декодирования. Она сравнима со стандартным Transformer. Не нужны специальные ядра.

Версия V1 была медленнее. Кэш значений загружался дважды. Требовалось своё ядро внимания.

Новая архитектура повышает арифметическую интенсивность. Снижение пропускной способности при обучении незначительно. Это проверено на GPU.

Для длинных последовательностей авторы советуют YOCO. Эта техника уже используется в Gemma. Сложность становится линейной.

Авторы также объясняют ограничение величины Softmax. Контекстный вектор — взвешенная сумма. Его норма строго ограничена.

Дмитрий Волков
Автор: Дмитрий Волков

Продакт-менеджер. Пишу о том, как ИИ меняет подходы к развитию продуктов и масштабированию стартапов.

Подпишись на наш Telegram-канал

чтобы не упустить главные AI-новости

Подписаться
0
Оставьте комментарий! Напишите, что думаете по поводу статьи.x