Microsoft опубликовала код Diff-Transformer V2. Архитектура улучшает механизм внимания. Это ускоряет работу моделей.
Новая версия вдвое увеличивает число голов запроса. Количество голов ключа и значения остаётся прежним. Это экономит память.
Дифференциальная операция сводит размерность обратно. Проекция выхода не меняется. Параметров становится меньше.
Главное преимущество — скорость декодирования. Она сравнима со стандартным Transformer. Не нужны специальные ядра.
Версия V1 была медленнее. Кэш значений загружался дважды. Требовалось своё ядро внимания.
Новая архитектура повышает арифметическую интенсивность. Снижение пропускной способности при обучении незначительно. Это проверено на GPU.
Для длинных последовательностей авторы советуют YOCO. Эта техника уже используется в Gemma. Сложность становится линейной.
Авторы также объясняют ограничение величины Softmax. Контекстный вектор — взвешенная сумма. Его норма строго ограничена.