Qwen выпустила Qwen3.8-Flash-Next — экспериментальную модель с открытыми весами, архитектура которой станет основой Qwen4. Модель содержит 125 млрд параметров, но при работе активирует 6 млрд. Еще 51 млрд параметров приходятся на n-граммные представления.
Главные изменения — разреженное внимание Qwen Sparse Attention, управляемые остаточные связи и n-граммные представления, рассчитанные на снижение затрат при длинном контексте. Базовая длина контекста составляет 262 тыс. токенов и может расширяться до 1 млн.
По данным Qwen, модель набрала 62,5% на SWE-bench Pro, 91,7% на GPQA Diamond и 84,5% на AndroidWorld. Она поддерживает текст, изображения и видео и совместима с vLLM, SGLang и Hugging Face Transformers.