阿里通义千问团队近日推出了一款名为Qwen3.8-Flash的多模态混合专家(MoE)模型,该模型基于下一代Qwen4架构构建,旨在为开发者提供提前体验新架构特性的技术预览平台。模型主架构包含1250亿参数,同时配备510亿参数的N-gram嵌入模块,实际运算时每token仅激活60亿参数,在保证性能的同时显著降低了计算资源消耗。
技术团队在四大核心模块进行了突破性改进。注意力机制采用GDN+QSA混合架构,其中门控增量网络(GDN)通过动态压缩历史信息提升处理效率,稀疏注意力模块(QSA)则通过微块级索引筛选关键上下文。在超长序列处理测试中,该架构使预填充和解码阶段的注意力计算速度分别提升7.6倍和4.9倍。残差连接模块引入四分支门控机制,配合FP8量化存储技术,将显存占用降低40%以上。
嵌入层创新采用510亿参数的N-gram查表系统,通过局部上下文匹配扩展模型容量。该模块支持异步预取技术,可将参数动态卸载至主机内存,避免长期占用GPU显存。优化器方面采用Muon优化算法,针对参数正交性、分工策略和矩阵分解进行专项优化,并重新拟合了符合新架构特性的扩展定律。
性能测试显示,在60亿激活参数条件下,Qwen3.8-Flash-Next-Base在14个基准测试中8项夺冠,涵盖编程能力(SWEBench-Pretrain)、数学推理(MGSM)、多模态理解(MMMU)等专业领域。相较于前代Qwen3.7-Plus,新模型训练成本降低至1/9,却在代码生成和办公自动化场景展现出更强的处理能力。
该模型将于千问AI平台开放API服务,定价体系为输入每百万token1元、输出3元。模型权重已在北京时间23:00同步开源至Hugging Face和ModelScope平台,提供标准版和FP8量化版两种选择。旗舰版本Qwen3.8-Flash-Next默认支持100万token上下文窗口,并集成官方开发工具包,方便开发者进行二次开发。











