阿里通义千问团队近日宣布推出新一代多模态混合专家模型Qwen3.8-Flash,该模型基于尚未正式发布的Qwen4架构研发,被定位为技术预览版本。核心创新在于采用混合专家(MoE)架构,主模型参数量达1250亿,同时配备510亿参数的N-gram嵌入模块,实际推理时每token仅激活60亿参数,在保持高性能的同时显著降低计算资源消耗。
技术架构实现四大突破性升级:在注意力机制方面,创新采用GDN+QSA混合架构,其中门控三角网络(GDN)负责高效压缩历史信息,稀疏注意力模块(QSA)通过微块级索引器筛选关键上下文。实测显示,处理百万token超长文本时,该设计使预填充和解码阶段的注意力计算效率分别提升7.6倍和4.9倍。残差连接模块引入四分支门控机制,配合FP8量化存储技术,使显存占用降低40%以上。
嵌入层创新采用可卸载的N-gram表结构,510亿参数可动态加载至主机内存,通过异步预取技术实现计算与数据加载的并行处理。优化器方面,定制开发的Muon优化器针对新架构特性,在参数正交化、分工策略及矩阵分解等关键环节进行专项优化,重新拟合的扩展定律使模型在60亿激活参数下即可达到千亿参数模型的性能水平。
性能测试数据显示,相比前代旗舰模型Qwen3.7-Plus,新模型训练成本降低至九分之一,但在代码生成和办公自动化场景中展现出更强的处理能力。在涵盖语言理解、数学推理、代码能力等维度的14个基准测试中,Qwen3.8-Flash-Next-Base在8项指标上取得领先,特别是在MMLU-Pro专业考试数据集和SWEBench代码预训练数据集上表现突出。
该模型将于近日在千问AI平台开放API服务,定价策略为每百万输入token收费1元,输出token收费3元。为降低开发者使用门槛,团队同步在Hugging Face和ModelScope平台开源模型权重,提供FP8量化版本以适配不同硬件环境。旗舰版本Qwen3.8-Flash-Next默认支持百万token上下文窗口,并集成官方开发的工具链,开发者可即刻体验新一代架构的强大能力。









