阿里通义千问团队近日推出全新多模态MoE模型Qwen3.8-Flash,同步开源Qwen3.8-Flash-Next架构权重。该模型采用主模型125B参数与51B N-gram Embedding的混合设计,通过动态参数激活机制实现每token仅6B参数运算,原生支持262,144 tokens上下文窗口,并可通过YaRN技术扩展至1M tokens处理能力。

技术架构实现四大核心突破:在注意力机制层面,创新采用GDN+QSA混合架构,通过门控压缩历史信息与微块级上下文筛选,使1M token超长序列处理在预填充阶段提速7.6倍,解码阶段提速4.9倍;残差计算引入四分支门控机制,配合FP8量化存储将显存占用降低60%;嵌入层通过51B参数的N-gram查表扩展模型容量,参数可动态卸载至主机内存;优化器采用Muon架构,针对新架构重新拟合扩展定律,在参数分工与矩阵计算融合方面取得突破。
性能测试显示,在6B激活参数条件下,Qwen3.8-Flash-Next-Base模型在14个基准测试中8项领先,包括MMLU-Pro知识推理、SuperGPQA专业问答、BBH综合任务等权威评测集。相比前代Qwen3.7-Plus,新模型训练成本降低至1/9,却在代码生成与办公自动化场景展现更强能力。官方公布的定价策略显示,API服务将按每百万tokens计费,输入1元/输出3元的定价方案较同类模型更具竞争力。

开源版本于北京时间8月26日23时同步登陆Hugging Face与ModelScope平台,除提供标准权重外,还首次发布FP8量化版本以降低部署门槛。Qwen3.8-Flash-Next特别内置1M上下文处理工具包,开发者可直接调用官方预置的上下文扩展、信息检索等模块。该架构被视为Qwen4系列的技术预演,其动态参数激活与混合专家系统设计,为下一代模型扩展奠定基础。











