阿里近日正式推出并开源了新一代大语言模型Qwen3.8-Flash,该模型通过架构创新实现了效率与成本的双重突破。在千亿级总参数中仅激活60亿参数的情况下,其性能表现超越Claude Opus4.6,接近Opus4.8水平,同时训练成本较前代Qwen3.7-Plus降低近90%,推理成本降至每百万Tokens输入1元、输出3元,仅为DeepSeek-V4-Flash价格的三分之一。
作为多模态混合专家(MoE)架构的典型应用,Qwen3.8-Flash采用1250亿参数的Transformer架构,但通过动态激活机制仅需调用60亿参数即可高效运行。其核心技术创新体现在四大方面:在注意力机制上,独创的QSA(Qwen Sparse Attention)与GDN高效融合,形成混合注意力架构,使长文本处理效率提升8倍以上;信息传递层面,自研的Gated Residual方法将传统单通道拆分为四条动态路径,显著提升训练稳定性;参数扩展方面,510亿规模的N-gram Embedding作为"外挂记忆库",在不增加计算负担的前提下优化参数寻址效率;模型优化环节,架构设计与训练策略协同优化,使收敛速度和训练吞吐量大幅提升。
成本优势源于技术突破与工程优化的双重作用。测试数据显示,Qwen3.8-Flash在保持与Qwen3.7-Plus相近性能的同时,训练资源消耗减少至前代的九分之一。推理环节的成本控制尤为突出,其每百万Tokens的输入输出价格体系,已形成对同类产品的显著竞争优势。这种效率提升不仅体现在理论指标上,在实际应用场景中,模型在1M Tokens长上下文处理时展现出更强的缓存命中率和计算效率。
该模型即日起通过"千问办公"平台首发上线,开发者和企业用户可通过千问AI平台获取API服务。此次开源不仅包含模型权重,还同步开放了完整的技术文档和训练框架,为全球开发者提供可复现的技术方案。行业分析认为,Qwen3.8-Flash的推出标志着大模型进入"高效能计算"新阶段,其架构创新为AI技术落地提供了新的工程范式。











