ITBear旗下自媒体矩阵:

DeepSeek V4.1 Flash解析:架构革新与成本优化下的高效模型之路

   时间:2026-09-12 17:35:46 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

DeepSeek近期对旗下产品进行了一次重要更新,网页版与移动应用同步升级,将原有的「快速」、「专家」及「识图」功能整合为统一入口,为用户提供更加便捷的操作体验。此次更新推出的DeepSeek V4.1 Flash模型,不仅整合了此前发布的多个版本特性,还在性能上实现了显著提升。

根据社交媒体反馈,V4.1 Flash最突出的特点是运行速度大幅提升。有用户测试显示,在DeepSeek Harness平台上的对话速度达到每秒217个token,其他测试结果则显示其速度范围在每秒420至507个token之间,甚至超越了Gemini 3.8 Flash的表现。这一速度优势得益于模型架构的重新设计和训练规模的扩大。

尽管V4.1 Flash的参数规模从上一代的2840亿增加至5520亿,接近翻倍,但其处理长输入和保存上下文所需的计算资源却显著减少。每token的全局KV缓存从V4 Flash的3.5KB压缩至890字节,仅为初代DeepSeek-V1的约四百分之一。这种优化使得模型在保持高性能的同时,降低了运行成本。

在技术实现上,V4.1 Flash采用了创新的CED(因果编码器-解码器)架构,将40层网络分为前后两部分。前20层作为编码器处理输入,后20层作为解码器生成输出。解码器所需的全局记忆直接由编码器的输出投影生成,避免了输入内容完整经过后20层的计算,从而大幅减少了预处理计算量。对于长文本输入,这种设计使计算量接近减半,特别适用于需要频繁调用工具的Agent场景。

除了架构创新,V4.1 Flash还引入了升级版的注意力机制CSA2,允许不同网络层共享全局KV缓存,进一步优化了计算效率。同时,主KV缓存采用FP4量化技术,并选用OCP开放标准格式,以支持更多硬件平台。这些技术改进共同推动了模型性能的提升。

在状态管理方面,V4.1 Flash采用了SWA Bounded Replay方案,将编码器的局部状态存储在短期内存池中,过期后仅需重新计算最近128个token即可恢复状态。这一设计使持久KV缓存占用降至上一代的约八分之一,同时确保状态可保留72小时以上,降低了长期存储成本。

V4.1 Flash在成本优化的同时,并未牺牲模型性能。其预训练语料库包含45万亿token的图像和文本数据,使模型从训练阶段就具备多模态处理能力。在Agent任务中,模型可以直接利用截图检查工作,例如验证网页或办公文件的排版和图表是否需要修改,提供了除文字结果外的额外检查依据。

在编程任务测试中,DeepSeek设计了出题、试做和检查的独立AI流程,确保题目质量、环境配置和验收要求的一致性。解题轨迹成为重新审核题目质量的材料,形成训练闭环。随着强化学习规模的扩大,模型在各项代码智能体基准测试中的性能均有所提升。

在性能评估中,V4.1 Flash在多个Agent测试中表现突出。在DeepSWE v1.1软件问题解决测试中,其得分达到74.2%,超越上一代Flash的54.4%和V4-Pro的62.7%,与Opus-5的74.0%和GPT-5.6 Sol的73.0%持平。在Terminal-Bench 2.1和AutomationBench测试中,V4.1 Flash的得分也显著高于同类模型。然而,在高难度任务中,如Terminal-Bench 4.0和高难科学问答GPQA Diamond,V4.1 Flash仍与领先模型存在一定差距。

模型表现还受到Agent框架的影响。同一模型在不同框架下的得分存在差异,系统提示、工具定义和上下文管理等因素均会影响模型能力的发挥。DeepSeek在强化学习中引入了随推理档位变化的长度惩罚机制,使模型能够根据任务需求调整推理长度,平衡性能与成本。

自去年以来,DeepSeek的发布节奏明显加快,从V4 Flash到V4 Pro,再到视觉推理预览模型Vision Exp,直至最新的V4.1 Flash,不断推动模型性能的边界。随着Benchmark分数接近极限,速度和每秒处理token数成为新的竞争焦点,DeepSeek正通过技术创新引领这一趋势。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version