DeepSeek V4.1 Flash 发布后,DeepSeek 网页版和 App 也更新了,之前需要选择的「快速」、「专家」和「识图」都合并升级为一个入口。
全新的 DeepSeek V4.1 Flash 同时具备了日常对话、图片理解与复杂问题解决能力,看起来像是把过去这一个多月,DeepSeek 发布的 V4 Flash 正式版、Vision Exp、V4 Pro 正式版几个模型,全部融合在一起了。
在社交媒体上,大家对 V4.1 Flash 最多的评价就是「快」。
有网友展示自己在 DeepSeek Harness 内的对话,模型的运行速度是 217 tok/s 左右。而其他的测试结果显示,V4.1 Flash 的运行速度为 420-507 tok/s ,比 Gemini 3.8 Flash 还要更快。
本来是融合了好几个模型,主干参数也接近上一代 Flash 的两倍,从 284B 到了 552B,但怎么速度就变快了。
虽然 4.1 看着是一次小更新,但从 DeepSeek 公开的技术报告来看,V4.1 Flash 采用了重新设计的模型架构,并扩大了训练数据和强化学习规模。
参数的增加,但处理长输入和保存上下文所需的开销却降低了,因为每 Token 的全局 KV cache 只有 890 字节,是自家 V4-Flash 的四分之一;和 2023 年的初代 DeepSeek-V1 相比,缩小了约 437 倍。
总参数变多,但是用来每一次工具调用、每一轮对话,模型上下文的 KV cache 却减少了,而减少的 KV cache 也没有因此让 V4.1 Flash 变弱,在多个 Agent 基准测试上,它打平甚至反超了 Claude Opus-5 和 GPT-5.6 Sol。
我们分析了 V4 Flash 和 V4.1 Flash 的两篇论文技术报告,看到了 DeepSeek 在 Agent 时代到底要做什么样的高效率模型。
图|论文地址:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
模型变大,成本怎么降下来
所谓的 KV cache 可以理解为模型处理过内容后留下的中间状态;后续生成需要参考前文时,复用这些状态,可以省下重新计算的开销。
而当我们的上下文越长时,这个用来保存模型状态的工作台台面就会越大,占的显存越多。
DeepSeek 四代模型的演化,可以说就是在不断地对 KV cache 进行压缩,从 V1 的每 token 389 KB,到 V3.2 的 48 KB、V4-Flash 的 3.5 KB,再到今天的 890 字节,连 1 KB 都不到。
V4.1-Flash 采用的做法是一组组合拳。在架构上,40 层网络被修改成「编码器 + 解码器」两半(CED 架构),Causal Encoder-Decoder,简称 CED。
它把 40 层网络分成前后两部分:前 20 层是因果编码器,后 20 层是解码器。后半部分需要的全局 KV 缓存,可以直接由前半部分的最终输出生成,因此,大部分输入内容无需再完整经过后 20 层。
即解码器需要的全局记忆直接由编码器的输出投影生成,预处理长文本的计算量近乎减半。这对频繁调用工具、缓存经常不命中的 Agent 负载尤其省钱。
图|DeepSeek 各代模型在不同上下文长度下的单 Token 解码(Decode)FLOPs 对比。
具体来说,假设我们让 AI 帮忙选一批办公电脑,看产品资料、查价格、列出配置,最后给采购建议。
第一轮,它读了几款电脑的介绍。第二轮,我们补充预算,让它重新筛选。第三轮,我们又接着说,有两个岗位需要剪视频,配置得单独调整。
就这样每次我们只补充一句话,模型处理的内容却可能越来越长。要接着完成任务,它需要记得前面选过哪些型号、为什么淘汰某一款、预算是多少,以及哪些要求刚刚发生了变化。
V4 是标准的 decoder-only,整个模型「读」和「写」用同一套全部工序。给它一段 100 万 token 的输入,每个 token 都要完整穿过全部 43 层。
现在 V4.1 Flash 大部分只需经过前半段,后半程的解码器不用再把原文逐层过一遍,而是直接拿编码器读完之后「消化好的笔记」,技术上是把编码器最后一层的隐状态投影成解码器的全局 KV cache,然后基于这份笔记开始生成。
图|V4 Flash 和 V4.1 Flash 架构区别
这样一来,模型处理输入时,每个 token 激活约 80 亿参数;生成时,激活约 160 亿参数。对于足够长的输入,技术报告给出的预处理计算量接近减半。
可以说 V4.1 Flash 的 CED 这套结构就是冲着 Agent 负载设计,它优先节省的,正是 Agent 不断接收材料时的计算。资料越长,省去大部分输入在后半网络中的处理,就越有价值。
其次,注意力机制升级为 CSA2,让不同层之间可以「借用」彼此算好的索引和缓存,而不是各算各的;主 KV cache 更是用上了 FP4 量化,并且特意选了 OCP 开放标准格式,理由是「支持尽可能多的硬件平台」。
V4.1-Flash 的 Compressed Sparse Attention 2,简称 CSA2,是让多个网络层共享全局 KV 缓存。有的层负责建立缓存、挑出相关位置;后续层可以沿用这份缓存,重新选择自己需要的位置;还有一些层连选择结果也直接复用。
上一代部署方案会把全局和部分局部 KV 状态长期保存,以便用户重新生成答案,或继续多轮对话。但局部状态往往只在活跃会话的短时间内有用,长期保留会占用大量存储。
V4.1-Flash 把编码器的局部状态放进只保留几分钟的内存池。状态过期后,如果用户又继续任务,就重新计算最近 128 个 token,近似恢复需要的局部状态。DeepSeek 将这个办法称为 SWA Bounded Replay。
它用少量重算,换掉了长期保存这部分状态的开销。移走局部状态,再叠加全局缓存压缩,同等负载下,持久 KV 缓存占用降到上一代的约八分之一,且可以保证驻留 72 小时以上。
换句话说,用户三天内回来继续对话,服务商都不用重新付钱算一遍。
这种近似恢复的方案也会带来取舍,恢复结果与完整重新计算并不完全相同,DeepSeek 在报告中称已测场景中的质量影响很小,并把极端长上下文检索、会话恢复时的状态变化列为后续重点测试对象。
V4.1 Flash 对比 V4 Flash 的不同,还在于 552B 主干之外,模型还外挂了 196B 的「条件记忆」模块 Engram:它不做计算,只做查表。
通过把常见词的 2 到 4 个组合预先存成一张巨大的哈希表,用到时直接查出来接进网络,DeepSeek V4.1 Flash 的成本又能进一步下降。
省下计算和存储之后,模型还得把题做对
V4.1-Flash 使用了包含图像和文本的 45 万亿 token 预训练语料。它从语言模型预训练开始就接触多模态数据,图像经过视觉编码器处理后,与文字一起进入语言主干。
这让 Agent 可以直接利用截图检查工作。例如,在生成网页或办公文件后,读取渲染出来的画面,判断排版、图表或页面是否需要修改。工具返回的文字结果之外,模型多了一种检查依据。
后训练部分,DeepSeek 也写得相当明确:这次沿用了监督微调、强化学习和蒸馏,没有引入新的后训练算法。团队主要投入在训练数据和环境的生产上。
这似乎也在说,RL 的军备竞赛,主战场可能不在论文里的新算法,而在数据工程的水电煤。
他们把一道 Agent 任务拆成三个部分:问题、执行环境、验证系统。模型要面对足够难的要求,环境得能运行,验收也要与题目对应。
通用 Agent 的材料,来自内部员工和外部合作伙伴反馈的工作记录、工具接口与失败案例。团队据此重建工具的输入输出格式和行为约束,让模型可以在模拟环境中反复练习实际工作里出过错的步骤。
图|DeepSeek 会不断读取图片来检查结果
以编程任务为例,有的 AI 负责出题、准备工作环境,有的负责试做,还有独立的 AI 检查题目和验收要求是否一致、答案有没有泄漏、能不能靠钻漏洞过关。检查不过,就修好题目再试。
任务用于新一轮强化学习后,解题轨迹又会成为重新审核题目质量的材料。某个测试如果一直诱导模型钻空子,或者失败源于环境配置而非能力,这些问题就需要回到任务生产环节处理。
图|在 DeepSeek Harness 的 Minimal 模式下,随着强化学习(RL)训练规模的扩大,模型在各项代码智能体基准测试中的性能均有所提升。
在 DeepSeek 的归纳中,这次后训练的收益主要来自任务规模、多样性和可验证性的改善。模型做过更多类型的工作,也更频繁地得到与结果相关的反馈。
工具软件本身也会影响表现,DeepSeek 用不同工具框架测试同一个模型,发现系统提示、工具配置和历史信息管理的差异,都可能改变任务结果。
DeepSeek 在报告中表示,后续会继续扩大模型、数据和强化学习规模,并把模型与工具框架放在一起优化。
V4.1-Flash 目前是这一新架构系列中最小尺寸的模型,未来的 V4.1-Pro 或许会延续这一架构,但从上次 V4 Pro 正式版的经历来看,DeepSeek 显然不会再轻易就发布一款新的 Pro 模型。
Agent 测试进步明显,难题仍有差距
能力提升最集中地出现在 Agent 测试中。
在 DeepSeek 公布的最高推理档位结果里,V4.1-Flash 的 DeepSWE v1.1 软件问题解决率达到 74.2%,上一代 Flash 为 54.4%,V4-Pro 为 62.7%。同一测试表格中的 Opus-5 为 74.0%,GPT-5.6 Sol 为 73.0%。
Terminal-Bench 2.1 的成绩从 82.7 升到 90.6;面向工作自动化的 AutomationBench,则从 37.7 升到 54.8,也高于同表中的 V4-Pro、Opus-5 和 GPT-5.6 Sol。
最难的任务仍然拉得开距离。Terminal-Bench 4.0 上,新 Flash 从上一代的 7.0 提高到 31.2,但 Opus-5 为 51.8。在高难科学问答 GPQA Diamond 上,V4.1-Flash 的 90.9 也低于 V4-Pro 的 92.4。
原生视觉带来了新的可用范围,领先模型的优势也还在。带工具的专业图表测试 Chartography 中,V4.1-Flash 得到 78.9,高于 Kimi K3 的 68.1,低于 Opus-5 的 84.0。
模型的表现,还会受 Agent 框架影响。同一个 V4.1-Flash,在最高推理档位下,用 mini-SWE 跑 DeepSWE 得到 74.2,换成 Claude Code 为 69.8,Codex 为 65.6。系统提示、工具定义和上下文管理,都会影响模型能否把能力用出来。
另一方面,更长的思考也会增加账单。
DeepSeek 在强化学习中加入了随推理档位变化的长度惩罚,让同一模型学会用不同长度的推理处理任务。API 提供 low、high、max 三档,分别对应内部 50、75、100 的 effort 值。
图|报告中的总体趋势是,增加推理投入能改善成绩,但图表也出现了更高档位得分下降的情况。
在 V4 Flash 报告的结尾,DeepSeek 列了 7 条未来方向,包括架构精简、训练稳定性、稀疏嵌入、低延迟、长程 Agent、多模态,和数据合成,5 个月后 V4.1 似乎正逐条解决这些问题。
模型可以更大,思考可以更长,工具也可以调用更多次。只要最终把任务做完所需要的显存、延迟和总成本继续下降,它就依然是一款更便宜的模型。
从 7 月底发布 V4 Flash,到 8 月推出 V4 Pro,很快又更新了视觉推理预览模型 Vision Exp,再到这两天更新 V4.1 Flash,DeepSeek 的整体发布节奏对比过去一年,似乎是前所未有的快。
而过去那些卷 Benchmark 的分数,也会在一次次接近 100 分之后,开始卷速度,卷每秒处理的 Token 谁更多。











