DeepSeek官方宣布,其最新研发的DeepSeek-V4-Flash正式版API已启动公开测试。此次升级聚焦于性能优化与接口适配,在保持模型架构与参数规模不变的前提下,通过后训练技术显著提升了多场景下的任务处理能力。
根据公开的基准测试数据,正式版在九项核心Agent能力评估中实现全面突破。其中Terminal Bench 2.1得分达82.7,较预览版提升12.3%;NL2Repo指标跃升至54.2,增幅达18.6%;Cybergym测试中取得76.7分,刷新同类模型纪录。在工具调用专项测试Toolathlon Verified中,70.3分的成绩使其跻身行业前列,而DSBench-Hard复杂场景测试的59.6分,则验证了模型在多步骤推理任务中的可靠性。
技术团队特别强调,此次升级重点优化了Responses API格式的原生支持,并完成与Codex生态的深度适配。开发者可通过标准化接口直接调用模型能力,无需额外开发中间层。值得注意的是,本次更新仅涉及API服务端,DeepSeek-V4-Pro的API接口及移动端/网页端模型版本保持不变,官方承诺Pro版本正式版将在完成最终验证后尽快发布。
据开发文档披露,V4-Flash正式版沿用130亿参数架构,通过改进的注意力机制与强化学习策略,在代码生成、系统操作、多工具协同等场景展现出更强的稳定性。测试数据显示,在自动化工作流构建任务Automation Bench Public中,模型成功率从预览版的18.7%提升至25.1%,DSBench-FullStack全栈开发测试得分亦增长至68.7分。











