ITBear旗下自媒体矩阵:

DeepSeek V4-Flash正式版公测,轻量模型Agent能力飙升,性价比之战打响

   时间:2026-08-01 01:48:26 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

人工智能领域正迎来新一轮技术竞赛,轻量化大模型在Agent能力上的突破成为焦点。某科技公司最新发布的V4-Flash正式版模型,在多项复杂任务测试中展现出接近高端模型的性能表现,引发行业对模型训练范式转变的讨论。该模型通过优化后训练阶段技术,在保持130亿激活参数规模的同时,实现了终端操作、代码仓库生成等场景下的能力跃升。

在最新公布的基准测试中,V4-Flash正式版在Terminal Bench 2.1获得82.7分,较三个月前V4-Pro预览版在2.0版本的67.9分提升显著。尽管测试集版本存在差异,但轻量模型在Cybergym网络安全任务中取得76.7分、Toolathlon工具调用测试获得70.3分的成绩,仍被视为技术突破的重要标志。研发团队特别强调,此次升级未改变模型架构与参数规模,仅通过改进训练方法实现性能提升。

技术文档显示,该模型总参数达2840亿,但实际推理时仅需激活130亿参数,这种设计显著降低了计算资源消耗。与之形成对比的是,同期高端模型V4-Pro总参数达1.6万亿,激活参数490亿。性能差距的缩小表明,在特定任务场景下,模型规模与实际表现之间不再呈现简单正相关,训练数据质量与算法优化正在发挥更大作用。

在代码生成专项测试中,采用极简框架的Code Agent任务取得突破性进展。测试环境设置max档位、topp=0.95、temperature=1.0等参数,验证了模型在复杂工具调用场景下的稳定性。这被解读为研发团队在Agent框架层面进行针对性优化的成果,其自研的Harness系统首次以完整形态亮相,该系统承担着模型持续学习能力的工程实现任务。

团队负责人透露,Harness系统的研发始于今年3月,由具有量化交易背景的技术专家领衔。这个90后技术团队曾在顶级金融机构工作,擅长处理高并发计算场景。系统规划与V4正式版同步推进,旨在解决模型长期记忆与经验积累的技术难题,这被视为实现通用人工智能的关键技术路径。

商业化布局方面,新模型展现出明确的战略定位。内部测试集显示,其在全栈开发场景取得68.7分,复杂编码任务获得59.6分,表明该模型更适合作为开发者工具链的基础组件。原生支持的Responses API格式与Codex兼容特性,降低了应用迁移成本,这被视为对主流生态发起挑战的重要举措。相比传统对话场景,Agent应用对推理速度和成本更为敏感,轻量模型在此领域具有显著价格优势。

资本市场的反应印证了技术突破的商业价值。该公司两个月前完成超500亿元人民币融资,创下国内AI行业单轮融资纪录。近期启动的新一轮融资将估值推高至710亿美元,较前次融资上涨37%。值得注意的是,创始人通过特殊架构保持公司控制权,其早期坚持自有资金投入的策略,如今转向积极融资,折射出企业加速商业化进程的战略转向。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version