ITBear旗下自媒体矩阵:

DeepSeek-V4首推多模态模型权重开放 视觉升级后部分测试超越Claude Opus 4.8

   时间:2026-09-01 15:39:01 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

人工智能领域迎来重要进展,DeepSeek近日为旗下V4系列模型增添了视觉处理能力。此次升级后的V4-Flash-Vision-Exp模型已通过Hugging Face平台向开发者开放下载,配套提供的还有视觉编码器、Aligner组件及核心算法实现代码,涵盖DFlash Attention、MoE架构、Hyper-Connections等关键技术模块。

这款拥有约3050亿参数的实验性多模态模型,在延续V4-Flash文本处理优势的基础上,通过嵌入视觉模块实现了图像理解能力的突破。开发者演示显示,新模型不仅能识别照片内容、提取截图文字,还可解析图表数据并将其融入工作流程。在复杂应用场景中,该模型已展现出制作PPT、修改网页代码、生成动态前端页面等跨模态任务处理能力。

基准测试数据显示,V4-Flash-Vision-Exp在多模态Agent任务中表现亮眼。ApexBench测试中取得36.5的Pass@1得分,虽略低于Anthropic的Claude Opus 4.8(39.4),但在Chartography图表解析任务中以64.3分接近Opus的65.0分。更值得关注的是,该模型在Agents' Last Exam(27.3分)和ZeroBench(35.0分)测试中均超越Opus-4.8的对应成绩。

文本处理能力测试表明,视觉模块的加入未对原有性能造成显著影响。在Terminal Bench 2.1测试中,新模型取得83.9分,较前代提升1.2分;DeepSWE任务得分从54.4跃升至59.3,超过Opus-4.8的58.0分。不过在NL2Repo代码生成任务中,57.7分的表现仍落后于Opus的69.7分,CyberGym安全测试得分也微降1.4分至75.3分。

技术文档披露了视觉处理的实现细节:模型支持JPEG、PNG等主流图片格式,可处理单图或多图输入。为控制计算成本,输入图像会进行动态缩放处理,最终等效分辨率限制在800×800像素范围内,单图占用Token数不超过384个。这种设计虽保证了处理效率,但在需要识别微小文字或精细纹理的场景中可能存在性能瓶颈。

此次升级标志着V4系列正式迈入多模态时代。通过在保持文本处理优势的同时拓展视觉能力,DeepSeek为智能体开发提供了新的技术路径。尽管当前版本在高清图像处理方面仍有提升空间,但其展现的跨模态任务处理能力已引发业界广泛关注。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version