人工智能领域迎来新进展,DeepSeek旗下多模态模型deepseek-v4-flash-vision-exp正式上线。该模型在原有文本处理能力基础上新增原生图片输入功能,标志着这一技术团队在视觉理解领域迈出关键一步。与前代版本相比,新模型在保持纯文本处理性能的同时,通过引入视觉模块显著提升了多模态任务处理能力。
技术测试显示,新模型在涉及图像理解的智能体任务中表现突出。在特定基准测试中,其性能较纯文本版本提升显著,已接近行业头部模型水平。开发团队特别强调,此次升级并未增加使用成本,图片处理费用按转换后的token计算,单图最高消耗384个token。在高峰时段且无缓存的情况下,处理单张图片的成本约为人民币0.12分,仅为同类图像处理服务的二十分之一。
配套工具链同步迎来重大更新。DeepSeek Harness最新版本已原生支持多模态模型调用,用户可直接在开发环境中选择视觉模型进行任务部署。这种软硬件协同升级的设计,使得开发者能够快速构建涉及图像识别的应用场景。实际测试中,研究人员利用该组合成功完成了三维建模、动态网页设计等复杂任务,其中三维模型渲染效果获得专业人士认可。
基础图像识别能力方面,新模型展现出高效的视觉处理能力。在针对人物侧脸识别的专项测试中,系统能在3秒内准确识别图像内容,即使面对具有挑战性的角度和光线条件仍保持较高准确率。不过测试也发现,当前版本在处理细节特征时仍存在局限,例如在手指计数任务中会持续出现识别偏差,这反映出多模态模型在微观特征解析方面仍有改进空间。
开发历程显示,该项目的视觉模块研发历时四个月。今年二季度起,团队开始逐步灰度测试图像理解功能,经过三个月的网页端和移动端公测后,最终完成全平台部署。值得注意的是,此次升级仅聚焦于输入端的能力扩展,并未涉及图像生成功能。技术文档特别说明,模型设计初衷是提升现有应用的视觉交互能力,而非创造新的视觉内容。
行业观察人士指出,此次升级使DeepSeek在专业领域的应用价值显著提升。特别是在需要图文协同的办公场景中,视觉模块的加入大幅提高了文档处理、设计评审等工作的自动化程度。某科技公司实际测试表明,采用新模型后,其产品原型设计周期缩短了40%,需求沟通效率提升近一倍。
国内人工智能领域近期动态频出。除DeepSeek的视觉模型升级外,某新晋多模态模型"牛来"在海外社交平台引发关注。该模型因独特的抽象处理风格走红,甚至促使某开发平台推出限时免费活动。虽然开发方尚未正式确认,但技术社区普遍推测其与某知名AI企业存在关联。这一现象反映出国内团队在多模态技术研发上的集体突破,正在重塑全球人工智能竞争格局。










