DeepSeek近日在API平台正式推出了一款实验性质的多模态模型——DeepSeek-V4-Flash-Vision-Exp。开发者只需将model参数设置为deepseek-v4-flash-vision-Exp,即可轻松调用这一新模型,为多模态应用开发提供更强大的支持。
该模型在继承V4-Flash全部文本能力的基础上,进一步增强了视觉理解能力。据测试,其多模态Agent的综合表现已接近Claude Opus-4.8的旗舰水平,能够更好地满足复杂场景下的应用需求。在纯文本层面,DeepSeek-V4-Flash-Vision-Exp的推理能力、知识储备以及文本Agent能力均与V4-Flash正式版保持一致,在Terminal Bench 2.1、DeepSWE、DSBench-Hard等文本类评测中,得分与原版持平,可继续胜任代码编写、工具调用、长文档处理等原有业务场景。
在视觉相关任务中,该模型的表现尤为突出。与原版V4-Flash相比,其在ApexBench、AgentsLast Exam、Chartography等多模态专项评测中的分数显著提升。模型能够完成截图解析、界面识别、图表读取以及图文混合任务,适用于GUI智能体、屏幕操作、图文数据分析等多种开发场景,为开发者提供了更广泛的应用可能性。
在计费方面,DeepSeek-V4-Flash-Vision-Exp沿用了V4-Flash的现有定价标准。图片输入将转换为token参与计费,单张图片最高计384 tokens,且不会额外收取视觉专项费用。具体来说,百万token输入缓存未命中时收费1元,输出收费2元;若缓存命中,费用可低至每百万token 0.02元,有效降低了多模态Agent开发的调用成本。
该模型还延续了100万token的超长上下文窗口,并支持思考模式。开发者可根据任务复杂度设置high或max推理强度,其中复杂多模态智能体任务推荐开启max档位。模型适配Harness智能体框架,支持工具调用和Function Call,能够结合图片理解完成调研、数据提取、自动化任务编排等链路工作,为开发者提供更高效、灵活的开发体验。
值得注意的是,官方明确表示DeepSeek-V4-Flash-Vision-Exp属于实验预览版本,不建议直接用于生产环境。后续,团队将根据线上真实调用反馈对模型进行迭代优化,持续提升其稳定性和输出效果。目前,正式版的上线时间尚未对外公布。











