近日,DeepSeek API平台迎来了一位新成员——多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp。这款实验性质的模型现已正式上线,为用户提供了全新的多模态交互体验。用户只需在调用时设置model参数为'deepseek-v4-flash-vision-exp',即可轻松访问该模型。

DeepSeek-V4-Flash-Vision-Exp在文本处理能力上表现卓越,与DeepSeek-V4-Flash正式版不相上下,涵盖了Agent、推理、世界知识等多个领域。而在视觉理解方面,该模型更是实现了显著突破。在需要视觉理解的Agent Benchmark测试中,DeepSeek-V4-Flash-Vision-Exp的表现远超DeepSeek-V4-Flash,多模态Agent能力已逼近Opus-4.8水平。
为了方便用户使用,DeepSeek为V4-Flash-Vision-Exp模型提供了全面的API支持。用户可以通过API服务将图片转换为token进行计费,每张图片最多占用384个tokens,且计费标准与V4-Flash模型保持一致。该API还支持Chat Completions、Messages、Responses三种格式调用,可轻松接入各类Agent工具,实现图文混合输入。用户可以通过base64内联、外部URL或Files API三种方式传入图片。
值得一提的是,DeepSeek还同步上线了Files API服务,且该服务完全免费。用户可先将图片上传至平台,随后在请求中通过file_id进行引用,从而有效节省请求带宽。这一功能尤其适用于需要多次使用同一张图片的场景,避免了重复上传的繁琐过程。











