DeepSeek官方近日宣布,其全新研发的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp已正式登陆DeepSeek API平台。这一模型被官方定义为实验性质,旨在探索多模态技术在实际应用中的潜力。
据官方介绍,V4-Flash-Vision-Exp在文本处理能力上已与DeepSeek-V4-Flash正式版不相上下,而在涉及视觉理解的Agent Benchmark测试中,其多模态Agent能力更是接近了Opus-4.8的水平。这一突破意味着该模型在处理图文混合任务时,能够展现出更为出色的性能。
该模型在各类Agent框架中均表现出良好的多模态适配性,能够支持用户通过多样化的Agent工具解锁更多实用场景。无论是需要同时处理文本和图像的任务,还是对视觉信息有特定要求的应用,V4-Flash-Vision-Exp都能提供有力的支持。
用户可通过设置model='deepseek-v4-flash-vision-exp'来调用该模型的API服务。在计费方面,图片将被转换为token后按token数量计费,每张图片最多占用384个tokens,且计费标准与V4-Flash模型保持一致。
DeepSeek提供的多模态API支持Chat Completions、Messages、Responses三种调用格式,便于接入各类Agent工具。同时,该API还支持图文混合输入,并提供了base64内联、外部URL、Files API三种图片传入方式,以满足不同用户的需求。具体使用方法可参考官方API文档中的“API指南-图像理解”部分。











