8月20日消息,DeepSeek正式发布多模态新模型。
全新的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp上线DeepSeek API 平台。
据 DeepSeek 官方介绍,这是一个实验性质的模型,用户可以通过设置 model='deepseek-v4-flash-vision-exp' 来访问 V4-Flash-Vision-Exp 模型的 API。
在纯文本能力(Agent、推理、世界知识等)方面,DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash 正式版持平;
在需要视觉理解的 Agent Benchmark 上,DeepSeek-V4-Flash-Vision-Exp 相比 DeepSeek-V4-Flash 实现了大幅跃升,多模态 Agent 能力已接近 Opus-4.8。
官方还展示了三个应用示例,分别是在 Agent 框架下生成商业定制西藏自驾游 PPT、对 DeepSeek Harness 官网进行二次创作,以及制作黏土怪物风格动态特效的前端 Mini Demo。
API 计费方面,图片会转换成 token 后按 token 计费,一张图片最多占用 384 tokens,计费价格与 V4-Flash 模型一致。
多模态 API 支持 Chat Completions、Messages 和 Responses 三种调用格式,支持图文混合输入,图片传入方式包括 base64 内联、外部 URL 和 Files API 三种。
Files API 也已同步开放,该服务不收取费用。
据介绍,用户可先将图片上传到平台,再在请求中通过 file_id 引用,以节省请求带宽,同一张图片在多个请求中无需重复上传。










