DeepSeek|V4-Flash-Vision-Exp多模态API上线,单图至高约0.001元

PromptTree|阅读 0
2026/08/21 17:13
DeepSeek多模态Vision APIAgent
DeepSeek宣布实验性视觉模型DeepSeek-V4-Flash-Vision-Exp上线API平台,补齐长期缺失的看图接口;兼容Chat Completions、Messages、Responses与Files API,高峰时段单图理解最高价约0.001152元,公开口径称多模态Agent能力接近Claude Opus 4.8量级。

开发者侧的多模态能力,终于从网页识图走向可计费的API。对很多团队来说,Agent「能看图」长期停留在演示页:模型在聊天框里认一张图可以,但要把截图、文档页、UI界面稳定接进自动化流水线,却缺一条正式、可报价、可审计的接口。DeepSeek在8月21日把这一环补齐。

DeepSeek是国内大模型公司,API平台长期覆盖文本与推理场景;DeepSeek Harness是其开源Agent外壳,与模型迭代节奏高度耦合。所谓多模态API,白话是不只收文字token,还把图片编码成token一并计费,让程序可以批量传图、混排图文、走同一套鉴权与账单;所谓Vision-Exp后缀,白话是实验性视觉版本,能力在快速迭代,SLA与定价可能随正式版调整。

公开材料显示,实验性视觉理解模型DeepSeek-V4-Flash-Vision-Exp已上线API平台。模型在纯文本Agent、推理与世界知识等基准上与V4-Flash正式版持平;在需要视觉理解的Agent Benchmark上相对V4-Flash大幅提升,公开口径称多模态Agent能力已接近Claude Opus 4.8量级。调用时模型参数设为deepseek-v4-flash-vision-exp;图片先转token再计费,单张最多按384 tokens计算,价格与V4-Flash对齐,高峰时段理解一张图最高价约0.001152元。

接口与工程侧可核对要点:

  1. 格式:同时兼容Chat Completions、Messages、Responses三种格式,支持图文混合输入与base64内联或外部URL传图。
  2. 文件:同步上线免费Files API,可先上传图片凭file_id引用,避免重复传输大体积载荷。
  3. 示例:官方展示按抽象风格要求生成PPT素材,以及对Harness官网做黑蓝深海、玻璃UI等视觉二次创作。

可以把它想成:以前「看图」像每次手工递一张照片给客服;Files API则像先把资料存进共享盘,后续任务只传引用号——对长会话、多轮改图类Agent,带宽与失败重试成本都会更可控。

把这条放进多模态Agent坐标:一侧是Harness多模态升级,一侧是模型侧放出对应API,组合意义是把「看图干活」从演示走向可采购栈。对开发者,价值是把截图、文档、UI界面纳入同一套工作流账单;对企业,则要验收实验模型稳定性、速率限制与合规条款——能调用是入口,能在生产任务里稳定读图才是验收。

需要把边界读清楚。Exp后缀表明仍处实验阶段;接近Opus 4.8为厂商对标口径,须按真实任务复测。下一观察点是正式版定价、上下文长度与Harness原生视觉链路的失败恢复率——API上线是补齐,不是终点。