开发者侧的多模态能力,终于从网页识图走向可计费的API。对很多团队来说,Agent「能看图」长期停留在演示页:模型在聊天框里认一张图可以,但要把截图、文档页、UI界面稳定接进自动化流水线,却缺一条正式、可报价、可审计的接口。DeepSeek在8月21日把这一环补齐。
DeepSeek是国内大模型公司,API平台长期覆盖文本与推理场景;DeepSeek Harness是其开源Agent外壳,与模型迭代节奏高度耦合。所谓多模态API,白话是不只收文字token,还把图片编码成token一并计费,让程序可以批量传图、混排图文、走同一套鉴权与账单;所谓Vision-Exp后缀,白话是实验性视觉版本,能力在快速迭代,SLA与定价可能随正式版调整。
公开材料显示,实验性视觉理解模型DeepSeek-V4-Flash-Vision-Exp已上线API平台。模型在纯文本Agent、推理与世界知识等基准上与V4-Flash正式版持平;在需要视觉理解的Agent Benchmark上相对V4-Flash大幅提升,公开口径称多模态Agent能力已接近Claude Opus 4.8量级。调用时模型参数设为deepseek-v4-flash-vision-exp;图片先转token再计费,单张最多按384 tokens计算,价格与V4-Flash对齐,高峰时段理解一张图最高价约0.001152元。
接口与工程侧可核对要点:
可以把它想成:以前「看图」像每次手工递一张照片给客服;Files API则像先把资料存进共享盘,后续任务只传引用号——对长会话、多轮改图类Agent,带宽与失败重试成本都会更可控。
把这条放进多模态Agent坐标:一侧是Harness多模态升级,一侧是模型侧放出对应API,组合意义是把「看图干活」从演示走向可采购栈。对开发者,价值是把截图、文档、UI界面纳入同一套工作流账单;对企业,则要验收实验模型稳定性、速率限制与合规条款——能调用是入口,能在生产任务里稳定读图才是验收。
需要把边界读清楚。Exp后缀表明仍处实验阶段;接近Opus 4.8为厂商对标口径,须按真实任务复测。下一观察点是正式版定价、上下文长度与Harness原生视觉链路的失败恢复率——API上线是补齐,不是终点。