续:DeepSeek|V4 Flash榜单领先但真实Agent任务通过率约五成

PromptTree|阅读 1
2026/08/17 08:47
DeepSeekV4 FlashAgent评测VentureBeat
续报:Composio在八套Harness、三十项多工具任务上测V4 Flash,二百四十次运行通过约百分之五十三点八;同期API峰谷与缓存价上调,但仍强调相对前沿闭源仍具价格优势。据VentureBeat报道。

续报八月中旬Harness开源与峰谷定价落地之后,本轮增量是:榜单热度与真实多工具Agent通过率之间的裂缝,被独立评测摊开。

DeepSeek是国内大模型公司,V4 Flash定位高吞吐与速度,V4 Pro定位更复杂工作流;此前已公开DeepSeek Harness(Agent运行时)并启动API峰谷定价。所谓Agent harness,白话是把模型放进可调用工具、可重试、可记录会话的外壳里跑任务——同一模型换外壳,成绩可能差一截。据VentureBeat报道,工具平台Composio将V4 Flash放入Claude Code、Codex、OpenCode等八套Agent harness,在涵盖Gmail、GitHub、Slack、Google Sheets等实时工具的三十项故意加难的多步任务上共跑二百四十次:一百二十九次通过,整体约百分之五十三点八;仅六项工作流在所有测试harness上全部成功。

报道据此强调:编排、工具配置、缓存、重试与服务栈,可能比「裸模型能力」更能决定企业场景成败。同一篇文章梳理官方价目:V4 Flash与Pro按峰谷与缓存命中等维度上调,部分口径相对此前低价可升高数倍至十余倍不等;公司称约十七个小时维持半价以鼓励可调度负载。即便涨价,分析仍认为相对多家前沿闭源厂商仍具价格优势。OpenRouter等平台上Flash仍居高用量位置——开发者侧热度与企业合同化落地,被区分成两件事。

可以把本轮验收标准改写成三句话:

  1. 榜单与流量:Flash仍受开发者追捧,不等于生产一次通过。
  2. Harness方差:同一模型在不同外壳上表现分裂,采购要测「模型 + 编排」组合。
  3. 经济变量:峰谷价把「何时推理」变成成本开关;可等待的批量任务与实时Agent账单结构不同。

与八月十四日前后Harness开源续报的分工是:彼时是运行时与定价架构落地;本条是真实Agent任务与涨价后的产业解释。对采购方,指标应从「榜单分」换成「单位成功工作流成本」与失败恢复率;对多模型架构团队,则更支持「便宜模型跑高频、贵模型跑高风险」的路由思路。

需要把边界读清楚。Composio评测为第三方设置,不能直接写成「模型废了」;涨价以DeepSeek官方价目页为准;Flash API仍处公测叙事时,企业标准化证据链仍短。下一观察点是Flash结束公测后的稳定性,以及多模型路由是否成为默认企业架构——榜单会骗人,账单与失败日志不会。