续报八月中旬Harness开源与峰谷定价落地之后,本轮增量是:榜单热度与真实多工具Agent通过率之间的裂缝,被独立评测摊开。
DeepSeek是国内大模型公司,V4 Flash定位高吞吐与速度,V4 Pro定位更复杂工作流;此前已公开DeepSeek Harness(Agent运行时)并启动API峰谷定价。所谓Agent harness,白话是把模型放进可调用工具、可重试、可记录会话的外壳里跑任务——同一模型换外壳,成绩可能差一截。据VentureBeat报道,工具平台Composio将V4 Flash放入Claude Code、Codex、OpenCode等八套Agent harness,在涵盖Gmail、GitHub、Slack、Google Sheets等实时工具的三十项故意加难的多步任务上共跑二百四十次:一百二十九次通过,整体约百分之五十三点八;仅六项工作流在所有测试harness上全部成功。
报道据此强调:编排、工具配置、缓存、重试与服务栈,可能比「裸模型能力」更能决定企业场景成败。同一篇文章梳理官方价目:V4 Flash与Pro按峰谷与缓存命中等维度上调,部分口径相对此前低价可升高数倍至十余倍不等;公司称约十七个小时维持半价以鼓励可调度负载。即便涨价,分析仍认为相对多家前沿闭源厂商仍具价格优势。OpenRouter等平台上Flash仍居高用量位置——开发者侧热度与企业合同化落地,被区分成两件事。
可以把本轮验收标准改写成三句话:
与八月十四日前后Harness开源续报的分工是:彼时是运行时与定价架构落地;本条是真实Agent任务与涨价后的产业解释。对采购方,指标应从「榜单分」换成「单位成功工作流成本」与失败恢复率;对多模型架构团队,则更支持「便宜模型跑高频、贵模型跑高风险」的路由思路。
需要把边界读清楚。Composio评测为第三方设置,不能直接写成「模型废了」;涨价以DeepSeek官方价目页为准;Flash API仍处公测叙事时,企业标准化证据链仍短。下一观察点是Flash结束公测后的稳定性,以及多模型路由是否成为默认企业架构——榜单会骗人,账单与失败日志不会。