一条内测招募帖,把评论区变成了开源Agent路演——DeepSeek要摸的不是又一个聊天机器人,而是模型之外的执行层。
DeepSeek是国内以高性价比大模型与API服务著称的人工智能公司,产品线覆盖对话、推理与开发者接口,近年在开源与闭源API两端都保持高频迭代。所谓Harness,业内常用公式概括为:Model + Harness = Agent。模型负责理解与规划,Harness负责把能力落到真实环境——调工具、操作终端、读写文件、管理上下文、处理执行错误,最终走完任务闭环。它不是单纯的代码补全插件,而是套在模型外面的「缰绳与马具」。
近期,DeepSeek由Agent Harness团队负责人公开招募Harness内测参与者,要求申请者参与过开源Agent项目的建立与维护,并提交GitHub仓库作为代表作品。公开信息显示,公司已在内部使用Harness完成DeepSeek-V4-Flash正式版等相关基准测试;社区据此猜测,其可能进一步推进面向软件工程场景的Coding Agent产品形态,但官方尚未给出完整产品时间表,相关推断仍属观察口径,不宜写成已发布结论。
据开发者侧统计,截至8月3日上午约11:30,报名者约769人、去重后开源仓库约712个、合计星标超过约120万,覆盖约18个赛道:从个人Harness、Coding Agent,到记忆系统、安全工具与评测框架,几乎摊开了当前Agent基础设施的主要方向。
这件事为什么值得单独跟踪:
把背景拉开:过去半年,行业已经从「会不会写一段代码」走到「能不能在仓库里改完、跑通、少翻车」。微软等云厂商强调把harness与模型解耦,使「每个模型都可替代」;中国开源阵营则在低价模型之上抢执行层标准。谁先把稳定的工具调用、沙箱与评测脚手架做成默认,谁就更可能锁住开发者工作流——模型可以换,执行习惯很难换。
对报名开发者,价值是把仓库送到可能成为主流执行层的团队眼前,换取反馈与曝光。对DeepSeek,价值是拿到真实失败案例与场景需求,而不是只看榜单截图。对企业工程负责人,则应开始把「模型选型」和「Harness/运行时选型」拆开评估:没有可靠执行层,再便宜的旗舰模型也会在长任务中失速。
下一观察点很具体:内测反馈能否转化为可对外的Harness能力或产品入口,以及社区复现能否在V4-Flash等高性价比底座上跑出可对比的长任务成功率。执行层一旦产品化,开源Agent赛道的比武台会从模型卡,进一步挪到工具协议、沙箱策略与评测集上。