研究|HarnessEval-W:把世界模型评测做成可执行Harness

PromptTree|阅读 0
2026/08/19 08:29
HarnessEvalMirroS世界模型Agent评测
MirroS联合清华、北大、Berkeley、MIT、英伟达等力量发布HarnessEval-W:用可执行Harness评测视觉世界模型,覆盖约18个模型与约330个案例;论文arXiv:2608.16859,代码已开源。

模型会跑任务之后,下一问是:评测本身会不会也需要一套Agent外壳?MirroS联合多家机构给出的答案叫HarnessEval-W。

公开材料与开源仓库显示,MirroS团队联合清华、北大、Berkeley、MIT、xbench、英伟达等研究力量,于8月18日前后发布HarnessEval;首个落地实现面向视觉世界模型,称为HarnessEval-W,论文编号arXiv:2608.16859;代码与项目页分别公开于GitHub(mirros-lab/harnesseval-w)与 mirros-lab.github.io/HarnessEval-W。所谓Harness,白话是把「规划步骤、调用工具、验证证据、汇总结论」做成可执行工作流,而不是只丢一个固定量表打分;所谓世界模型,白话是根据历史观测与用户动作生成未来画面、并维持可干预世界状态的系统——判断它好不好,往往要看物理是否离谱、因果是否断裂、状态能否长程保持。

方法与规模上可核对的要点:

  1. 流程:父Agent解读案例上下文,把评测问题拆成可测子问题,调度带诊断工具的子Agent,再校验证据并汇总为可检查的evidence tree(证据树)。
  2. 维度:围绕观测质量(Render)、干预下状态转移(Transition)、长程世界持续性(Persistence)组织案例。
  3. 规模:公开口径称覆盖约18个代表性世界模型、约330个评测案例,并报告数千次量级的打分轨迹。
  4. 开放:完整流水线、评测代码与基准资源开源,邀请社区扩展技能库与案例。

把这条放进2026年中的评测坐标:前一阶段行业习惯比榜单分数;Agent时代更卡人的,是「分数背后有没有可复核推理链」。可以把它想成:旧评测像只给总分的试卷;HarnessEval像带步骤分与验算过程的阅卷——错在哪一帧、哪一次干预,证据树上应该看得见。对世界模型与视频生成团队,意义是失败模式可以被拆开看;对企业采购,则提示「评测即工作流」可能成为下一代验收标配。

需要把边界读清楚。作者实验设置与人类偏好对齐结果以论文为准,跨机构复现仍待社区验证;榜单快照会随版本更新。下一观察点是技能库能否持续生长,以及该方法能否迁移到更通用的Agent评测——能给世界模型做体检是第一步,能让评测系统自己发现能力缺口才是下一程。