模型会跑任务之后,下一问是:评测本身会不会也需要一套Agent外壳?MirroS联合多家机构给出的答案叫HarnessEval-W。
公开材料与开源仓库显示,MirroS团队联合清华、北大、Berkeley、MIT、xbench、英伟达等研究力量,于8月18日前后发布HarnessEval;首个落地实现面向视觉世界模型,称为HarnessEval-W,论文编号arXiv:2608.16859;代码与项目页分别公开于GitHub(mirros-lab/harnesseval-w)与 mirros-lab.github.io/HarnessEval-W。所谓Harness,白话是把「规划步骤、调用工具、验证证据、汇总结论」做成可执行工作流,而不是只丢一个固定量表打分;所谓世界模型,白话是根据历史观测与用户动作生成未来画面、并维持可干预世界状态的系统——判断它好不好,往往要看物理是否离谱、因果是否断裂、状态能否长程保持。
方法与规模上可核对的要点:
把这条放进2026年中的评测坐标:前一阶段行业习惯比榜单分数;Agent时代更卡人的,是「分数背后有没有可复核推理链」。可以把它想成:旧评测像只给总分的试卷;HarnessEval像带步骤分与验算过程的阅卷——错在哪一帧、哪一次干预,证据树上应该看得见。对世界模型与视频生成团队,意义是失败模式可以被拆开看;对企业采购,则提示「评测即工作流」可能成为下一代验收标配。
需要把边界读清楚。作者实验设置与人类偏好对齐结果以论文为准,跨机构复现仍待社区验证;榜单快照会随版本更新。下一观察点是技能库能否持续生长,以及该方法能否迁移到更通用的Agent评测——能给世界模型做体检是第一步,能让评测系统自己发现能力缺口才是下一程。