智能体练到一定程度,静态题库会变「太简单」;重新造仿真又贵又容易引入假标签。EnvHarness选择给旧环境加可编程外壳。
VentureBeat报道,Google Cloud AI Research与学术合作方开源EnvHarness(Apache 2.0)。它在既有环境外包一层:Stage改起始状态,Contract过滤动作或改观测,Chain把任务串成更长轨迹,同时保留原环境与原有校验器。配套EnvRigger按「观察—诊断—编写—验证」循环,根据失败轨迹自动组合修改并检验是否仍可解。主实验覆盖ALFWorld、WebArena、SWE-bench Verified、OfficeQA与SpreadsheetBench;相对未改环境,持出任务最高提升约9分;SWE-bench上平均步数从约55.01降至约49.61。
研究者强调它不替代底层环境,而是放大器;适合可重置的数字沙箱,不适合直接怼不可逆生产系统或真机。代码、实验配置与强化学习实现已在GitHub公开。对企业团队,这意味着在可信题库上继续「挖弱点」,而不是无限生成新仿真。