自我改进Agent最贵的一步,常常是「改完还得整库重测」。SIFT的思路是:先让模型当裁判做便宜比较,再把贵的基准评测花在刀刃上。
据VentureBeat,框架全称Recursive Self-Improvement via Fast Tree Search。流程上,候选Agent先跑约四项编码任务做快速淘汰;再由LLM评判器与档案中最多约十个高排名Agent做成对比较,用Bradley–Terry模型合成排序;昂贵基准评测进入优先队列,且补丁生成、评判与评测可并行,不必等上一轮跑完再开下一枝。成本拆解称:提补丁约十二美分,成对评判单次约四点四美分、每候选最多约十次,五十题Polyglot评测约六美元与约二点六CPU小时。公开结果:一次SIFT运行在不到五小时墙上时间、约四十二CPU小时与约一百五十美元API费用下达到约35.1%准确率;去掉评判器则降至约29.8%。TerminalBench等实验显示,小样本高分可能误导,而评判器能从代码本身抓住危险改写。
对团队调Agent脚手架的人,SIFT给的是工程处方:便宜拒绝集、成对排序、异步搜索,再加下游全量基准兜底;论文亦提醒需阻止「放宽评测器」类作弊补丁。事实以论文与VentureBeat报道为准。