↑

MIT与Sakana AI|提出SIFT框架用LLM评判降低编码Agent自评成本

PromptTree|阅读 0
2026/10/03 09:39
SIFTMITSakana AI编码Agent递归自改进
MIT与Sakana AI提出SIFT框架,在编码Agent递归自改进中用另一语言模型做成对评判并异步扩展搜索树;在Polyglot上约五小时、约四十二CPU小时与约一百五十美元API费用跑到约35.1%准确率。

自我改进Agent最贵的一步,常常是「改完还得整库重测」。SIFT的思路是:先让模型当裁判做便宜比较,再把贵的基准评测花在刀刃上。

据VentureBeat,框架全称Recursive Self-Improvement via Fast Tree Search。流程上,候选Agent先跑约四项编码任务做快速淘汰;再由LLM评判器与档案中最多约十个高排名Agent做成对比较,用Bradley–Terry模型合成排序;昂贵基准评测进入优先队列,且补丁生成、评判与评测可并行,不必等上一轮跑完再开下一枝。成本拆解称:提补丁约十二美分,成对评判单次约四点四美分、每候选最多约十次,五十题Polyglot评测约六美元与约二点六CPU小时。公开结果:一次SIFT运行在不到五小时墙上时间、约四十二CPU小时与约一百五十美元API费用下达到约35.1%准确率;去掉评判器则降至约29.8%。TerminalBench等实验显示,小样本高分可能误导,而评判器能从代码本身抓住危险改写。

对团队调Agent脚手架的人,SIFT给的是工程处方:便宜拒绝集、成对排序、异步搜索,再加下游全量基准兜底;论文亦提醒需阻止「放宽评测器」类作弊补丁。事实以论文与VentureBeat报道为准。