研究|Salesforce:自改进Agent脆弱性——方差、任务顺序与欠规格化

PromptTree|阅读 0
2026/08/20 09:45
Salesforce自改进AgentWebArenaAgent评测
Salesforce AI Research于8月19日提交arXiv:2608.18066,复评记忆型自改进Agent:约七成情形方差上升,乱序任务下性能由升转降,并指向任务与环境欠规格化。

自改进Agent若只报单次跑分,很容易把运气写成进步。企业若把「越用越聪明」写进采购故事,却不测方差与乱序,最后买单的往往是线上事故。

Salesforce AI Research是Salesforce旗下人工智能研究团队,长期关注企业场景下的Agent可靠性与评测协议。所谓自改进Agent,白话是系统在任务流中边干边写记忆,试图用过去经验提升后续表现;所谓欠规格化,白话是任务说明或环境约束写得不够清楚,模型只好脑补——脑补对了像聪明,脑补错了会把错误写进长期记忆。团队于8月19日在arXiv提交论文《On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification》(编号2608.18066)。

研究在升级底层模型与Agent外壳后,于WebArena、VisualWebArena、SCUBA等网页代理基准上重测Agent Workflow Memory与ReasoningBank两类代表方法,并沿两条轴扩展:多次独立运行以量化方差;随机打乱任务顺序以检验顺序依赖。

主要可核对的观察:

  1. 方差:复杂环境与多步任务上评估本就嘈杂,叠上自改进环后噪声常被放大——约百分之七十一的情形方差上升,同实验最优与最差运行差距可达约十个百分点。
  2. 顺序:默认任务顺序往往隐含由易到难的课程;ReasoningBank在默认顺序下平均约提升百分之一点五,随机打乱后反而约下降百分之四点五。
  3. 机制假设:任务与环境欠规格化会让Agent写下「听起来合理却不可执行」的记忆(例如在仅浏览器环境中建议调用API),干扰后续策略。
  4. 缓解:补充更细评分标准与环境反馈可部分缓解,但仍留显著缺口。

对产业的提醒很直接:单次Demo分数不够当采购依据;真实流量也不会按教材顺序到来。可以把评测纪律改写成两句验收语——要报多运行分布,不要只报最好一次;要用乱序压力测,不要只测默认课表。作者呼吁更严格的评测协议,以及能让人有效盯住记忆写入的系统与界面,避免Agent以不可预见的方式失败。

需要把边界读清楚。论文针对特定记忆方法与网页基准,外推到所有Agent架构需谨慎。下一观察点是业界是否把多运行与乱序写入默认报告模板,以及记忆写入是否引入更强的人机共审——能越跑越强是愿景,能在乱序与噪声下不越跑越飘才是验收。