自改进Agent若只报单次跑分,很容易把运气写成进步。企业若把「越用越聪明」写进采购故事,却不测方差与乱序,最后买单的往往是线上事故。
Salesforce AI Research是Salesforce旗下人工智能研究团队,长期关注企业场景下的Agent可靠性与评测协议。所谓自改进Agent,白话是系统在任务流中边干边写记忆,试图用过去经验提升后续表现;所谓欠规格化,白话是任务说明或环境约束写得不够清楚,模型只好脑补——脑补对了像聪明,脑补错了会把错误写进长期记忆。团队于8月19日在arXiv提交论文《On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification》(编号2608.18066)。
研究在升级底层模型与Agent外壳后,于WebArena、VisualWebArena、SCUBA等网页代理基准上重测Agent Workflow Memory与ReasoningBank两类代表方法,并沿两条轴扩展:多次独立运行以量化方差;随机打乱任务顺序以检验顺序依赖。
主要可核对的观察:
对产业的提醒很直接:单次Demo分数不够当采购依据;真实流量也不会按教材顺序到来。可以把评测纪律改写成两句验收语——要报多运行分布,不要只报最好一次;要用乱序压力测,不要只测默认课表。作者呼吁更严格的评测协议,以及能让人有效盯住记忆写入的系统与界面,避免Agent以不可预见的方式失败。
需要把边界读清楚。论文针对特定记忆方法与网页基准,外推到所有Agent架构需谨慎。下一观察点是业界是否把多运行与乱序写入默认报告模板,以及记忆写入是否引入更强的人机共审——能越跑越强是愿景,能在乱序与噪声下不越跑越飘才是验收。