自探索智能体最贵的往往不是「想出更好的策略」,而是把已经失败过的路径再付费跑一遍。9月17日,据VentureBeat报道,Google与DeepMind及马里兰大学、弗吉尼亚大学等研究者提出Dream-RSI:让历史发现轨迹变成可查询的世界,在「做梦」里改进探索策略,从而少调用昂贵的在线发现智能体。
该工作由约17名研究者跨机构完成,定位轻量编排层:控制分支、并行与停止,而不改底层编码智能体本身。公开叙事刻意区分两类「RSI」:安全辩论里可能导致失控的递归自我改进,与工程上提高自探索循环效率的策略改进——Dream-RSI明确站在后者。
方法与结果要点(研究报道口径):
所谓历史发现树,白话是把探索过程存成带结果的搜索档案,而不是扔进日志黑洞。所谓回放模拟器,白话是问「假如当时换种分支策略会怎样」时,答案已经在磁盘上。所谓做梦改进,白话是先在档案里试成千上万种策略,再把赢家放回真实在线探索。
放在企业Agent预算暴涨的上下文里,团队常为重复失败路径二次付费。Dream-RSI把「已付费历史」变成可复用资产。竞品编排若只会加并行、不会读历史,成本曲线会更陡;若只有论文、缺可复现代码,热度也会快消。
产业影响上,若开源被广泛复现,可能进入更多Agent编排产品;若数字只绑死特定基线,采购仍会谨慎。需要把边界读清楚:162倍对照特定设置;研究≠已上线云产品。下一观察点是第三方复现质量,以及是否进入Google内部Agent栈。