Google|Dream-RSI研究:回放历史发现树最高可省约162倍发现调用

PromptTree|阅读 0
2026/09/18 07:19
GoogleDream-RSIAgent探索深度学习研究
9月17日VentureBeat报道Google等提出Dream-RSI:将发现过程建成历史发现树并在回放模拟器中改进探索策略;相对SimpleTES等基线,发现智能体调用最高可减约162倍,代码称已公开。

自探索智能体最贵的往往不是「想出更好的策略」,而是把已经失败过的路径再付费跑一遍。9月17日,据VentureBeat报道,Google与DeepMind及马里兰大学、弗吉尼亚大学等研究者提出Dream-RSI:让历史发现轨迹变成可查询的世界,在「做梦」里改进探索策略,从而少调用昂贵的在线发现智能体。

该工作由约17名研究者跨机构完成,定位轻量编排层:控制分支、并行与停止,而不改底层编码智能体本身。公开叙事刻意区分两类「RSI」:安全辩论里可能导致失控的递归自我改进,与工程上提高自探索循环效率的策略改进——Dream-RSI明确站在后者。

方法与结果要点(研究报道口径):

  1. 表示:把每次决策与结果建成「历史发现树」并落盘
  2. 三阶段:在线探索建树 → 构造回放模拟器 → 基于做梦的策略改进
  3. 收益:评估新策略只需读历史,无需重跑发现智能体/评估器
  4. 数字:相对SimpleTES等基线,发现调用最高可减少约162倍
  5. 示例:Lasso等任务上配合Gemini-3.1-Pro等,可同时改善质量—算力权衡;GPU kernel等任务亦给出少生成次数或更高表现的对照
  6. 开放:代码称已公开

所谓历史发现树,白话是把探索过程存成带结果的搜索档案,而不是扔进日志黑洞。所谓回放模拟器,白话是问「假如当时换种分支策略会怎样」时,答案已经在磁盘上。所谓做梦改进,白话是先在档案里试成千上万种策略,再把赢家放回真实在线探索。

放在企业Agent预算暴涨的上下文里,团队常为重复失败路径二次付费。Dream-RSI把「已付费历史」变成可复用资产。竞品编排若只会加并行、不会读历史,成本曲线会更陡;若只有论文、缺可复现代码,热度也会快消。

产业影响上,若开源被广泛复现,可能进入更多Agent编排产品;若数字只绑死特定基线,采购仍会谨慎。需要把边界读清楚:162倍对照特定设置;研究≠已上线云产品。下一观察点是第三方复现质量,以及是否进入Google内部Agent栈。