清华AIR×域变换|Zeva提出具身In-Context Causal Learning,冻结权重也能自进化

PromptTree|阅读 0
2026/09/04 09:23
清华AIRZeva具身智能世界模型
清华AIR与孵化公司域变换公开Zeva:部署后冻结策略权重,仅更新因果交互记忆,实现In-Context Causal Learning。仿真口径RoboCasa平均成功率约76.8%,自进化曲线由约26%抬至约73%;支持一次人类演示后无需微调复现关键操作。

具身模型若每次失败都要回炉微调,部署成本会把「自进化」锁死在实验室;若能在参数冻结的前提下越用越强,产线才敢谈持续运行。近窗,清华大学人工智能国际治理研究院方向的产业研究机构清华AIR,与其孵化公司域变换,公开Zeva框架——自称首个实现In-Context Causal Learning(ICCL)的具身世界动作模型(WAM)路径。

清华AIR面向产业化AI研究,域变换由相关教授团队发起,定位把物理智能自进化从论文推向可部署系统。Zeva要回答的不是「再训一个更大的VLA」,而是:机器人在真实世界里做错一次之后,能不能把这次交互变成下次决策的上下文,而无需改动权重。

方法与评测要点:

  1. 因果交互抽取:把已执行动作与其引起的状态变化编码为因果信号
  2. 双时标因果记忆:分别沉淀短期与更长周期经验,供后续检索
  3. 上下文策略注入:决策时检索与当前任务阶段匹配的证据,构造Causal Prompt注入冻结的动作生成模型(公开材料提及Cosmos3等相关组件),全程零梯度更新
  4. 仿真:RoboCasa365-Atomic5平均成功率约76.8%,公开称优于对照的前沿VLA/WAM
  5. 自进化:部署后累计成功率从Evolve 1约26%抬升至Evolve 4约73%;支持一次人类演示初始化后、无需微调复现关键操作

所谓ICCL,白话是像大模型的上下文学习,但学的是「我刚才碰了什么、世界怎么变了」;所谓冻结权重,白话是现场只改记忆与提示,不改模型参数,从而避免每台机器人单独微调的工程地狱。对产线而言,这意味着故障恢复可能从「叫算法工程师」变成「多试几次、把经验写进记忆」。

放在具身路线图上下文里,行业长期在模仿学习、强化学习与世界模型之间摆动:模仿缺泛化,强化学习贵且难安全,纯扩大参数又碰数据墙。Zeva把scaling曲线拆成两条——参数规模之外,再加一条「交互次数→因果上下文→成功率」的独立轴。若成立,竞品只刷预训练分数会显得不够;若难复现,则仍是论文高光。

产业影响上,域变换作为落地载体,后续要看客户侧连续运行与跨本体迁移;对本体厂,则是要不要把因果记忆层写进标配中间件。需要把边界读清楚:数字属论文与项目页评测口径,跨工况、跨本体泛化仍待第三方复现。下一观察点是开源或产品化节奏,以及真实产线故障恢复指标。