续:Scalabot|发布HERON-CRA情境强化行动模型

PromptTree|阅读 0
2026/09/16 07:49
ScalabotHERON-CRA具身智能强化学习
继近窗发布HERON-World Model后,Scalabot于9月15日发布HERON-CRA,强调Context Expert、RL Engine与Cross-Embodiment Pretraining,并与世界模型结合形成「真实经验+想象轨迹」学习闭环。

世界模型若只能「预演未来」,还缺一截:真实失败之后能不能记住、改策略,再把经验迁移到别的身体与任务上。继近窗发布HERON技术架构下的首个模型HERON-World Model(让机器人学习世界、预演未来)之后,Scalabot于9月15日发布第二个模型——HERON-Context Reinforcement Action Model(HERON-CRA)。公开定位是让机器人记住过去、从错误中学习,并把一次经验转化为下一次能力。

Scalabot是松延动力相关具身智能团队/品牌,近窗持续推进HERON体系。HERON-World Model回答的是「能不能在脑子里先演一遍」;HERON-CRA回答的是「演完、做错之后,能不能越做越稳,并且换本体还能用」。两者被叙述为可结合:CRA在真实环境中积累成功与失败经验,再作为起点与World Model一起生成「想象轨迹」,以便在不增加真实硬件风险的前提下反复尝试。

能力要点(团队公开口径):

  1. Context Expert:理解任务如何发生,把握情境与过程
  2. RL Engine:从错误中持续修正,使行动具备持续进化可能
  3. Cross-Embodiment Pretraining:跨不同身体与任务迁移已学能力
  4. 闭环:真实状态经验 + World Model想象轨迹,降低真机试错成本
  5. 目标叙事:从「做对一次」走向「能够持续修正」「越做越好」

所谓情境强化行动,白话是先搞清楚「眼下这场任务是怎么展开的」,再用强化学习把错误变成下次更好的策略。所谓跨本体预训练,白话是希望学到的不只是某一台机械臂的肌肉记忆,而是可迁移的操作能力。对具身团队,这把讨论从「有没有世界模型海报」推进到「评价与反馈有没有真正进入行动环」。

续报意义上,上周侧重理解与预演,本周补上记忆、强化与迁移。竞品开源项目若只有世界模型权重、缺少行动侧闭环与跨本体叙述,完整度会显得半截;若CRA长期只有框架文案、缺少可复核真机成功率表,同样难说服工程团队。

产业影响上,若随后给出评测协议与接口文档,会抬高「世界模型+行动模型」双件套的可复现讨论密度;若停在发布口径,热度会随新闻周期退去。需要把边界读清楚:公开材料以能力框架与产品叙事为主,独立大规模真机对照表仍有限。下一观察点是评测协议与权重/接口是否进一步开放,以及与World Model闭环在第三方机台上的复现。