星尘智能|发布SmoothRL,异步推理下在线强化学习只从真实执行动作学习

PromptTree|阅读 0
2026/09/05 08:14
星尘智能SmoothRL在线强化学习具身智能
9月4日前后星尘智能发布SmoothRL,解决大模型异步推理下「计划动作」与「真实执行」不一致时的在线RL记账问题:只对Execution区域回传梯度。S1真机上投掷成功率约39%→94%,给笔戴帽约8%→83%,开箱约30%→90%。

真实机器人没有「暂停键」。当视觉-语言-动作模型(VLA)与世界动作模型一次生成未来一段时间的动作序列,推理又越来越慢时,部署侧普遍改用异步推理:手上继续做A,后台同时算B。问题随之而来——模型「计划过」的动作,和机器人「真正做过」的动作,不再一一对应。9月4日前后,星尘智能(Astribot)基座模型团队发布在线强化学习框架SmoothRL,把账本拆清楚:只对真实执行过的动作做策略更新。

星尘智能是聚焦绳驱本体与具身全栈的机器人公司,公开叙事强调「Design for AI」:身体、操作系统与模型不应割裂设计。产品线覆盖Lumo系列基座模型、前端Agent以及绳驱本体S1;近日亦有强化学习专家加盟补强「训练之后」环节。SmoothRL由基座模型团队推出,对应论文已挂到arXiv(编号2608.29768),英文全称Online Reinforcement Learning During Asynchronous Execution。

框架与实现要点:

  1. 三区划分:每个action chunk按执行状态切成Committed(上一轮已锁定、来不及改)、Execution(本轮真正落地)、Discarded(尚未执行就被下一轮覆盖)
  2. 梯度规则:价值梯度只穿过Execution区域,避免「没做过的动作」因任务成败被错误记功或背锅
  3. Reinforce in Deployment:训练rollout本身就跑异步推理,replay记录真实时间关系下的轨迹,而不是先在理想同步世界练完再换异步部署
  4. 策略结构:以微调后的π0.5为冻结基础策略,再用轻量TD3-style actor-critic在原始动作空间学习residual correction
  5. 控制节奏:S1约30Hz执行动作,约5Hz发起推理请求;基础策略每次预测约32帧,固定延迟预算下真正执行的Execution区约占其中一部分帧

所谓异步在线强化学习,白话是机器人边干活边学,而且只根据真正发生过的动作改策略;所谓action chunk,白话是一次推理吐出「未来一小段动作清单」,而不是一步一问。异步之所以必要,是因为模型越大、单次推理越慢,若每算完一段才动一下,投掷这类高动态任务会在chunk边界掉速,整段摆动可能直接失败。

真机侧,团队在绳驱本体S1上测了三项互补任务。动态投掷要求从随机位置抓取并投进不同目标箱,成功率由约39%升至约94%(约250个rollout评估节点);给笔戴帽允许相对位姿误差约5毫米量级,由约8%升至约83%;快递开箱需用约1毫米宽刀片插入约2—3毫米接缝,由约30%升至约90%。公开口径还显示,投掷任务中末端加速度均方根约降52%、加加速度约降47%——更准的同时更平滑。学习曲线也并不总是单调:开箱任务中途曾一度回落,再爬升到终值,说明真实在线探索会经历阶段性变差。

放在具身商业化上下文里,过去两年行业主要在解决「会不会」:更多数据、更强基座、更宽场景。进入开放环境之后,新瓶颈往往是「差几毫米、差半拍」。竞品若只在仿真同步设定下刷分,到真机异步部署仍可能对错账。SmoothRL把讨论钉在部署态时间结构上,等于主动邀请对照:后训练有没有按真实执行分布优化。

产业影响上,若同类框架成为标配,具身交付验收会更多看连续运行中的偏差收敛与动作平滑,而不仅看离线成功率截图。需要把边界读清楚:当前实现依赖固定延迟预算与稀疏成败奖励,操作员必要时仍可介入;基础策略若离目标过远,局部residual救不回来。下一观察点是更大范围策略更新、更广任务分布,以及与生成式策略端到端优化的结合。