真实机器人没有「暂停键」。当视觉-语言-动作模型(VLA)与世界动作模型一次生成未来一段时间的动作序列,推理又越来越慢时,部署侧普遍改用异步推理:手上继续做A,后台同时算B。问题随之而来——模型「计划过」的动作,和机器人「真正做过」的动作,不再一一对应。9月4日前后,星尘智能(Astribot)基座模型团队发布在线强化学习框架SmoothRL,把账本拆清楚:只对真实执行过的动作做策略更新。
星尘智能是聚焦绳驱本体与具身全栈的机器人公司,公开叙事强调「Design for AI」:身体、操作系统与模型不应割裂设计。产品线覆盖Lumo系列基座模型、前端Agent以及绳驱本体S1;近日亦有强化学习专家加盟补强「训练之后」环节。SmoothRL由基座模型团队推出,对应论文已挂到arXiv(编号2608.29768),英文全称Online Reinforcement Learning During Asynchronous Execution。
框架与实现要点:
所谓异步在线强化学习,白话是机器人边干活边学,而且只根据真正发生过的动作改策略;所谓action chunk,白话是一次推理吐出「未来一小段动作清单」,而不是一步一问。异步之所以必要,是因为模型越大、单次推理越慢,若每算完一段才动一下,投掷这类高动态任务会在chunk边界掉速,整段摆动可能直接失败。
真机侧,团队在绳驱本体S1上测了三项互补任务。动态投掷要求从随机位置抓取并投进不同目标箱,成功率由约39%升至约94%(约250个rollout评估节点);给笔戴帽允许相对位姿误差约5毫米量级,由约8%升至约83%;快递开箱需用约1毫米宽刀片插入约2—3毫米接缝,由约30%升至约90%。公开口径还显示,投掷任务中末端加速度均方根约降52%、加加速度约降47%——更准的同时更平滑。学习曲线也并不总是单调:开箱任务中途曾一度回落,再爬升到终值,说明真实在线探索会经历阶段性变差。
放在具身商业化上下文里,过去两年行业主要在解决「会不会」:更多数据、更强基座、更宽场景。进入开放环境之后,新瓶颈往往是「差几毫米、差半拍」。竞品若只在仿真同步设定下刷分,到真机异步部署仍可能对错账。SmoothRL把讨论钉在部署态时间结构上,等于主动邀请对照:后训练有没有按真实执行分布优化。
产业影响上,若同类框架成为标配,具身交付验收会更多看连续运行中的偏差收敛与动作平滑,而不仅看离线成功率截图。需要把边界读清楚:当前实现依赖固定延迟预算与稀疏成败奖励,操作员必要时仍可介入;基础策略若离目标过远,局部residual救不回来。下一观察点是更大范围策略更新、更广任务分布,以及与生成式策略端到端优化的结合。