生数|发布Motus2自进化通用世界模型,探索灵巧操作闭环改进

PromptTree|阅读 0
2026/09/13 08:48
生数科技Motus2世界模型具身智能
生数发布面向灵巧操作的自进化通用世界模型Motus2;同一模型暴露策略、模拟器与评估器形成闭环,项目页与论文已公开,并给出多项真机对照成功率。

多数具身策略仍停在「看见状态就输出动作」,真正缺的是:能不能先预演后果、给结果打分,再用反馈改策略。近窗,生数科技发布面向灵巧操作的自进化通用世界模型Motus2;项目主页与论文已公开。公开叙事强调:同一共享参数的视频—动作模型,同时暴露策略(世界—动作模型)、模拟器(动作条件世界模型)与评估器(价值模型),把动作提案、后果预测与结果评估耦合成可规划、可学习的闭环,并把它定位为对递归自我改进(RSI,Recursive Self-Improvement)的初步探索。

生数是国内做视频生成与世界模型产品线的团队,此前以Vidu等视频能力与Motus系列具身世界模型并行推进。前代Motus发布时,公开对照口径称在约50项通用任务测试中较Pi-0.5绝对成功率高出约35个百分点以上。Motus2进一步纳入视觉、语言、动作与触觉等模态,试图在一个模型里同时点亮「行动、预测、评估」三棵技能树,并把失败轨迹也纳入动力学与价值学习,而不只当噪声丢掉。

模型与数据要点(项目页/团队公开口径):

  1. 三接口:Policy 提案动作;Simulator 预测视觉后果;Evaluator 评估任务进展
  2. 信息流:中间训练与后训练采用Action-first,避免动作在生成前「偷看」未来视频帧
  3. 规划:推理侧可用Best-of-N,在脑内比较候选分支后再执行
  4. 学习:训练侧把价值信号用于基于模型的强化学习(MBRL);主要更新动作相关参数
  5. 数据:约13万小时人类第一视角(Ego)原始录制小时构成「人类数据金字塔」;再叠加百小时级机器人轨迹与人机对齐数据
  6. 触觉:轻量触觉专家模块,在子片段执行前用最新触觉窗口细化动作
  7. 本体:演示覆盖Sharpa Wave、WUJI Hand等高自由度灵巧手平台

真机对照(团队评测协议):

  1. 五项真机任务:仅Ego预训练平均成功率约51%;加入机器人中间训练后约84%
  2. 放置手机与多指操作:基础策略约65%;规划与MBRL结合约75%
  3. 部分接触任务:加入触觉后平均成功率约从60%升至72.5%
  4. 任务样例:拧灯泡、翻书、撕纸、开易拉罐等高接触操作

所谓自进化,白话是用模型自己的预测与打分改进策略,不等于开放世界里无限自主学习;所谓Ego数据路径,白话是先从人类第一视角操作经验学世界与手物交互,再迁移到机器手控制空间。对具身团队,这把讨论从「有没有世界模型海报」推进到「评价与反馈有没有真正进入闭环」。

放在近窗世界模型与VLA开源竞赛上下文里,行业一边刷长视频生成,一边追问真实接触力与失败恢复。Motus2选择把规划、MBRL与触觉补丁塞进同一套共享骨干,赌的是「脑内预演」能降低真机试错成本。竞品若只有演示成片、给不出同协议下的规划/学习消融,对照会变得吃力。

产业影响上,若权重与评测协议持续开放,会抬高「闭环自改进」作为可复现议题的密度;若长期停在项目页演示,市场仍会打折。需要把边界读清楚:成功率为团队评测协议下的公开数字;长期开放环境持续学习、跨本体触觉迁移仍属早期。下一观察点是权重与评测协议开放节奏,以及第三方在非自家手上的复现成功率。