多数具身策略仍停在「看见状态就输出动作」,真正缺的是:能不能先预演后果、给结果打分,再用反馈改策略。近窗,生数科技发布面向灵巧操作的自进化通用世界模型Motus2;项目主页与论文已公开。公开叙事强调:同一共享参数的视频—动作模型,同时暴露策略(世界—动作模型)、模拟器(动作条件世界模型)与评估器(价值模型),把动作提案、后果预测与结果评估耦合成可规划、可学习的闭环,并把它定位为对递归自我改进(RSI,Recursive Self-Improvement)的初步探索。
生数是国内做视频生成与世界模型产品线的团队,此前以Vidu等视频能力与Motus系列具身世界模型并行推进。前代Motus发布时,公开对照口径称在约50项通用任务测试中较Pi-0.5绝对成功率高出约35个百分点以上。Motus2进一步纳入视觉、语言、动作与触觉等模态,试图在一个模型里同时点亮「行动、预测、评估」三棵技能树,并把失败轨迹也纳入动力学与价值学习,而不只当噪声丢掉。
模型与数据要点(项目页/团队公开口径):
真机对照(团队评测协议):
所谓自进化,白话是用模型自己的预测与打分改进策略,不等于开放世界里无限自主学习;所谓Ego数据路径,白话是先从人类第一视角操作经验学世界与手物交互,再迁移到机器手控制空间。对具身团队,这把讨论从「有没有世界模型海报」推进到「评价与反馈有没有真正进入闭环」。
放在近窗世界模型与VLA开源竞赛上下文里,行业一边刷长视频生成,一边追问真实接触力与失败恢复。Motus2选择把规划、MBRL与触觉补丁塞进同一套共享骨干,赌的是「脑内预演」能降低真机试错成本。竞品若只有演示成片、给不出同协议下的规划/学习消融,对照会变得吃力。
产业影响上,若权重与评测协议持续开放,会抬高「闭环自改进」作为可复现议题的密度;若长期停在项目页演示,市场仍会打折。需要把边界读清楚:成功率为团队评测协议下的公开数字;长期开放环境持续学习、跨本体触觉迁移仍属早期。下一观察点是权重与评测协议开放节奏,以及第三方在非自家手上的复现成功率。