多数世界—动作模型仍习惯「借」预训练视频生成器的视觉先验,真正从头在操作数据上把生成与动作组件训起来的路径,公开样本并不多。近窗,智元机器人公开GE-Act 2.0(Genie Envisioner Act 2.0):强调可训练的生成与动作组件均在具身操作数据上从随机初始化起步,不依赖现成视频生成模型;配套论文已出现在arXiv(编号2609.05588)。
智元是国内人形与具身操作整机厂商,此轮把叙事压在「原生世界—动作模型」与可对照的数据缩放曲线上。公开实验采用约300、1200、5000、30000小时四档共训数据对照;真机零样本测试覆盖约100项原子任务、约20类技能及两种机器人本体,并在留出场景、背景、光照与物体实例条件下评估,不先做逐任务微调——等于先考「没见过的房间能不能干」,而不是「背过的考卷能不能满分」。
模型与结果要点(论文/团队公开口径):
所谓原生世界—动作模型,白话是先在操作数据里学会「看见未来状态再反推动作」,而不是先做一个好看的视频生成器再硬接到机械臂;所谓数据缩放仍未饱和,白话是继续堆真实配对轨迹,成功率还在涨。公开材料亦称,折毛巾、嵌套纸杯、拔插笔盖、插花等精细操作在小规模数据下完不成,到约3万小时才出现能力跃迁——对具身团队,这把讨论从「有没有世界模型海报」推到「小时数—成功率曲线能不能公开对照」。
放在世界模型赛道上下文里,近窗多家厂商用高动态演示或仿真榜单证明「推演能接到身体上」。智元选择「从零共训 + 跨本体共享数据」切口,赌的是操作数据本身的Scaling Law,而不是视频生成先验的迁移红利。竞品若只有演示成片、给不出同协议下的小时数曲线,对照会变得吃力。
产业影响上,若跨本体迁移被更多厂商复现,共享操作数据的价值会进一步抬升;若曲线只在自家本体成立,市场仍会回到「整机绑定模型」的老路径。需要把边界读清楚:成功率为团队评测协议下的公开数字;真机连续工况、失败恢复与安全围栏仍待更多第三方复核。下一观察点是开源权重/评测协议是否放出,以及其他本体厂能否在同协议下对照。