智元|发布GE-Act 2.0原生世界—动作模型,数据扩大百倍成功率显著提升

PromptTree|阅读 1
2026/09/10 08:15
智元机器人GE-Act 2.0世界模型具身智能
近窗智元公开GE-Act 2.0:生成与动作组件均在操作数据上从零训练;共训数据从约300扩至约3万小时后,G1-OP成功率约从17.1%升至44.1%,并显示跨本体迁移迹象。

多数世界—动作模型仍习惯「借」预训练视频生成器的视觉先验,真正从头在操作数据上把生成与动作组件训起来的路径,公开样本并不多。近窗,智元机器人公开GE-Act 2.0(Genie Envisioner Act 2.0):强调可训练的生成与动作组件均在具身操作数据上从随机初始化起步,不依赖现成视频生成模型;配套论文已出现在arXiv(编号2609.05588)。

智元是国内人形与具身操作整机厂商,此轮把叙事压在「原生世界—动作模型」与可对照的数据缩放曲线上。公开实验采用约300、1200、5000、30000小时四档共训数据对照;真机零样本测试覆盖约100项原子任务、约20类技能及两种机器人本体,并在留出场景、背景、光照与物体实例条件下评估,不先做逐任务微调——等于先考「没见过的房间能不能干」,而不是「背过的考卷能不能满分」。

模型与结果要点(论文/团队公开口径):

  1. 结构:控制导向自编码器CoAE + 一步式视觉规划器SVP + 逆动力学模型IDM
  2. 训练:视觉规划与逆动力学可先在互补数据上分别预训练,再用KASO做知识对齐的选择性联合优化,降低「预测未来」与「记录动作」错位监督
  3. 压缩:CoAE将一帧约256×384画面压缩为约24个视觉token;指令—画面匹配准确率公开称约97.95%
  4. 时延:在RTX 5090上生成一个连续动作chunk公开称约104毫秒
  5. 缩放:数据扩大约100倍后,G1-OP总体成功率约从17.1%升至44.1%,G2-90D约从13.4%升至31.1%;5000到30000小时未见明显饱和
  6. 跨本体:训练数据占比不足约2%的G2-90D随共享数据扩大提升约17.7个百分点
  7. 微调后公开口径:RoboTwin陌生环境成功率约60.52%,GenieSim指令遵循得分约0.770

所谓原生世界—动作模型,白话是先在操作数据里学会「看见未来状态再反推动作」,而不是先做一个好看的视频生成器再硬接到机械臂;所谓数据缩放仍未饱和,白话是继续堆真实配对轨迹,成功率还在涨。公开材料亦称,折毛巾、嵌套纸杯、拔插笔盖、插花等精细操作在小规模数据下完不成,到约3万小时才出现能力跃迁——对具身团队,这把讨论从「有没有世界模型海报」推到「小时数—成功率曲线能不能公开对照」。

放在世界模型赛道上下文里,近窗多家厂商用高动态演示或仿真榜单证明「推演能接到身体上」。智元选择「从零共训 + 跨本体共享数据」切口,赌的是操作数据本身的Scaling Law,而不是视频生成先验的迁移红利。竞品若只有演示成片、给不出同协议下的小时数曲线,对照会变得吃力。

产业影响上,若跨本体迁移被更多厂商复现,共享操作数据的价值会进一步抬升;若曲线只在自家本体成立,市场仍会回到「整机绑定模型」的老路径。需要把边界读清楚:成功率为团队评测协议下的公开数字;真机连续工况、失败恢复与安全围栏仍待更多第三方复核。下一观察点是开源权重/评测协议是否放出,以及其他本体厂能否在同协议下对照。