具身智能圈里,「世界模型」一直被视作机器人走向通用化的关键拼图,但长期缺乏一份「足够大、又开源」的实证。Meta FAIR这轮的RoboJEPA,恰好补上了这个缺口。
Meta FAIR与Mila合作,于10月8日前后发布了RoboJEPA:一个基于联合嵌入预测架构(JEPA)的动作条件潜在世界模型家族,其研究成果同步上线arXiv(编号2610.10515),并开放了全部模型checkpoint以及训练与机器人部署代码。论文由Artem Zholus等主导,联合末位作者包括Jeannette Bohg、Nicolas Ballas与Mahmoud Assran。
规模与数据: RoboJEPA的核心贡献在于「缩放」——团队将Meta此前的V-JEPA 2.1架构扩展到8B参数,并在覆盖12种机器人形态、23个公开数据集、约15002小时机器人视频数据(约287万条轨迹)的规模上完成训练。通过从2200万参数一路做到80亿参数的缩放实验,论文试图回答一个此前悬而未决的问题:机器人世界模型的性能,是否也会像语言模型那样,随模型与数据规模持续增长。
技术含义: 世界模型让机器人「在想象中预演动作后果」,是提升样本效率与泛化能力的重要方向。跨12种形态(机械臂、四足、人形等)的联合训练,则指向一个更激进的目标——让同一套世界模型服务不同形态的机器人,而不是「一机一模型」。这种「多形态缩放」若成立,将大幅摊薄具身模型的数据与训练成本。
开源价值: 与许多只发论文不开源的做法不同,RoboJEPA把checkpoint、训练代码与部署代码一并放出,这为第三方复现与二次开发提供了实打实的工件。对产业观察者,它是否「可用」要等社区实测,但它至少把「机器人世界模型能否规模化」这个问题,从口号推进到了可验证的阶段。事实以arXiv论文与Meta公开代码为准。