只会生成一段好看视频,还称不上「世界模型」;能把相机几何当原生输入、重建三维并喂给机器人仿真,讨论才进入空间智能。9月1日,李飞飞联合创立的World Labs在官网发布Atlas,自称从头预训练的omni世界模型,把文本、图像、视频与3D放进同一套空间上下文,并把它写成通往具身预训练与视觉特效工作流的「里程碑式」节点。
World Labs以「空间智能」为长期命题,产品线已包括面向三维世界创作的Marble,以及面向开发者的World API;2026年7月还通过收购SceniX等动作补强仿真相关能力。Atlas被定位为下一代通用世界模型,架构为多模态自回归扩散Transformer:先把输入编码进共享空间上下文,再条件生成后续内容,并强调几何一致性与「看见之外」的合理补全。它将驱动未来版本的Marble等产品,而不是替换掉已有商业入口的一次性演示。
官方能力清单:
所谓空间上下文,白话是每张图都带着位姿「钉」在三维里,而不是只靠自然语言猜运镜;所谓Real-to-Sim,白话是用少量真实拍摄重建可训练环境,再生成机器人视角的RGB与深度。对人机评测与稀疏重建基准,官方给出优于若干专用或视频模型的对照叙述,并强调随训练算力扩大能力可持续提升——这是在用缩放定律讲世界模型故事。
产业影响上,VFX、游戏、具身仿真都可能把「从手机扫一眼到可训环境」写进工作流;对机器人公司,意义在于降低真实数据匮乏的训练成本。需要把边界读清楚:early access不等于全面商用;仿真到真机的迁移效果需客户侧验证。下一观察点是合作伙伴名单、API化节奏与具身客户订单。