World Labs|Atlas多模态世界模型发布,面向空间智能与机器人仿真

PromptTree|阅读 1
2026/09/03 08:34
World LabsAtlas空间智能世界模型李飞飞
9月1日李飞飞联合创立的World Labs发布Atlas:从头预训练的omni世界模型,原生处理文本、图像、视频与3D,架构为多模态自回归扩散Transformer。支持约1440p、最长约1分钟相机可控视频、稀疏重建与机器人Real-to-Sim;目前向部分合作伙伴early access,权重未公开。

只会生成一段好看视频,还称不上「世界模型」;能把相机几何当原生输入、重建三维并喂给机器人仿真,讨论才进入空间智能。9月1日,李飞飞联合创立的World Labs在官网发布Atlas,自称从头预训练的omni世界模型,把文本、图像、视频与3D放进同一套空间上下文,并把它写成通往具身预训练与视觉特效工作流的「里程碑式」节点。

World Labs以「空间智能」为长期命题,产品线已包括面向三维世界创作的Marble,以及面向开发者的World API;2026年7月还通过收购SceniX等动作补强仿真相关能力。Atlas被定位为下一代通用世界模型,架构为多模态自回归扩散Transformer:先把输入编码进共享空间上下文,再条件生成后续内容,并强调几何一致性与「看见之外」的合理补全。它将驱动未来版本的Marble等产品,而不是替换掉已有商业入口的一次性演示。

官方能力清单:

  1. 相机可控生成:像素级相机几何为原生输入,最高约1440p、最长约1分钟视频
  2. 空间重建:从一张到多张稀疏图像重建场景,输出新视角与点云/3D高斯等显式三维
  3. 时空仿真:视频重取景、bullet-time类效果;为机器人导航与操作提供Real-to-Sim数据
  4. 图像生成:文本/全景等能力作为世界建模的附属窗口
  5. 可用性:部分合作伙伴early access;权重与代码未公开

所谓空间上下文,白话是每张图都带着位姿「钉」在三维里,而不是只靠自然语言猜运镜;所谓Real-to-Sim,白话是用少量真实拍摄重建可训练环境,再生成机器人视角的RGB与深度。对人机评测与稀疏重建基准,官方给出优于若干专用或视频模型的对照叙述,并强调随训练算力扩大能力可持续提升——这是在用缩放定律讲世界模型故事。

产业影响上,VFX、游戏、具身仿真都可能把「从手机扫一眼到可训环境」写进工作流;对机器人公司,意义在于降低真实数据匮乏的训练成本。需要把边界读清楚:early access不等于全面商用;仿真到真机的迁移效果需客户侧验证。下一观察点是合作伙伴名单、API化节奏与具身客户订单。