交互式世界模型要「玩得久」,条件信号若与生成内容在表征与时间结构上对不齐,画面就会在长程中漂掉——像导航地图与实景道路各说各话。
AlayaWorld团队在arXiv发布技术报告《AlayaWorld: Interactive Long-Horizon World Modeling - Full Technical Report (v1.1)》(arXiv:2608.13492)。所谓世界模型,白话是让系统在可交互环境里持续预测「下一步画面/状态会怎样」;所谓长程,白话是交互不是两三秒演示,而是较长时间窗口内仍保持空间与时间一致性。摘要写明:主干架构、分块自回归生成方案与训练数据相对前版未变,但大幅修订条件信号的表示与注入方式,原则是条件应在潜表征与时间结构上尽量贴近生成内容。
两项主要改动:以流式三维点缓存渲染器替换此前基于深度变形的空间记忆;将视觉条件编码进与生成视频一致的因果VAE潜空间,并对齐时间统计。所谓点缓存,白话是把空间记忆存成可流式更新的三维点表示再渲染回条件,而不是靠深度图硬拧视角;所谓因果VAE,白话是编解码遵守时间因果,避免「偷看未来帧」造成训练与推理不一致。
报告列出的六项具体修改:
对具身与视频生成方向,这是把「长程一致性」从口号落成可复现的工程清单:改的不是又堆一层参数,而是条件如何与生成对齐。对做交互演示与仿真的团队,点缓存 + 统一VAE协议,指向的是「记得住空间、跟得上时间」的运维级问题,而不只是单帧画质。
需要把边界读清楚。论文结果以作者实验设置为准,跨数据与跨任务泛化仍待社区复现;技术报告不等于产品可用SDK。下一观察点是是否开放权重或交互演示,以及与其他世界模型在长程指标上的对照——改条件管道是否真能换来更稳的长时间交互,要用公开评测说话。