自动驾驶规划如果只吐出一条轨迹,往往像只准备了一个「标准答案」。真实路口却同时存在加速通过、减速让行、偏转避让等多种合理未来。蔚来智能驾驶基础模型预研团队用MM-Future,试图让模型一次推演多组「场景+动作」配对假设。
论文全名为《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》,通讯作者任少卿同时署名蔚来与中国科学技术大学AGI研究院;第一作者Shuai Liu署名NIO与中山大学。公开学术记录中,任少卿此前代表性工作集中在2014—2016年的Faster R-CNN、ResNet等;此次以通讯作者身份回到自动驾驶世界模型与规划方向。论文指出:级联式方案可覆盖多种候选,但场景与动作单向传递;联合式方案可双向交互,却常只生成单组结果。MM-Future的空白填补是——一次生成多组paired scene–action hypothesis,组内场景与动作继续共同演化。
方法要点包括:动作端用Gaussian Mixture Noise、场景端用独立噪声构造多样性起点;Best-of-Many监督只强化与真值最接近的赢家,避免所有候选被拉成同质轨迹;MM-Tokens把多摄像头、多时间帧特征压成面向规划的紧凑表示,不必为每种候选生成完整高清未来视频;modality-aware Transformer共享注意力做交互、模态分支保留各自统计;Future-Conditioned Proposal Scorer用历史与该候选专属未来打分,并用stop-gradient防止生成器为刷分扭曲分布。推理可概括为:编码历史→生成多组结果→评分→输出最高分轨迹。
评测上,NAVSIM-v1 navtest(trainval训练)PDMS为94.0,表中对照DriveFuture 90.7、DrivoR 93.7;NAVSIM-v2上EPDMS为91.5,高于文中列出的UniTeD 90.1与DriveFuture 89.9。消融显示:仅动作单模式PDMS 84.1,32模式到92.3;加入场景—动作联合后单模式85.1、32模式92.9;评分器读取配对未来后到93.3。主模型一次采样64组,单卡H800、batch size 1、bf16下端到端前向约233ms。闭环HUGSIM上平均HD-Score 32.3,也存在极端场景弱于部分对照的披露。
对公司叙事,这与NIO WorldModel、NADArch 2.0及全闭环强化学习路线相接:公司称截至今年9月,相关智驾系统已部署超95万辆车。产业意义在于,世界模型角色从「预测未来」进一步走向「比较不同动作对应的不同未来」。论文仍处公开数据集与仿真阶段,计算开销、隐式表征与极端场景稳定性需继续验证。论文地址公开为arxiv.org/pdf/2609.20377。