AI 资讯量子位
时隔十年,AI大牛署名新论文
这篇最新论文,让自动驾驶能“走一步想十步”,更像老司机了! 最近,任少卿指导发布论文 《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》 ,提出一种新的多模式世界—动作联合模型。 公开学术记录中,他的代表性研究主要集中在2014—2016年,包括Faster R-CNN、ResNet等一系列计算机视觉经典工作。 这篇论文要解决的核心问题很明确:同一个驾驶场景下,系统需要处理的不只是一条轨迹,也不只是一个确定的未来。…
内容摘要
这篇最新论文,让自动驾驶能“走一步想十步”,更像老司机了!
最近,任少卿指导发布论文 《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》 ,提出一种新的多模式世界—动作联合模型。
公开学术记录中,他的代表性研究主要集中在2014—2016年,包括Faster R-CNN、ResNet等一系列计算机视觉经典工作。
这篇论文要解决的核心问题很明确:同一个驾驶场景下,系统需要处理的不只是一条轨迹,也不只是一个确定的未来。
团队的思路是:让模型一次生成多组场景—动作假设,车辆轨迹与对应的未来场景共同演化,最后再从中选择。
简单来说,自动驾驶不仅能看清周围环境,还能预演多种可能的未来,最终选择最安全的路径执行。
从一条轨迹,扩展到多个未来
端到端自动驾驶的基本逻辑,是将传感器观测直接映射为自车轨迹或控制指令。
World–Action Model则进一步增加了未来场景建模,让规划不仅依据当前环境,也参考动作可能带来的后果。
现有的World–Action Model大致存在两类路线:
一类是 级联式方案 。例如先生成几条候选轨迹,再分别预测每条轨迹对应的未来场景;或者先预测未来场景,再基于场景完成规划。这种方式可以生成多个候选结果。
但这种方法的问题也很明确:信息按 单向传递 ,后生成的变量无法回头修正前面的决策。
假如模型已经先确定自车向前通过路口,随后才预测到对向车辆没有减速,这个未来结果很难重新参与前面的动作生成过程。
另一类是 联合式方案 。场景和动作放在同一个生成过程中,两者可以相互影响。
车辆动作变化,预测环境随之调整;环境一旦变化,也会反过来影响车辆轨迹。现有这类方法通常只生成一组场景—动作结果。
论文指出了其中的空白:级联式模型可以覆盖多种驾驶结果,但场景和动作之间缺乏双向交互;联合模型具备双向交互能力,但通常只生成单组结果。
但真实道路往往需要同时处理这两件事。
MM-Future给出的方案是: 一次生成多组场景—动作假设,每一组内部的场景和动作继续共同演化。
每一组结果叫做paired scene–action hypothesis(配对场景-动作假设)。
假设模型同时生成几十组候选,其中一组可能是自车加速、对向车辆让行,另一组是自车减速、对向车辆先行,还有其他不同程度的制动、通过方式以及场景变化。
这些结果不再只有轨迹差异,每条轨迹对应的未来环境也各不相同。由此,多种可能的未来进入规划过程。
同时推演几十个未来,需要面临的三道门槛
论文把多模式联合建模的难点拆成了三项:
多样性从哪里产生,多组未来如何控制计算成本,以及生成多个候选后如何筛选。MM-Future的核心设计也是围绕这三个问题展开。
首先是 多样性问题 。
真实驾驶数据有天然局限,一段录像只记录一种已经发生的结果。司机最终减速,数据中就不会同时留下同一时刻选择加速后的真实场景。模型需要在单结果监督下学出多种合理结果。
MM-Future在动作端根据训练轨迹分布建立了Gaussian Mixture Noise,从不同动作先验出发;场景端则使用独立噪声。
动作与场景的初始状态两两配对,构成了不同驾驶结果的独立起点。
训练时又加入 Best-of-Many监督 。模型一次生成多组候选,先找出与真实轨迹最接近的一组,再用同一个赢家索引监督动作流和场景流。
这样可以避免所有候选被同一条真值轨迹拉向相似结果,也能保持一条轨迹和它对应的未来场景始终配对。
其次是 计算成本 。多视角视频如果按每种候选完整展开,模式数量和预测时间一增加,计算量会迅速上升。
MM-Tokens不承担RGB图像重建,也不需要恢复完整BEV。有限的Token预算主要保留与未来演化和驾驶规划相关的信息。
从论文给出的注意力可视化来看,MM-Tokens关注的信息主要集中在 道路结构、路口、前车以及周围交通参与者等区域 。
模型由此无需为几十种候选分别生成完整的高清未来视频,内部保留的是一组面向规划的紧凑未来场景表征。
第三项是 场景与动作如何共同演化,以及多组候选如何筛选 。MM-Future使用了modality-aware Transformer同时处理动作流和场景流。
共享注意力负责两类信息的交互,模态专属分支保留两类数据各自的统计特征。
每一组候选共享模型参数,但不同模式之间不交换Token。
因此,动作轨迹会随着配对场景的变化继续更新,场景预测也会根据自车动作重新调整。多轨迹规划由此引入了动作与环境的双向耦合。
生成结束后,Future-Conditioned Proposal Scorer负责完成最后筛选。
它评估一条候选轨迹时,同时读取历史信息和这条轨迹专属的预测未来,再给出分数。每个候选只能读取自己配对的未来,不能借用其他模式的场景结果。
论文还对轨迹和未来Token使用stop-gradient,避免生成器为了提高评分而改变输出分布。
最终推理过程可以压缩成四步:编码历史观测,生成多组场景—动作结果,使用历史与配对未来给候选评分,再输出得分最高的轨迹。
世界模型开始更深层进入规划
MM-Future最终带来了多大提升呢?
论文使用 NAVSIM 和 HUGSIM 两套基准进行了测试:
在NAVSIM-v1 navtest上,使用trainval数据训练的MM-Future获得94.0 PDMS。同一张结果表中,WAM方案DriveFuture为90.7,E2E方案DrivoR trainval为93.7。
NAVSIM-v2上,MM-Future获得91.5 EPDMS,高于论文列出的UniTeD 90.1和DriveFuture 89.9。
更能说明方法效果的是 消融实验 。
只生成动作、仅保留一种模式时,PDMS为84.1;把动作候选增加到32种后提升到92.3。
加入场景—动作联合生成后,单模式为85.1,32模式达到92.9。最后让评分器读取每条轨迹对应的预测未来,PDMS继续提升到93.3。
几组对照分别验证了三个环节:增加模式数量带来主要增益;场景和动作联合生成还能继续提升;配对未来参与候选评分后,规划指标再次改善。
评分器带来的提升在 TTC指标 上最明显,论文据此认为:候选专属未来主要帮助模型排除交互风险较高的轨迹。
多模式训练还表现出更快的收敛速度。16模式和32模式达到0.80验证PDM分数大约需要3.8k steps,单模式需要17.5k steps。
这个结果说明,多种假设不仅增加了推理分支,在论文设定下也改善了训练效率和最终指标。
不过,多组未来假设也带来了额外的计算成本。
论文主模型一次采样64组场景—动作候选,在单张NVIDIA H800、batch size为1、bf16条件下,端到端前向延迟约为233ms。
16种候选的延迟和单模式方案较为接近,增加到32种后延迟明显提高。候选覆盖范围和计算成本之间仍需要平衡。
闭环测试也存在类似的局限。
MM-Future没有针对HUGSIM继续微调,在436个场景上取得32.3平均HD-Score,高于论文列出的Latent-WAM 28.9和UniAD 28.6。
平均Route Completion为44.5,略低于Latent-WAM的45.9;Extreme难度下HD-Score为8.6,Latent-WAM达到18.1。
论文也主动指出了可解释性问题。MM-Tokens属于隐式场景表征,模型到底保留了哪些规划信息,目前仍难直接观察。
因此,MM-Future目前展示出的价值,更适合放在方法层面理解:
自动驾驶世界模型的角色正在从未来预测进一步走向规划,模型不仅需要估计场景会怎样变化,还要比较不同动作对应的不同场景结果。
更关键的变化发生在多模式的定义上。以往多模式规划主要回答可以走哪几条轨迹,MM-Future把问题扩展到采取不同轨迹后,环境分别可能怎样变化。世界模型开始承担动作后果建模的一部分功能。
这条路线仍处于公开数据集和仿真验证阶段,计算开销、隐式表征、极端场景稳定性都需要继续验证。
论文当前能够支持的结论更明确:在自动驾驶规划中,同时覆盖多种可能结果,并让场景与动作保持双向交互,能够带来稳定的指标增益。
真实道路始终存在多种合理结果。随着世界模型继续进入规划环节,自动驾驶需要处理的对象,也正在从一条候选轨迹,扩展到一组动作与未来的联合结果。
团队介绍
MM-Future背后的研究团队,主要来自蔚来智能驾驶基础模型预研团队。
对于任少卿,大家应该已经很熟悉了——
他是国内自动驾驶深度学习化最关键的那批推手之一,目前为中国科学技术大学讲席教授,中科大官网显示其担任通用人工智能研究所所长;也仍是蔚来智能驾驶业务负责人。
而MM-Future放在蔚来的技术演进里看,也有另一层意义。
2024年,蔚来发布NIO WorldModel和NADArch 2.0,将智能驾驶架构进一步转向世界模型驱动的端到端体系;2025年又加入全闭环强化学习,2026年初最新版NWM开始大规模推送。
蔚来最新披露,截至今年9月,这套基于世界模型和全闭环强化学习的智驾系统已经部署到超过95万辆车。
从NWM到MM-Future,可以看到蔚来世界模型路线的一条演进线索:
先让模型预测未来,再让未来进入规划;从生成多条轨迹,继续走向同时生成多组动作与未来。
论文地址:https://arxiv.org/pdf/2609.20377
版权所有,未经授权不得以任何形式转载及使用,违者必究。
蔚来汽车 车圈最新认知
杰西卡
扫码分享至朋友圈
相关阅读
理想汽车携全系车型亮相2024北京车展,持续聚焦用户价值提升
AD Pro 3.0全面升级大模型架构
理想 车圈最新认知
智己Robotaxi送我回酒店,一段式端到端上车,年底去安全员
Momenta秀出秘密武器,训练成本降低100倍
智己,Momenta,传统车企怎么变? 车圈最新认知
华为手机老将,加盟深蓝任CEO
前荣耀中国区CMO
深蓝汽车 车圈最新认知
大众汽车冻结招聘,56岁员工提前退休
下个月开始
传统车企怎么变? 大众汽车 车圈最新认知
首例碰瓷Robotaxi被罚,武汉还是太领先了
“萝卜”已跑出日均4.2万单
Robotaxi 无人车往哪里开? 车圈最新认知
智驾一标配,比亚迪市值破万亿
自此之后,比亚迪没有短板
比亚迪 车圈最新认知
热门文章
AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水
27B模型分分钟交付网页,Qwen 3.8还是太能了
“留给人类阻止AI的时间不多了”
APUS 开源国内首批Jev跨平台复现:国产模型实现秒级决策
6天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官
加入我们
寻求报道
商务合作
追踪人工智能新趋势,报道科技行业新突破
资讯来源
量子位