「多模式联合世界‑动作模型」目录01 自动驾驶世界‑动作模型现存两难矛盾1.1 三类主流WAM范式的固有短板02 MM‑Future完整技术链路2.1 面向规划的MM‑Tokens压缩表征2.2 多模式联合世界‑动作条件流生成2.3 未来条件提案打分器03 NAVSIM、HUGSIM仿真基准实验04 写在最后作为ResNet、Faster R‑CNN的核心作者任少卿在计算机视觉基础模型留下了里程碑级成果。时隔十年他以通讯作者身份带来自动驾驶世界‑动作模型MM‑Future直面智驾交互规划的现实痛点路口、环岛等复杂场景下同一组传感器观测会衍生出多种合理驾驶可能性。01 自动驾驶世界‑动作模型现存两难矛盾1.1 三类主流WAM范式的固有短板当下自动驾驶世界‑动作模型WAM主要分为解耦、串联、联合生成三类路线很难同时兼顾多候选输出和场景‑动作双向协同演化两大诉求。串联式WAM分为场景优先、动作优先两条分支。场景优先先预测未来画面再输出规划轨迹动作优先先输出多条候选轨迹再逐条推演对应的未来场景。 优势是能够产出多条候选假设。但信息流单向传递自车的加减速、变道动作无法反过来修改推演出来的周边环境状态。真实道路交互中自车行为会直接诱发其他交通参与者改变运动串联架构捕捉不到这种双向耦合关系。联合生成WAM在同一个生成流程内让未来场景和自车轨迹互相作用、协同演化可以模拟交互双向影响。 短板在于绝大多数现有方案只能输出单一组场景‑动作结果。面对无信号路口、环岛这类具备多种合理结局的交互场景只输出单一假设很容易漏掉可行备选行为。端到端多模式规划无世界模型依靠扩散模型直接生成多条自车轨迹完全不去建模周边环境的未来变化。仅依靠轨迹几何形态做筛选缺少对不同轨迹诱发的环境交互风险的判断依据复杂路口交互场景可靠性不足。MM‑Future核心取舍生成多组独立的{自车轨迹专属未来场景}配对假设。每一组假设内部场景与动作双向协同演化依靠MM‑Tokens压缩表征抑制算力膨胀最后打分器结合配套推演未来完成候选筛选。图 | 三类WAM范式对比示意图02 MM‑Future完整技术链路整套框架由三部分构成MM‑Encoder编码器产出面向规划的MM‑Tokens模态感知条件流Transformer完成多组场景‑动作联合生成未来条件式提案打分器完成候选轨迹排序。整套推理流程不需要重建原始图像、BEV稠密网格。2.1 面向规划的MM‑Tokens压缩表征多模式推演存在一个现实工程痛点如果每一条候选模式都完整推演多视图图像token或者BEV网格算力开销会随模式数量、预测时长成倍膨胀。 MM‑Encoder处理多相机时序图像序列将时间切分为多个时间块使用可学习的块级Query借助注意力聚合多相机、多帧特征压缩得到少量MM‑Tokens。关键设计损失函数不约束MM‑Tokens还原RGB画面交由整套多模式世界‑动作建模目标引导表征学习。让token只保留和规划、未来演化强相关的道路、障碍物、可行驶区域线索。对比稠密patch token单时间块token数量大幅下降让一次性并行生成几十组未来假设具备可行性。图 | MM‑Encoder编码流程示意图2.2 多模式联合世界‑动作条件流生成真实训练样本只记录现实发生的那一条交互结局其他可行的未来没有观测样本。论文采用高斯混合噪声GMN生成多组初始化源一组动作噪声 一组独立场景噪声一一配对形成M个模式的初始条件。模态感知Transformer区分动作流、场景流双分支共享跨模态注意力实现双向影响AdaLN、独立前馈网络保留两个模态各自统计特性非对称块掩码保证历史观测固定未来动作、场景token可以互相看见、互相改变。 训练采用BoMBest‑of‑Many多中选优监督。图 | 单模式与多模式训练收敛曲线指标边界提示BoM监督只能保证至少存在一条高质量样本不保证全部M个模式都具备物理合理性生成集合中会混杂部分不合理候选打分器是必不可少的后置过滤环节。2.3 未来条件提案打分器多条候选轨迹不能只依靠轨迹本身的几何平滑度做评判。完全相同的一条轨迹搭配推演出来的未来场景不一样交互风险完全不同。 打分器输入历史MM‑Tokens同时将每一条候选轨迹和它专属配对的预测未来MM‑Tokens作为输入模式之间做块对角掩码某条候选只能读取自己对应的未来推演不能挪用其他模式的推演结果。输出PDMS相关多维度打分筛选最终执行轨迹。图 |MM‑Token 注意力可视化打分器跳出单纯评判曲率、加速度的思路把“这条轨迹会诱发怎样的周边演化”纳入评判依据。03 NAVSIM、HUGSIM仿真基准实验评测数据集采用NAVSIM、HUGSIM核心指标PDMS、EPDMS衡量规划综合安全性、舒适性HUGSIM执行零样本闭环评测HD‑Score。基线覆盖端到端规划、VLA驱动规划、传统世界‑动作模型三类方案。表|NAVSIM‑v1 navtest数据集定量对比表MM‑Future(trainval)在NAVSIM‑v1取得PDMS94.0对比同类别WAM基线GraphWorld(90.1)、DriveFuture(90.7)具备明显提升。表NAVSIM‑v2 navtest 测试集定量实验结果在NAVSIM‑v2拓展评测EPDMS达到91.5迁移到HUGSIM仿真做零样本闭环HD‑Score达到32.3整套模型没有在HUGSIM数据集做任何微调。指标边界解读PDMS/EPDMS均为仿真内部评测指标代表仿真环境下的交互规划表现仿真内部交通参与者行为模型固定指标优势不能直接等价于真实道路实车表现。零样本HUGSIM仅做域迁移域gap依旧客观存在。表模型关键组件消融实验统计表消融实验验证三个核心模块的必要性去掉多模式配对联合生成指标大幅跌落替换MM‑Tokens变回稠密patch token显存与计算开销暴涨移除未来条件打分器仅靠轨迹本身筛选高危交互场景通过率显著下滑。04 写在最后时隔多年任少卿把研究视角从传统2D视觉转向自动驾驶世界‑动作建模。MM‑Future直面现有WAM范式的经典矛盾多候选输出 和 场景‑动作双向耦合演化过去两者很难同时拿到。通过高斯混合噪声初始化多组配对假设模态感知条件流Transformer完成组内双向协同生成依靠面向规划的MM‑Tokens压缩表征抑制算力膨胀再利用未来条件打分器结合专属推演未来做候选筛选。在NAVSIM仿真数据集上相比同类型WAM基线取得提升HUGSIM零样本闭环仿真也拿到可观分数。但要客观看待目前整套工作依旧处在仿真验证阶段。BoM监督带来的模式质量参差不齐、缺少实车验证都是后续走向工程落地必须跨过的坎。它给交互类世界‑动作规划提供了一套新的范式参考。Ref论文标题MM‑Future: Multi‑Mode Joint World–Action Modeling for Autonomous Driving论文链接https://arxiv.org/pdf/2609.20377