任少卿时隔十年再出手:MM-Future让自动驾驶“走一步想十步”
「多模式联合世界‑动作模型」目录01 自动驾驶世界‑动作模型现存两难矛盾1.1 三类主流WAM范式的固有短板02 MM‑Future完整技术链路2.1 面向规划的MM‑Tokens压缩表征2.2 多模式联合世界‑动作条件流生成2.3 未来条件提案打分器03 NAVSIM、HUGSIM仿真基准实验04 写在最后作为ResNet、Faster R‑CNN的核心作者任少卿在计算机视觉基础模型留下了里程碑级成果。时隔十年他以通讯作者身份带来自动驾驶世界‑动作模型MM‑Future直面智驾交互规划的现实痛点路口、环岛等复杂场景下同一组传感器观测会衍生出多种合理驾驶可能性。01 自动驾驶世界‑动作模型现存两难矛盾1.1 三类主流WAM范式的固有短板当下自动驾驶世界‑动作模型WAM主要分为解耦、串联、联合生成三类路线很难同时兼顾多候选输出和场景‑动作双向协同演化两大诉求。串联式WAM分为场景优先、动作优先两条分支。场景优先先预测未来画面再输出规划轨迹动作优先先输出多条候选轨迹再逐条推演对应的未来场景。 优势是能够产出多条候选假设。但信息流单向传递自车的加减速、变道动作无法反过来修改推演出来的周边环境状态。真实道路交互中自车行为会直接诱发其他交通参与者改变运动串联架构捕捉不到这种双向耦合关系。联合生成WAM在同一个生成流程内让未来场景和自车轨迹互相作用、协同演化可以模拟交互双向影响。 短板在于绝大多数现有方案只能输出单一组场景‑动作结果。面对无信号路口、环岛这类具备多种合理结局的交互场景只输出单一假设很容易漏掉可行备选行为。端到端多模式规划无世界模型依靠扩散模型直接生成多条自车轨迹完全不去建模周边环境的未来变化。仅依靠轨迹几何形态做筛选缺少对不同轨迹诱发的环境交互风险的判断依据复杂路口交互场景可靠性不足。MM‑Future核心取舍生成多组独立的{自车轨迹专属未来场景}配对假设。每一组假设内部场景与动作双向协同演化依靠MM‑Tokens压缩表征抑制算力膨胀最后打分器结合配套推演未来完成候选筛选。图 | 三类WAM范式对比示意图02 MM‑Future完整技术链路整套框架由三部分构成MM‑Encoder编码器产出面向规划的MM‑Tokens模态感知条件流Transformer完成多组场景‑动作联合生成未来条件式提案打分器完成候选轨迹排序。整套推理流程不需要重建原始图像、BEV稠密网格。2.1 面向规划的MM‑Tokens压缩表征多模式推演存在一个现实工程痛点如果每一条候选模式都完整推演多视图图像token或者BEV网格算力开销会随模式数量、预测时长成倍膨胀。 MM‑Encoder处理多相机时序图像序列将时间切分为多个时间块使用可学习的块级Query借助注意力聚合多相机、多帧特征压缩得到少量MM‑Tokens。关键设计损失函数不约束MM‑Tokens还原RGB画面交由整套多模式世界‑动作建模目标引导表征学习。让token只保留和规划、未来演化强相关的道路、障碍物、可行驶区域线索。对比稠密patch token单时间块token数量大幅下降让一次性并行生成几十组未来假设具备可行性。图 | MM‑Encoder编码流程示意图2.2 多模式联合世界‑动作条件流生成真实训练样本只记录现实发生的那一条交互结局其他可行的未来没有观测样本。论文采用高斯混合噪声GMN生成多组初始化源一组动作噪声 一组独立场景噪声一一配对形成M个模式的初始条件。模态感知Transformer区分动作流、场景流双分支共享跨模态注意力实现双向影响AdaLN、独立前馈网络保留两个模态各自统计特性非对称块掩码保证历史观测固定未来动作、场景token可以互相看见、互相改变。 训练采用BoMBest‑of‑Many多中选优监督。图 | 单模式与多模式训练收敛曲线指标边界提示BoM监督只能保证至少存在一条高质量样本不保证全部M个模式都具备物理合理性生成集合中会混杂部分不合理候选打分器是必不可少的后置过滤环节。2.3 未来条件提案打分器多条候选轨迹不能只依靠轨迹本身的几何平滑度做评判。完全相同的一条轨迹搭配推演出来的未来场景不一样交互风险完全不同。 打分器输入历史MM‑Tokens同时将每一条候选轨迹和它专属配对的预测未来MM‑Tokens作为输入模式之间做块对角掩码某条候选只能读取自己对应的未来推演不能挪用其他模式的推演结果。输出PDMS相关多维度打分筛选最终执行轨迹。图 |MM‑Token 注意力可视化打分器跳出单纯评判曲率、加速度的思路把“这条轨迹会诱发怎样的周边演化”纳入评判依据。03 NAVSIM、HUGSIM仿真基准实验评测数据集采用NAVSIM、HUGSIM核心指标PDMS、EPDMS衡量规划综合安全性、舒适性HUGSIM执行零样本闭环评测HD‑Score。基线覆盖端到端规划、VLA驱动规划、传统世界‑动作模型三类方案。表|NAVSIM‑v1 navtest数据集定量对比表MM‑Future(trainval)在NAVSIM‑v1取得PDMS94.0对比同类别WAM基线GraphWorld(90.1)、DriveFuture(90.7)具备明显提升。表NAVSIM‑v2 navtest 测试集定量实验结果在NAVSIM‑v2拓展评测EPDMS达到91.5迁移到HUGSIM仿真做零样本闭环HD‑Score达到32.3整套模型没有在HUGSIM数据集做任何微调。指标边界解读PDMS/EPDMS均为仿真内部评测指标代表仿真环境下的交互规划表现仿真内部交通参与者行为模型固定指标优势不能直接等价于真实道路实车表现。零样本HUGSIM仅做域迁移域gap依旧客观存在。表模型关键组件消融实验统计表消融实验验证三个核心模块的必要性去掉多模式配对联合生成指标大幅跌落替换MM‑Tokens变回稠密patch token显存与计算开销暴涨移除未来条件打分器仅靠轨迹本身筛选高危交互场景通过率显著下滑。04 写在最后时隔多年任少卿把研究视角从传统2D视觉转向自动驾驶世界‑动作建模。MM‑Future直面现有WAM范式的经典矛盾多候选输出 和 场景‑动作双向耦合演化过去两者很难同时拿到。通过高斯混合噪声初始化多组配对假设模态感知条件流Transformer完成组内双向协同生成依靠面向规划的MM‑Tokens压缩表征抑制算力膨胀再利用未来条件打分器结合专属推演未来做候选筛选。在NAVSIM仿真数据集上相比同类型WAM基线取得提升HUGSIM零样本闭环仿真也拿到可观分数。但要客观看待目前整套工作依旧处在仿真验证阶段。BoM监督带来的模式质量参差不齐、缺少实车验证都是后续走向工程落地必须跨过的坎。它给交互类世界‑动作规划提供了一套新的范式参考。Ref论文标题MM‑Future: Multi‑Mode Joint World–Action Modeling for Autonomous Driving论文链接https://arxiv.org/pdf/2609.20377

相关新闻

30-seconds-of-code:CSS 逻辑属性与物理属性对照指南(Logical  Physical Properties)

30-seconds-of-code:CSS 逻辑属性与物理属性对照指南(Logical Physical Properties)

教程文档 【免费下载链接】30-seconds-of-code Coding articles to level up your development skills 项目地址: https://gitcode.com/gh_mirrors/30/30-seconds-of-code 点击查看 免费下载 导读 CSS 逻辑属性(Logical Properties)让开发者…

2026/9/30 7:23:18 阅读更多 →
Java集合-02-ArrayList源码:扩容、System.arraycopy 与 fail-fast

Java集合-02-ArrayList源码:扩容、System.arraycopy 与 fail-fast

1. 结论先行:ArrayList 本质是动态数组ArrayList 是 Java 集合框架中最常用的 List 实现之一,其底层本质是一个可动态扩容的对象数组。它之所以查询快、增删慢,根源就在于这个数组结构:数组支持按下标 O(1) 随机访问,但…

2026/9/30 7:23:18 阅读更多 →
友为合同管理系统 | 模板与条款标准化——上线前最重要的一步

友为合同管理系统 | 模板与条款标准化——上线前最重要的一步

01 引言:模板乱了,系统就白建了核心观点:合同模板和条款的标准化,是合同管理系统能否真正发挥价值的基础。现实情况却往往令人担忧。企业真正有多少模板、散落在哪些位置、哪些存在版本冲突,法务部门往往并不清楚。大量…

2026/9/30 7:23:18 阅读更多 →

最新新闻

Linux软硬链接本质:inode与路径的底层原理

Linux软硬链接本质:inode与路径的底层原理

1. 为什么软硬链接不是“复制”,而是“指针”——从文件系统底层讲清楚你有没有试过用ln命令创建一个链接,结果发现删掉源文件后,软链接打不开、硬链接还能访问?或者反过来,改了软链接指向的文件,硬链接却毫…

2026/9/30 7:56:32 阅读更多 →
Linux软链接与硬链接的本质区别及实战应用

Linux软链接与硬链接的本质区别及实战应用

1. 为什么软链接和硬链接不是“差不多就行”的替代品?在Linux系统里,软链接(symbolic link)和硬链接(hard link)常被新手统称为“快捷方式”,但这种类比会埋下严重隐患。我刚入行时就吃过亏&…

2026/9/30 7:56:32 阅读更多 →
SAP S/4HANA部署方式选择实战决策指南

SAP S/4HANA部署方式选择实战决策指南

简介:本资源是一份面向SAP系统实施顾问、云架构师及企业数字化转型从业者的S/4HANA云部署方式深度解析文档,聚焦SAP官方当前主流的四种部署模型及其业务定位差异,有效解决企业在上云路径选择中的决策困惑。文档以清晰对比方式展开&#xff1a…

2026/9/30 7:56:32 阅读更多 →
uni-app 登录页 UI 精修:从背景层到页面栈的细节实战

uni-app 登录页 UI 精修:从背景层到页面栈的细节实战

uni-app 里给微信小程序做登录页面,第一版基本都停留在“能用”的阶段:一个 logo、两个输入框、一个按钮,收工。等产品拿着竞品截图走过来,说一句“这个登录页面 UI 好看,你照着改一下”,很多人才发现自己在…

2026/9/30 7:56:32 阅读更多 →
uni-app微信小程序登录页:Vue3纯CSS高转化UI实战

uni-app微信小程序登录页:Vue3纯CSS高转化UI实战

做小程序登录页这件事,我前后推倒重来过至少七个版本。第一版是照着教程堆出来的深色背景配白色输入框,自认为挺"高级",结果上线一周后后台数据显示登录页跳出率接近四成;第二版换了配色,数据没动&#xff1…

2026/9/30 7:56:32 阅读更多 →
拆开这个环:优化 RAG 通道,解开 SEO 与 GEO 的死循环

拆开这个环:优化 RAG 通道,解开 SEO 与 GEO 的死循环

摘要:GEO 没有标准,它只是 RAG 的引用打分回路。这个回路正在反向磨平人类内容:RLHF 把 AI 磨成平均值,GEO 再让人类照着这个平均值生长,两个平均化首尾相接,咬成死循环。解法不是拒绝 AI,也不是…

2026/9/30 7:55:32 阅读更多 →

日新闻

Base64 图片头部特征识别:从文件头到格式判断的完整指南

Base64 图片头部特征识别:从文件头到格式判断的完整指南

1. 项目概述:为什么说看懂 base64 图片头部是基本功这几年跟 base64 打交道的机会越来越多,后端接口返回图片、前端渲染验证码、小程序里存小图、还有一些老系统导出报表,动不动就给你一段长到怀疑人生的 base64 字符串。很多人拿到字符串就直…

2026/9/30 0:00:35 阅读更多 →
Java公交站牌广告管理系统:JSP+Servlet+MySQL实战落地指南

Java公交站牌广告管理系统:JSP+Servlet+MySQL实战落地指南

简介:本资源是一份面向Java初学者与课程设计学生的公交站牌广告灯箱管理系统毕业设计文档,聚焦城市公共广告资源信息化管理痛点,提供从需求分析到技术实现的完整方案。文档采用标准学术论文结构,含摘要、英文摘要、目录及五章正文…

2026/9/30 0:00:35 阅读更多 →
用 Redis Lua 构建大模型 API 多租户原子配额治理体系

用 Redis Lua 构建大模型 API 多租户原子配额治理体系

我去年年底接了一个内部 AI 平台的治理需求,背景很直接:公司把 DeepSeek、MiniMax 这类大模型 API 统一封装成内部网关,开放给几个业务团队用。结果第一个月账单出来,额度直接超了 4 倍。仔细查日志,发现原因并不复杂—…

2026/9/30 0:00:35 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/29 8:16:59 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/29 16:41:41 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/9/29 8:24:48 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/29 19:29:29 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/29 5:58:00 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/29 3:55:56 阅读更多 →