AutoVLA论文阅读笔记
论文https://arxiv.org/pdf/2506.13757代码1、为什么要做这个研究理论走向和目前缺陷 ?之前的vla模型要么结构复杂要么梯度断连自回归式的输出路点虽然优雅但是llm天然不太适合这种精确数值计算实际的输出轨迹不可行。2、他们怎么做这个研究 方法尤其是与之前不同之处 ?把连续轨迹通过k-disk离散为一个个动作token就可以用llm decode同时输出语言token和动作token。SFT阶段监督有两类只有动作监督和同时兼有动作和思考监督赋予模型快思考和慢思考的能力。RFT阶段用GRPO微调模型奖励函数同时考虑思维链长度和轨迹好坏使得模型能够自适应决定快思考和慢思考。3、发现了什么总结结果补充和理论的关系?效果不错模型结构优雅但是耗时严重且吃显存。摘要借助llm的世界知识和推理能力可以提升端到端自动驾驶表现效果。但是现有的vla模型经常会有这几个问题1输出的轨迹物理上是不可执行2模型结构过滤复杂3简单场景却进行长思考。本文提出的AutoVLA把思考和动作生成统一到自回归式输出的端到端模型中输入是视觉输入和文本引导输出就直接是思考过程和规划结果。通过把连续的轨迹离散为一个个的动作token这样就可以整合到语言token中了。训练时通过sft赋予了模型两种思考模式1快思考及不用显式输出思考内容直接输出规划token。2慢思考显式输出思维链内容和规划的token。为了提高规划的效率还用了grpo做强化学习后训练避免模型在简单场景中输出长思考内容。在nuPlan, nuScenes, Waymo, and CARLA的开环和闭环结果表明其性能不错。1 引言视觉为主的端到端VA模型对训练和部署要求不高研究已经非常多了但是VA模型主要还是用模仿学习的方法训练不具备世界知识长尾场景处理不好。vla模型利用了vlm的世界知识和推理能力理论上限更高。现有的vla模型有如下两个问题1用vlm模型以文本的方式直接出waypoints, 但是vlm模型天生对数值任务处理不好生成的轨迹实际是不可通行的。或者先出个元动作然后下游再用一个规划器/解码器细化为规划路径这样就结构复杂了而且可能会打断端到端优化的链路。2过度思考或过少思考。简单场景应该直接出动作就行了复杂场景需要深度思考但现有的模型没办法平衡。DriveVLM虽然通过快慢系统的方式实现了快执行和慢思考的平衡但是模型结构不够优化训练成本也比较大。AutoVLA通过把连续的轨迹离散为一个个的动作token这样就可以像语言token一样混在一起输出了。在SFT阶段模型既收到有思维链监督的真值数据也有只有规划路径的数据这样就赋予了模型快思考和慢思考的能力。同时在RFT阶段还设计了可变的规划奖励函数利用GRPO优化赋予模型自适应的决定思考的深度从而平衡路径规划的准确率和效率。本文主要贡献1提出AutoVLA模型利用了预训练vlm的端到端的模型可以直接进行策略学习和深度思考输入是原始图像和语言文本。2提出利用GRPO进行后训练赋予模型自适应快思考还是慢思考的能力。3开环和闭环评估性能都优秀。2 相关研究VA: UniAD, VAD, ParaDrive, GenAD, DiffusionDriveVLA/VLM大概三个方向1把驾驶视为一个问答任务不输出动作只做场景描述。2第二种就是用vlm或vla生成元动作或决策指令 交给下游的传统规划器或生成式规划器或端到端模型来细化为规划轨迹这种方法整合比较容易但是会打断端到端的优化。3第三种方案是把vlm直接出隐式动作token或最终的规划轨迹即vla然而仅仅用一个简单的轨迹解码器如mlp或GRU可能会产生实际并不可通行的规划路径ORION通过引入生成式规划器来解决此问题但增加了模型复杂度和计算量。强化学习微调RFT:RFT可以提升模型的性能和适用性。Gen-Drvie和TrajHF用了RFT来确保生成的轨迹安全且符合人类偏好。RAD用了3DGS来生成场景和RL闭环训练。但其实把RFT用于智驾VLA模型的训练还是比较少的AlphaDrive虽然用GRPO了增强规划性能并确保训练效率和稳定性但是仅仅作用于元动作层。本文GRPO后训练赋予模型自适应决定思考的深度的能力。3 AutoVLA模型主要有两个组件1VLM主干网络输入是图像和文本自回归输出是思考和动作token。2物理元动作生成把之前只生成语言token的llm decode拓展到去生成物理元动作这些元动作是物理上可以执行的通过聚类获得的保证可以被翻译成规划轨迹。训练AutoVLA主要有两个阶段1SFT阶段标注为GT轨迹思考内容。2RFT: 通过任务特定的奖励函数优化规划器性能从而提高运行效率并最小化不必要的推理。3.1 框架模型输入多帧多视角图像C 导航指令I 自车状态S, 具体来说用了自车的左前、前、右前三个相机作为输入每路相机用最近两秒的4帧输入即1个当前帧3个历史帧导航指令即左转、直行这种自车状态S包括速度、加速度和历史行为。基础的VLM模型qwen2.5-vl-3B动作分词器不连续的自车轨迹离散为物理元动作每个元动作就是短期的位移和方位角变化D_x, D_y, D_theta这样就可以把轨迹规划任务转化为next-token预测的任务构建动作码本是通过k-disk聚类算法实现的k-disk聚类相对k-means聚类获取动作码本更合适原因是k-disk使用最小包围圆盘圆心替代 K-Means 的均值向量作为簇代表可以避免生成物理不自然的中间轨迹。比如一簇点大部分集中在直行区域少量点在急转弯k-means均值会落在直行与转弯中间生成不真实的漂移动作。而k-disk MED 最小包围圆的圆心在直行簇中心圆刚好包住转弯离群点,用这个圆心做码本模板代表基础直行行为离群仅体现为圆盘半径增大不污染模板本身。最终获得了2048个元动作的动作码本。统一思考和动作用一个人llm decode既输出语言token,也输出动作token. 并自适应决定是否输出语言token。3.2 思维链数据思考的目的主要是理解复杂场景的语义以及动态环境的交互关系。虽然很重要但是想要获取大规模高质量的驾驶场景思维链数据比较困难主要原因是1驾驶场景大多比较简单和重复2对于关键信息如交通灯、车灯的表达不充分3思考过程质量低比如遇到stop sign就停。利用qwen2.5-vl-72b模型制备思维链数据并且保证4项关节内容详细的场景描述关键目标的识别交通参与者的意图自车驾驶的决策。为了规范思考效果还把最终的gt轨迹作为引导来生成思维链数据。有了上述思维链数据制备过程最终获得45.6k的nuPlan数据和7.2k的waymo数据。还整合了nuScenes和CARLA的DriveLM和VQA数据。3.3 SFT除了像标注llm训练是对所有输出token进行监督还额外对动作token进行监督。SFT数据中有些简单场景是没有思维链内容只有动作监督的所以上述公式就有可能对仅有动作的样本进行更大权重的监督了故此对动作token的损失计算单独计算权重并且如果有思维链内容也要整体赋予一个新的权重。3.4 RFTRFT确保自适应决定是否进行深度思考。用了GRPO微调可以稳定训练提升收敛速度。此外同一场景下进行多模态规划天然就比较适合GRPO优化。给定场景输入query q 包含图像自车状态导航指令从旧的策略中采样G个候选输出通过归一化组相对优化A获得当前策略模型目标函数大概逻辑就是计算每个输出的优势然后clip到一定范围内然后考虑每个输出的优势 更新当前策略模型同时利用新策略模型的相对SFT出来的模型一直不变的kl散度控制更新幅度。每个输出的优势利用一个奖励函数计算同时考虑驾驶奖励(nuPlan使用PDMS考虑安全舒适效率等。waymo用ADE)和思维链的奖励。思维链的奖励考虑了思维链的长度作为奖励函数。4 实验4.1 实验设置数据集真实场景和仿真数据都有。真实场景nuPlan 120小时驾驶数据8路摄像头。Waymo 111.7小时8路摄像头。nuScenes: 1000段城市场景数据6个摄像头。CARLA 50w帧数据6路摄像头。此外还用上了针对nuScenes和CARLA数据制作的思维链数据DriveLM.Benchmarks: 开环评估NAVISIMPDMS指标nuScenes 使用L2距离作为评估指标Waymo使用RFS评估指标。闭环评估Bench2Drive,指标SR, DR等。实现细节每个动作token对应0.5秒的运动预测未来5秒的动作变化即输出10个token。SFT阶段训5个epoch学习率0.00001FSDP训练策略。8卡L40s每张卡bs1累计四个step后梯度回传更新相当于bs32。SFT损失设置lamda_a 1, lamda_cot 40说明在有思维链的数据中损失权重更大。RFT阶段LoRA微调微调6000steps。4.2 主要结果数据规模实验nuPlan和nuScenes的实验均表明在数据规模效果比较小的时候只有动作监督放到效果更好当数据规模够大大于100k时有cot监督的数据效果更好。RFT性能慢思考模式很耗时如下表所示。故此用了RFT来增强模型自适应思考的能力实验表明RFT是的PDMS指标提升性能也有大幅提升耗时降低66.8%GRPO的group size越大越好。nuPlan 实验结果best-of-N是指输出的6条规划轨迹使用oracle打分器选出的最优的那个。Waymo E2E PerformanceCARLA闭环性能Bench2Drive benchmark4.3 消融实验文本式路点输出对比动作token和文本化的路点动作分词方法RT-1, FAST以及K-disk。RT-1方法对车辆动力学模型比较敏感而很多数据是只有轨迹的FAST需要比较大的码本效果才比较好。综合来看k-disk分词效果最好。5 结论统一思考和动作在同一个llm decoder中输出SFT使模型同时支持快思考和慢思考RFT使模型自适应决定是快思考还是慢思考。局限模型跑的tai慢1hz且显存消耗巨大。

相关新闻

基于大模型的智能留学咨询系统设计与优化

基于大模型的智能留学咨询系统设计与优化

1. 项目概述:留学咨询大模型的智能办理系统这个项目本质上是一个基于大语言模型的智能留学咨询系统,核心目标是通过AI技术实现留学申请流程的自动化处理。不同于传统留学中介的人工服务模式,我们采用大模型作为底层引擎,结合业务规…

2026/7/30 9:07:44 阅读更多 →
项目开发必备:如何系统管理前置条件(Prerequisites)

项目开发必备:如何系统管理前置条件(Prerequisites)

1. 项目概述"0.Prerequisites"这个标题看似简单,却蕴含着项目开发中最容易被忽视的关键环节。作为从业十余年的老手,我见过太多项目因为前期准备不足而中途夭折的案例。这个编号为0的阶段,实际上决定了整个项目的成败基础。在技术领…

2026/7/28 4:22:46 阅读更多 →
使用Visual C++为Authorware 7开发DLL:从原理到部署的完整指南

使用Visual C++为Authorware 7开发DLL:从原理到部署的完整指南

1. 项目概述与核心价值如果你是一位还在维护或开发Authorware 7项目的多媒体工程师,那么你大概率会遇到一个经典困境:Authorware自带的脚本功能(比如它的计算图标)在处理复杂逻辑、高性能计算或者与特定硬件(如串口、U…

2026/7/28 11:44:00 阅读更多 →

最新新闻

魔兽争霸III终极兼容性工具:5个技巧让经典游戏在现代电脑上完美运行

魔兽争霸III终极兼容性工具:5个技巧让经典游戏在现代电脑上完美运行

魔兽争霸III终极兼容性工具:5个技巧让经典游戏在现代电脑上完美运行 【免费下载链接】WarcraftHelper Warcraft III Helper , support 1.20e, 1.24e, 1.26a, 1.27a, 1.27b 项目地址: https://gitcode.com/gh_mirrors/wa/WarcraftHelper 你是否还在为《魔兽争…

2026/7/30 11:44:40 阅读更多 →
BBWEYY 跨境电商低成本获客转化解决方案:30天搭建BBWEYY GEO与独立站获客转化闭环,含零代码SAAS、AI编程、源码定制交付

BBWEYY 跨境电商低成本获客转化解决方案:30天搭建BBWEYY GEO与独立站获客转化闭环,含零代码SAAS、AI编程、源码定制交付

跨境电商实战指南 30天搭建BBWEYY GEO与独立站获客转化闭环 从品牌诊断、站点上线到内容信源与数据复盘的执行指南 干货分享|准备快速启动跨境独立站和GEO项目的企业团队 30天不能完成所有增长工作,但可以搭好一个能够持续迭代的获客底座,…

2026/7/30 11:44:40 阅读更多 →
BBWEYY 跨境电商低成本获客转化解决方案:AI搜索时代,跨境品牌用BBWEYY GEO提升海外曝光实战,含零代码SAAS、AI编程、源码定制交付

BBWEYY 跨境电商低成本获客转化解决方案:AI搜索时代,跨境品牌用BBWEYY GEO提升海外曝光实战,含零代码SAAS、AI编程、源码定制交付

跨境电商实战指南 AI搜索时代,跨境品牌用BBWEYY GEO提升海外曝光实战 从品牌提及监测到可信信源建设的完整方法 干货分享|正在布局海外品牌、内容营销与AI搜索曝光的企业 AI搜索不会因为企业发布更多广告就自动推荐品牌,它更依赖清晰、可信…

2026/7/30 11:44:40 阅读更多 →
接口自动化测试总结

接口自动化测试总结

🍅 点击文末小卡片,免费获取软件测试全套资料,资料在手,涨薪更快想要在软件测试这个行业继续前行,就必须拥有核心竞争力,掌握自动化测试技术,是必不可少的一个技能。目前国内的互联网行业变化很…

2026/7/30 11:44:40 阅读更多 →
BBWEYY 跨境电商低成本获客转化解决方案:亚马逊卖家用BBWEYY独立站降低单一平台依赖实战,含零代码SAAS、AI编程、源码定制交付

BBWEYY 跨境电商低成本获客转化解决方案:亚马逊卖家用BBWEYY独立站降低单一平台依赖实战,含零代码SAAS、AI编程、源码定制交付

跨境电商实战指南 亚马逊卖家用BBWEYY独立站降低单一平台依赖实战 保留亚马逊成交优势,同时建立自主品牌、客户与复购渠道 干货分享|亚马逊精品、铺货、品牌备案与多站点卖家 独立站不是与亚马逊二选一,而是帮助卖家获得品牌表达、客户沉淀…

2026/7/30 11:44:40 阅读更多 →
视频驱动的空间智能灾害推演技术解析与应用

视频驱动的空间智能灾害推演技术解析与应用

1. 项目概述:当灾害推演遇上空间智能 去年参与某地防汛指挥系统升级时,我第一次见识到传统灾害推演的局限性——决策者们围坐在二维平面图前,对着静态的风险标识争论不休。这种脱离空间维度的推演方式,就像用象棋规则下立体围棋。…

2026/7/30 11:43:40 阅读更多 →

日新闻

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南 【免费下载链接】DriverStoreExplorer Driver Store Explorer 项目地址: https://gitcode.com/gh_mirrors/dr/DriverStoreExplorer 您是否曾因Windows系统盘空间不足而烦恼?是否遇到过设…

2026/7/30 0:00:13 阅读更多 →
如何3步掌握Video Download Helper:网页视频下载的完整实战指南

如何3步掌握Video Download Helper:网页视频下载的完整实战指南

如何3步掌握Video Download Helper:网页视频下载的完整实战指南 【免费下载链接】VideoDownloadHelper Chrome Extension to Help Download Video for Some Video Sites. 项目地址: https://gitcode.com/gh_mirrors/vi/VideoDownloadHelper 你是否曾经在浏览…

2026/7/30 0:00:13 阅读更多 →
“双减”后首个AI备课压力测试报告:覆盖32所中小学的176节AI辅助课,暴露4大隐性增负节点

“双减”后首个AI备课压力测试报告:覆盖32所中小学的176节AI辅助课,暴露4大隐性增负节点

更多请点击: https://intelliparadigm.com 第一章:AI 教师备课辅助 AI 教师备课辅助系统正逐步成为教育数字化转型的核心支撑工具,它并非替代教师,而是通过语义理解、知识图谱与多模态生成能力,将教师从重复性劳动中解…

2026/7/30 0:00:13 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/29 22:18:20 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/29 15:00:03 阅读更多 →

月新闻