比亚迪发布HyWorldVLA论文开启自动驾驶新探索比亚迪汽车新技术研究院公开了一篇名为HyWorldVLA的论文该论文瞄准当前自动驾驶最热门的方向——Vision - Language - ActionVLA World Model世界模型。HyWorldVLA在自动驾驶公开基准NAVSIM v1上取得SOTA成绩PDMS达到90.59。比亚迪智能化的反差与突破过去几年外界提到比亚迪智能化多想到“天神之眼”、供应链整合、规模化落地以及今年的“兜底”但对于其“代码级自研”的AI技术和学术成果了解甚少甚至有传言其智能发布会PPT由供应商帮忙制作。然而这篇论文让大家看到了一个不同的比亚迪它不但有自动驾驶成果还有一支长期投入物理AI基础模型的研发团队。HyWorldVLA的研究方向与创新点HyWorldVLA瞄准的是让AI从“识别道路”走向“理解世界”这一前沿路线。近几年行业开始探索端到端自动驾驶模型加入世界模型World Model是进一步的发展。世界模型希望让AI拥有“内部模拟器”能预测未来。但目前的自动驾驶世界模型面临既想让模型理解真实世界细节又希望高效推理的核心矛盾。现有的解决方式有Pixel - level World Model和Latent World Model前者直观但计算成本高、易受视觉噪声影响后者效率高但可能丢失真实世界细节。HyWorldVLA提出混合世界模型Hybrid World Modeling保留视觉世界模型对环境细节的理解能力利用隐空间模型提升推理效率并引入Vision - Language - ActionVLA模型形成端到端流程。HyWorldVLA的测试效果与意义HyWorldVLA选择NAVSIM v1作为测试平台该平台采用更接近实际驾驶质量的综合指标PDMS。HyWorldVLA在测试中取得PDMS 90.59的成绩达到公开结果中的领先水平说明在公开数据集和仿真驾驶环境中比亚迪这套基础模型具备当前自动驾驶研究前沿能力。不过benchmark领先不等于完成量产自动驾驶其更准确的意义是比亚迪证明了自己具备多模态、物理AI基础模型研究能力。HyWorldVLA的实现方法与优势分析HyWorldVLA的混合过程分为三步。第一步训练视频压缩器用视频VAE压缩视频帧引入文本信息提升压缩质量第二步预训练将图像、动作、语言和隐特征转成统一离散token模型同时预测未来画面token和隐特征第三步联合微调模型只输出隐特征动作生成模块产出最终轨迹。消融实验表明“混合”本身贡献最大像素级精细监督和隐空间都不可或缺隐特征监督权重适中时效果最佳隐空间带来噪声鲁棒性“额外红利”在恶劣天气下推理更可靠。该方案赢在“分阶段干活”两个阶段分工明确。HyWorldVLA的技术趋势与挑战HyWorldVLA代表的是自动驾驶基础模型探索方向与Tesla FSD、Waymo、NVIDIA Cosmos等路线处于同一技术趋势但有自己的差异化侧重。不过距离真正大规模量产部署仍需面对真实数据闭环、车端算力约束、长尾场景覆盖等一系列工程化挑战。比亚迪AI团队构成与特征HyWorldVLA论文由比亚迪汽车新技术研究院原规划院杨东生领导独立完成。比亚迪还有其他AI论文如2025年发表的EMoE - Planner等但部分领域与自动驾驶及物理AI基础研究关联不深。这表明比亚迪对核心AI基础模型研究是近几年才开始的。团队成员中Liulong Ma、Hongbiao Zhu等有鲜明的哈工大、CMU背景说明BYD新技术研究院的AI团队在吸收顶尖名校的计算机、机器人人才形成“机器人AI派”团队。比亚迪自研AI团队的构成呈现出从2024年甚至更早启动真正自研、团队成员学术背景集中、与自研机器人项目呼应等特征与其他车企研发路线不同更接近Tesla AI“机器人 自动驾驶”一体化组织逻辑。总结比亚迪发布HyWorldVLA的意义比亚迪发布HyWorldVLA的意义不仅在于多了一篇论文更让外界看到其物理AI基础模型研发的能力。自动驾驶竞争进入“物理AI能力竞争”比亚迪已有所认识不过HyWorldVLA是否代表其进入第一梯队还有待验证但它是老牌车企中率先按AI系统能力建设团队、推进研究的玩家。