比亚迪发AI论文:HyWorldVLA达SOTA,展现物理AI基础模型研发能力!
比亚迪发布HyWorldVLA论文开启自动驾驶新探索比亚迪汽车新技术研究院公开了一篇名为HyWorldVLA的论文该论文瞄准当前自动驾驶最热门的方向——Vision - Language - ActionVLA World Model世界模型。HyWorldVLA在自动驾驶公开基准NAVSIM v1上取得SOTA成绩PDMS达到90.59。比亚迪智能化的反差与突破过去几年外界提到比亚迪智能化多想到“天神之眼”、供应链整合、规模化落地以及今年的“兜底”但对于其“代码级自研”的AI技术和学术成果了解甚少甚至有传言其智能发布会PPT由供应商帮忙制作。然而这篇论文让大家看到了一个不同的比亚迪它不但有自动驾驶成果还有一支长期投入物理AI基础模型的研发团队。HyWorldVLA的研究方向与创新点HyWorldVLA瞄准的是让AI从“识别道路”走向“理解世界”这一前沿路线。近几年行业开始探索端到端自动驾驶模型加入世界模型World Model是进一步的发展。世界模型希望让AI拥有“内部模拟器”能预测未来。但目前的自动驾驶世界模型面临既想让模型理解真实世界细节又希望高效推理的核心矛盾。现有的解决方式有Pixel - level World Model和Latent World Model前者直观但计算成本高、易受视觉噪声影响后者效率高但可能丢失真实世界细节。HyWorldVLA提出混合世界模型Hybrid World Modeling保留视觉世界模型对环境细节的理解能力利用隐空间模型提升推理效率并引入Vision - Language - ActionVLA模型形成端到端流程。HyWorldVLA的测试效果与意义HyWorldVLA选择NAVSIM v1作为测试平台该平台采用更接近实际驾驶质量的综合指标PDMS。HyWorldVLA在测试中取得PDMS 90.59的成绩达到公开结果中的领先水平说明在公开数据集和仿真驾驶环境中比亚迪这套基础模型具备当前自动驾驶研究前沿能力。不过benchmark领先不等于完成量产自动驾驶其更准确的意义是比亚迪证明了自己具备多模态、物理AI基础模型研究能力。HyWorldVLA的实现方法与优势分析HyWorldVLA的混合过程分为三步。第一步训练视频压缩器用视频VAE压缩视频帧引入文本信息提升压缩质量第二步预训练将图像、动作、语言和隐特征转成统一离散token模型同时预测未来画面token和隐特征第三步联合微调模型只输出隐特征动作生成模块产出最终轨迹。消融实验表明“混合”本身贡献最大像素级精细监督和隐空间都不可或缺隐特征监督权重适中时效果最佳隐空间带来噪声鲁棒性“额外红利”在恶劣天气下推理更可靠。该方案赢在“分阶段干活”两个阶段分工明确。HyWorldVLA的技术趋势与挑战HyWorldVLA代表的是自动驾驶基础模型探索方向与Tesla FSD、Waymo、NVIDIA Cosmos等路线处于同一技术趋势但有自己的差异化侧重。不过距离真正大规模量产部署仍需面对真实数据闭环、车端算力约束、长尾场景覆盖等一系列工程化挑战。比亚迪AI团队构成与特征HyWorldVLA论文由比亚迪汽车新技术研究院原规划院杨东生领导独立完成。比亚迪还有其他AI论文如2025年发表的EMoE - Planner等但部分领域与自动驾驶及物理AI基础研究关联不深。这表明比亚迪对核心AI基础模型研究是近几年才开始的。团队成员中Liulong Ma、Hongbiao Zhu等有鲜明的哈工大、CMU背景说明BYD新技术研究院的AI团队在吸收顶尖名校的计算机、机器人人才形成“机器人AI派”团队。比亚迪自研AI团队的构成呈现出从2024年甚至更早启动真正自研、团队成员学术背景集中、与自研机器人项目呼应等特征与其他车企研发路线不同更接近Tesla AI“机器人 自动驾驶”一体化组织逻辑。总结比亚迪发布HyWorldVLA的意义比亚迪发布HyWorldVLA的意义不仅在于多了一篇论文更让外界看到其物理AI基础模型研发的能力。自动驾驶竞争进入“物理AI能力竞争”比亚迪已有所认识不过HyWorldVLA是否代表其进入第一梯队还有待验证但它是老牌车企中率先按AI系统能力建设团队、推进研究的玩家。

相关新闻

PTA编程题“念数字”详解:字符串与递归解法及格式控制技巧

PTA编程题“念数字”详解:字符串与递归解法及格式控制技巧

1. 项目概述:从“念数字”看PTA编程题的解题心法最近在辅导一些同学准备程序设计类考试和刷题,发现很多人对PTA(Programming Teaching Assistant,程序设计类实验辅助教学平台)上的题目感到头疼,尤其是那些看…

2026/7/30 7:36:13 阅读更多 →
Allegro PCB设计:掌握图形层快速切换技巧,提升批量操作效率

Allegro PCB设计:掌握图形层快速切换技巧,提升批量操作效率

1. 项目概述:一个被低估的效率痛点在Allegro PCB设计软件里,有一个操作几乎每天都会发生,但很多人却用着最原始、最耗时的方法——那就是在不同层之间切换图形元素。想象一下这个场景:你正在布局一块复杂的多层板,突然…

2026/7/30 7:36:13 阅读更多 →
AI系统模块化架构:LLM、Agent与链路神经的协同设计

AI系统模块化架构:LLM、Agent与链路神经的协同设计

1. 项目概述:AI系统的模块化架构演进 在2023年大模型技术爆发后,我们正在见证AI系统架构的第三次范式转移。不同于早期单体模型(如BERT)和中期工具调用(如ChatGPT Plugins)的架构,新一代AI系统呈…

2026/7/30 7:36:13 阅读更多 →

最新新闻

HuggingFace AutoModelForCausalLM:从任务头设计理解语言建模原理

HuggingFace AutoModelForCausalLM:从任务头设计理解语言建模原理

上周帮一个刚入行的朋友配置本地开发环境,他盯着 HuggingFace 模型下载页面看了半天,突然问:“为什么同一个模型,有人用 AutoModel ,有人用 AutoModelForCausalLM ?这俩到底有什么区别?”我…

2026/7/30 7:46:17 阅读更多 →
Agent Skills从零到企业级实战:完整构建指南与最佳实践

Agent Skills从零到企业级实战:完整构建指南与最佳实践

这次我们来看一个关于 Agent Skills 的完整学习路径教程。这个教程的重点不是空谈概念,而是从零基础到企业级实战的完整构建过程,涵盖了当前最实用的 Agent 技术栈和项目实践。 如果你正在寻找一套能真正跑通、能部署、能集成到现有系统的 Agent 方案&a…

2026/7/30 7:46:17 阅读更多 →
智能车入门指南:从核心部件到PID控制,零基础构建自主行驶模型车

智能车入门指南:从核心部件到PID控制,零基础构建自主行驶模型车

1. 项目概述:从零开始认识智能车如果你对“智能车”这三个字感到既兴奋又迷茫,觉得它充满了科技感,但又不知从何下手,那么你来对地方了。这篇文章就是为你——一个对电子、编程、机械可能只有一点点了解,甚至完全零基础…

2026/7/30 7:46:17 阅读更多 →
USB 2.0高速握手协议详解:从Chirp信号到状态机,解决设备降速与兼容性问题

USB 2.0高速握手协议详解:从Chirp信号到状态机,解决设备降速与兼容性问题

1. 项目概述:从“插上就能用”到“握手言和”的幕后故事 我们每天都在用USB接口给手机充电、传文件、接鼠标键盘,绝大多数时候都是“即插即用”,感觉理所当然。但你可能没想过,当你把一个USB 2.0的U盘插入电脑的瞬间,电…

2026/7/30 7:46:17 阅读更多 →
在机器视觉系统中,工业相机的镜头有什么作用

在机器视觉系统中,工业相机的镜头有什么作用

在机器视觉系统中,工业镜头是成像前端核心部件,相当于人眼的晶状体,直接决定相机能否清晰、准确采集目标图像,是视觉检测成败的关键。相机镜头由多个透镜,可变(亮度)光圈和对焦环组成。可观察相机显示屏来调整可变光圈…

2026/7/30 7:46:17 阅读更多 →
FPGA彩灯控制器设计:Verilog状态机实现与Quartus仿真全流程

FPGA彩灯控制器设计:Verilog状态机实现与Quartus仿真全流程

1. 项目概述:从需求到实现的逻辑闭环最近在整理一些FPGA的入门项目,发现“彩灯控制器”是一个被反复提及,但很多资料又讲得不够透彻的经典案例。它麻雀虽小,五脏俱全,几乎涵盖了数字逻辑设计的核心思想:时钟…

2026/7/30 7:45:16 阅读更多 →

日新闻

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南 【免费下载链接】DriverStoreExplorer Driver Store Explorer 项目地址: https://gitcode.com/gh_mirrors/dr/DriverStoreExplorer 您是否曾因Windows系统盘空间不足而烦恼?是否遇到过设…

2026/7/30 0:00:13 阅读更多 →
如何3步掌握Video Download Helper:网页视频下载的完整实战指南

如何3步掌握Video Download Helper:网页视频下载的完整实战指南

如何3步掌握Video Download Helper:网页视频下载的完整实战指南 【免费下载链接】VideoDownloadHelper Chrome Extension to Help Download Video for Some Video Sites. 项目地址: https://gitcode.com/gh_mirrors/vi/VideoDownloadHelper 你是否曾经在浏览…

2026/7/30 0:00:13 阅读更多 →
“双减”后首个AI备课压力测试报告:覆盖32所中小学的176节AI辅助课,暴露4大隐性增负节点

“双减”后首个AI备课压力测试报告:覆盖32所中小学的176节AI辅助课,暴露4大隐性增负节点

更多请点击: https://intelliparadigm.com 第一章:AI 教师备课辅助 AI 教师备课辅助系统正逐步成为教育数字化转型的核心支撑工具,它并非替代教师,而是通过语义理解、知识图谱与多模态生成能力,将教师从重复性劳动中解…

2026/7/30 0:00:13 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/29 22:18:20 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/29 15:00:03 阅读更多 →

月新闻