2026年7月 世界人工智能大会WAIC创新发展论坛上清华大学李升波教授发表了题为《迈向泛在具身智能之路物理原生的世界模型、数据结构与训练算法》的主题演讲介绍了“物理原生智能”Physics-native Intelligence, Phi的概念与定义并系统阐述其核心特征与技术体系为破解物理世界的泛在智能开发难题提供了新型范式。李升波指出物理原生智能需要具备三项核心特征。第一状态解耦表征State-decoupled latent representation利用状态而不是观测表征世界的运动特性而且状态需要解耦为两个部分即由物理模型的“显状态”和神经网络的“隐状态”两部分构成兼顾描述的准确性与场景的泛化性。第二时序因果优先Temporality and causality as priorities模型结构满足时序性和因果性遵循事件发生时序优先的原则且动作规划尽量减少对未来“预测”信息的依赖减少模型推理过程的幻觉风险。第三物理定律约束Comply with underlying physical principles训练算法嵌入底层物理规律的约束包括训练动力学的对称守恒性以及辛几何结构等同时满足人机物交互过程的硬性安全约束即“绝对安全性”且具有对小样本数据的持续学习能力。以下内容根据李升波教授演讲整理略有增补删减各位嘉宾大家上午好今天诸位同仁汇聚一堂共同探讨人工智能的技术发展与应用前景我想是因为大家都看到了这一趋势人工智能时代已然来临了。过去十年以ChatGPT为代表一系列具有通用能力的人工智能技术不断涌现不断推动智能系统由专用化走向通用化。发展人工智能的核心目标是通用化。从视觉智能、语言智能起步到融合视频、图像和文本的多模态智能再到今天广泛热议的具身智能技术演进的目标是一致的就是不断提升智能的通用化水平。过去十年人工智能研究的经验是通用化不仅仅是一个目标而且是一类手段通用化的智能反而可以解决各类“专用智能”无法解决的难题。另外从应用的需求看唯有广泛适用于各类不同的场景才能使智能化系统从实验室的象牙塔真正走进千家万户融入人们的日常生产生活。具身智能是当前的研究热点但它的基本概念并不复杂人类是最典型的具身智能体。类似于人类与周围世界的交互智能体通过感知获取环境信息经过决策之后形成动作再通过动作影响物理世界。具备这一完整感知、决策与动作过程且与物理世界进行交互的智能体我们称之为“具身智能”。虽然当前各界讨论更多的是机器人但汽车无疑是具身智能的先行领域。自动驾驶汽车可视为第一个规模化量产的具身智能系统围绕自动驾驶开展研究的工程师和学者们也是具身智能的开拓者与先行者。随着智能化技术的不断发展我们相信不远的未来不仅仅是汽车和机器人一切能够感知环境、推理决策、实施动作与物理世界交互的实体都有可能成为智能的载体。这正是具身智能大有可为、广受关注的重要原因。问大家一个问题具身智能的研究、开发与产业落地究竟难不难从过去汽车领域的实践看研发难度很大也极具挑战。自动驾驶从上个世纪60年代就开始进入学术界的视野至今已有数十年的研究历史。过去十年以端到端模型训练为代表的技术体系虽然取得了长足地进步但到目前为止大规模量产的系统仍以L2级驾驶辅助为主且主要应用于高速公路和城市快速路。面向城区主干道路以及交叉路口、匝道、环岛等复杂工况智能驾驶系统的场景泛化能力仍然相对薄弱。尽管不少人对与L4级自动驾驶的规模化应用持有十分乐观的态度例如无人驾驶出租车但这类系统的可靠性与安全性仍有待进一步提升近两年不断出现的自动驾驶事故都证明了这一判断。从这个例子看出开发具身智能与现有的语言智能、视觉智能是存在显著性差异的。一个突出的区别是具身智能系统对安全性和可靠性的要求极高甚至到了十分苛刻的程度。语言或视觉模型的输出主要作用于信息空间容许一定的幻觉现象存在甚至部分人认为“幻觉”本身就是创造性的一部分。而具身模型产生的动作将直接作用于物理世界比如说高速行驶的汽车或家庭服务的机器人每一次幻觉性动作都有可能导致重大的安全事故这是不能被允许的。因此如何构建高安全、高可靠、高泛化的具身智能系统是摆在学术界和工业界面前的一项重大课题。我们以汽车与机器人的对比进一步说明困难的产生原因。与汽车相比机器人的自由度更高、系统结构更加复杂交互对象和任务类型也更加多样。从模型、数据和训练三个维度看现有自动驾驶模型达到百亿级参数规模训练数据达到亿级驾驶片段。按照同样的技术路线结合家居服务场景的要求进行预估机器人的具身模型或许需要万亿级神经网络参数和千亿级真机交互片段训练难度将比汽车领域高一个数量级甚至更多。这意味着训练一个实用性的具身智能模型将极具挑战性。如果仍然沿用现有视觉、语言和多模态大模型的训练思路主要依赖更大的参数、更多的数据和更强的算力我们能否经济、高效地实现泛在场景的具身智能呢答案几乎是否定的。从学术上说具身智能归属为Safety-critical Intelligence与人类交互的场景越多对安全性要求越高。用于家居服务领域的机器人尤其是面向老人、小孩等安全敏感对象将比自动驾驶汽车更加困难。幸运的是过去六十余年中人工智能的先驱者已经为我们提供了许多思想方面的启发使我们能够从物理的视角重新思考具身智能的开发范式。例如人工智能之父McCarthy强调建立世界的一般性表征图灵奖获得者Pearl提出要重视人类认知中因果关系的建模、分析与逻辑推断诺贝尔奖获得者Hopfield则指出应当关注物理系统所呈现出的集体属性。这些哲学式思考分别从世界表征、因果认知和物理结构等方面为今天的具身智能研究提供了重要启发。以这些重要思想为基础结合近十年大模型领域的技术进展以及具身智能的客观需求我与清华大学研究团队的同事们形成了”物理原生智能”的概念与定义并逐步凝练了它的核心特征与技术体系。本次报告我们将对这一技术体系进行系统性地介绍。物理原生智能是一类更加遵循物理世界的底层运行逻辑且以实现与物理世界高质量交互为目标的具身智能。它仍然以数据驱动的端到端模型训练为基本架构从世界模型、数据结构和训练算法三个维度体现物理实体对智能系统开发的要求。这些客观要求包括第一物理世界的高质量交互数据是十分稀缺的而不是完备或富裕的甚至不少领域几乎无真机数据第二与人类打交道的自动驾驶、机器人等具身智能系统对功能安全性的要求极高任何一次幻觉性动作都可能引发重大事故第三考虑数据闭环的重要作用以及真实数据只能逐步累积的客观事实具身模型的训练算法需要具有更强的稳定性、持续性和长期进化能力。那么物理原生智能具备什么特征呢包括三类核心特征1以解耦的状态表征系统动力学而不能直接采用传感器观测值描述世界即物理世界的真实性是隐藏在观测之下的2设计满足时序性与因果性的隐式模型结构尽量减少对未来”预测”信息的依赖3采用底层物理规律规范模型的训练过程要求满足绝对安全性且对小样本数据的持续学习能力。我们将这类具身智能称为Physics-native Intelligence简称Phi。世界模型使用状态而非观察的好处在于该模型将可直接嵌入物理层面的动力学模型一方面有利于提升动作推理的准确性进一步提升策略训练的准确性另一方面对世界模型的可溯源性也有帮助。通常而言预测信息尤其是长时域的预测又增加了一个不确定性环节它的准确性是比较差的这导致高质量的轨迹或者动作输出更加困难。具体来说物理原生智能的第一个特征是利用状态对物理世界进行表征而不是直接采用观测值且要求显状态与隐状态两者是解耦的。系统状态由两个部分构成显状态服从系统动力学与物理约束从而保证状态转移的长期稳定隐状态用于描述难以显式建模的因素并服从物理规律驱动的受控转移以降低长程推演过程中的信息失真。第二个特征是满足物理世界的时序性和因果性具体包括三个方面。一是时序优先即原因必须先于结果二者的次序不能颠倒系统动作生成尽量不要依赖状态的预测值二是干预敏感即当动作输入发生变化时后续状态应当产生合理且可解释的差异三是具备反事实推理的能力不仅关注成功样本和正向经验也重视失败样本、负向经验及其所带来的信息增益。第三个特征是将更加底层的物理规律嵌入模型与训练过程。一方面由广义对称性决定的虚拟物理量应当保持广义的守恒性另一方面训练动力学应当保持相应的辛几何结构。也就是说物理原生智能不能只是关注某一条具体的物理方程还应该关注时空对称性、能量守恒性和辛几何结构保持等具有更强普适性的底层规律。同时以硬约束为代表的交互安全性人机之间、机机之间、机环之间是真实世界的基本要求训练算法只能设法满足不能无视违背。这类要求称之为“绝对安全性Absolute Safety”。物理原生智能Phi还需要新的训练范式。一方面采用虚实混合数据hybrid data利用仿真数据或互联网数据缓解真实物理世界数据稀缺的问题另一方面采用阶梯训练staged training方法以步步为营、逐级提升的方式持续改善模型性能一般来说都是先监督学习后强化学习而不是寄希望于通过某一种训练方法一次性将模型性能提升至目标水平。我们团队的实践经验建议将训练过程至少划分为三个阶段首先采用监督学习进行预训练建立基础模型的初步通用能力随后采用强化学习进行后训练进一步提升特定任务的性能最后在实车或真机上开展强化学习微调使模型满足实际应用的性能与安全要求。每个阶段所使用的数据类型、性能指标和训练算法均有所不同需要根据具体任务和约束条件进行调整。当然仅有上述基本特征和训练范式仍然不够我们还需要进一步回答开发物理原生智能的具体措施。下面将从世界模型、数据结构和训练算法三个层面介绍物理原生智能Phi的技术路径。世界模型是物理原生智能的核心。无论朴素世界模型NWM还是世界动作模型WAM和受控世界模型CWM面向具身智能的世界模型都面临一个核心问题是如何引入动作信息使模型不仅能够预测世界的状态演化还能够推断动作对物理世界的影响并进一步支撑对物理世界的干预。世界动作模型WAM通常通过引入逆动力学模型将未来状态与动作建立关联受控世界模型CWM则直接增加动作维度将动作看做世界状态转移的条件。然而这两类方法在长时程、精细化和高稳定性的动作输出方面仍然存在不足与强化学习后训练、强化学习微调等类脑训练算法之间的匹配程度也有待进一步提升。物理原生世界模型Phi-World Model进一步强化了模型对物理世界因果规律的满足并增加了评价模型提升策略模块的可训练性。该模型以显状态和隐状态两类状态作为转移动力学的核心显状态直接嵌入物理动力学模型隐状态则采用神经网络构造相应的物理表征和转移关系。从观测到状态的映射可以采用已有的编码器机制从而更好地利用现有大模型领域的发展成果。策略模块和评价模块直接与状态相关联而不是仅仅依赖原始观测。这种结构化的信息输入有利于提升模型的动作准确性、功能安全性与可解释性。物理原生数据Phi-Data层面从当前观测到下一时刻观测的转移数据o,a,o’是基础组件。在此基础上还需要增加奖励信号 (r) 以及人类经验知识 (K)三者共同构成物理原生数据的三类基本要素。无论是互联网视频数据、Ego或UMI数据还是真机操作数据与仿真合成数据都可以通过一定的数据重构、时空对齐和质量增强方法转化为结构一致的物理原生数据。这些数据要素如何与模型训练相结合转移数据主要用于支撑编码器、解码器和受控转移模块的训练并为策略模块的学习提供基础。奖励信号主要与强化学习相结合用于训练评价模块并进一步提升策略性能。人类经验知识则可以借助多模态大模型的理解与评价能力转化为相应的监督或评价信号嵌入受控转移模型或评价模型为世界模型性能的提升提供支持。将数据信息有效注入模型还需要相应训练算法的支持。物理原生算法Phi-Algorithm设计的第一个要求是嵌入训练动力学的底层规律尤其是结构对称与守恒特性。神经网络模型的训练过程本质上可以被视为一个动力学系统的离散状态演化过程。类似于物理世界中的动力学训练动力学也存在广义能量关系、辛几何结构保持等底层规律。如果能够将这些性质显式嵌入训练算法的设计过程将有助于显著提升训练系统的稳定性。物理原生算法的第二项要求是具备绝对安全的保障能力。“绝对安全性Absolute Safety”是具身模型训练的一项特殊要求其含义是在真机训练过程中使每一代模型都满足相应的安全“硬约束”。这类似于人类新手学习驾驶的过程不能只要求学习完成以后才实现“安全”驾驶在整个学习过程中同样必须保证“安全”。从理论上看要实现这一目标就需要同步优化每一代策略及其所对应的安全可行区域。而安全可行区域的扩大又与智能体对环境的认知不确定性相互制约需要通过相应的博弈机制实现均衡。这是真机训练过程保障绝对安全的基本原理。训练算法的第三项客观需求是抗遗忘能力。这与人类大脑的持续学习机制相类似。由于具身领域的数据相对稀缺、完备性不足、应用场景繁多并且不同任务均具有较高的性能要求因此训练过程往往只能采用多阶段、分步骤的方式每次仅依赖小样本就可以使模型性能持续进化而不能期望累积足够数据之后通过一次性训练解决所有问题。这一过程中如何使每一批小数据都形成有效增益并避免后续训练破坏模型已经获得的性能是训练算法必须解决的基本问题。其设计关键在于建立明确的抗遗忘条件并构造相应的梯度正交机制以降低不同阶段训练任务之间的相互干扰。围绕上述思路我与团队的同事们、老师们、学生们在过去十年开展了一系列面向工业具身智能的基础理论、模型结构和训练算法研究。期间我们自主研发了面向工业对象的强化学习训练平台GOPS。该平台贯通数据生成、场景建模、任务转化、网络构建、优化求解、参数调优以及最终的模型部署与系统应用形成了功能一体化的工具链以更好地支撑自动驾驶和机器人等领域的具身模型开发。GOPS内嵌了一系列具有物理原生属性的算法例如DSAC通过连续值分布建模缓解策略高估问题提升中小规模强化学习的稳定性RAD将辛结构守恒融入自适应优化器抑制异常梯度引发的参数更新振荡LipsNet结合傅里叶滤波与李普希兹约束缓解神经网络策略的动作震荡RACS构建安全强化学习的三元迭代框架通过可行域内外的差异化更新实现安全区域的单调扩展与策略收敛DACER将反向扩散模型嵌入在线策略迭代过程支持多模态动作生成并缓解策略分叉难题BOOM采用规划自学习驱动的世界模型强化学习机制兼顾算法稳定性与复杂控制性能NANO依托自然梯度下降构造几何约束的非线性高斯滤波器提升复杂系统的状态估计能力MVP引入瞬时速度约束和复合生成与选择机制兼具生成式策略的高表达能力与单步生成的高时间效率。这些算法覆盖神经网络优化器、神经网络结构设计、系统状态估计滤波、小模型强化学习训练、大模型强化学习训练、世界模型增强训练等不同环节。我们希望通过这些研究更好地赋能全行业使智能的提升不只依赖数据规模与算力规模的增长也能够通过模型结构和训练算法的创新实现进一步的突破。最后简要总结今天的发言。自动驾驶是具身智能的重要起点而物理原生智能为我们从自动驾驶走向机器人、走向更加广泛的物理实体提供了一条值得持续探索的技术路径。人工智能时代刚刚到来模型、数据、算法等领域的研究方兴未艾人与智能系统的连接关系也正在逐步深化让我们期待泛在具身智能Aha moment的早日到来