Loco-Manipulation:机器人移动与操作协同的技术演进
0. 引言在机器人技术发展的早期阶段,移动能力与操作能力长期处于割裂状态。工业机械臂固定在生产线上,精度极高却无法移动半步;移动机器人能够自主导航,却只能充当搬运工角色。这种设计在结构化的工业环境中尚可应对,但当机器人需要走进家庭、医院、仓库等开放场景时,局限性立刻显现。没有哪个真实任务能够被简单分解为先移动到位,再执行操作两个独立步骤。Loco-Manipulation(Locomotion Manipulation)正是为了打破这一僵局而诞生的技术范式。它不是简单地将移动平台与机械臂拼接在一起,而是要实现两者在时间、空间、动力学层面的深度协同。移动过程中调整姿态为操作创造条件,操作产生的力反馈实时影响移动策略,全身关节协调配合以维持动态平衡。这种协同能力,是机器人从专用工具进化为通用助手的关键一步。从技术演进的角度看,Loco-Manipulation 的发展轨迹清晰地反映了机器人学从分而治之到整体优化的范式转变。早期研究者尝试用分层控制架构来规避协同难题,但很快发现这种方案在动态场景中力不从心。当机器人需要边走边推动重物时,操作产生的反作用力会破坏移动平衡,而移动姿态的变化又会影响操作精度。两个子系统之间的耦合无法被简单忽略,必须从根本上重新设计控制架构。真正的突破来自于两条并行发展的技术路径。第一条是模型驱动路径(Model-based),研究者基于物理动力学理论,将机器人全身建模为统一系统,通过优化算法同步规划移动与操作动作。这条路径的代表是苏黎世联邦理工学院(ETH Zurich)的工作,他们在 ANYmal 四足机器人上实现了开门、推重物、跨越障碍等复杂任务,成功率超过 90%,展现了模型驱动方法在结构化环境中的卓越性能。第二条是学习驱动路径(Learning-based),研究者放弃手动设计协同规则,转而让机器人通过强化学习或模仿学习,从数据中自主发现移动与操作的最优协同策略。这条路径的优势在于无需精确建模,能够适应复杂接触、非结构化环境,且可以通过迁移学习复用人类演示数据。近年来,随着大规模仿真平台和视觉-语言-动作模型的成熟,学习驱动方法在人形机器人领域取得了显著进展。本文将系统梳理 Loco-Manipulation 的核心技术脉络,深入解析模型驱动与学习驱动两大范式的代表性成果,并探讨技术走向工业落地过程中的关键挑战与未来趋势。1. 技术背景与核心挑战1.1 为什么需要 Loco-Manipulation传统机器人系统将移动与操作视为两个独立模块,这种设计在特定场景下是合理的。例如,工业机械臂的工作空间固定,只需优化操作精度;AGV 小车只负责物料运输,无需考虑操作任务。但当我们希望机器人能够应对开放世界的多样化需求时,这种分离设计的弊端开始显现。考虑一个看似简单的家居场景:机器人需要从地面拾取一个物体并放到桌上。如果采用传统的先移动后操作策略,机器人需要经历移动到物体附近、停止调整姿态、伸出机械臂抓取、移动到桌子旁、再次停止调整、最后放置物体等六个步骤。这个流程存在多个问题。首先,每次切换模块都需要重新定位和调整,效率低下。其次,如果物体位置在移动过程中发生偏移,或者桌面高度与预期不符,机器人需要反复调整。最关键的是,当机器人抓取重物时,负载会改变重心分布。如果移动控制器没有感知到这一变化,可能导致失衡甚至跌倒,这在真实应用中是不可接受的安全隐患。Loco-Manipulation 的核心思想是将移动与操作视为一个整体进行规划和控制。在上述场景中,机器人可以在接近物体的过程中,同步调整身体姿态和机械臂位置,使得到达时无需额外调整即可抓取。抓取重物后,机器人能够实时调整步态和重心,补偿负载变化对平衡的影响。在移动到桌子的过程中,根据视觉反馈动态调整轨迹和末端位置,确保放置精度。这种协同不仅提升了效率,更重要的是增强了鲁棒性。机器人能够应对动态变化,而不是依赖精确的预先规划,这是适应真实世界复杂性的关键能力。1.2 核心技术挑战实现 Loco-Manipulation 面临三大核心挑战,每一个都需要在理论和工程层面取得突破。挑战一:动态耦合的复杂性移动与操作之间存在强耦合关系。机械臂的运动会改变机器人的整体重心,进而影响移动稳定性;移动过程中的加速度和地面反力会传递到机械臂,影响操作精度。这种耦合在数学上表现为高维、非线性的动力学方程,难以精确求解。以四足机器人为例,当它用前肢抓取物体时,后肢需要承担更多重量以维持平衡,同时调整步态以补偿重心偏移。如果采用传统的分层控制,底层控制步态,上层控制机械臂,两个控制器之间缺乏信息交互,容易导致冲突。底层控制器试图维持标准步态,而上层控制器的动作却在不断破坏这个步态。挑战二:实时性与计算复杂度的矛盾要实现流畅的移动操作协同,控制频率通常需要达到 50Hz 以上,即每 20 毫秒更新一次控制指令。但全身动力学模型的维度很高,人形机器人通常有 30 个自由度,四足机器人加上机械臂也有 20 个自由度。在如此高的维度下进行实时优化求解,对算法效率和硬件性能都提出了极高要求。模型驱动方法需要在每个控制周期内求解一个包含数百个约束的优化问题。学习驱动方法则需要神经网络能够在毫秒级时间内完成前向推理。如何在保证控制精度的前提下降低计算复杂度,是工程实现的关键,也是制约技术落地的主要瓶颈之一。挑战三:泛化能力与数据效率的权衡真实世界的场景千变万化:地面可能不平整,物体形状各异,环境光照变化,甚至可能有人类或其他机器人的干扰。模型驱动方法依赖精确的环境建模,一旦实际情况偏离模型假设,性能会显著下降。学习驱动方法虽然理论上能够从数据中学习泛化能力,但需要大量多样化的训练数据。而在真实机器人上采集数据成本高昂且存在安全风险,每小时数据采集成本可达数千美元。如何在有限的数据条件下训练出既稳定又泛化的策略,是当前研究的核心难题之一。仿真到现实(Sim-to-Real)迁移技术提供了一种解决思路,但仿真与现实之间的差距仍然是制约性能的瓶颈。2. 模型驱动方法——物理建模的精确协同模型驱动(Model-based)方法是 Loco-Manipulation 领域的经典技术路径,其核心思想是基于机器人动力学模型,通过优化算法求解满足物理约束的最优控制序列。这类方法的优势在于可解释性强、稳定性高、能够提供理论保证,因此在工业级应用中占据主导地位。从数学角度看,模型驱动方法将机器人控制问题转化为约束优化问题。2.1 核心技术框架模型驱动方法的典型流程包括三个关键步骤:全身动力学建模、接触建模与约束处理、优化问题构建。步骤1:全身动力学建模将机器人视为一个刚体系统,建立包含所有关节的动力学方程。对于腿式机器人,这通常采用浮动基座(Floating Base)模型,其动力学方程的一般形式为M ( q ) q ¨ C ( q , q ˙ ) q ˙ g ( q ) τ J T F c o n t a c t M(q)\ddot{q} C(q,\dot{q})\dot{q} g(q) \tau J^T F_{contact}M(q)q¨​C(q,q˙​)q˙​g(q)τJTFcontact​。这个模型捕捉了机器人的惯性特性、重力影响、以及接触力的作用。关键在于,它将移动(基座运动)和操作(机械臂运动)统一在同一个方程中,自然地包含了两者之间的动力学耦合。步骤2:接触建模与约束处理腿式机器人与环境的交互主要通过足端接触实现。接触建模需要考虑摩擦锥约束、单侧约束和接触状态切换三个关键要素。摩擦锥约束确保接触力必须在摩擦锥内,否则会发生滑动,其数学表达为∥ f t a n g e n t i a l ∥ ≤ μ ⋅ f n o r m a l \|f_{tangential}\| \leq \mu \cdot f_{normal}∥ftangential​∥≤μ⋅fnormal​。单侧约束表明机器人只能推地面,不能拉地面,即法向力必须非负。接触状态切换描述足端在支撑相和摆动相之间的转换。这些约束的准确建模是保证机器人稳定运动的基础,也是模型驱动方法相比学习方法的核心优势之一。步骤3:优化问题构建将移动操作协同问题表述为一个优化问题,目标是找到一条轨迹,使得机器人能够完成任务的同时满足所有物理约束。目标函数通常包含跟踪误差、控制代价和接触力代价三项,表示为∑ t [ ∥ q t − q r e f ∥ 2 ∥ u t ∥ 2 ∥ F t ∥ 2 ] \sum_t [ \|q_t - q_{ref}\|^2 \|u_t\|^2 \|F_t\|^2 ]∑t​[∥qt​−qref​∥2∥ut​∥2∥Ft​∥2]。约束条件包括动力学约束、接触约束、关节限位、扭矩限制和任务约束。这是一个非线性优化问题,通常采用序列二次规划(SQP)或内点法求解。优化算法的效率直接决定了系统的实时性能,是工程实现的关键技术难点。2.2 代表性工作解析2.2.1 ETH Zurich: 多接触场景的通用规划框架苏黎世联邦理工学院在 2023 年发表于 Science Robotics 的工作Versatile Multi-Contact Planning and Control代表了模型驱动方法的最高水准。该工作的核心创新在于提出了一个能够自动发现接触序列的规划框架。传统方法需要人工指定接触序列,例如先用右前足接触墙面,再用左前足接触地面,这在复杂场景中几乎不可行。ETH 的方案采用双层优化架构,外层基于图搜索的接触序列规划,内层基于优化的轨迹生成。外层将环境中的可接触表面离散化为接触候选点,构建一个状态图,每个节点代表一个接触状态。通过启发式搜索找到从初始状态到目标状态的接触序列,大幅降低了人工设计的复杂度。内层对于给定的接触序列,求解一个轨迹优化问题,生成满足动力学约束的全身运动轨迹。这里采用了采样方法与优化方法的结合,先用快速采样生成粗略轨迹,再用优化方法精细化。在真实的 ANYmal 四足机器人上,该方法成功完成了多个高难度任务。开启重型洗碗机门时,机器人需要用前肢抓住把手,克服门的静摩擦力拉开,同时后肢保持平衡,必须协调四肢的接触力分配。转动阀门任务需要多次重新抓握,每次抓握时都要调整身体姿态以获得合适的操作角度。跨越弹簧门时,机器人用前肢推开门,在门回弹之前快速通过,这要求移动与操作的时序精确协调。成功率达到 90% 以上,规划时间在普通笔记本上约 1 分钟,证明了方法的实用性。但该方法仍存在局限:需要预先获得环境的几何模型,在未知环境中难以应用;对于接触候选点较多的场景,图搜索的复杂度会显著增加。2.2.2 ETH Zurich: 扭矩级全身MPC控制同样来自 ETH Zurich,2025 年发表于 RAL 的工作Whole-Body Inverse Dynamics MPC将模型驱动方法推向了新的高度,直接在扭矩空间进行优化,而不是传统的位置或速度空间。传统的 MPC(模型预测控制)通常在简化模型上进行优化,然后通过底层控制器将优化结果转换为关节扭矩。这种分层设计的问题在于,简化模型无法准确捕捉全身动力学,导致优化结果在实际执行时可能违反扭矩限制或导致不稳定。该工作的创新在于直接优化关节扭矩,将全身逆动力学作为优化问题的约束。这样做的好处是优化结果天然满足动力学可行性,无需额外的跟踪控制器,简化了控制架构。关键技术包括自适应时间步长、接触力优化和实时性优化三个方面。自适应时间步长采用几何级数分布,近期步长小保证精确控制,远期步长大降低计算量,在保证控制精度的同时提升实时性。接触力优化不仅优化扭矩,还同时优化接触力,确保接触力与扭矩的一致性。通过代码生成和编译优化,将求解时间压缩到 12.5ms,实现 80Hz 的控制频率,满足实时控制需求。在 Unitree B2-Z1 四足操作机器人上,该方法实现了三类高难度任务。行走中牵引 10kg 负载时,机械臂抓住重物,在行走过程中保持稳定,负载超过了机械臂的额定负载,必须通过全身协调来分担重量。推箱子靠墙任务中,机器人边走边推动箱子,直到箱子贴墙,要求实时感知推力反馈,调整步态以维持推力方向和大小。白板擦拭任务是典型的力控任务,机械臂末端装有海绵,在白板上施加恒定压力进行擦拭,同时机器人横向移动以覆盖整个白板。实验数据显示,位置跟踪误差小于 0.1m,力控误差小于 10N,在受到 0.8m/s 的基座扰动后能够快速恢复稳定,证明了方法的鲁棒性。2.2.5 MIT: 双足机器人的动态平衡与操作协同麻省理工学院在 IEEE-RAS Humanoids 2014 发表的工作Whole-body Motion Planning with Centroidal Dynamics and Full Kinematics以及 IROS 2018 的Dynamic Locomotion in the MIT Cheetah 3 Through Convex Model-Predictive Control,聚焦于如何在保持动态平衡的同时执行操作任务。他们提出的基于轨迹优化的方法,将全身动力学、零力矩点(ZMP)约束和操作任务目标统一在一个优化框架中。该方法的核心创新在于引入了时变的稳定性裕度概念。在操作任务的不同阶段,系统动态调整稳定性约束的严格程度,在需要精确操作时放宽移动稳定性要求,在快速移动时加强平衡约束。实验结果显示,Atlas 人形机器人能够在行走过程中拾取 5kg 重物,并在不停止的情况下完成放置动作。这种动态平衡与操作的协同,为人形机器人在动态环境中的应用提供了新思路。2.3 模型驱动方法的优势与局限模型驱动方法的核心优势体现在四个方面。首先是物理一致性保证,基于第一性原理建模,确保生成的动作在物理上可行,不会违反动力学约束或导致失稳,这在安全关键型应用中至关重要。其次是可解释性强,优化过程透明,可以清晰地看到每个约束的作用,便于调试和故障诊断。当系统出现问题时,工程师能够快速定位原因,而不是面对黑箱模型束手无策。第三是样本效率高,不需要大量数据训练,只需要准确的模型参数,这些参数可以通过 CAD 模型或系统辨识获得。相比学习方法动辄需要数百万次交互,模型方法的数据需求几乎可以忽略不计。第四是实时性能优异,经过优化的求解器可以在毫秒级时间内完成计算,满足高频控制需求。ETH 的工作已经证明,在普通计算平台上实现 80Hz 以上的控制频率是完全可行的。但模型驱动方法也存在明显的局限性。建模成本高是首要问题,需要精确的动力学模型和环境几何模型,跨场景部署时需要重新建模,这在快速变化的应用场景中是难以接受的。泛化能力受限是第二个问题,对模型误差敏感,当实际系统与模型存在偏差时,性能会显著下降。例如,机器人长期使用后关节磨损导致摩擦系数变化,模型方法需要重新辨识参数才能恢复性能。复杂接触场景处理困难是第三个挑战,当接触点数量多、接触状态频繁切换时,优化问题的规模和复杂度急剧增加,可能导致求解失败或实时性下降。最后,难以处理高维感知输入,传统优化方法难以直接处理图像等高维传感器数据,通常需要预先提取几何特征,这限制了方法在视觉驱动任务中的应用。3. 学习驱动方法——数据赋能的自主协同学习驱动(Learning-based)方法代表了 Loco-Manipulation 的另一条技术路径。与模型驱动方法不同,学习方法不依赖精确的数学模型,而是让机器人通过与环境交互,从数据中自主学习移动与操作的协同策略。这类方法的核心优势在于泛化能力强、能够处理复杂感知输入、可以迁移人类技能,因此在开放场景和人形机器人领域展现出巨大潜力。从技术角度看,学习方法将控制问题转化为函数逼近问题。3.1 强化学习的核心思想强化学习(Reinforcement Learning, RL)是学习驱动方法的主流技术。其基本思想是让机器人在仿真环境中反复尝试,通过奖励信号引导其发现最优策略。机器人通过策略网络π ( a ∣ s ) \pi(a|s)π(a∣s)输出动作,与环境交互获得奖励,然后通过价值网络V ( s ) V(s)V(s)评估状态的好坏。优势函数A ( s , a ) Q ( s , a ) − V ( s ) A(s,a) Q(s,a) - V(s)A(s,a)Q(s,a)−V(s)衡量某个动作相对于平均水平的优劣,指导策略改进。奖励函数是强化学习的核心,它定义了什么是好的行为。在 Loco-Manipulation 任务中,奖励函数通常包含多个组成部分:任务进度奖励鼓励接近目标,移动效率奖励鼓励快速移动,稳定性惩罚避免剧烈晃动。能耗惩罚鼓励平滑动作,接触力惩罚避免过大冲击,任务完成奖励在到达目标时给予大额奖励。这些奖励项的权重需要精心调整,是影响学习效果的关键因素。3.2 代表性工作解析3.2.1 UC Berkeley: 四足机器人的技能组合框架加州大学伯克利分校在 IROS 2024 发表的工作HiLMa-Res提出了一个通用的分层强化学习框架,实现了四足机器人移动与腿部操作的深度协同。该工作的关键洞察是:移动能力是任务无关的通用技能,而操作能力是任务特定的。因此,可以将控制器分为两层,底层负责跟踪任意给定的末端执行器轨迹,同时保持机器人平衡。底层控制器通过强化学习训练,输入是期望的足端轨迹,输出是关节扭矩。关键技术是使用中枢模式发生器(CPG)生成标称步态,再通过贝塞尔曲线参数化残差轨迹,实现对标称步态的灵活调整。上层是任务特定的操作规划器,根据具体任务规划足端应该如何运动。这个规划器也通过强化学习训练,但输入是任务相关的观测,输出是贝塞尔曲线参数和 CPG 参数。在真实四足机器人上,该框架实现了三类任务。足球运球时,机器人用前肢推动足球,同时保持行走,这个任务在仿真中训练,零样本迁移到真实机器人,成功率达到 75%。障碍跨越任务中,机器人需要抬高前肢跨越障碍物,同时保持平衡,使用视觉输入检测障碍物高度,成功率 87.5%。负载导航时,机器人用前肢抓住重物,在行走过程中保持稳定,使用真实数据训练,成功率 100%。该框架的技术优势体现在三个方面:通用性强,底层控制器只需训练一次,可以复用到多个任务;样本效率高,上层规划器的训练数据量远小于端到端方法;零样本迁移,仿真训练的策略可以直接部署到真实机器人。3.2.1.1 SaPaVe: 主动感知与操作的端到端框架2026 年 3 月被 CVPR 2026 接收的 SaPaVe 工作针对机器人与复杂场景交互中的主动感知和操作问题。现有方法难以统一语义驱动的主动感知与鲁棒的、视角不变的执行。SaPaVe 提出了一个端到端框架,以数据高效的方式联合学习这些能力。该方法的关键创新是解耦相机和操作动作,而不是将它们放在共享动作空间中,并遵循自底向上的训练策略:首先在大规模数据集上训练语义相机控制,然后使用混合数据联合优化两种动作类型。为支持该框架,引入了 ActiveViewPose-200K 数据集,包含 20 万个图像-语言-相机运动对,用于语义相机运动学习,以及一个 3D 几何感知模块,提高动态视角下的执行鲁棒性。还提出了 ActiveManip-Bench,这是首个用于评估超越固定视角设置的主动操作基准。在仿真和真实世界环境中的大量实验表明,SaPaVe 的性能优于最近的视觉-语言-动作模型(如 GR00T N1 和 π₀),在真实世界任务中的成功率提高了 31.25%。这些结果表明,当通过解耦但协调的策略训练时,紧密耦合的感知和执行能够实现高效且可泛化的主动操作。3.2.2 BIGAI Unitree: 无传感器的力-位统一控制北京通用人工智能研究院与宇树科技在 CoRL 2025 发表的工作提出了首个无需外力传感器的力-位统一控制策略,这是学习驱动方法在接触密集型任务中的重要突破。传统的操作任务通常分为两类:位置控制(如抓取)和力控制(如擦拭、开门)。但在真实场景中,很多任务需要同时控制位置和力。擦黑板需要保持恒定的接触力,同时沿着黑板表面移动;开柜门需要施加足够的拉力,同时跟踪门把手的运动轨迹。传统方法通常依赖外力传感器来测量接触力,但这类传感器成本高、易损坏,且增加了系统复杂度。该工作的核心创新是通过强化学习,让机器人从自身的历史状态中估计外力,无需额外传感器。训练分为两个阶段。第一阶段在仿真中预训练移动和到达能力,此时不考虑力控制,奖励函数只包含位置跟踪误差和稳定性项。第二阶段引入随机的力指令和外部扰动,训练策略学习力估计和力控制。关键是使用模型预测控制(MPC)损失来监督力估计器。通过使用估计的力预测未来状态,与实际观测到的下一状态对比,最小化预测误差,从而提升力估计的准确性。在 Unitree B2-Z1 四足操作机器人和 Unitree G1 人形机器人上,该方法在四类接触密集任务中的表现显著优于纯位置控制。擦黑板任务成功率从 45% 提升到 92%,开关柜门从 60% 提升到 95%,抽屉开启从 30% 提升到 78%。力控制误差稳定在 10N 以内,位置跟踪误差小于 0.1m,证明了方法的有效性。更重要的是,该方法实现了跨机器人形态的泛化,同一套策略可以在四足和人形机器人上部署,展现了学习方法的强大适应能力。3.2.3 NVIDIA CMU: 大规模视觉仿真到真实迁移NVIDIA 与卡内基梅隆大学在 2025 年提出的 VIRAL 框架,代表了视觉驱动 Loco-Manipulation 的最高水准。该工作的核心贡献是实现了基于 RGB 视觉的长周期移动操作任务的零样本部署。视觉驱动的移动操作面临三大挑战。首先是 Sim-to-Real 鸿沟,仿真中的视觉与真实世界差异巨大,包括光照、材质、相机噪声等多个方面。其次是长周期任务的误差累积,一个完整的循环需要 20 秒,视觉误差会逐步累积。第三是数据效率问题,真实机器人上采集视觉-动作数据成本极高。VIRAL 采用师生蒸馏框架来解决这些挑战,教师策略使用特权信息(全状态)在仿真中训练,学生策略仅使用视觉输入。教师策略通过特权强化学习训练,可以访问物体的精确位置、速度等信息。学生策略通过蒸馏学习教师的知识,结合 DAgger 和行为克隆技术,使用学生策略收集轨迹,查询教师的动作作为专家标签,最小化学生与教师的动作差异。为了缩小 Sim-to-Real 差距,VIRAL 采用了大规模的视觉域随机化。光照随机化包括环境光强度、方向光强度和光照方向;材质随机化包括物体的颜色、粗糙度和金属度;相机参数随机化包括焦距、曝光和白平衡。还包括图像质量退化,添加噪声、运动模糊和 JPEG 压缩。通过这些随机化,学生策略在仿真中见过各种视觉条件,从而能够泛化到真实世界。在 Unitree G1 人形机器人上,VIRAL 实现了连续 54 个行走-放置-抓取-转向循环,成功率 91.5%,平均每个循环耗时 20.2 秒,接近人类遥操作水平的 21.4 秒。关键性能指标包括零样本迁移,仿真训练的策略直接部署,无需真实数据微调;场景泛化,支持托盘位置变化、机器人姿态变化、桌面高度变化;光照鲁棒性,在不同光照条件下均能稳定工作。3.3 视觉-语言-动作模型迈向通用智能近年来,大语言模型的成功启发了机器人领域的研究者:能否构建一个统一的模型,将视觉感知、语言理解、动作生成融合在一起,实现真正的通用机器人智能?3.3.1 OpenDriveLab AgiBot: 大空间移动操作的 VLA 框架OpenDriveLab 与 AgiBot 在 2025 年提出的 WholeBodyVLA 是首个面向大空间移动操作的视觉-语言-动作模型。传统 VLA 模型主要针对桌面操作任务,输入是固定视角的图像,输出是机械臂的关节角度。但在大空间移动操作中,机器人需要理解自然语言指令、感知大范围环境、协调全身动作。WholeBodyVLA 的解决方案是引入双 LAM(Latent Action Model),分别处理操作和移动。视觉编码器和语言编码器提取多模态特征,VLA 主干网络解码为 latent 动作,然后分离为操作和移动的 latent,最后解码为具体动作。与传统的连续速度控制不同,WholeBodyVLA 采用离散的移动指令接口:前进/后退、左移/右移、左转/右转、蹲下/站立。这种设计降低了学习难度,提升了精度,增强了稳定性。在 Agibot X2 人形机器人上,WholeBodyVLA 在三大任务中的平均成功率达到 78.0%,较基线提升 21.3%。背包打包需要从桌上拾取多个物品,依次放入背包,需要双臂协同和精准放置。箱子装载需要将散落在地面的物品收集到箱子中,需要蹲下和大范围移动。推车推动需要推动 50kg 重型推车到指定位置,需要全身力量协调。这些任务展现了 VLA 模型在大空间移动操作中的强大能力。3.3.1.1 Stanford USC: Ψ₀ 人形机器人 Loco-Manipulation 基础模型斯坦福大学与南加州大学在 2026 年 3 月提出的 Ψ₀ (Psi-Zero) 是首个专门针对人形机器人 Loco-Manipulation 任务的开放基础模型。该工作指出,现有方法试图通过在大规模人类和人形机器人数据上联合训练来解决这一问题,但由于人类与人形机器人之间的运动学和运动差异,这种策略并不理想。Ψ₀ 的核心创新是解耦学习过程以最大化异构数据源的效用。具体而言,提出了分阶段训练范式:第一阶段,在大规模第一人称人类视频上自回归预训练 VLM 主干网络,获取可泛化的视觉-动作表示;第二阶段,在高质量人形机器人数据上后训练基于流的动作专家,学习精确的机器人关节控制。关键发现是数据配方的重要性:与使用嘈杂的互联网片段或异构跨具身机器人数据集的方法相比,在高质量的第一人称人类操作数据上预训练,然后在特定领域的真实世界人形机器人轨迹上后训练,能够产生更优的性能。实验显示,Ψ₀ 仅使用约 800 小时的人类视频数据和 30 小时的真实世界机器人数据,就在多个任务中实现了最佳性能,在总体成功率上比使用 10 倍以上数据预训练的基线高出 40% 以上。团队承诺将整个生态系统开源,包括数据处理和训练管道、人形机器人基础模型和实时动作推理引擎。3.3.2 基于大模型的任务规划斯坦福大学在 ICRA 2023 发表的工作Code as Policies: Language Model Programs for Embodied Control以及 Google DeepMind 在 ICML 2023 的PaLM-E: An Embodied Multimodal Language Model,展示了如何使用大语言模型将自然语言指令分解为可执行的移动操作子任务序列。例如,当用户说帮我准备咖啡时,LLM 将其分解为:移动到咖啡机、打开柜门、取出咖啡杯、放置到咖啡机下、按下按钮等步骤。每个步骤再由底层控制器执行,形成完整的任务链。关键创新在于引入了环境反馈机制。当某个子任务失败时,LLM 能够根据错误信息重新规划,而不是简单地重试。实验显示,这种自适应规划使长周期任务的成功率提升了 40%。…详情请参照古月居

相关新闻

实测Kimi K2.6代码模型:集成Hermes框架构建私有AI编程助手

实测Kimi K2.6代码模型:集成Hermes框架构建私有AI编程助手

1. 项目概述:当顶尖推理框架遇上新晋代码模型最近,AI代码助手领域又有了新动静。Kimi Chat背后的月之暗面公司,发布了其最新的代码模型Kimi K2.6。官方宣称其在HumanEval等基准测试上达到了SOTA(State-of-the-Art)水平…

2026/8/25 10:32:27 阅读更多 →
C#文件操作实战:从System.IO基础到TXT文件高效处理

C#文件操作实战:从System.IO基础到TXT文件高效处理

1. 从零开始:为什么C#操作TXT文件是基本功如果你刚开始接触C#,或者从其他语言转过来,可能会觉得操作一个简单的TXT文件没什么技术含量。不就是读点字、写点字吗?但恰恰是这种看似基础的操作,构成了无数复杂应用的基石。…

2026/8/25 10:32:27 阅读更多 →
腾讯云锐驰型轻量服务器深度评测:40元月租的200Mbps带宽真香吗?

腾讯云锐驰型轻量服务器深度评测:40元月租的200Mbps带宽真香吗?

1. 从一次深夜的“冲动消费”说起那天晚上,我又一次在折腾自己的个人项目。一个自用的文档同步服务,一个偶尔跑跑脚本的自动化工具,还有一个想搭起来玩玩的小游戏服务器。它们零零散散地分布在几个不同的云服务商那里,管理起来麻烦…

2026/8/25 10:32:27 阅读更多 →

最新新闻

三消游戏消除算法优化:从O(n²)到O(1)的增量检测实现

三消游戏消除算法优化:从O(n²)到O(1)的增量检测实现

1. 项目概述:从“三消”到“巧判”的核心跃迁做游戏开发的朋友,尤其是接触过休闲益智品类的,对“消消乐”这类三消游戏肯定不陌生。表面上看,它规则简单:玩家交换相邻的两个元素,如果交换后能在横竖方向凑齐…

2026/8/25 11:20:13 阅读更多 →
三消游戏核心算法:并查集实现高效消除判定与工程实践

三消游戏核心算法:并查集实现高效消除判定与工程实践

1. 从“三消”到“巧判”:一个被低估的核心算法做游戏开发的朋友,尤其是接触过休闲益智类项目的,对“消消乐”(三消)这个品类肯定不陌生。市面上从《Candy Crush Saga》到《开心消消乐》,无数成功产品验证了…

2026/8/25 11:20:13 阅读更多 →
多模态AI智能体协同决策系统:构建电影预演的数字大脑

多模态AI智能体协同决策系统:构建电影预演的数字大脑

1. 项目概述:当导演拥有了“数字大脑”想象一下,你是一位导演,正站在一个空旷的摄影棚里,面前是即将开拍的电影场景。演员的走位、摄影机的运动轨迹、灯光的角度、甚至后期特效的雏形,所有这些元素都在你的脑海里翻腾。…

2026/8/25 11:20:13 阅读更多 →
Spring boot启动和Spring启动

Spring boot启动和Spring启动

Spring boot启动第一步,启动main方法,创建 SpringApplication 实例:new springApplication(),SpringApplication 是启动 Spring Boot 应用的核心类。它负责启动应用的上下文,并执行所有必要的初始化步骤。 这里推断应用…

2026/8/25 11:19:13 阅读更多 →
系统分析师论文范文(二)单元、集成、功能性、能测试

系统分析师论文范文(二)单元、集成、功能性、能测试

TPS = Transactions Per Second中文:每秒事务数 每秒系统能够成功处理的业务请求 / 事务数量,是衡量系统吞吐量、处理能力的核心指标。 VuGen负责:写脚本、录业务(准备测试代码) Controller负责:搭建测试场景、设置并发、梯度加压、启动压测、实时监控= 全权执行性能测试…

2026/8/25 11:19:13 阅读更多 →
系统分析师论文范文(一)静态测试

系统分析师论文范文(一)静态测试

建议摘要300字左右,正文2000-2700字都可以,建议2200字;最后字数分配建议摘要300字+项目背景500字+主体1200字+结尾500字,其中主体1200字按过程来写。 DICOM 3.0:管影像(CT/MR/ 超声 / X 光等图像 + 元数据),是影像设备与 PACS的语言。 HL7:管业务与临床数据(患者、医…

2026/8/25 11:19:13 阅读更多 →

日新闻

洛谷 P7912:[CSP-J 2021 T4] 小熊的果篮 ← 双向链表

洛谷 P7912:[CSP-J 2021 T4] 小熊的果篮 ← 双向链表

【题目来源】 https://www.luogu.com.cn/problem/P7912 【题目描述】 小熊的水果店里摆放着一排 n 个水果。每个水果只可能是苹果或桔子,从左到右依次用正整数 1,2,…,n 编号。连续排在一起的同一种水果称为一个“块”。小熊要把这一排水果挑到若干个果篮里&#x…

2026/8/25 0:00:34 阅读更多 →
Transformers.js 网页端图像抠图实战:零后端 3 行代码返回透明 PNG

Transformers.js 网页端图像抠图实战:零后端 3 行代码返回透明 PNG

Transformers.js 网页端图像抠图实战:零后端 3 行代码返回透明 PNG 【免费下载链接】transformers.js State-of-the-art Machine Learning for the web. Run 🤗 Transformers directly in your browser, with no need for a server! 项目地址: https:/…

2026/8/25 0:00:34 阅读更多 →
数学建模竞赛论文写作指南:从模型构建到学术表达的核心技能

数学建模竞赛论文写作指南:从模型构建到学术表达的核心技能

1. 项目概述:从“会做”到“会写”的竞赛核心跃迁“全国大学生数学建模竞赛”,这个名字对理工科学生来说,分量极重。每年,无数团队在三天三夜的时间里,为一个开放性问题绞尽脑汁,从建立模型、求解算法到编程…

2026/8/25 0:00:34 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/25 3:38:12 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/25 3:38:18 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/25 3:38:23 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/24 20:22:44 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/25 10:31:12 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/24 11:20:22 阅读更多 →