项目团队 投稿
量子位 | 公众号 QbitAI
人形机器人控制本身的技术范式正在重新分工。
近日,Science Robotics(《科学·机器人学》)发表论文《Evolution of humanoid locomotion control》。
作者团队来自普渡大学、卡内基梅隆大学、新加坡国立大学、加州大学伯克利分校、纽约大学、加州理工学院和Meta,系统梳理了过去数十年人形机器人控制的发展:从早期实时反馈与动力学模型,到轨迹优化和模型预测控制(MPC),再到依赖大规模物理仿真的强化学习(RL),以及正在进入控制系统的扩散模型、视觉—语言—动作模型(VLA)和世界模型。
作者认为,这些看似不同的方法始终围绕三个底层问题展开:如何表示机器人与环境的物理动力学,如何在接触、摩擦和执行器约束下做决策,以及如何面对模型误差与真实世界的不确定性。
由此,论文提出一个更具统一性的方向:人形机器人控制正在走向物理引导的生成智能。
这把优化、学习、预测推理与在线适应重新组合进同一个控制体系。

△作者将数十年的人形机器人控制演进概括为经典方法、基于学习的方法和新兴方法三个阶段:从受限地形上的稳定行走,到复杂地形上的敏捷运动,再到开放环境中的多任务运动—操作

△三代控制范式及核心原则
从经典控制到强化学习:真正改变的是“优化发生在哪里”
经典人形控制的核心,是把动力学写出来,并在约束内求解。
早期常用线性倒立摆、ZMP、捕获点等降阶模型,只保留与平衡和落脚相关的关键变量,以换取高频、可解释的反馈控制。
随着算力提升,全阶动力学、逆动力学、全身QP、轨迹优化与MPC逐渐能够处理更复杂的全身运动与接触约束。
这类方法的优势很明确:摩擦锥、关节限位、力矩边界和接触模式都可以直接写进优化问题。
但人形机器人是高维、欠驱动、混合动力系统;一旦把滑动、柔性、结构振动、执行器非线性和复杂地形同时纳入,模型与在线求解都会迅速变重。

△建模方法可以看作从基于物理到数据驱动、从低到高表达力的连续谱:降阶模型、全阶模型、物理仿真器、学习得到的动力学、隐式动力学、世界模型,以及位于中间的混合模型
强化学习改变了这一结构,但并不意味着“摆脱模型”。现代人形RL高度依赖Isaac、MuJoCo等高吞吐量物理仿真器,而物理仿真器本身就是复杂动力学模型。
真正变化的是优化发生的位置。
经典预测控制往往在部署时根据当前状态在线求解优化问题;强化学习则在仿真中提前经历大量状态、扰动和接触,通过大规模离线训练把求解结果“编码”进神经网络策略,部署时主要变成快速推理。
从这个角度看,RL与经典控制并非两条割裂路线。
论文指出,今天许多常见的学习技巧都能找到经典控制中的思想对应:领域随机化对应鲁棒控制,自适应模块对应自适应控制,隐式表征对应模型降阶,分层学习则延续了级联控制的系统分工。
因此,经典控制并没有被强化学习淘汰。即使在最先进的人形RL系统中,PD跟踪、逆运动学、全身控制、MPC和解析动力学仍频繁出现在底层接口与训练结构中。

△A比较模型/数据复杂度,以及主要训练或优化发生在离线还是在线;B展示部署前后的层级结构和典型控制时间尺度:关节力矩层约1000Hz、运动生成层约100Hz、任务规划层约1Hz

△左侧是经典控制:状态估计器、解析模型与在线控制器;右侧是强化学习:在物理仿真器中离线优化策略,部署时主要由策略根据观测输出动作

△稳定性、高维动力学、混合接触、约束、鲁棒性和适应性等挑战,被横向对应到经典方法、基于学习的方法和新兴方法三套技术路线
下一阶段:从“输出动作”到“生成物理可行的未来”
论文认为,人形控制正在进入第三阶段。
变化同时发生在五个维度:判别式→生成式、单模态→多模态、单任务→多任务、运动→运动—操作、离线训练→测试时适应。
传统策略往往学习“观测→动作”的直接映射。但在真实世界,同一个状态可能存在多个合理选择,例如绕障时向左或向右都可能成立。生成式策略则试图学习可行动作或轨迹的分布,再根据视觉、语言、历史状态等条件生成未来行为。
这使生成式控制与预测性控制出现了新的交汇点:二者都在对未来进行推理,只是前者更多从数据中学习可行轨迹分布,后者更多依赖显式动力学和在线优化。
但机器人和语言模型有一个本质区别:机器人输出最终必须落到物理世界。生成出来的轨迹不能只是“看起来合理”,还必须满足接触、摩擦、力矩、运动学限位与安全约束。生成式方法只有与物理可行性绑定,才可能真正成为控制方法。

△变化并不只发生在模型架构上,而是同时发生在五个维度
VLA到底应该控制到哪一层?
当视觉—语言模型和VLA进入人形机器人,一个关键问题是:基础模型到底应该直接输出什么?
目前多数系统仍倾向于分层架构。高层基础模型负责视觉与语言理解、任务意图和较低频的运动学目标;低层控制器或跟踪策略负责平衡、接触处理与全身执行。例如,Helix把高层命令交给独立运动模块,NVIDIA的GR00T体系也采用高层运动意图与低层全身跟踪相结合的路线。
另一条更激进的方向,是让一个统一模型直接覆盖高频平衡、全身运动与富含接触的操作。这可能带来更深的跨模态耦合,但也会显著增加鲁棒性、安全性与验证难度。
所以,“VLA会不会接管控制”并不是最精确的问题。更值得关注的是:未来基础模型的控制边界到底停在任务级意图、运动学轨迹,还是最终能够直接覆盖高频、富含接触的全身控制?
从“会走”到“会做事”,以及部署后的继续适应
通用人形机器人不能永远把运动和操作分开。只会运动的系统可以到达目标位置,却很难真正与环境交互;只做操作的系统又常常假设基座静止,忽略整个身体的动力学。
因此,论文把运动→运动—操作视为关键转变。目标不是简单把“机械臂策略”接到“走路策略”后面,而是让系统联合推理移动、接触与力,实现真正的全身物理交互。
与此同时,真实机器人部署后还必须继续适应。无论仿真多复杂,真实系统都必然存在摩擦变化、载荷变化、结构误差和未见扰动。经典自适应控制、RL中的适应模块,以及新兴的上下文学习和测试时适应,本质上都在回答同一个问题:机器人能否利用部署时的信息修正自己的控制行为,同时不破坏稳定与安全?
真正影响部署的,可能不是平均成功率,而是罕见失效
论文在展望中指出,摔倒仍然是阻碍人形机器人部署的主要障碍之一。这意味着,只报告平均回报或平均成功率并不足够。未来还需要更加标准化地评估恢复能力、摔倒频率、冲击严重程度,尤其要关注那些概率很低、但后果严重的失败。
数据同样是硬约束。机器人很难像语言模型那样直接获得互联网规模的数据。遥操作和仿真都很重要,但任何一种单独都不足以覆盖真实世界泛化所需要的分布;尤其缺少罕见失效、富含接触的交互、恢复行为与以人为中心的部署数据。
因此,下一代人形基础模型的核心问题并不只是“模型还能不能更大”,而是如何把经验数据与物理规律真正结合,让数据驱动的泛化能力始终受到物理结构和安全约束的引导。
从工程化的稳定性,到智能自主性
回看过去几十年,人形机器人控制并没有经历“经典控制被强化学习淘汰、强化学习又即将被大模型淘汰”的线性替代。
更准确地说:经典控制把动力学、稳定性和约束显式写进系统;强化学习借助大规模物理仿真与策略优化,将大量计算前移到离线训练,从而获得更强的敏捷性与鲁棒性;生成式模型、基础模型与世界模型则开始进一步把多模态感知、多任务行为、预测性推理和测试时适应带入闭环。
最终,这些路线正在走向融合。物理规律并不会消失,而会继续通过仿真器、奖励设计、系统辨识、实时接口和安全约束进入学习系统。
人形机器人控制正在从“让机器稳定地动起来”,走向“让机器在复杂物理世界中自主地理解、预测、行动并适应”。而决定这条路线能否真正成立的,不只是模型能生成多丰富的动作,而是这些动作能否长期、稳定、安全地经得起真实世界检验。
作者团队简介
本文由来自普渡大学、卡内基梅隆大学、新加坡国立大学、加州大学伯克利分校、纽约大学、加州理工学院和Meta的研究者共同完成,团队覆盖经典控制、优化、强化学习、人形机器人与具身智能等方向。
顾彦(Yan Gu):普渡大学机械工程学院副教授;共同第一作者。

石冠亚(Guanya Shi):卡内基梅隆大学机器人研究所助理教授;共同第一作者。

石凡(Fan Shi):新加坡国立大学电子与计算机工程系助理教授;共同第一作者。

张益嘉(I-Chia Chang):普渡大学机械工程学院博士生。

王彦仁(Yen-Jen Wang):加州大学伯克利分校计算机科学博士生。

程启龙(Qilong Cheng):纽约大学Tandon工程学院博士生。

Zachary Olkin:加州理工学院机械与土木工程系博士生。 Ivan Lopez-Sanchez:纽约大学Tandon工程学院博士生。 Yunchu Feng:纽约大学Tandon工程学院博士生。 张健(Jian Zhang):Meta Robotics Studio技术负责人兼总监。 Aaron D. Ames:加州理工学院机械与土木工程系教授。

苏浩(Hao Su):纽约大学Tandon工程学院副教授;通讯作者。

Koushil Sreenath:加州大学伯克利分校机械工程系教授;通讯作者。

其中顾彦、石冠亚和石凡为共同第一作者,苏浩和Koushil Sreenath为通讯作者。
论文标题:《Evolution of humanoid locomotion control》
论文链接:https://www.science.org/doi/10.1126/scirobotics.aed3973
资源库:https://github.com/purdue-tracelab/Humanoid-Locomotion-Survey
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。
🌟 点亮星标 🌟