Science Robotics梳理人形机器人运控60年:强化学习之后,生成式控制正在成型

量子位 2026-09-05 09:06
项目团队 投稿 
量子位 | 公众号 QbitAI

人形机器人控制本身的技术范式正在重新分工。

近日,Science Robotics(《科学·机器人学》)发表论文《Evolution of humanoid locomotion control》。

作者团队来自普渡大学、卡内基梅隆大学、新加坡国立大学、加州大学伯克利分校、纽约大学、加州理工学院和Meta,系统梳理了过去数十年人形机器人控制的发展:从早期实时反馈与动力学模型,到轨迹优化和模型预测控制(MPC),再到依赖大规模物理仿真的强化学习(RL),以及正在进入控制系统的扩散模型、视觉—语言—动作模型(VLA)和世界模型。

作者认为,这些看似不同的方法始终围绕三个底层问题展开:如何表示机器人与环境的物理动力学,如何在接触、摩擦和执行器约束下做决策,以及如何面对模型误差与真实世界的不确定性。

由此,论文提出一个更具统一性的方向:人形机器人控制正在走向物理引导的生成智能。

这把优化、学习、预测推理与在线适应重新组合进同一个控制体系。

Science Robotics梳理人形机器人运控60年:强化学习之后,生成式控制正在成型图1
作者将数十年的人形机器人控制演进概括为经典方法、基于学习的方法和新兴方法三个阶段:从受限地形上的稳定行走,到复杂地形上的敏捷运动,再到开放环境中的多任务运动—操作
Science Robotics梳理人形机器人运控60年:强化学习之后,生成式控制正在成型图2
三代控制范式及核心原则

从经典控制到强化学习:真正改变的是“优化发生在哪里”

经典人形控制的核心,是把动力学写出来,并在约束内求解。

早期常用线性倒立摆、ZMP、捕获点等降阶模型,只保留与平衡和落脚相关的关键变量,以换取高频、可解释的反馈控制。

随着算力提升,全阶动力学、逆动力学、全身QP、轨迹优化与MPC逐渐能够处理更复杂的全身运动与接触约束。

这类方法的优势很明确:摩擦锥、关节限位、力矩边界和接触模式都可以直接写进优化问题。

但人形机器人是高维、欠驱动、混合动力系统;一旦把滑动、柔性、结构振动、执行器非线性和复杂地形同时纳入,模型与在线求解都会迅速变重。

Science Robotics梳理人形机器人运控60年:强化学习之后,生成式控制正在成型图3
建模方法可以看作从基于物理到数据驱动、从低到高表达力的连续谱:降阶模型、全阶模型、物理仿真器、学习得到的动力学、隐式动力学、世界模型,以及位于中间的混合模型

强化学习改变了这一结构,但并不意味着“摆脱模型”。现代人形RL高度依赖Isaac、MuJoCo等高吞吐量物理仿真器,而物理仿真器本身就是复杂动力学模型。

真正变化的是优化发生的位置。

经典预测控制往往在部署时根据当前状态在线求解优化问题;强化学习则在仿真中提前经历大量状态、扰动和接触,通过大规模离线训练把求解结果“编码”进神经网络策略,部署时主要变成快速推理。

从这个角度看,RL与经典控制并非两条割裂路线。

论文指出,今天许多常见的学习技巧都能找到经典控制中的思想对应:领域随机化对应鲁棒控制,自适应模块对应自适应控制,隐式表征对应模型降阶,分层学习则延续了级联控制的系统分工。

因此,经典控制并没有被强化学习淘汰。即使在最先进的人形RL系统中,PD跟踪、逆运动学、全身控制、MPC和解析动力学仍频繁出现在底层接口与训练结构中。

Science Robotics梳理人形机器人运控60年:强化学习之后,生成式控制正在成型图4
A比较模型/数据复杂度,以及主要训练或优化发生在离线还是在线;B展示部署前后的层级结构和典型控制时间尺度:关节力矩层约1000Hz、运动生成层约100Hz、任务规划层约1Hz
Science Robotics梳理人形机器人运控60年:强化学习之后,生成式控制正在成型图5
左侧是经典控制:状态估计器、解析模型与在线控制器;右侧是强化学习:在物理仿真器中离线优化策略,部署时主要由策略根据观测输出动作
Science Robotics梳理人形机器人运控60年:强化学习之后,生成式控制正在成型图6
稳定性、高维动力学、混合接触、约束、鲁棒性和适应性等挑战,被横向对应到经典方法、基于学习的方法和新兴方法三套技术路线

下一阶段:从“输出动作”到“生成物理可行的未来”

论文认为,人形控制正在进入第三阶段。

变化同时发生在五个维度:判别式→生成式、单模态→多模态、单任务→多任务、运动→运动—操作、离线训练→测试时适应。

传统策略往往学习“观测→动作”的直接映射。但在真实世界,同一个状态可能存在多个合理选择,例如绕障时向左或向右都可能成立。生成式策略则试图学习可行动作或轨迹的分布,再根据视觉、语言、历史状态等条件生成未来行为。

这使生成式控制与预测性控制出现了新的交汇点:二者都在对未来进行推理,只是前者更多从数据中学习可行轨迹分布,后者更多依赖显式动力学和在线优化。

但机器人和语言模型有一个本质区别:机器人输出最终必须落到物理世界。生成出来的轨迹不能只是“看起来合理”,还必须满足接触、摩擦、力矩、运动学限位与安全约束。生成式方法只有与物理可行性绑定,才可能真正成为控制方法。

Science Robotics梳理人形机器人运控60年:强化学习之后,生成式控制正在成型图7
变化并不只发生在模型架构上,而是同时发生在五个维度

VLA到底应该控制到哪一层?

当视觉—语言模型和VLA进入人形机器人,一个关键问题是:基础模型到底应该直接输出什么?

目前多数系统仍倾向于分层架构。高层基础模型负责视觉与语言理解、任务意图和较低频的运动学目标;低层控制器或跟踪策略负责平衡、接触处理与全身执行。例如,Helix把高层命令交给独立运动模块,NVIDIA的GR00T体系也采用高层运动意图与低层全身跟踪相结合的路线。

另一条更激进的方向,是让一个统一模型直接覆盖高频平衡、全身运动与富含接触的操作。这可能带来更深的跨模态耦合,但也会显著增加鲁棒性、安全性与验证难度。

所以,“VLA会不会接管控制”并不是最精确的问题。更值得关注的是:未来基础模型的控制边界到底停在任务级意图、运动学轨迹,还是最终能够直接覆盖高频、富含接触的全身控制?

从“会走”到“会做事”,以及部署后的继续适应

通用人形机器人不能永远把运动和操作分开。只会运动的系统可以到达目标位置,却很难真正与环境交互;只做操作的系统又常常假设基座静止,忽略整个身体的动力学。

因此,论文把运动→运动—操作视为关键转变。目标不是简单把“机械臂策略”接到“走路策略”后面,而是让系统联合推理移动、接触与力,实现真正的全身物理交互。

与此同时,真实机器人部署后还必须继续适应。无论仿真多复杂,真实系统都必然存在摩擦变化、载荷变化、结构误差和未见扰动。经典自适应控制、RL中的适应模块,以及新兴的上下文学习和测试时适应,本质上都在回答同一个问题:机器人能否利用部署时的信息修正自己的控制行为,同时不破坏稳定与安全?

真正影响部署的,可能不是平均成功率,而是罕见失效

论文在展望中指出,摔倒仍然是阻碍人形机器人部署的主要障碍之一。这意味着,只报告平均回报或平均成功率并不足够。未来还需要更加标准化地评估恢复能力、摔倒频率、冲击严重程度,尤其要关注那些概率很低、但后果严重的失败。

数据同样是硬约束。机器人很难像语言模型那样直接获得互联网规模的数据。遥操作和仿真都很重要,但任何一种单独都不足以覆盖真实世界泛化所需要的分布;尤其缺少罕见失效、富含接触的交互、恢复行为与以人为中心的部署数据。

因此,下一代人形基础模型的核心问题并不只是“模型还能不能更大”,而是如何把经验数据与物理规律真正结合,让数据驱动的泛化能力始终受到物理结构和安全约束的引导。

从工程化的稳定性,到智能自主性

回看过去几十年,人形机器人控制并没有经历“经典控制被强化学习淘汰、强化学习又即将被大模型淘汰”的线性替代。

更准确地说:经典控制把动力学、稳定性和约束显式写进系统;强化学习借助大规模物理仿真与策略优化,将大量计算前移到离线训练,从而获得更强的敏捷性与鲁棒性;生成式模型、基础模型与世界模型则开始进一步把多模态感知、多任务行为、预测性推理和测试时适应带入闭环。

最终,这些路线正在走向融合。物理规律并不会消失,而会继续通过仿真器、奖励设计、系统辨识、实时接口和安全约束进入学习系统。

人形机器人控制正在从“让机器稳定地动起来”,走向“让机器在复杂物理世界中自主地理解、预测、行动并适应”。而决定这条路线能否真正成立的,不只是模型能生成多丰富的动作,而是这些动作能否长期、稳定、安全地经得起真实世界检验。

作者团队简介

本文由来自普渡大学、卡内基梅隆大学、新加坡国立大学、加州大学伯克利分校、纽约大学、加州理工学院和Meta的研究者共同完成,团队覆盖经典控制、优化、强化学习、人形机器人与具身智能等方向。

Science Robotics梳理人形机器人运控60年:强化学习之后,生成式控制正在成型图8
Science Robotics梳理人形机器人运控60年:强化学习之后,生成式控制正在成型图9
Science Robotics梳理人形机器人运控60年:强化学习之后,生成式控制正在成型图10
Science Robotics梳理人形机器人运控60年:强化学习之后,生成式控制正在成型图11
Science Robotics梳理人形机器人运控60年:强化学习之后,生成式控制正在成型图12
Science Robotics梳理人形机器人运控60年:强化学习之后,生成式控制正在成型图13
Science Robotics梳理人形机器人运控60年:强化学习之后,生成式控制正在成型图14
Science Robotics梳理人形机器人运控60年:强化学习之后,生成式控制正在成型图15
Science Robotics梳理人形机器人运控60年:强化学习之后,生成式控制正在成型图16

其中顾彦、石冠亚和石凡为共同第一作者,苏浩和Koushil Sreenath为通讯作者。

论文标题:《Evolution of humanoid locomotion control》
论文链接:https://www.science.org/doi/10.1126/scirobotics.aed3973
资源库:https://github.com/purdue-tracelab/Humanoid-Locomotion-Survey

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目/主页链接,以及联系方式

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
IC 机器人
more
全链就绪!IICIE国际集成电路创新博览会9月9日深圳启幕
Xbotics x 魔法原子|首个融合机械臂开发&真实场景部署的具身智能实训营圆满收官!
9月10日· 14号馆二楼14B会议室 | 2026中国MicroLED CPO产业高峰论坛
展会预告 | 广立微诚邀您共赴IICIE 2026
最新议程更新 | 2026中国MicroLED CPO产业高峰论坛即将揭幕
如何做IC设计科研?(PPT分享)
ARRI联名 双增距镜加持 荣耀Magic9系列开启预约
合封SiC缩小充电器体积,硅动力发布65W快充方案
荣耀Magic9系列细节再曝,内置风扇+双2亿ARRI联名影像
博世SiC MOSFET路线曝光
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号