点击下方卡片,关注【Xbotics具身智能实验室】公众号
你想要的这里都有~~

❝7 类腿部关键任务、统一全身动作接口,以及首次被系统检验的跨 GMT 迁移问题。
过去几年,LIBERO、RLBench、ManiSkill 等 Benchmark 为机械臂策略提供了统一的任务、数据与评测协议,也推动 VLA 模型从单项演示走向多任务学习。
但当 VLA 从固定基座机械臂走向人形机器人,问题不再只是“手应该怎么动”。机器人还需要在不断变化的第一视角中行走、转身、调整重心、维持平衡,并让双臂与双腿共同完成接触和操作。
换句话说:当 VLA 真正拥有一具人形身体,我们应该如何评测它?
目前,一条越来越重要的技术路线是:让高层 VLA 根据视觉、语言和本体状态输出动作意图,再由底层 GMT (General Motion Tracker) 将这些动作转化为稳定、满足动力学约束的机器人运动。
但在讨论更强的模型之前,首先需要回答一个基础问题:
❝“高层策略输出动作意图、底层 GMT 负责执行”这条分层路线,能否让机器人在统一任务协议下真正完成复杂的全身交互?
过去的系统往往在各自的任务、数据和控制器上展示结果,社区缺少一个标准化平台,来比较不同高层策略能否借助 GMT 完成同一组任务。HumanoidArena 首先提供了这样一个测试场:固定任务定义、观察空间和中间动作接口,系统评测完整分层闭环的任务成功率、稳定性与泛化能力。
当这条路线可以完成任务后,第二个问题随之而来:
❝高层策略学到的究竟是可迁移的全身动作意图,还是与特定 GMT 共同适配后形成的控制方式?如果更换底层 GMT,同一个策略还能完成任务吗?
这并不只是动作格式或接口协议是否统一的问题。不同 GMT 具有不同的运动先验、关节跟随特性、稳定方式和纠错行为;即使接收完全相同的中间动作,最终实现出的身体姿态、关节轨迹和相机视角也可能不同。例如,一个 GMT 可能更准确地跟随髋关节 roll,另一个则可能更充分地执行髋关节 pitch。为了完成同一个任务,高层策略需要适应底层 GMT 的实际响应,学习不同的动作组合和补偿方式。
因此,在特定 GMT 的闭环示范上训练得到的 Policy,学到的往往不只是“去哪里、做什么”,还包含了如何让这个 GMT 把意图执行出来。GMT 的动作倾向会影响机器人运动和第一视角观察,新的观察又进一步影响 Policy 的下一步输出,最终形成 Policy 与 GMT 之间的隐式共同适配。更换 GMT 后,变化的不只是动作如何被解释,而是整条感知—决策—执行闭环的状态分布。
随着 GMT 持续发展,这个问题会变得越来越重要。今天的策略可能基于 TWIST2 的闭环示范训练,随后需要部署到 SONIC,未来还可能面对新一代全身运动追踪器。理想情况下,底层 GMT 的进步应当能够直接提升整个系统的执行能力,而不必为每个新 GMT 重新采集全部数据、重新训练一套高层策略。这要求中间动作不仅格式统一,更具有跨 GMT 一致的有效动作语义:高层 Policy 能够表达不过度依赖某个追踪器运动偏好的任务意图,并由不同 GMT 将其转化为正确的全身行为。
为研究这些问题,我们推出 HumanoidArena:一个面向第一视角分层全身学习(Egocentric Hierarchical Whole-body Learning)的 simulation-first benchmark。它希望将 LIBERO 式的标准化策略评测进一步推进到人形机器人的全身交互场景,同时让高层策略与底层全身运动追踪器之间的接口成为可观察、可比较、可诊断的研究对象。

01 为什么现有操作 Benchmark 还不够?
LIBERO、RLBench、ManiSkill 等平台极大推动了机器人操作学习。但其中大量任务围绕固定基座或桌面机械臂展开:抓取、放置、推拉、开关抽屉……机器人通常只需在相对稳定的视角和工作空间内控制末端执行器。
人形机器人面对的是另一类问题。
踢球:先定位球和球门,再调整站位、单腿支撑并控制触球时机; 跨桌搬运:拿稳物体的同时行走、转身,再对准目标完成放置; 开门并穿过门框:手臂接触、身体转向、迈步和抗扰平衡必须连续配合; 坐上沙发:机器人需要在第一视角下找到位置、避障、对齐身体并稳定下坐; 高低位交互:面对不同高度的目标,机器人需要下蹲、起身或改变全身姿态。
在这些任务中,腿不只是把双手运送到工作区的“移动底盘”,而是任务成功条件的一部分。脚步位置、支撑转换、重心控制和身体朝向,都会直接决定交互能否完成。
与此同时,机器人头部和腕部相机也会随走路、摆臂、转身、下蹲和接触剧烈变化。策略必须在不断变化的第一视角中持续理解场景,并让视觉、语言、本体状态与全身动作保持一致。
因此,人形机器人需要的不只是“更多机械臂任务”,而是一套能够真正评测感知、决策与全身动态执行如何协同的基准。
02 关键接口:把“大脑”和“小脑”分开评测
当前一种实用的人形机器人技术路线是分层全身控制:
高层策略(Policy)接收第一视角图像、本体状态和语言指令,预测紧凑的中间全身动作; 底层通用运动追踪器(General Motion Tracker,GMT)将该动作转化为满足动力学约束、能够保持平衡的机器人运动。
可以把前者理解为负责“看懂任务并决定怎么做”的大脑,后者理解为负责“把意图稳定执行出来”的小脑。
这一分工很有吸引力:高层可以利用模仿学习和 VLA 模型处理视觉与语义,底层则利用强化学习控制器提供高频、快速的动态稳定能力。HumanoidArena 首先检验这套分层闭环能否完成腿部关键的全身交互任务,再进一步诊断失败来自策略、动作表示,还是底层追踪器。
更重要的是,这种分层设计理论上应该允许两层独立演进:VLA 可以持续吸收更强的视觉—语言预训练,GMT 也会不断提升运动范围、稳定性和接触能力。如果每次更新 GMT 都必须重新采集数据并训练高层策略,这种模块化带来的扩展优势就会大打折扣。因此,策略与 GMT 之间是否存在一个真正可复用的动作接口,是分层全身学习能否规模化的关键。
HumanoidArena 为此定义了一套统一的策略接口:
输入:第一视角 RGB、任务指令和 64D 标准化本体状态; 输出:40D 中间全身动作,覆盖平面根节点运动、身体高度、根节点朝向、29 维关节目标和双手开合; 执行:通过适配器交给 TWIST2 或 SONIC 两种 GMT 后端; 频率:高层动作与两种后端统一在 50 Hz 下对齐。
这样,HumanoidArena 一方面可以测量不同策略—GMT 组合能否完成任务;另一方面可以保持策略和输出空间不变,只替换底层 GMT,直接检验已有策略能否利用新的执行后端。
❝HumanoidArena 评测的不再只是“策略成功率”,而是“策略—动作表示—追踪器”这一完整组合。
03 七类任务:没有下肢参与,就无法完成
HumanoidArena 构建了 7 类腿部关键任务,覆盖人—物交互(HOI)和人—场景交互(HSI)。

| Football | |||
| DoubleDesk | |||
| P&PBox | |||
| OpenDoor | |||
| SitSofa | |||
| Boxing | |||
| VisNavi |
这些任务并不是把“走路”和“操作”简单串联起来。机器人必须在闭环中不断重新感知、调整身体、执行接触,并在不完美动作后恢复。例如在足球任务中,第一次触球力度不足后,策略仍可能重新定位足球、调整双脚并完成第二次射门。这样的恢复能力,正是长时程全身交互区别于一次性动作回放的地方。
04 从遥操作到训练:一条完整、统一的数据链路
为了让两种 GMT 下的数据可比较,HumanoidArena 使用共享的上游采集与重定向流程。
操作者通过 PICO 头显接收机器人的第一视角视频;人体动作经 GMR 重定向为共享的机器人空间参考信号;TWIST2 或 SONIC 再分别解释和执行该信号。系统同步记录第一视角图像、状态、动作和可重放轨迹,并转换为 LeRobot 兼容格式。

图 3:以 DoubleDesk 为例,操作者手持锤子、抬腿跨越门槛,动作经 GMR 重定向为 G1 Motion,再由 TWIST2 或 SONIC 驱动仿真机器人完成相同行为;Simulator 渲染机器人自身的第一视角并反馈给操作者,形成闭环遥操作。
| 操作者佩戴 PICO 头显录制全身示范 | 同步的仿真机器人第一视角 |
目前公开数据包含:
7 个任务; 每个任务、每种 GMT 各 100 条成功示范; 合计 1,400 条闭环示范轨迹; 每帧包含 640×480 第一视角图像、40D 动作/sonic 64D latent action; 以 50 Hz 提供稠密的全身状态—动作监督; LeRobot 兼容数据与模型权重;完整 raw data。
这里的重点不仅是数据量,更是所有示范共享同一个策略侧动作语义,而执行动态来自不同 GMT。这为研究“数据来自哪个控制器,会怎样影响策略”提供了受控条件。
05 不只测成功率:四类压力测试 + 跨 GMT 部署
HumanoidArena 将泛化问题拆成三个相互独立的扰动维度,并保留无扰动的基准设置:
| Base | ||
| Visual | ||
| Semantic | ||
| Execution |
用 P&PBox 看懂三类扰动
为了让三个维度更加直观,项目主页以 P&PBox 为例进行受控对照:每组测试只改变一个因素,任务目标和其他条件保持不变。
Execution:目标位置变了,策略还能调整动作吗?
相比 Base,Execution 测试扩大货架沿 x 轴的位置范围,引入更大的空间变化,要求策略重新调整接近路径、站位和放置动作。
Semantic:出现外观相似的干扰物,策略还能找到正确目标吗?
相比 Base,Semantic 测试在目标箱子旁加入外观相似的干扰物,用于判断策略是否真正理解任务目标,而不是依赖简单的外观匹配。
Visual:任务布局不变,仅改变光照,策略还能稳定识别场景吗?
Visual 测试保持任务布局和目标不变,只随机改变光照方向,由此改变阴影、高光和场景对比度,单独检验视觉外观变化带来的影响。
在此基础上,平台还提供两种部署协议:
In-GMT:训练数据和部署使用同一种 GMT; Cross-GMT:保持高层策略与 40D 输出空间不变,只替换底层 GMT。
每个实验配置使用 3 个随机种子、每个种子 20 次 rollout,共 60 次评测。平台以任务成功率(SR)为主要指标,并额外统计平均跌倒率(AFR),因为对人形机器人而言,“完成任务”和“保持稳定”同样重要。
06 四类策略同场比较,结果揭示了什么?
HumanoidArena 在统一输入、动作接口和训练预算下,对比了四类代表性策略:
ACT:基于 action chunk 的模仿学习策略; Diffusion Policy(DP):基于扩散过程的动作生成策略; Flow Matching(FM):基于流匹配的动作预测策略; π0.5:指令条件的 VLA 风格策略。
所有方法使用相同数量的任务示范,并训练 100K gradient steps。实验得到三个值得关注的结论。
发现一:现有策略已经能完成腿部关键任务,但不存在脱离 GMT 的“绝对最优策略”
在训练和部署 GMT 一致时,四类策略均能完成部分复杂全身任务,证明分层方案可以支撑第一视角下的踢球、开门、搬运和坐下等行为。
但最佳策略会随底层 GMT 改变:
在 TWIST2 上,Flow Matching 的 HOI / HSI 平均成功率最高,分别为 36.11% / 58.75%; 在 SONIC 上,Diffusion Policy 最优,分别达到 52.22% / 65.83%; 比较两个后端的最佳结果,SONIC 在 HOI / HSI 上分别比 TWIST2 高出 16.11 / 7.08 个百分点。
这说明高层策略的表现不能脱离执行后端单独解读。一个更准确的评价单位,应当是策略—GMT 配对。

发现二:换一个 GMT,平均成功率绝对下降约四成
跨 GMT 是 HumanoidArena 最具诊断性的实验。研究固定已经训练好的高层策略,只替换低层执行后端。结果显示:
TWIST2 → SONIC 的平均绝对成功率下降为 39.9 个百分点; SONIC → TWIST2 的平均绝对成功率下降为 36.0 个百分点; 两个方向的迁移表现并不对称,部分任务的迁移保留率甚至为 0。

进一步的动作分布分析发现:同一个策略面对来自 TWIST2 和 SONIC 的观察时,预测出的 40D 动作常形成来源相关的不同分布,尤其是在涉及行走、接触和全身协调的任务上。
换句话说,更换 GMT 不只改变了“动作怎样被执行”,还会通过身体姿态、相机运动和本体状态,反过来改变策略看到的输入,最终让策略输出也发生偏移。
❝跨 GMT 迁移不是一个简单的控制器替换问题,而是感知、动作与执行动态共同形成的闭环分布迁移。
发现三:视觉变化最容易让系统失效
视觉、语义和执行扰动都会造成性能下降,但视觉变化表现出最一致的冲击,尤其是在 HOI 任务中。例如在 TWIST2-HOI 上:
ACT 的平均成功率从 28.33% 降至 14.44%; Flow Matching 从 36.11% 降至 18.33%。
第一视角并不只是多装一台相机。身体运动会不断改变观察分布,而光照、阴影和对比度变化会进一步放大这种困难。视觉鲁棒性仍是全身策略走向真实部署必须跨越的一道门槛。

图 4:在训练与部署 GMT 一致时,四类策略面对 Visual、Semantic 和 Execution 三类扰动的平均成功率变化。
07 HumanoidArena 希望推动哪些问题?
HumanoidArena 并不试图用一个总分概括人形机器人的全部能力。它更希望把过去隐藏在端到端成功率背后的问题拆开:
什么样的中间全身动作,既紧凑、可学习,又能被不同 GMT 稳定执行? 如何让策略学习任务意图,而不是过拟合某个追踪器的运动先验和纠错方式? 面对快速变化的第一视角,如何更好地融合视觉、语言和本体感知? 如何区分感知失败、身体对齐失败、接触失败、恢复失败和追踪器执行失败? 如何把仿真中的可控评测进一步延伸到真实机器人?
论文也给出了一套面向全身交互的失败分类:目标定位、接近与身体对齐、接触前姿态、接触执行、接触后恢复,以及追踪器引起的执行失败。相比只看最终成功或失败,这种过程级诊断更有助于定位下一步该改策略、数据、动作接口,还是 GMT。
08 完整开源:环境、数据、模型与评测链路
HumanoidArena 已公开完整研究资源,包括:
基于 Isaac Lab 的任务环境与仿真资产; TWIST2、SONIC 两种 GMT 接入与统一动作适配器; LeRobot 兼容数据集、完整 raw data 与模型权重; ACT、Diffusion Policy、Flow Matching、π0.5 训练配置; 策略训练、部署和评测脚本; 预训练模型与 checkpoints; 第一视角与第三视角任务演示视频。
我们希望这套平台能够降低第一视角全身策略学习的研究门槛,让任务、策略、动作表示与底层控制器可以在同一套协议下被复现和比较。
HumanoidArena 目前仍是 simulation-first benchmark,任务、场景和 GMT 数量也有继续扩展的空间。接下来,我们期待与社区共同加入更多人形机器人本体、全身控制器、交互任务与真实世界评测,推动可迁移、可扩展的人形机器人全身智能。
项目信息
论文: HumanoidArena: Benchmarking Egocentric Hierarchical Whole-body Learning
arxiv:2606.17833
-END-
Ask Me Anything|提问箱
❝对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。
怎么问:在评论区留言,或私信公众号
我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。
提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。
一起把问题变成知识,推动社区进步 🚀