Xbotics Talk| HumanoidArena:人形机器人的“LIBERO”来了?让 VLA 真正学会全身交互

Xbot具身知识库 2026-07-18 10:06

点击下方卡片,关注【Xbotics具身智能实验室】公众号

你想要的这里都有~~



Xbotics Talk| HumanoidArena:人形机器人的“LIBERO”来了?让 VLA 真正学会全身交互图1

7 类腿部关键任务、统一全身动作接口,以及首次被系统检验的跨 GMT 迁移问题。

过去几年,LIBERO、RLBench、ManiSkill 等 Benchmark 为机械臂策略提供了统一的任务、数据与评测协议,也推动 VLA 模型从单项演示走向多任务学习。

但当 VLA 从固定基座机械臂走向人形机器人,问题不再只是“手应该怎么动”。机器人还需要在不断变化的第一视角中行走、转身、调整重心、维持平衡,并让双臂与双腿共同完成接触和操作。

换句话说:当 VLA 真正拥有一具人形身体,我们应该如何评测它?

目前,一条越来越重要的技术路线是:让高层 VLA 根据视觉、语言和本体状态输出动作意图,再由底层 GMT (General Motion Tracker) 将这些动作转化为稳定、满足动力学约束的机器人运动。

但在讨论更强的模型之前,首先需要回答一个基础问题:

“高层策略输出动作意图、底层 GMT 负责执行”这条分层路线,能否让机器人在统一任务协议下真正完成复杂的全身交互?

过去的系统往往在各自的任务、数据和控制器上展示结果,社区缺少一个标准化平台,来比较不同高层策略能否借助 GMT 完成同一组任务。HumanoidArena 首先提供了这样一个测试场:固定任务定义、观察空间和中间动作接口,系统评测完整分层闭环的任务成功率、稳定性与泛化能力。

当这条路线可以完成任务后,第二个问题随之而来:

高层策略学到的究竟是可迁移的全身动作意图,还是与特定 GMT 共同适配后形成的控制方式?如果更换底层 GMT,同一个策略还能完成任务吗?

这并不只是动作格式或接口协议是否统一的问题。不同 GMT 具有不同的运动先验、关节跟随特性、稳定方式和纠错行为;即使接收完全相同的中间动作,最终实现出的身体姿态、关节轨迹和相机视角也可能不同。例如,一个 GMT 可能更准确地跟随髋关节 roll,另一个则可能更充分地执行髋关节 pitch。为了完成同一个任务,高层策略需要适应底层 GMT 的实际响应,学习不同的动作组合和补偿方式。

因此,在特定 GMT 的闭环示范上训练得到的 Policy,学到的往往不只是“去哪里、做什么”,还包含了如何让这个 GMT 把意图执行出来。GMT 的动作倾向会影响机器人运动和第一视角观察,新的观察又进一步影响 Policy 的下一步输出,最终形成 Policy 与 GMT 之间的隐式共同适配。更换 GMT 后,变化的不只是动作如何被解释,而是整条感知—决策—执行闭环的状态分布。

随着 GMT 持续发展,这个问题会变得越来越重要。今天的策略可能基于 TWIST2 的闭环示范训练,随后需要部署到 SONIC,未来还可能面对新一代全身运动追踪器。理想情况下,底层 GMT 的进步应当能够直接提升整个系统的执行能力,而不必为每个新 GMT 重新采集全部数据、重新训练一套高层策略。这要求中间动作不仅格式统一,更具有跨 GMT 一致的有效动作语义:高层 Policy 能够表达不过度依赖某个追踪器运动偏好的任务意图,并由不同 GMT 将其转化为正确的全身行为。

为研究这些问题,我们推出 HumanoidArena:一个面向第一视角分层全身学习(Egocentric Hierarchical Whole-body Learning)的 simulation-first benchmark。它希望将 LIBERO 式的标准化策略评测进一步推进到人形机器人的全身交互场景,同时让高层策略与底层全身运动追踪器之间的接口成为可观察、可比较、可诊断的研究对象。

Xbotics Talk| HumanoidArena:人形机器人的“LIBERO”来了?让 VLA 真正学会全身交互图2
图1:HumanoidArena 总览

01 为什么现有操作 Benchmark 还不够?

LIBERO、RLBench、ManiSkill 等平台极大推动了机器人操作学习。但其中大量任务围绕固定基座或桌面机械臂展开:抓取、放置、推拉、开关抽屉……机器人通常只需在相对稳定的视角和工作空间内控制末端执行器。

人形机器人面对的是另一类问题。

  • 踢球:先定位球和球门,再调整站位、单腿支撑并控制触球时机;
  • 跨桌搬运:拿稳物体的同时行走、转身,再对准目标完成放置;
  • 开门并穿过门框:手臂接触、身体转向、迈步和抗扰平衡必须连续配合;
  • 坐上沙发:机器人需要在第一视角下找到位置、避障、对齐身体并稳定下坐;
  • 高低位交互:面对不同高度的目标,机器人需要下蹲、起身或改变全身姿态。

在这些任务中,腿不只是把双手运送到工作区的“移动底盘”,而是任务成功条件的一部分。脚步位置、支撑转换、重心控制和身体朝向,都会直接决定交互能否完成。

与此同时,机器人头部和腕部相机也会随走路、摆臂、转身、下蹲和接触剧烈变化。策略必须在不断变化的第一视角中持续理解场景,并让视觉、语言、本体状态与全身动作保持一致。

因此,人形机器人需要的不只是“更多机械臂任务”,而是一套能够真正评测感知、决策与全身动态执行如何协同的基准。

02 关键接口:把“大脑”和“小脑”分开评测

当前一种实用的人形机器人技术路线是分层全身控制

  1. 高层策略(Policy)接收第一视角图像、本体状态和语言指令,预测紧凑的中间全身动作;
  2. 底层通用运动追踪器(General Motion Tracker,GMT)将该动作转化为满足动力学约束、能够保持平衡的机器人运动。

可以把前者理解为负责“看懂任务并决定怎么做”的大脑,后者理解为负责“把意图稳定执行出来”的小脑。

这一分工很有吸引力:高层可以利用模仿学习和 VLA 模型处理视觉与语义,底层则利用强化学习控制器提供高频、快速的动态稳定能力。HumanoidArena 首先检验这套分层闭环能否完成腿部关键的全身交互任务,再进一步诊断失败来自策略、动作表示,还是底层追踪器。

更重要的是,这种分层设计理论上应该允许两层独立演进:VLA 可以持续吸收更强的视觉—语言预训练,GMT 也会不断提升运动范围、稳定性和接触能力。如果每次更新 GMT 都必须重新采集数据并训练高层策略,这种模块化带来的扩展优势就会大打折扣。因此,策略与 GMT 之间是否存在一个真正可复用的动作接口,是分层全身学习能否规模化的关键。

HumanoidArena 为此定义了一套统一的策略接口:

  • 输入:第一视角 RGB、任务指令和 64D 标准化本体状态
  • 输出:40D 中间全身动作,覆盖平面根节点运动、身体高度、根节点朝向、29 维关节目标和双手开合;
  • 执行:通过适配器交给 TWIST2 或 SONIC 两种 GMT 后端;
  • 频率:高层动作与两种后端统一在 50 Hz 下对齐。

这样,HumanoidArena 一方面可以测量不同策略—GMT 组合能否完成任务;另一方面可以保持策略和输出空间不变,只替换底层 GMT,直接检验已有策略能否利用新的执行后端。

HumanoidArena 评测的不再只是“策略成功率”,而是“策略—动作表示—追踪器”这一完整组合。

03 七类任务:没有下肢参与,就无法完成

HumanoidArena 构建了 7 类腿部关键任务,覆盖人—物交互(HOI)和人—场景交互(HSI)。

Xbotics Talk| HumanoidArena:人形机器人的“LIBERO”来了?让 VLA 真正学会全身交互图3
图 2:Football、DoubleDesk、SitSofa 与 VisNavi 的成功轨迹。

类别
任务
机器人需要完成什么
为什么必须使用全身
HOI
Football
接近足球并将其踢入球门
站位调整、单腿支撑、摆腿与触球时机缺一不可
HOI
DoubleDesk
从一张桌子拿起锤子,搬运到另一张桌子的篮筐中
行走、持物稳定、转身和放置连续耦合
HOI
P&PBox
从桌面拿起箱子并放到货架上
需要持物行走,并随货架高度调整站姿和伸展范围
HSI
OpenDoor
接近、打开并穿过一扇门
门把操作、推门、身体转向和跨越门框需协同完成
HSI
SitSofa
绕开障碍并稳定坐上沙发
依赖空间对齐、下肢定位和受控下坐
HSI
Boxing
击打不同高度的目标
需要下蹲、起身,并协调躯干、手臂和腿部
HSI
VisNavi
仅依靠第一视角视觉穿越受限场景
行走过程中持续感知、避障并调整身体朝向

这些任务并不是把“走路”和“操作”简单串联起来。机器人必须在闭环中不断重新感知、调整身体、执行接触,并在不完美动作后恢复。例如在足球任务中,第一次触球力度不足后,策略仍可能重新定位足球、调整双脚并完成第二次射门。这样的恢复能力,正是长时程全身交互区别于一次性动作回放的地方。

04 从遥操作到训练:一条完整、统一的数据链路

为了让两种 GMT 下的数据可比较,HumanoidArena 使用共享的上游采集与重定向流程。

操作者通过 PICO 头显接收机器人的第一视角视频;人体动作经 GMR 重定向为共享的机器人空间参考信号;TWIST2 或 SONIC 再分别解释和执行该信号。系统同步记录第一视角图像、状态、动作和可重放轨迹,并转换为 LeRobot 兼容格式。

Xbotics Talk| HumanoidArena:人形机器人的“LIBERO”来了?让 VLA 真正学会全身交互图4
HumanoidArena 闭环遥操作与双 GMT 执行流程

图 3:以 DoubleDesk 为例,操作者手持锤子、抬腿跨越门槛,动作经 GMR 重定向为 G1 Motion,再由 TWIST2 或 SONIC 驱动仿真机器人完成相同行为;Simulator 渲染机器人自身的第一视角并反馈给操作者,形成闭环遥操作。

数据采集实拍
同步仿真视角


操作者佩戴 PICO 头显录制全身示范同步的仿真机器人第一视角

目前公开数据包含:

  • 7 个任务
  • 每个任务、每种 GMT 各 100 条成功示范
  • 合计 1,400 条闭环示范轨迹
  • 每帧包含 640×480 第一视角图像、40D 动作/sonic 64D latent action;
  • 以 50 Hz 提供稠密的全身状态—动作监督;
  • LeRobot 兼容数据与模型权重;完整 raw data。

这里的重点不仅是数据量,更是所有示范共享同一个策略侧动作语义,而执行动态来自不同 GMT。这为研究“数据来自哪个控制器,会怎样影响策略”提供了受控条件。

05 不只测成功率:四类压力测试 + 跨 GMT 部署

HumanoidArena 将泛化问题拆成三个相互独立的扰动维度,并保留无扰动的基准设置:

测试模式
改变什么
希望回答的问题
Base
原始物体范围、资产和光照
策略在匹配分布下能完成多少任务?
Visual
光照方向、阴影和场景对比度
外观变化后,视觉策略是否仍然可靠?
Semantic
在场景中添加语义相似的干扰资产
策略理解的是目标语义,还是记住了特定外观?
Execution
扩大物体或机器人初始位姿随机化范围
接近路径、站位和接触几何变化后,策略能否调整?

用 P&PBox 看懂三类扰动

为了让三个维度更加直观,项目主页以 P&PBox 为例进行受控对照:每组测试只改变一个因素,任务目标和其他条件保持不变。

Execution:目标位置变了,策略还能调整动作吗?

Base
Execution


相比 Base,Execution 测试扩大货架沿 x 轴的位置范围,引入更大的空间变化,要求策略重新调整接近路径、站位和放置动作。

Semantic:出现外观相似的干扰物,策略还能找到正确目标吗?

Base
Semantic


相比 Base,Semantic 测试在目标箱子旁加入外观相似的干扰物,用于判断策略是否真正理解任务目标,而不是依赖简单的外观匹配。

Visual:任务布局不变,仅改变光照,策略还能稳定识别场景吗?

Base
Visual Case 1
Visual Case 2



Visual 测试保持任务布局和目标不变,只随机改变光照方向,由此改变阴影、高光和场景对比度,单独检验视觉外观变化带来的影响。

在此基础上,平台还提供两种部署协议:

  • In-GMT:训练数据和部署使用同一种 GMT;
  • Cross-GMT:保持高层策略与 40D 输出空间不变,只替换底层 GMT。

每个实验配置使用 3 个随机种子、每个种子 20 次 rollout,共 60 次评测。平台以任务成功率(SR)为主要指标,并额外统计平均跌倒率(AFR),因为对人形机器人而言,“完成任务”和“保持稳定”同样重要。

06 四类策略同场比较,结果揭示了什么?

HumanoidArena 在统一输入、动作接口和训练预算下,对比了四类代表性策略:

  • ACT:基于 action chunk 的模仿学习策略;
  • Diffusion Policy(DP):基于扩散过程的动作生成策略;
  • Flow Matching(FM):基于流匹配的动作预测策略;
  • π0.5:指令条件的 VLA 风格策略。

所有方法使用相同数量的任务示范,并训练 100K gradient steps。实验得到三个值得关注的结论。

发现一:现有策略已经能完成腿部关键任务,但不存在脱离 GMT 的“绝对最优策略”


在训练和部署 GMT 一致时,四类策略均能完成部分复杂全身任务,证明分层方案可以支撑第一视角下的踢球、开门、搬运和坐下等行为。

但最佳策略会随底层 GMT 改变:

  • 在 TWIST2 上,Flow Matching 的 HOI / HSI 平均成功率最高,分别为 36.11% / 58.75%;
  • 在 SONIC 上,Diffusion Policy 最优,分别达到 52.22% / 65.83%
  • 比较两个后端的最佳结果,SONIC 在 HOI / HSI 上分别比 TWIST2 高出 16.11 / 7.08 个百分点

这说明高层策略的表现不能脱离执行后端单独解读。一个更准确的评价单位,应当是策略—GMT 配对

In-GMT 评测结果
Xbotics Talk| HumanoidArena:人形机器人的“LIBERO”来了?让 VLA 真正学会全身交互图5
表 1:In-GMT 评测。训练数据与部署使用相同 GMT,报告不同策略在 TWIST2 和 SONIC 下的任务成功率与平均跌倒率。

发现二:换一个 GMT,平均成功率绝对下降约四成

跨 GMT 是 HumanoidArena 最具诊断性的实验。研究固定已经训练好的高层策略,只替换低层执行后端。结果显示:

  • TWIST2 → SONIC 的平均绝对成功率下降为 39.9 个百分点
  • SONIC → TWIST2 的平均绝对成功率下降为 36.0 个百分点
  • 两个方向的迁移表现并不对称,部分任务的迁移保留率甚至为 0。

Cross-GMT 评测结果
Xbotics Talk| HumanoidArena:人形机器人的“LIBERO”来了?让 VLA 真正学会全身交互图6
表 2:Cross-GMT 评测。T→S 表示使用 TWIST2 示范训练、部署时切换为 SONIC;S→T 表示反向迁移。每项同时报告绝对性能下降与相对迁移保留率。

进一步的动作分布分析发现:同一个策略面对来自 TWIST2 和 SONIC 的观察时,预测出的 40D 动作常形成来源相关的不同分布,尤其是在涉及行走、接触和全身协调的任务上。

换句话说,更换 GMT 不只改变了“动作怎样被执行”,还会通过身体姿态、相机运动和本体状态,反过来改变策略看到的输入,最终让策略输出也发生偏移。

跨 GMT 迁移不是一个简单的控制器替换问题,而是感知、动作与执行动态共同形成的闭环分布迁移。

发现三:视觉变化最容易让系统失效

视觉、语义和执行扰动都会造成性能下降,但视觉变化表现出最一致的冲击,尤其是在 HOI 任务中。例如在 TWIST2-HOI 上:

  • ACT 的平均成功率从 28.33% 降至 14.44%
  • Flow Matching 从 36.11% 降至 18.33%

第一视角并不只是多装一台相机。身体运动会不断改变观察分布,而光照、阴影和对比度变化会进一步放大这种困难。视觉鲁棒性仍是全身策略走向真实部署必须跨越的一道门槛。

Xbotics Talk| HumanoidArena:人形机器人的“LIBERO”来了?让 VLA 真正学会全身交互图7
视觉、语义与执行扰动下的鲁棒性结果

图 4:在训练与部署 GMT 一致时,四类策略面对 Visual、Semantic 和 Execution 三类扰动的平均成功率变化。

07 HumanoidArena 希望推动哪些问题?

HumanoidArena 并不试图用一个总分概括人形机器人的全部能力。它更希望把过去隐藏在端到端成功率背后的问题拆开:

  • 什么样的中间全身动作,既紧凑、可学习,又能被不同 GMT 稳定执行?
  • 如何让策略学习任务意图,而不是过拟合某个追踪器的运动先验和纠错方式?
  • 面对快速变化的第一视角,如何更好地融合视觉、语言和本体感知?
  • 如何区分感知失败、身体对齐失败、接触失败、恢复失败和追踪器执行失败?
  • 如何把仿真中的可控评测进一步延伸到真实机器人?

论文也给出了一套面向全身交互的失败分类:目标定位、接近与身体对齐、接触前姿态、接触执行、接触后恢复,以及追踪器引起的执行失败。相比只看最终成功或失败,这种过程级诊断更有助于定位下一步该改策略、数据、动作接口,还是 GMT。

08 完整开源:环境、数据、模型与评测链路

HumanoidArena 已公开完整研究资源,包括:

  • 基于 Isaac Lab 的任务环境与仿真资产;
  • TWIST2、SONIC 两种 GMT 接入与统一动作适配器;
  • LeRobot 兼容数据集、完整 raw data 与模型权重;
  • ACT、Diffusion Policy、Flow Matching、π0.5 训练配置;
  • 策略训练、部署和评测脚本;
  • 预训练模型与 checkpoints;
  • 第一视角与第三视角任务演示视频。

我们希望这套平台能够降低第一视角全身策略学习的研究门槛,让任务、策略、动作表示与底层控制器可以在同一套协议下被复现和比较。

HumanoidArena 目前仍是 simulation-first benchmark,任务、场景和 GMT 数量也有继续扩展的空间。接下来,我们期待与社区共同加入更多人形机器人本体、全身控制器、交互任务与真实世界评测,推动可迁移、可扩展的人形机器人全身智能。

项目信息

论文: HumanoidArena: Benchmarking Egocentric Hierarchical Whole-body Learning
arxiv:2606.17833


-END-

Ask Me Anything|提问箱

对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。

怎么问:在评论区留言,或私信公众号

我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。

提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。

一起把问题变成知识,推动社区进步 🚀

声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
AR IC 机器人
more
马斯克转发的“断头”机器人,甄子丹:打不过
独家|机器人的指尖上,新晋一家百亿公司
工控巨头投资超50个亿,研发机器人核心零部件;4亿元具身智能数采中心项目启动 | 市场观察
WAIC华山论剑,罕见AI新共识:机器人ChatGPT时刻,最快两年!
苏度 WAIC 首秀:机器人能力如何从 Demo 走向部署
中国机器人,现在有多疯狂!
手机、车机、机器人都能用,大模型真的开始落地了
荣耀Robot Phone已开启预约,全球首款机器人手机
WAIC看了一圈,这家公司的机器人在认真打工
一文看懂今年的WAIC!AI+机器人扎堆“干活”、搬货、取药、折气球,天要变了...
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号