CoorDex团队 投稿
量子位 | 公众号 QbitAI
身体和灵巧手,不再各练各的。
对人类来说,一边走路、一边伸手拿起桌上的瓶子,几乎不需要思考。
但换成人形机器人,这套动作在当前范式下通常会被拆成三步:走到物体前,停稳,完成抓取,再继续移动。尤其换上高自由度灵巧手后,机器人往往必须先把双脚“钉”在地上。

问题不只是平衡。
行走会持续改变手腕的位置,手指接触物体产生的扰动又会反过来影响全身稳定。
机器人必须同时协调腿部、躯干、手臂、手腕和多根手指,让几十个关节从零开始共同探索,训练难度会迅速膨胀。
北卡罗来纳大学教堂山分校IDEAL Lab与加州大学伯克利分校研究团队提出了CoorDex:不再让强化学习直接控制全部关节,而是先分别学会“怎么动身体”和“怎么动手指”,再在低维潜在空间里学习二者如何配合。
论文已被RSS 2026 WCBM Workshop接收。代码、模型权重均已开源。

49个自由度,为什么不能直接一起学?
CoorDex的实验平台由29自由度Unitree G1和20自由度五指WUJI灵巧手组成,共有49个受控自由度。
传统夹爪的动作接近“张开—闭合”。灵巧手却还要决定每根手指的预抓取姿态、闭合时机和接触方式,并在机器人继续移动时维持抓取。
直接使用PPO输出全部关节目标,相当于让策略同时摸索走路、伸手、抓取和接触稳定性。奖励信号也很难告诉它,失败究竟来自脚步、手腕,还是某根手指。
CoorDex的核心判断是:
下游任务不应该重新学习全部运动能力,而应该重点学习如何调用和协调已经掌握的能力。
论文因此没有把49个关节塞进同一个强化学习动作空间,而是先将复杂运动压缩成两套可复用的“运动先验”。
先把身体和手,分别练成“运动先验”
团队首先训练两套职责不同的运动先验。身体侧,研究人员通过仿真遥操作采集全身动作轨迹及利用现有开源数据集,训练运动跟踪策略,使G1学会行走、伸手、调整躯干和放置手腕,随后再将跟踪策略蒸馏为主要依赖机器人本体感知的身体潜在先验。
手部侧,团队利用开源的人手动作数据,单独训练灵巧手跟踪策略,再蒸馏出手部潜在先验。
这里有一个关键设计:训练手部先验时,参考数据直接驱动手腕,策略只控制20个手指关节。
因为在行走的人形机器人上,手腕位置本来就是脚步、躯干和手臂共同作用的结果。如果手部先验还要同时解释六维手腕运动,它就会把大量表示能力花在“手被送到哪里”,而不是“手指该怎么配合”。
于是,CoorDex对两套先验进行了明确分工:
身体先验负责行走、伸手和手腕放置; 手部先验负责预抓取、闭合和多指接触。
经过蒸馏,29维身体动作被压缩到16维潜变量,20维手指动作被压缩到12维。下游策略面对的不再是49个独立关节,而是两个具有运动结构的低维潜在空间。

△CoorDex方法概览
如上图,身体与手部的参考动作首先由具有特权信息的教师策略进行跟踪,并分别蒸馏为以本体感知为条件的潜在运动先验。在下游强化学习阶段,协调残差策略结合任务上下文与两套先验的潜变量均值,分别预测身体和手部的潜在残差。冻结的解码器将修正后的潜变量映射为关节位置目标,用于执行人形机器人的移动操作任务。
不重学动作,只学习“怎么修正”
不过,拥有两套先验还不够。
如果身体和手完全独立决策,很容易出现手指已经准备闭合,手腕却还没有到位。如果简单地把两组潜变量拼在一起交给同一个网络,又可能抹掉身体运动与手指操作原本不同的控制结构。
为此,论文提出了Coordinated Latent Residual Policy,协调潜在残差策略。
每个控制时刻,冻结的身体先验和手部先验首先根据机器人当前状态,给出一组默认潜变量。
下游策略再读取物体相对位置、机器人姿态、目标信息、指尖接触以及两套先验的输出,通过共享的协调主干理解机器人正处于接近、预抓取、接触还是搬运阶段。随后,两个专门的输出头分别预测:
身体潜变量残差:修正步态、躯干、伸手轨迹与手腕位置; 手部潜变量残差:修正手指预形、闭合过程与接触细节。
残差与先验输出相加,再由冻结的解码器还原成最终的关节位置目标。
简单来说就是,强化学习不再回答“下一步49个关节分别应该转多少”,而只需要回答:
在已经会走、会伸手、会抓的基础上,身体和手此刻需要微调多少?
这种方式既保留了运动先验中的自然动作结构,也让身体和手能够看到同一份任务状态,在接触发生前后及时配合。
三组任务,真正考验“边走边操作”
团队在Isaac Lab中设计了三类连续灵巧移动操作任务:
WalkGrab:机器人持续向前行走,从侧桌抓起瓶子并继续搬运。 OpenFridge:机器人抓住冰箱把手,同时向后迈步,为开门腾出空间。 WalkPickTurn:机器人走向桌面,抓起方块,并在保持抓取的同时完成转身。
三项任务分别考验移动中的动态抓取、持续的关节物体交互,以及较长时间跨度的技能组合。
实验结果显示,CoorDex在WalkGrab、OpenFridge和WalkPickTurn上的成功率分别达到55%、66%和89%。
其中,WalkGrab最能体现“不停步操作”:机器人靠近瓶子时会适当减速,但停止率为0,跌倒率同样为0。OpenFridge中,机器人平均能够将门打开至57.76度;WalkPickTurn中,最终朝向误差最低约为9.98度。更关键的结果来自受控消融实验。

WALKGRAB任务的定性对比。每一列展示了对应方法在一次完整执行过程中的连续关键帧。All Joint Space产生了不稳定的全身运动;Body Prior+Hand Joint Space虽然能够到达瓶子附近,但无法学会可靠的抓取;Monolithic Latent Residual能够到达交互区域,但生成的身体运动不够自然,也未能完成任务;CoorDex则成功完成了接近、抓取、抬起和搬运的完整动作序列。
在相同PPO训练预算和任务奖励下,直接控制全部关节的方案虽然100%能够接近瓶子,却一次也没有完成抓取。
保留身体先验、但直接控制手指关节的方案,接近瓶子的比例达到96%,最终任务成功率仍然为0。
即使身体和手都采用潜在先验,如果只使用一个单体网络统一预测全部潜变量残差,成功率依然为0,身体动作也会出现更明显的抖动。
只有采用“共享协调表示+身体、手部分头修正”的CoorDex,完成了完整的接近、抓取、抬起和搬运过程,WalkGrab成功率达到55%。其动作变化率也由单体潜变量方案的0.40下降至0.22。这组结果说明,问题并不是机器人“走不到”物体旁边。
真正的难点在于,高维多指接触不会仅靠粗粒度的全身控制自然涌现。要让机器人在运动中真正抓稳,既需要利用运动先验降低探索难度,也需要保留身体与手的结构化分工。

目前,论文的主要定量实验仍在仿真中完成,策略也使用了物体位姿和接触信号等特权状态。团队还在搭载Dex3-1灵巧手的真实Unitree G1上进行了WalkGrab、OpenFridge和WalkPickTurn的轨迹执行验证。不过,论文也明确指出,这部分用于验证动作与真实硬件的运动学兼容性,并不是完整的视觉闭环Sim2Real实验;仿真成功率对应的硬件配置仍是G1与20自由度WUJI灵巧手。CoorDex接下来的挑战也很明确:加入视觉感知、去除特权信息,并验证身体—手部先验能否迁移到更多灵巧手、物体和开放环境。
从CoorDex到AnyBody:把运动先验做成更通用的控制接口
沿着同一条技术路线,IDEAL团队近期还推出了另一项人形机器人全身控制工作——AnyBody。
CoorDex解决的是“身体和灵巧手如何在任务中协同”,AnyBody进一步追问:
控制人形机器人时,是否必须每次都提供一套完整的全身动作?
AnyBody学习了一套统一的全身潜在运动表示,并通过Transformer接收任意子集的身体关键点。

部署时,用户可以只指定一只手腕、只控制躯干、只给出双脚轨迹,也可以自由组合多个关键点。模型会在统一的潜在运动空间中,补全协调且符合物理约束的全身动作。
为了适配不同输入方式,AnyBody在训练过程中随机遮挡关键点,并进一步加入手腕、躯干、双脚等具有实际意义的稀疏控制模式,使同一个控制器能够应对不同遥操作与任务接口。AnyBody同样将冻结的解码器视为运动先验,再通过轻量级潜在残差强化学习适配下游任务。
在空中写字,以及开放区域、障碍物、低矮空间和容器内部等多种到达任务中,潜在空间微调后的成功率均超过95%。团队还在真实Unitree G1上使用Apple Vision Pro进行单手腕或双手腕稀疏遥操作,验证了模型在少量关键点引导下生成稳定全身动作的能力。把两项工作放在一起,可以看到一条比较清晰的技术路线:
先从动作数据中沉淀可复用的全身与手部运动能力,再让任务策略在低维潜在空间中进行组合、调用和修正。
CoorDex让机器人开始学会一边走、一边用手。AnyBody则让人类能够用更加自由、稀疏的方式告诉机器人“身体应该怎么动”。
二者共同指向的,是让人形机器人从一个个孤立的动作技能,走向可复用、可组合的运动智能。
作者团队
CoorDex和AnyBody分别由北卡罗来纳大学教堂山分校IDEAL Lab与加州大学伯克利分校团队和佐治亚理工学院团队合作完成,作者包括Sikai Li、Shuning Li、Zhenyu Wei、Yunchao Yao、Chenran Li、Jiachen Li和Mingyu Ding。第一作者Sikai Li是IDEAL Lab二年级博士生,通讯作者丁明宇是北卡罗来纳大学教堂山分校助理教授、实验室负责人。
IDEAL Lab专注于全栈机器人学习,致力于构建能够像人类一样自然、灵巧地与物理世界交互的智能机器人,研究涵盖人形机器人、灵巧手、机器人硬件以及机器人基础大模型。此前火热的首个灵巧手跨平台跨任务Benchmark DexVerse,以及可在人形机器人和灵巧手两个形态之间切换的自重构机器人Handroid也是出自此Lab。
CoorDex论文地址:https://arxiv.org/pdf/2606.23680
CoorDex项目主页:https://skevinci.github.io/coordex/
CoorDex开源代码:https://github.com/Skevinci/CoorDex
AnyBody论文地址:https://arxiv.org/pdf/2606.29209v1
IDEAL Lab:https://ideal.cs.unc.edu/
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。
🌟 点亮星标 🌟