点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
来源:3D视觉工坊
3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:
太长不看版:Hydra-0 用「动作流」(把机器人动作表示为图像平面上的像素运动)作为共享视觉接口,统一多本体、多任务、多视频生成骨干的世界建模与控制。最佳配置相比动作条件基线降低 90.4% 机器人运动误差与 60.2% 物体运动误差;RoboLab 上回放与参考成功率 Pearson 相关 r=0.96;并涌现逆模式——从人类演示的物体流反推可执行机器人动作。
导读
我们提出 Hydra-0,一个以「动作流」(action flow)为条件的通用(generalist)世界模型,把机器人动作表示为像素运动。这一共享的视觉接口通过学习跨本体(embodiment)、跨任务、跨环境、跨视频生成骨干的动作后果,实现了通用的世界建模与控制。
我们的最佳配置相比动作条件(action-conditioned)基线,将机器人运动误差降低 90.4%,物体运动误差降低 60.2%,同时支持零样本组合(zero-shot composition)与数据高效适配(data-efficient adaptation)。
在 RoboLab 基准上,Hydra-0 的「回放成功率」与「参考成功率」之间取得 Pearson 相关系数 r=0.96。
最后,我们发现该接口涌现出一种逆模式(inverse mode):一个「世界动作模型」(world action model),能从由人类演示迁移来的期望物体流,预测出与之兼容的机器人运动;一个训练好的动作头(action head)把得到的潜特征映射为可执行动作,无需针对任务的专家机器人演示。这些结果共同表明,动作流有潜力作为一种共享控制接口,连接异构训练数据、开环策略评估与机器人控制。

效果展示

▲ 动作流作为一种共享控制接口。上:Hydra-0 从多样化的交互视频中学习,包括第一视角人类演示、手持 UMI 夹爪、双臂机械臂与单臂机器人。中:可见本体的运动被表示为图像平面的流轨迹,将异构交互置于一个与本体无关的、像素对齐的共享动作流空间中,不依赖特定本体的关节或末端执行器坐标。这一统一接口使单一通用世界模型能够从多本体数据中学习并跨交互场景迁移。下:在前向模式中,给定的夹爪流条件作用于未来场景预测,其回滚(rollout)支持开环策略评估;在逆模式中,期望的物体流引出兼容的机器人运动,由监督式读出头转换为可执行动作。

▲ XVLA-Soft-Fold 与 Deform360 上的定性评估。每个数据集专属面板展示整个 5 秒时域内的六张同步快照:从上到下依次为 Wan-Move、微调后的 Cosmos 2.5、动作流条件输入、我们生成的清晰输出,以及匹配的 Ground Truth。

▲ 真实世界开环策略评估。布料折叠的定性回滚展示记录的参考轨迹,以及以记录的机器人运动为条件的对应开环预测。

▲ 基于物体流条件的真实机器人执行(柔性弯管任务)。从一个留出的(held-out)人类演示中提取期望的物体流;仅以该物体流为条件,Hydra-0 生成兼容的机器人运动;一个学习到的动作输出头将潜特征回滚转换为可执行的机器人动作。

▲ DROID 上的额外定性评估。整行尺寸的「动作流」行提供条件输入;「Ours」行展示对应的、无流叠加的清晰生成回滚。所有行展示同一匹配验证样本在相同的六个同步时间戳上。
引言
在物理世界中行动的机器人,可以从「预测场景或物体在自身运动下如何演化」中受益,而这一能力正由世界模型提供。一个在多样化交互数据上训练的基础世界模型,有望成为众多机器人与交互场景的通用预测模拟器,因为它捕捉了它们之间共享的物理规律。尽管可用数据广泛,我们仍缺乏能跨本体、任务与环境泛化的、可迁移的基础世界模型。
许多现有的世界模型与动作条件视频模型仍局限于其训练时的本体,限制了多本体训练与向新部署设置的迁移。一个常见原因是它们依赖原生的机器人指令:关节空间指令直接编码了机器人结构,而同一个末端执行器指令在不同运动学结构的机器人上会产生不同的关节轨迹与可见的连杆运动。由于这两种表示都没有指定结果的图像平面运动,视频模型必须学习从指令到视觉动力学的、依赖于本体的映射。基于运动与轨迹条件的视频模型已证明,图像平面运动可以作为一种共享的视觉条件;而基于流与轨迹的接口也被用于机器人学习与控制。这些工作共同留下一个开放问题:如何把一个共享的视觉运动表示 grounding(落地)到跨本体的、可执行的机器人指令上。
我们用动作流弥合这一鸿沟——动作流是一种共享的图像平面运动表示,同时支持前向动力学预测与逆向运动预测。动作流表示可见机器人或物体点的稀疏轨迹,让同一格式既能描述本体运动,也能描述任务意图。在前向方向上,我们通过机器人控制器与物理仿真执行一个候选运动指令,再利用机器人几何与相机标定把得到的可见机器人表面轨迹投影到图像平面。这些像素对齐的轨迹指明了机器人在观测视频中应当移动的位置,同时保留了其运动学施加的约束,从而提供了与可执行指令直接挂钩的视觉条件。基于 ATI 与 Wan-Move 中基于轨迹的视觉条件,我们的世界模型用这一条件去预测该指令的后果——我们称之为运动学接地(kinematically grounded)的视频预测。
同一个动作流接口也可以被反转用于机器人控制。我们把这一逆模式实例化为一个「世界动作模型」。给定期望的物体流作为任务意图,模型推断出与之兼容的机器人运动;一个训练好的动作头把它的潜特征映射为可执行的真实机器人动作,而无需针对任务的专家机器人演示。
主要贡献
我们把机器人动作条件建模为运动学接地的图像平面动作流。训练时,动作流可直接从交互视频中恢复;在前向预测的部署时,我们利用 Isaac Lab 中的控制器-物理回滚(rollout)、机器人几何与相机标定,从可执行指令推导出它。
我们证明动作流可以作为一种共享接口,用于跨本体与跨视频生成骨干的通用世界建模。最佳配置相比未使用动作流条件的 Cosmos 2.5 基线,将机器人运动误差降低 90.40%、物体运动误差降低 60.16%,并支持向「机器人-可形变物体」交互的零样本与数据高效迁移。
我们利用动作流条件的仿真进行开环策略评估。在 5 个 RoboLab 策略上,回放成功率与参考成功率的 Pearson 相关系数为 r = 0.96。
我们在概念验证式的「世界动作模型」中反转同一接口:从由人类演示迁移来的期望物体流预测出兼容的机器人运动;一个训练好的动作头把其潜特征映射为可执行的真实机器人动作,且无需针对任务的专家机器人演示。
方法
一句话核心思路: 把机器人动作"画"成图像平面上的像素运动(即动作流),让这个统一的视觉运动接口同时承担世界建模与控制——跨本体、跨任务、跨视频生成骨干,全都共用同一套"画面里怎么动"的语言。
Hydra-0 将动作流作为统一接口,贯穿离线训练与在线部署两端,可按三条主线理解:
(a) 动作流表示(Action Flow Representation): 动作流是图像平面上一组稀疏的轨迹点,描述可见机器人本体或物体点的运动。它最大的优势是与本体解耦——不再依赖特定机器人的关节角或末端执行器坐标,而是直接表达"在相机画面里,这些点会移动到哪里"。训练时,动作流可从交互视频中直接跟踪恢复;部署时,则通过 Isaac Lab 中的控制器+物理仿真执行候选指令,再经机器人几何与相机标定,把连杆轨迹投影回图像平面,得到可直接用于条件化的"本体动作流"。
(b) 世界模型训练(World-Model Training): 动作流作为运动感知的视觉条件(图 4),将首帧潜特征沿时间传播,在 DiT patch 嵌入前与带噪视频潜特征拼接,驱动因果自回归模型做 flow-matching 预测。由于条件已落地到可执行的像素运动,模型学到的是"给定画面上的这个运动,场景会如何演化",从而具备跨本体、跨骨干(Wan2.2 / Cosmos 2.5 等)的通用世界建模能力。
(c) 控制与逆模式(Control / Inverse Mode): 同一个接口可以反向使用。给定期望的物体流作为任务意图,模型推断与之兼容的机器人运动;一个训练好的动作头把潜特征映射为可执行的真实机器人动作,且无需针对任务的专家机器人演示——这就是涌现的逆模式(详见 效果展示 中图 10 的真实机器人演示)。

▲ Hydra-0 总览。离线训练阶段(上):我们通过同时跟踪本体与被操作物体,从交互视频中恢复动作流;未来视频被编码以构建 flow-matching 训练目标。在线部署阶段(下):Isaac Lab 通过机器人控制器与物理仿真执行候选指令序列 a₀:₋₁,在预测时域内产生机器人连杆的位姿变换;利用这些变换,我们把可见的机器人表面点传播并经标定相机投影,以条件化因果自回归模型。

▲ 动作流的构建与采样。无几何信息的数据集视频被密集跟踪,并 grounding 到本体与被操作物体的掩码中。训练时,我们从四种条件模式中采样输入条件(本体模式选择执行体的轨迹作为主动作流);物体模式选择被操作物体上观测到的未来轨迹——当推理时显式提供物体轨迹,同一模式也可作为期望运动条件,引出兼容的机器人运动。

▲ 动作流作为视觉条件。动作流轨迹将首帧潜特征沿时间传播,形成运动感知的视觉条件 C,在 DiT patch 嵌入之前与带噪视频潜特征 Z 拼接。
笔者理解。 动作流之所以能统一多任务世界模型,关键在于它把"指令"翻译成了视觉模型最擅长处理的东西——图像平面上的运动。不同本体的关节角、末端位姿千差万别,但在相机画面里"物体被推到左边""夹爪合拢"却是共通的像素语言;一旦条件落地为像素运动,世界模型就不必再为每个本体各学一套"指令→视觉动力学"的映射,数据因而能在多本体之间共享复用。更耐人寻味的是逆模式的涌现:当同一接口同时编码前向与反向运动,模型便能从"我想让物体怎么动"反推出"机器人该怎么做",把任务规约与执行学习天然解耦——这或许正是通往通用机器人控制接口的一条务实路径。
实验结果
我们围绕三个核心结论组织实验:动作流带来大幅运动误差下降、开环策略评估高度可信、以及数据高效的跨任务迁移。冗余的腕部相机自运动、训练语料统计与推理提速等表格在此略去。

▲ 多本体数据集上的评估。所有方法在五个留出(held-out)集上各使用相同的 100 段验证片段;PSNR/SSIM(全参考保真度)、物体与夹爪 EPE(以像素计的轨迹点运动误差)、FID/FVD(分布质量)、VLM(1–5 分制)。
在五个留出多本体数据集上以相同 100 段验证片段对比,Hydra-0 相比动作条件(action-conditioned)的 Cosmos 2.5 基线,将**机器人运动误差降低 90.4%、物体运动误差降低 60.2%**。这一量级的下降并非来自更大的骨干,而是源于把条件从"原生相对 6D 动作"替换为"运动学接地的动作流"——在同一 Cosmos 2.5 骨干下,仅此一项替换就在 PSNR、SSIM、夹爪/物体 EPE 等指标上全面占优。换言之,误差下降是接口层面的收益,而非算力堆出来的。

▲ 使用 Hydra-0 的开环策略评估。每个点聚合 10 次试验;虚线为最小二乘拟合。评估策略包括 RoboLab 上的 π0、π0.5、GR00T N1.7、Cosmos-3 Edge 与 Cosmos-3 Nano。
在 RoboLab 上对 5 个策略的开环评估中,Hydra-0 生成的成功率与参考成功率高度吻合,Pearson 相关系数 r = 0.96(Spearman ρ = 0.93)。这意味着:用动作流条件的仿真做开环策略评估,其结果足以替代在真实机器人上跑参考轨迹——为"不开真机就能给策略打分"提供了量化背书,这对机器人迭代尤为关键。

▲ 在 IWS 任务上的数据效率。每个任务报告 LPIPS、物体流端点误差(EPE)与 FVD 随任务专属训练数据占比的变化(越低越好)。Ours (PT) 从原始 Wan2.2 权重出发;Ours (MT) 从我们的多本体中间训练(mid-trained)检查点出发。Wan-Move 与 ATI 以零样本评估。
在 IWS 任务上的数据效率实验进一步显示,从多本体中间训练检查点(Ours MT)出发,仅需少量任务专属数据即可逼近全量训练性能,且明显优于从原始 Wan2.2 权重(Ours PT)微调;Wan-Move、ATI 更可零样本迁移。这说明动作流作为共享接口,确实把多本体数据中的共性物理规律沉淀了下来,新任务只需补充少量"个性"数据即可。
总结 & 未来工作
我们提出运动学接地的动作流,作为一种视觉控制接口,用于跨机器人本体与视频骨干的可迁移神经世界仿真。除了改进动作条件预测与数据高效迁移,该接口还支持策略评估:在 RoboLab 策略上,回放成功率与参考成功率的 Pearson 相关系数为 r = 0.96。在逆方向上,我们的世界动作模型利用来自留出(held-out)人类演示的期望物体流,无需本体流输入即可生成兼容的机器人运动;一个训练好的动作头把其潜特征映射为可执行的机器人动作,且无需针对任务的专家机器人演示。这些结果把动作流定位为一种共享控制接口:它把任务规约(task specification)与执行学习分离开来,同时连接起异构训练数据、开环策略评估与机器人控制。
局限性(Limitations)与未来工作: 定性来看,世界动作模型会表现出厘米级的抓取不精确。我们推测有限的深度感知可能是造成这种不精确的原因。在生成的回滚中,抓取与接触状态也可能含混不清,包括物体是否已被成功固定。未来的世界模型可通过条件化额外模态(如深度、触觉感知与力感知)来减少这些歧义。我们的腕部相机实验仅限于一个定性的 DROID 概念验证;在腕部相机仿真、移动操作以及相机运动更丰富的场景中的系统性评估,仍是未来工作。我们当前的评估仅限于开环策略评估;闭环评估仍是未来工作的重要方向。
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。