只拍一段视频,机器人就能学会开门: Video2DoorTraversal 真机成功率达 96.57%

Xbotics具身智能实验室 2026-08-28 11:00

点击下方卡片,关注【Xbotics具身智能实验室】公众号

你想要的这里都有~~


一次手机采集,把真实门“搬进”仿真,再把学到的动作带回现实

开门对人来说几乎不需要思考,但对移动机器人而言,它同时考验视觉、接触操作、底盘运动和机械臂协调。Video2DoorTraversal 选择了一条无需任何遥操作和人类演示数据的路线:给陌生的真实门拍一段手机视频,自动建立对应的DoorTwin(门数字孪生),让机器人先在仿真中练习,再回到真实世界完成开门与穿越。

Single RGB Video → DoorTwin → 仿真练习 → 策略学习 → 真实机器人

先看结果:一次采集,做到什么程度?

96.57%
五扇真实门平均成功率

97.27%
仿真完整穿门成功率

80.95%
三扇相似未见门 Zero-Shot(零样本)成功率

约 13 s
从接近门到完成穿越的平均耗时

只拍一段视频,机器人就能学会开门: Video2DoorTraversal 真机成功率达 96.57%图1
Video2DoorTraversal 在不同真实门上的完整开门与穿越过程。

一扇陌生门,为什么值得先做一个“数字替身”?

这项工作的核心是 One-Shot(单次采集)Real-to-Sim-to-Real(真实-仿真-真实):现实世界只负责提供一次视频观测,后续的大量试错尽量放到仿真中完成。这样做的价值很实际——真实机器人不用围着同一扇门反复采数据,也不需要人为给每扇门重新搭建仿真资产。

研究团队把整个问题拆成三个关键问题:数字门能否对齐现实?没有真人遥操作,训练轨迹从哪里来?仿真里学会的动作,真机能否连续做完?对应的答案,正是 DoorTwin、仿真在环轨迹生成和 ArticuACT。

只拍一段视频,机器人就能学会开门: Video2DoorTraversal 真机成功率达 96.57%图2
Video2DoorTraversal 整体流程:从单段 RGB 视频到 DoorTwin、仿真轨迹生成,再到真机部署。

第一关:数字门能不能在尺寸、把手位置和关节结构上对齐现实?

DoorTwin 解决的是“练习场够不够像真实世界”的问题。手机视频首先经过 DAGE,恢复 metric depth(绝对尺度深度)和 camera poses(相机位姿);SAM 3 对视频逐帧分割门体,多帧信息再被聚合成带真实尺度的门几何。遇到玻璃或反光区域时,LingBot-Depth 用于进一步修正深度。

随后,系统提取门宽、门高和把手相对位置等关键约束,并交给 Articraft 生成 articulated(可动关节结构)、simulation-ready(可直接用于仿真)的门资产。对机器人来说,这些约束直接关系到能否抓准把手、能否正确推门以及穿越时是否会发生碰撞。

只拍一段视频,机器人就能学会开门: Video2DoorTraversal 真机成功率达 96.57%图3
DoorTwin 与 Articulate-Anything、PhysX-Omni、Articraft 的定性对比。

生成结束后还要过一道“复核”。系统会从参考视角重新渲染 DoorTwin,由视觉语言模型检查轮廓、把手类型、铰链方向、比例和把手位置;发现偏差后继续修改。这个 Render–Critique–Refine(渲染–评估–修正)循环,让资产从“像一扇门”进一步靠近“像这一扇门”。

只拍一段视频,机器人就能学会开门: Video2DoorTraversal 真机成功率达 96.57%图4
Reference View Critic(参考视角评估)逐步修正局部结构与把手位置。

第二关:没有真人遥操作,训练数据从哪里来?

DoorTwin 建好后,研究团队让 Agent 在 Isaac Gym 中完成 simulation-in-the-loop(仿真在环)练习。完整任务被拆成接近、抓取、转把手、推门、穿越等 parameterized skills(参数化技能),Agent 负责调整每一步的关键参数。

轨迹如果在仿真里失败,系统会读取碰撞、接触、门角度、把手旋转等反馈,定位问题后再修改参数并重新执行。最终保留下来的训练数据都经过物理仿真验证,无需针对每扇门人工遥操作采集。消融结果也很直观:去掉 simulator rollout(仿真执行反馈)后,轨迹生成成功率从 85.63% 降到 48.13%。

第三关:仿真里学会以后,真机能不能连续做完?

最后,研究团队用这些自动生成的 demonstration(示教轨迹)训练 ArticuACT。策略同时读取前视和腕部深度图,直接输出底盘速度、底盘转向、机械臂关节和夹爪命令,让开门过程保持连续。

为减小相机视角变化带来的空间歧义,ArticuACT 还加入 Plücker ray(普吕克射线)条件编码,把相机几何显式告诉策略;同时预测“是否接触把手、把手转了多少、门开了多少”等交互进度,帮助模型理解当前任务阶段。

只拍一段视频,机器人就能学会开门: Video2DoorTraversal 真机成功率达 96.57%图5
左:ArticuACT 组件与控制空间消融;右:随着示教数量增加,完整穿门成功率持续提升。

真正关键的结果:仿真高成功率,真机也能稳住

为便于直接比较,下面统一采用“完整穿门成功率”作为核心指标:

测试环境

规模(门×单门次数)

Vanilla ACT

Video2DoorTraversal

仿真

20 × 256

64.84%

97.27%

真机

5 × 35

65.71%

96.57%

真机完成“接近门—开门—穿越”的完整过程平均耗时约 13 秒。

只拍一段视频,机器人就能学会开门: Video2DoorTraversal 真机成功率达 96.57%图6
真实机器人执行过程:底盘前进速度、接触预测、把手旋转预测、门开启预测进度随时间同步变化。

更有意思的是 Zero-Shot(零样本)跨门测试:策略只在一扇重建门上训练,直接部署到三扇结构相似的未见门,不增加训练也不重新生成轨迹,分别取得 25/35、31/35 和 29/35,平均成功率 80.95%。这说明策略已经具备一定的跨门泛化能力。

从“开一扇门”继续往前看:机器人能否为新场景自动搭建练习场?

Video2DoorTraversal 当前聚焦的是推门穿越,但它更值得关注的地方,是“实例级仿真环境自动生成”这条路线。门只是典型的可动结构之一,抽屉、柜门、阀门、带铰链的设备面板,同样存在真实尺寸、部件关系和接触动力学的问题。

如果这套流程继续扩展,机器人进入新环境后或许可以先用几分钟完成观测,自动建立目标物体的数字孪生,再把大量试错留给仿真。这样一来,真实世界的数据采集成本、设备磨损和人工示教负担都有机会进一步下降。

从这个角度看,DoorTwin 的价值不止是生成一个 3D 模型。它更像一座中间桥梁:把真实环境转换成可练习、可验证、可扩展的数据源,再把学到的能力送回真实机器人。对于希望走出实验室、进入陌生建筑长期工作的移动机器人,这种“先理解环境,再自动生成练习场”的能力,可能会越来越重要。

一句话概括:给新门拍一段视频,自动建 DoorTwin,在仿真中把动作练熟,再让真实机器人直接上手。


-END-

Ask Me Anything|提问箱

对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。

怎么问:在评论区留言,或私信公众号

我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。

提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。

一起把问题变成知识,推动社区进步 🚀


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
功率 机器人
more
今年的研发预算将超20亿,小鹏机器人凭什么值400多亿?
第一代机器人创业者,揭穿当下具身智能“假商业化”
宇树科技研发费不及牧原养猪?经济学家警示人形机器人估值泡沫
当机器人开始读懂“想走路”:迈步从柔性外骨骼到脑机接口的十年跃迁
集萃智造:以“协作机器人+无人车”为根基 探索具身智能前沿之路
极飞科技:招聘雷达算法工程师、机器人算法工程师等岗,base广州丨低空招聘
瑞萨亮相 2026 第四届中国具身智能机器人产业大会,展示全链路半导体解决方案
新品直击|AI个训机器人来了!特殊儿童一人一案精准干预!ALSOLIFE携新品亮相福祉博览会
夯爆了!100米跑8.86秒?跳高3.40米?这群机器人彻底把人类打败了...
联想连投4轮!深圳外骨骼机器人研发商融资近亿元
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号