点击下方卡片,关注【Xbotics具身智能实验室】公众号
你想要的这里都有~~
一次手机采集,把真实门“搬进”仿真,再把学到的动作带回现实
开门对人来说几乎不需要思考,但对移动机器人而言,它同时考验视觉、接触操作、底盘运动和机械臂协调。Video2DoorTraversal 选择了一条无需任何遥操作和人类演示数据的路线:给陌生的真实门拍一段手机视频,自动建立对应的DoorTwin(门数字孪生),让机器人先在仿真中练习,再回到真实世界完成开门与穿越。
Single RGB Video → DoorTwin → 仿真练习 → 策略学习 → 真实机器人
先看结果:一次采集,做到什么程度?
96.57% | 97.27% |
80.95% | 约 13 s |

一扇陌生门,为什么值得先做一个“数字替身”?
这项工作的核心是 One-Shot(单次采集)Real-to-Sim-to-Real(真实-仿真-真实):现实世界只负责提供一次视频观测,后续的大量试错尽量放到仿真中完成。这样做的价值很实际——真实机器人不用围着同一扇门反复采数据,也不需要人为给每扇门重新搭建仿真资产。
研究团队把整个问题拆成三个关键问题:数字门能否对齐现实?没有真人遥操作,训练轨迹从哪里来?仿真里学会的动作,真机能否连续做完?对应的答案,正是 DoorTwin、仿真在环轨迹生成和 ArticuACT。

第一关:数字门能不能在尺寸、把手位置和关节结构上对齐现实?
DoorTwin 解决的是“练习场够不够像真实世界”的问题。手机视频首先经过 DAGE,恢复 metric depth(绝对尺度深度)和 camera poses(相机位姿);SAM 3 对视频逐帧分割门体,多帧信息再被聚合成带真实尺度的门几何。遇到玻璃或反光区域时,LingBot-Depth 用于进一步修正深度。
随后,系统提取门宽、门高和把手相对位置等关键约束,并交给 Articraft 生成 articulated(可动关节结构)、simulation-ready(可直接用于仿真)的门资产。对机器人来说,这些约束直接关系到能否抓准把手、能否正确推门以及穿越时是否会发生碰撞。

生成结束后还要过一道“复核”。系统会从参考视角重新渲染 DoorTwin,由视觉语言模型检查轮廓、把手类型、铰链方向、比例和把手位置;发现偏差后继续修改。这个 Render–Critique–Refine(渲染–评估–修正)循环,让资产从“像一扇门”进一步靠近“像这一扇门”。

第二关:没有真人遥操作,训练数据从哪里来?
DoorTwin 建好后,研究团队让 Agent 在 Isaac Gym 中完成 simulation-in-the-loop(仿真在环)练习。完整任务被拆成接近、抓取、转把手、推门、穿越等 parameterized skills(参数化技能),Agent 负责调整每一步的关键参数。
轨迹如果在仿真里失败,系统会读取碰撞、接触、门角度、把手旋转等反馈,定位问题后再修改参数并重新执行。最终保留下来的训练数据都经过物理仿真验证,无需针对每扇门人工遥操作采集。消融结果也很直观:去掉 simulator rollout(仿真执行反馈)后,轨迹生成成功率从 85.63% 降到 48.13%。
第三关:仿真里学会以后,真机能不能连续做完?
最后,研究团队用这些自动生成的 demonstration(示教轨迹)训练 ArticuACT。策略同时读取前视和腕部深度图,直接输出底盘速度、底盘转向、机械臂关节和夹爪命令,让开门过程保持连续。
为减小相机视角变化带来的空间歧义,ArticuACT 还加入 Plücker ray(普吕克射线)条件编码,把相机几何显式告诉策略;同时预测“是否接触把手、把手转了多少、门开了多少”等交互进度,帮助模型理解当前任务阶段。

真正关键的结果:仿真高成功率,真机也能稳住
为便于直接比较,下面统一采用“完整穿门成功率”作为核心指标:
测试环境 | 规模(门×单门次数) | Vanilla ACT | Video2DoorTraversal |
仿真 | 20 × 256 | 64.84% | 97.27% |
真机 | 5 × 35 | 65.71% | 96.57% |
真机完成“接近门—开门—穿越”的完整过程平均耗时约 13 秒。

更有意思的是 Zero-Shot(零样本)跨门测试:策略只在一扇重建门上训练,直接部署到三扇结构相似的未见门,不增加训练也不重新生成轨迹,分别取得 25/35、31/35 和 29/35,平均成功率 80.95%。这说明策略已经具备一定的跨门泛化能力。
从“开一扇门”继续往前看:机器人能否为新场景自动搭建练习场?
Video2DoorTraversal 当前聚焦的是推门穿越,但它更值得关注的地方,是“实例级仿真环境自动生成”这条路线。门只是典型的可动结构之一,抽屉、柜门、阀门、带铰链的设备面板,同样存在真实尺寸、部件关系和接触动力学的问题。
如果这套流程继续扩展,机器人进入新环境后或许可以先用几分钟完成观测,自动建立目标物体的数字孪生,再把大量试错留给仿真。这样一来,真实世界的数据采集成本、设备磨损和人工示教负担都有机会进一步下降。
从这个角度看,DoorTwin 的价值不止是生成一个 3D 模型。它更像一座中间桥梁:把真实环境转换成可练习、可验证、可扩展的数据源,再把学到的能力送回真实机器人。对于希望走出实验室、进入陌生建筑长期工作的移动机器人,这种“先理解环境,再自动生成练习场”的能力,可能会越来越重要。
一句话概括:给新门拍一段视频,自动建 DoorTwin,在仿真中把动作练熟,再让真实机器人直接上手。
-END-
Ask Me Anything|提问箱
对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。
怎么问:在评论区留言,或私信公众号
我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。
提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。
一起把问题变成知识,推动社区进步 🚀