点击下方卡片,关注【Xbotics具身智能实验室】公众号
你想要的这里都有~~
论文:The Imitator Game: Benchmarking Robot Imitative Ability Beyond Action Prediction
作者:周训哲,蔡亦扬,汪峰毅,鞠然等人
机构:香港大学,忆生科技,复旦大学,浙江大学
论文:arxiv.2608.22301

人类真正擅长的“模仿”,其实比复现动作复杂得多
想象一下,你第一次去朋友家,看他把一杯茶泡好。
他拿起茶包,放进杯子,倒水,等待,再把茶包取出来。回到自己的厨房,你发现茶包放在了另一个地方,你当然会去那里拿;如果家里没有茶包,只有散茶,你也不会因为“操作方式不一样”而不知道该怎么泡茶;甚至如果桌上没有茶,只有抹茶粉和搅拌棒,你依然知道应该做什么。
这里发生的事情很自然,以至于人们往往不会意识到它有多复杂。
人类模仿的对象,从来不只是动作本身,而是通过动作理解“这件事到底要完成什么”。
当环境没有发生变化时,人类可以复现原来的动作;当东西换了位置,人们会调整路径;当物体外观、形状发生变化时,也会相应改变抓取和操作方式;而当原来的工具甚至不存在时,人类依然能够尝试利用现有物品完成原来的目的。
这也是为什么人们在观察他人装一件家具、整理一个房间或做一道菜时,通常只需要看一遍,就可以在自己的环境里重新完成。人类并不会把对方手怎么抬、物体具体位于哪个像素位置,当成必须严格复制的内容。
从发展心理学关于社会学习和模仿层级的研究,到日常生活中的技能学习,人类本身就存在一种从动作复现逐渐走向目标和功能迁移的模仿能力。对于机器人而言,一个更完整的模仿系统也不应只停留在最底层的动作复现,而需要逐步具备这条从动作到目标、再到功能迁移的能力链。

过去几个月,机器人也开始真正“看视频学东西”
更有意思的是,这件事情正在机器人领域发生。
过去的机器人学习往往依赖语言告诉机器人“做什么”,或者依赖大量示教数据,让模型学习从视觉观察到动作输出的对应关系。但最近几个月,一批非常有代表性的工作开始把一个更接近人类学习方式的问题重新推到台前:
能不能直接给机器人看一段人类示范,让它在执行时自己学会一个新任务?
Generalist 在 GEN-1.5 中展示了 physical prompting:把几秒钟的示范放进上下文,机器人无需参数更新就可以立即尝试新任务;官方还展示了模型在扫东西的任务中,把香蕉当成临时刷子使用,表现出了超出原始动作轨迹的工具替代。
Skild AI 最新发布的 S1,则进一步把这种思路推进到更长时间尺度:单段视频示范可以驱动此前没有出现在训练任务中的长程操作,例如种植、煎饼、手冲咖啡和套件组装,部分任务执行时间达到十分钟量级。
这些工作并不彼此冲突,相反,它们共同说明了一件非常重要的事:任务的指定方式正在逐渐从“告诉机器人”走向“给机器人看”。
而一旦机器人开始真正通过人类视频学习新任务,一个自然的问题也随之出现:
机器人看懂的,到底是“怎么做”,还是“要做成什么”?
这个问题并非针对某一个具体模型,而更像是整个 human-to-robot video learning 方向接下来都需要面对的共同问题。
为什么“会做”还不够?
因为在现实部署里,机器人面对的环境几乎不可能和示范视频完全一样。
比如你在工厂里教机器人“把水倒进杯子”。训练时可能是某个固定大小的杯子、固定位置的水壶、固定的操作空间。
真正把机器人带回家之后,杯子换了、位置换了,甚至水壶也换了。再进一步,家里可能根本没有类似的水壶,只有水龙头。
如果机器人学到的是示范中的一组动作,它很容易在这些变化面前失效;但如果它学到的是“把水装进杯子”这个意图,它就应该知道:换一个杯子要调整抓取,换一个位置要重新规划,而当水壶不存在时,还可以寻找另一种能够完成这个目的的方式。
一次示范能不能带来这种举一反三的能力,决定了人类视频究竟能不能成为机器人学习真正高效、可扩展的监督源。
因此,The Imitator Game 并未将问题简单定义为“机器人能否复现一段视频”,而是进一步追问:
随着示范场景越来越不像执行场景,机器人还能保留多少示范中的信息?
The Imitator Game:把人类模仿拆成 L0–L3 四个层级
The Imitator Game 从人类模仿的角度出发,把示范场景与机器人执行场景之间的差异逐步拉大,让“动作复现”和“意图模仿”第一次可以在同一个 benchmark 中被区分出来。
最直观的例子就是论文中的“泡茶”。

L0:场景基本一致,复现示范
茶包、杯子和摆放都一样。
此时机器人可以直接复现示范中的操作方式。
L1:东西没变,但位置变了
茶包从右边移动到了前面。
机器人仍然面对同样的对象,也要得到同样的结果,但原来的运动轨迹已经不能直接照搬,因此必须适应新的空间布局。
L2:东西换了,但“是什么”没变
茶包换成了散茶。
外观、几何和具体操作方式发生了变化,但任务的语义角色仍然一致:还是要完成泡茶。
这要求机器人跨越视觉和物理差异,把示范中的任务迁移到新的对象实例上。
L3:连对象的功能都变了,但目的不能变
桌上已经没有茶,只有抹茶粉和搅拌棒。
这时候机器人再去“复现泡茶动作”已经没有意义。它必须理解更深一层的目的,并通过当前环境中的其他可用物体重新组织操作。
动作名字已经变了:从 steep 变成 mix;但想完成的事情仍然没有变。
论文将这种能力称为 intent-level imitation。
四个层级不是人为给模型增加四种提示,而是通过改变机器人实际面对的场景来定义。策略并不会被告诉“现在是 L2 还是 L3”,它只能根据示范和眼前环境自己判断:什么应该继续保留,什么必须放弃。论文也将这种分级与已有关于人类社会学习、目标导向模仿和类比迁移的理论联系起来。
IG-10K:同一段人类示范,真正对应不同的机器人世界
为了让这一问题能够被系统研究,研究团队进一步构建了 IG-10K。

IG-10K 不是把人类视频和机器人轨迹简单放在一起,而是以 paired episode 为基本单位:一段人类示范视频,对应机器人端不同的执行场景,并沿着 L0–L3 实例化场景错配关系。
目前数据集包含 20,000+ 对配对 episode,其中真机 11.7K,覆盖 50+ 个基础任务、200+ 个任务变体以及家庭、超市、餐厅、物流、医院和实验室六个领域。数据采用统一的 LeRobot 0.5.0 格式,并提供多视角 RGB-D、3D MANO 手姿、语义分割和多层语言标注。
更重要的是,整个项目并未止步于一个数据集,而是进一步搭建了一套能够持续扩展的实验基础设施:
IG-10K:为 human-video-to-robot learning 提供环境匹配的人机配对数据; 200+ ManiSkill 配对任务与统一接口:让不同研究者可以在相同任务和相同输入协议下快速接入; Imitator Arena:统一仿真自动评测与真实世界人类评价,并支持匿名 A/B 比较; Leaderboard / Community:面向后续模型、数据和环境持续扩展,而不是一次性的论文实验。
在 Arena 中,不同模型拿到的是同一个问题:示范视频 V + 当前机器人观测 o_t → 动作 a_t。模型不会被额外告知当前到底处在 L0、L1、L2 还是 L3。
这使 benchmark 不再依赖某一个模型的输入格式,而可以容纳 VLA、跨具身 skill 方法和 video-conditioned visuomotor policy 等不同路线。本轮实验共评估 3 类范式、9 个模型、15 个训练变体。
不只是“测一次”:The Imitator Game 想回答什么?
现阶段结果显示,视频条件的方法在 seen-task imitation 上展现出很强的潜力;在真实世界 zero-shot transfer 中,直接保留示范视频的信息也表现出明显优势。同时,随着配对预训练数据增加,更多方法能够从少量新的机器人示范中获得更好的适应能力。
但当任务真正进入 L3 功能替换,也就是“不再是把同一个对象换个位置或外观,而是要用另一种对象完成同一个目的”时,现有系统仍然会明显变得困难。代表模型在 L0–L2 之间整体较稳定,而 L3 出现明显下降。
而这也恰恰体现了这个 benchmark 的价值:它试图暴露的,并不是模型在熟悉条件下能做到什么,而是在场景逐渐偏离示范之后,能力究竟会在哪里失效。
从 The Imitator Game 的设计来看,其目标并非通过一次实验给任何模型下最终结论。相比单次排名,这项工作更希望解决的是另一件事:把问题定义清楚、统一测试场景、开放评测接口,再让社区持续将新的模型放到同一套标准下比较。
今天的 GEN-1.5、S1、HOST、Zero-WAM 等工作,都在探索人类视频作为机器人任务上下文的价值。而在 The Imitator Game 所定义的统一协议下,这些不同技术路线也可以被放入同一套坐标系中进行比较:从 L0 的直接执行,到 L1 的空间变化,再到 L2 的对象泛化,最终挑战 L3 的功能替换。
这些工作正在推动机器人进入一条新的学习范式,而 The Imitator Game 希望做的是把这条路的坐标系先建立起来。
从 Benchmark 到开放社区:The Imitator Game 的下一步
从目前公布的规划来看,这次发布并不是 The Imitator Game 的终点,而更像是整个项目的起点。
接下来,项目团队计划从几个方向持续扩展:
数据规模:继续扩大 IG-10K,增加更多任务、更多对象、更多替换方式与更丰富的人机配对;
仿真规模:扩展 ManiSkill 配对资产与任务,让研究者能够低成本验证新的 imitation interface;
真实世界评测:持续增加可评测的真机任务与模型;
模型规模:持续跟进最新的 ICL、VLA、World-Action Model 等路线,让 leaderboard 保持更新;
社区协作:欢迎大家贡献模型、数据、仿真环境、任务设计和新的评测思路。
从目前开放的数据、仿真任务、Arena 和 Leaderboard 等组成来看,The Imitator Game 的定位已经不只是一次性的 benchmark,而是在尝试搭建一套可以持续扩展的 human-to-robot learning 公共基础设施。
目前 The Imitator Game 依托香港大学团队,并与忆生科技联合推进。项目目前也在招募对机器人模仿学习、VLM/VLA、仿真、数据集与 benchmark 感兴趣的同学和研究者参与后续建设。
未来,随着更多模型、数据和任务接入,这套评测体系也有望继续扩展,并进一步推动社区共同探索下一代 robot imitation benchmark 应该如何定义。
-END-
Ask Me Anything|提问箱
对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。
怎么问:在评论区留言,或私信公众号
我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。
提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。
一起把问题变成知识,推动社区进步 🚀