点击下方卡片,关注“具身智能之心”公众号
之前分享过李弘扬老师在RSS上关于WBI的介绍。
昨天,DeepMind 发了 Gemini Robotics 2,标题是 brings whole body intelligence to robots。
讲的也是这件事,今天这篇文章和大家一起看看,deepmind到底在做什么,在传达一个什么信息。
01
先看之前的时间线
介绍version2 之前,先看看之前的版本,几个版本快有一年半时间了。
2025 年 3 月,Gemini Robotics 和 Gemini Robotics-ER 一起亮相,一个动手、一个动脑的双模型结构从这里定下来,动作数据主要在 ALOHA 2 双臂平台上采集。
三个月后,On-Device 版本把模型搬到机器人本地 GPU 上跑,也是这个家族里第一个开放微调的,官方给的门槛是 50 条演示。
到 9 月的 1.5 和 ER 1.5,重点转向执行前先生成推理步骤,同时引入 Motion Transfer,让模型能从异构的多本体数据里学习。
再往后就是现在的 Version 2,控制范围推到从脚到指尖的全身,并加上多机协作。
主线发展也比较清晰:从懂不懂 、装不装得进机器人、动之前想不想得清楚 、再到整个身体能不能一起动、多机协作。
回到这次的 version 2。

blog 开篇先给了一个定义,说清楚了这次版本想解决什么:
之外还一直强调WBC、灵巧操作,以及多机协同(和figure的路子类似)。

博客中Gemini Robotics 2 被deepmind定位成驱动下一代真正可适应机器人的智能层,它是在物理世界中解决 AGI 这条路上的一个重要里程碑。
1)这次是三个模型
本次deepmind并不是简单发布了一个模型,是发了一组,分工很清楚。

Gemini Robotics 2,视觉-语言-动作模型(VLA),负责从视觉和指令直接出动作。它控制的范围是从脚到指尖的完整人形,也支持双臂机器人;在灵巧手和夹爪上都能做精细操作。它可以驱动 Apptronik Apollo 2 上那只 SharpaWave 五指手,22 自由度。
相比上一代 Gemini Robotics 1.5,最大的变化就在这里:1.5 主要做上半身的桌面任务,version2则把控制扩展到了全身。同时它继承了 1.5 的motion transfer。
Gemini Robotics ER 2,具身推理模型(Embodied Reasoning),是高层规划那个脑子。博客中deepmind给它的定位是机器人的高层规划大脑,能力包括:执行时长达到几分钟、涉及上百个决策的multi-step任务;知道一个任务什么时候开始、什么时候结束,能识别关键事件节点;某一步失败了能自我纠正;能泛化到没见过的新情况。新增的是多机协作:不同类型的机器人之间可以通信、配合,完成单台机器人做不了的工作流。
Gemini Robotics On-Device 2,端侧 VLA,跑在机器人本地。博客给的说明是:适配一个全新本体只要几个小时,通常少于 200 条样本;支持形状、传感器、自由度各不相同的双臂机器人。
2)Gemini Robotics 2的几类能力
全身控制。 走路、下蹲、伸展、操作物体,都在一个策略里。举的例子是一句指令:把洒水壶放进底层货架的绿色箱子里。Apollo 听懂之后,走到桌前,拿起洒水壶,走向货架,精准放进去。这条链路里既有移动也有操作,既要站着也要蹲下。
灵巧操作。 博客里面有两种末端:五指手用来做打结、封密封袋这类精细动作;二指平行夹爪用来做紧凑装配这类复杂任务。DeepMind 这次强调的是同一个模型能同时驾驭这两种形态。
多机协作。 不同类型的机器人互相通信、协同工作,走完单台机器人完不成的流程(之前figure的多机协同能够完成铺床、自动换班)。这是version相对 1.5 的全新能力。
再加上任务时长这一条:能撑住几分钟量级、上百个决策的序列,中途失败能自己纠正。
3)实验效果做了充分展示
DeepMind 在发布页贴了三组成功率,成绩比较突出。
通用全身操作任务:硬件Apollo + Inspire 手

全身操作任务
多指灵巧操作:硬件是Apollo+Sharpa Wave手,拆灯泡成功率到了92%。Sharpa Wave 单手 22 个自由度,灵活性和活动范围接近人手。这双手我们已经很熟悉了,今年来,很多让人眼前一亮的高难度灵巧操作任务都有Sharpa Wave的参与。

Sharpa的多指灵巧操作
夹爪操作上,精密插入任务也到了近90%。

夹爪操作任务
还有一些现象:
同一只手、同一个灯泡,拆是 92%,拧是 36%,差 56 个点。 我们的理解是,这两件事的物理要求完全不同:拆是开环的,抓住反向旋转,旋到松为止,中途没有任何必须对准的目标;拧是闭环的,得先把灯泡轴线和灯座螺纹对上,旋进去还要维持同轴,力大了滑丝、力小了空转,最后还得判断什么时候算到位。
另外四项排得挺整齐:用簸箕(32%)要一边维持贴地角度一边往里扫,拧灯泡(36%)要对准螺纹,密封袋(40%)要两指沿轨道边捏边滑,系垃圾袋(44%)要一直知道两条带子的相对位置。都是动作展开中持续对准,成绩全落在 32 到 44 之间。而唯一不需要对准的那个动作,92%。
二指夹爪的成绩全面高于五指手。 听上去最难的精密插入用夹爪能做到 89.6%,比五指手最好的非拆卸任务(系垃圾袋 44%)高出一倍。自由度更高的那只手,在需要闭环的任务上反而更差。
三个取物位置里,地面最低。 货架 76.3、桌面 68.4 都在腰以上,主要是手臂的活;只有从地面拿东西必须下蹲,重心转移、姿态重构、视野和可达范围全变。这一项 45.7%,比另外两项低 23 到 31 个点。
4)关于多机协同和更高阶的任务
现实里大多数任务都要分多步、跨较长时间完成。
Gemini Robotics ER 2 这次承担高层大脑的角色,负责处理用户指令和与人沟通,观察房间环境,推理出所需的各个步骤,协调 VLA 执行具体动作,并持续追踪进度直到任务完成。由此机器人可以执行复杂的多步任务,某一步失败时自我纠正,并适应全新的情境与目标。
这次更新把可靠执行的任务序列拉长到数分钟、数百个决策,同时让 ER 2 能准确识别任务的开始与结束、定位关键事件发生的时刻。
此外新增多机器人协作,不同类型的机器人可以相互沟通、协同工作,共同完成单台机器人无法独立完成的工作流。
这里挺有意思,demo中是机械臂和人形机器人之间。

5)端侧部署
之前就说过,端侧部署不会是技术问题,是时间问题。
Gemini Robotics On-Device 2 正是在解决这个事情,端侧适配被压到几小时。
模型原生支持多躯体形态,博客给了很多本体形态做参考。Dexmate、SO101 和 Trossen 等多样化的机器人平台都支持。

6)再来看看安全这个事情
安全这块 blog 讲了两件事,这也是后面要关注的(deepmind确实走在了前面)。
一是新的 ASIMOV-Agentic 基准。它测的内容写得很具体:具身推理智能体能不能拒绝 VLA 发过来的不安全工具调用,能不能预判任务是否可行,以及会不会主动请求人来介入。
二是 Gemini Robotics ER 2 的表现。DeepMind 称它是迄今在安全约束遵循和人体贴近基准上最安全的机器人模型,人体检测能力增强,有人靠近时会触发安全工具调用、让机器人安全停下,符合协作安全标准。具体分数没给,同步放出了一份安全技术报告。
02
写在最后
Gemini Robotics 2 是一次扎实的推进。控制范围从上半身桌面推到从脚到指尖的整个人形,多机协作做进 ER,端侧适配压到几小时。
不过最有意思的是看完实验后,拆灯泡和拧灯泡之间的差距,靠什么来缩小差距?
靠更大的模型和更多的遥操作数据慢慢磨,是当下最主流的答案,但灵巧手全面输给二指夹爪这件事说明它磨得很慢;
靠往输入里补触觉和力反馈,让模型真的感觉到接触,方向对,可触觉数据的规模化采集今天还没有像样的解法;
还是靠 ASIMOV-Agentic 这种外挂的否决层兜底?

