点击下方卡片,关注【Xbotics具身智能实验室】公众号
你想要的这里都有~~
摘要:一个模型能驱动五花八门的末端执行器,是宣传点。更值得琢磨的是,它把"换把手有多难"这件一直靠手感判断的事,变成了一个能测量、能拆解、能反过来指导采数据的数。
做机器人本体和工装的人,心里大概都压着一个说不清的问题:给机器人换一个自研夹爪,模型要重训到什么程度?采多少数据才够?这把手比上一把"陌生"多少?
过去多半只能靠经验估:跑一版,不行再采、再跑,凭手感来。Generalist AI 在 7 月 21 日的更新里,给这个手感装上了一把尺子。
在拆这把尺子之前,得先把 Generalist 这条线的坐标交代清楚——因为这次的方法,是直接长在它前两代模型的地基上的。
一分钟看懂 GEN 系列的坐标
Generalist AI 是一家把"机器人预训练的 scaling law"摆到台面上讲的公司,团队来自 OpenAI、Boston Dynamics 和 Google DeepMind。它的模型不走 arXiv,而是以技术博客的形式一代代放出来,到现在是三连:
GEN-0(2025 年 11 月) 回答的是"数据堆得越多,模型是不是真的越强"。它公布了 27 万小时真实操作数据,并且以每周 1 万小时以上的速度往上加,用实打实的曲线把具身预训练的规模效应摆了出来。这是整条线的地基:先说清数据规模有用。
GEN-1(2026 年 4 月) 回答的是"这套预训练到底能把活干多好"。成绩很硬:在一批任务上把平均成功率从此前模型的 64% 提到 99%,任务完成速度约为先前水平的 3 倍(官方精确值 2.8 倍),而每个新任务只要约 1 小时的机器人数据就能适配。更关键的是,GEN-1 有一套明确的架构分工——大致可分成传感处理、谐波推理、驱动执行三块,分别对应"看懂世界""把感知和动作协同起来""发出控制"(其中谐波推理并不是流水线里的一道工序,而是让感知和行动在连续时间上异步耦合的机制)。记住这三块,后面那把尺子正是拆在它们身上的。
这次的千手更新(2026 年 7 月),问题又变了。它不再纠缠成功率,而是问:同一个 GEN-1,到底能接上多少种、多不一样的硬件,以及——这些硬件之间的差异,能不能被量出来。
对天天跟法兰盘、工装、末端执行器打交道的人来说,这第三个问题最实在。下面重点拆它。
这次到底秀了什么,又藏了什么
表面的卖点是能力秀:同一个预训练模型 GEN-1,既能驱动五指拟人手,也能驱动电动螺丝刀、打蛋器这类物理交互方式完全不同的专用工具。官方的说法是"单一基座模型能在物理交互方式截然不同的机器人上学会感觉运动策略,而且这些策略能互相迁移"。

支撑这次更新的数据集也顺带交代了:真实交互数据已经超过 50 万小时(比 GEN-0 时期的 27 万小时翻了近一倍),其中光是对二指夹爪的各种改装变体,官方给出的数量就有约 9000 种。选型的目的很明确,就是让模型见到尽可能宽的接触物理。进入这次权重分析的末端执行器有 9 种:电动螺丝刀、胶带切割器、开瓶器、超宽扁平手、刮扫组合、美工刀、打蛋器、削皮刀、夹钳。
但这篇真正值得做硬件的人收藏的,不是"能接多少种手"这个结果,而是它中间夹带的一个方法:Generalist 把"换一把手对模型到底有多难"这件一直靠直觉判断的事,变成了一个能测量、能拆解、还能反过来提示该采什么数据的量。 这一点,比能力秀更少被人拿出来讲。
把每一把手,当成一条"感觉通道"
在动尺子之前,得先理解 Generalist 怎么看待"一把手"。
在它的表述里,每一种末端执行器都不是一个孤立的硬件,而是模型感知物理世界的一条感觉运动接口——一条用来学习几何、接触和动力学的通道。电动螺丝刀的转速快过手指能跟上的极限;胶带切割器要同时管住张力和落点;夹钳带来顺应性,还有弹簧回弹这类动力学;金属铲和刮刀是贴着表面工作而不是绕着物体工作,逼着模型去推理分布式接触而不是单点接触;美工刀、削皮刀则要求沿着受约束的路径施加可控的力。

在成千上万条这样的通道上做预训练,模型学到的不是某一把手的固定操作,而是一套能迁移的物理常识:形状和接触面会怎么跟世界发生作用,随之该采取哪种驱动策略。

这个视角本身不算新。真正的新意在下一步——它把这个"通道"的概念,变成了可以量的东西。
主菜:ΔW,给陌生度打分
思路其实朴素得意外。
拿预训练好的 GEN-1,在一把新工具上做微调,得到一个新模型。把这两个模型的权重作差:
ΔW = W_ft − W_0
其中 W_0 是预训练模型的权重,W_ft 是微调后的权重。这个差值,Generalist 叫它"任务更新量"。
差值本身是一大堆参数,不是一个能比大小的数。真正上刻度的一步是:把这个差值取范数、再对原权重做归一化,压成一个百分比——相对参数变化量。有了这个百分比,"这把手有多陌生"才第一次可以横着比。道理很直白:在同一套测量口径下,一把手越陌生,模型为了学会用它,权重就得挪动得越多,这个百分比也就越大。
他们在 9 种末端执行器上量了一遍。结果落在一个区间里:相对参数变化量从 2.5% 到 11.4%。

区间的两头很说明问题。电动螺丝刀 11.4%,是最高的,而且明显甩开第二名的胶带切割器(约 7.9%);夹钳 2.5%,是最低的,也是唯一低于 5% 的一项。用官方的话说,控制一把电动螺丝刀需要的"再教育",比控制一把夹钳多得多。这符合直觉——一个高速旋转的主动工具,和一把纯被动的夹钳,对模型的要求本就不在一个量级。但关键是,这个"符合直觉"这次落成了一个具体的数,而不再只是一句感觉。
尺子还能拆开:陌生在哪一层
如果 ΔW 只能给出一个总分,它顶多算个新鲜指标。真正让它变成工具的,是它能拆——拆到前面说的 GEN-1 那三个子系统上:传感处理、谐波推理、驱动执行。上面那张图里,横轴的模型各层正是按这三块分组的,于是一把新手带来的"陌生度",不只有一个总量,还能看清它主要压在哪一层。
最说明问题的一个例子是打蛋器和削皮刀的对比。打蛋器对传感处理层权重的扰动,明显大于削皮刀。 官方的推测是:模型很可能得费更大劲去看清打蛋器那些细钢丝的几何形状,而这种又细又稀疏的结构在视觉上太难分辨,于是额外的负担主要压在了感知这一层。

这个例子好在,它没有停在"哦,原来是感知难"。它直接给出了一条数据处方:既然瓶颈在"看清"那些又细又稀疏的工具,那就有针对性地多采集这类工具的数据,去补强传感处理这一层。 官方也说,他们正在研究每一种新末端执行器如何改变预训练模型,据此有针对性地扩充数据集、在真实基准上评测。
到这里,这把尺子指向的用法才显出来。它不是一个孤立的分数,而是一条可以往下走的诊断链:
量出这把手有多陌生 → 拆开看陌生主要落在哪一层 → 反推该补采哪一类数据。
严格说,这条链还没在博客里跑完最后一环——补采、重训、再回头测一遍 ΔW 是不是真降下来了,官方没有给这组回测数据。所以现在它更像一块诊断仪表,而不是已经验证过疗效的闭环。但即便只到诊断这一步,它也补上了做本体和采数据的人一直缺的东西:过去"这批数据该往哪花",靠的是老师傅的经验和一轮轮试错;现在至少有了一个能读数、能定位、能指方向的量化依据。对于一个已经超过 50 万小时、还在持续往上堆的数据集来说,能把新增的采集量花在刀刃上,意义不比多几个点的成功率小。
一个同源的旁证:任务做到一半换手,模型不重启也能接着干
ΔW 是拿微调前后的权重作差量出来的——换句话说,那是要经过一轮"再教育"的。但博客里还有一个实验,换手时不做任何新的微调,却指向同一件事。
Generalist 直接在模型 rollout 的过程中,人工把末端执行器物理拆下来、换成另一把,全程不给模型任何新的在线微调,让同一套权重继续跑。结果是:模型感知到手变了,据此重新规划出一条新的轨迹和一套新的接触策略,仍然完成了原来的目标。

注意这里跟 ΔW 是两回事:ΔW 衡量的是"要重新学会一把手、权重得挪多少",而热插拔里权重完全没动,靠的是模型当场的感知和重新规划。但两个实验背后是同一个东西——模型内化的不是一把手一套死记的操作,而更接近一个先验:形状和接触面会怎么跟世界作用、随之该用哪种驱动策略。正因为有这个先验,一把没那么陌生的手,模型甚至不用重训、看一眼就能接着用。ΔW 从权重侧量这件事,热插拔从行为侧证这件事。
结尾:手长什么样,也许没那么要紧了
Generalist 在收尾处把话说得很直白:自然界从没收敛到操纵物理世界的唯一解,而是演化出千万种;机器人也不该被"出生时那双手"锁死。在它看来,机器人的手不会长得像人手,更像一个装着上千种手的工具箱,可以增强、重组、扩展;五指手只是其中一件工具,把机器人限制在这一种形态上,是想象力的失败。官方特意配了一组可视化来表达这个"可能性空间"——一边是自然演化出的形态,一边是机械设计的形态,都远不止一种。

-END-
Ask Me Anything|提问箱
对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。
怎么问:在评论区留言,或私信公众号
我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。
提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。
一起把问题变成知识,推动社区进步 🚀