允中 发自 凹非寺
量子位 | 公众号 QbitAI
机器人身体,正在成为具身智能里最被低估的变量。
过去两年,滚烫的金钱和聪明的大脑纷纷涌入人形机器人行业。
这背后的逻辑足够清晰:现实世界围绕人体尺度建造,双腿可以跨越台阶,双臂可以覆盖工作台,双手可以使用现成工具。
一副与人相似的身体,理论上能够直接进入工厂、仓库、商店和家庭,复用人类已经建立的物理基础设施。
但人形所追求的通用性,也把机器人领域最困难的一组问题,压进了同一套系统。
比如动态平衡、高自由度控制、灵巧操作、碰撞安全、能量效率和开放环境泛化,需要在一副身体上同时成立。
而当机器人真正走向产业,另一个问题正在浮现:通用机器人是否一定意味着通用身体?
李飞飞近期在围绕空间智能和机器人训练的讨论中,也给出了一个接近工程现实的观察:
人体由演化塑造成了适应开放、非结构化环境的通用形态,当任务边界足够明确时,最高效的身体可能沿着完全不同的方向演化。
她用“爬树”举例,如果一种生物长期面对的核心任务只有爬树,它最终形成的身体形态,大概率不会和人类相同。
这恰好解释了擎羽科技(FEAGINE)选择的路线。
擎羽由香港大学机器人学博士、前大疆创新嵌入式工程师彭锐创立,聚集了一批来自斯坦福、清华、普林斯顿、大疆等全球顶尖科技与研究体系的人才。
这家公司没有从复制一副人体开始,而是先把“身体”本身作为一个可以重新设计的变量。
在本次发布中,擎羽带来了FEAGINE A01、A02、A03三款仿生柔性机器人,以及第一代跨本体基础模型Fi0:Foundation Intelligence Across Embodiments。
前者解决的是机器人可以拥有怎样的身体,后者研究的则是身体发生变化之后,已经获得的智能能否继续使用。
单独看,A01、A02、A03是三款长度、节段、自由度和负载能力不同的柔性机器人;把它们与Fi0放进同一张技术路线图,它们又成为一组真实的embodiment variation。
身体逐渐变长,节段逐渐增加,可达空间、运动路径和接触方式随之变化,而模型需要理解其中哪些东西属于任务和世界,哪些东西由身体决定。
擎羽把这条硬件、数据与模型共同演化的技术路线称为:柔性具身智能。
△擎羽仿生柔性机械臂x Fi0跨本体基础智能模型
人形之外,具身智能的身体仍有巨大的设计空间
在机器人领域,柔性通常首先指向材料和机械结构。
软体机器人、连续体机器人和绳驱机器人通过弹性结构、连续弯曲或柔顺驱动获得更丰富的构型,使机器人能够顺应环境、包络物体,并降低刚性碰撞带来的风险。
柔性具身智能将这个概念继续向上推进。
柔性具身智能,是以可连续形变、可顺应接触的机器人本体为物理基础,将身体的结构参数、实时形态、感知和驱动能力纳入模型上下文,使任务知识与世界理解能够跨越不同身体复用,并由模型为当前身体生成适配行动的一类具身智能系统。
在擎羽的判断中,柔性本体能够拓展近人交互与复杂动作的边界,连续构型也为数据映射和跨本体泛化提供了新的基础。
友善的本体、丰富的数据、泛化的模型,被擎羽视为机器人进入真实生活空间的三个核心要素。
这条路线没有否定人形机器人的长期价值。它提出的是另一种市场结构:未来的机器人可能拥有许多不同的身体,通用性由共享智能提供,而每一种身体围绕自己的任务和环境达到更高效率。
全球首个量产绳驱柔性本体产品矩阵
FEAGINE A01、A02和A03,构成了全球首个实现标准化量产交付的绳驱柔性本体产品矩阵。
三款产品沿节段数量、自由度、长度和负载能力逐级展开,对应不同的实际部署需求。
FEAGINE A01采用一段柔性关节和2个自由度,整机重量750克,末端负载200克,更适合搭载在移动底盘、巡检设备和其他对重量敏感的平台上,在有限空间内完成轻量操作。
A02扩展至两段柔性关节和4个自由度,整臂长度30厘米,末端负载400克,最高移动速度达到0.78米每秒。
更大的工作空间和连续弯曲能力,使它能够进入桌面操作、近人服务、狭窄空间作业以及需要柔顺接触的场景。
A03进一步增加到三段柔性关节和6+1个自由度,整臂长度50厘米,末端负载600克,最高移动速度达到1.17米每秒。
更多节段带来了更大的构型空间,使机器人能够绕过障碍、从复杂角度接近目标,并承担更长距离、更高自由度的操作任务。
三款产品均支持ROS 1、ROS 2、Python与C++,A02和A03还配套GUI、MuJoCo与SAPIEN环境。
从移动操作、近人服务,到复杂空间中的抓取和交互,擎羽把柔性机械臂从实验室里的科研用具,变成可以直接集成和部署的标准机器人本体。
对Fi0而言,这组产品还有另一层意义。
随着长度、节段和自由度变化,同一个任务会自然产生不同的运动路径、身体构型和接触方式。
短臂可以直接接近目标,拥有更多节段的长臂能够利用构型冗余绕开障碍,双臂或多臂系统还可能重新组织任务中的动作分工。
任务保持不变,身体开始系统地改变任务的实现方式。
A01、A02和A03因此不只是三个SKU,它们也为Fi0提供了一组真实、连续且可以反复验证的本体差异。
每增加一种长度、节段和组合,模型都获得一个新的样本,用来理解身体变化究竟如何改变行动。

Fi0:跨本体基础模型Foundation Intelligence Across Embodiments
从上下文学习机器人技能,理解物理世界,并让行动适应不同身体。
Fi是擎羽对Foundation Intelligence的长期研究方向,Fi0是这一方向下的第一代跨本体基础模型。
它建立在一个基础判断上:
机器人对于任务和物理世界的理解,应当可以跨越身体继续复用;
真正需要随着身体变化的,是行动。
当任务是“把方块放进碗里”,机器人从A01换成A03,或者从单臂变成双臂,任务本身并没有重新定义。
操作对象之间的关系、抓取与释放的接触逻辑、任务推进的顺序以及最终的成功状态,仍然可以复用。
随着身体变化,真正需要重组的是可达空间、动作维度、运动路径、身体构型和动力学结果。
Fi0希望让任务意图、物体关系、接触逻辑和目标状态在不同身体之间延续,再根据当前机器人的形态、感知、驱动能力和动态状态,生成适合这副身体的动作。
但跨越身体只是Fi0希望解决的一半问题。
真实世界中的任务同样不会在训练阶段被穷尽。对于模型已经掌握的技能,Fi0可以直接执行;遇到训练覆盖之外的任务时,人类可以通过擎羽的Ego头环来提供一次demonstration。
模型将这段示范作为推理时的skill context,从中理解操作对象、任务过程、关键接触和目标状态,再调用已经获得的世界知识与操作能力完成执行,而无需针对当前任务重新训练参数。
由此,Fi0的能力沿着两个方向同时展开:新的技能可以通过上下文进入模型,已有技能可以跨越不同身体重新表达。
语言、视觉、人类示范、世界状态和本体信息共同构成Fi0的上下文。
语言给出目标与语义条件,demonstration在需要时补充具体技能,视觉与世界表示持续描述环境正在发生什么,本体信息则告诉模型此刻控制着怎样的身体。
任务可以来自预训练获得的能力,也可以在使用过程中通过上下文补充;真正执行时,模型再根据当前世界和当前身体生成行动。
围绕这条链路,Fi0同时建立对技能、世界、身体和行动后果的表示。
Skill Encoder将人类示范转化为可调用的技能上下文;
Cross-view World Encoder从不同观察视角中学习共享的物理世界;
Embodiment Graph将机器人结构与实时状态纳入模型;
World Dynamics Model与MAWA则进一步预测并评估不同动作可能带来的未来。
这些机制最终服务于同一个目标:让机器人能够在使用过程中获得新的技能,并在身体发生变化之后,继续调用此前积累的任务知识和世界知识。
从上下文中学习技能
机器人基础模型正在覆盖越来越多任务,但真实世界里的操作对象、任务流程和技能组合,很难在训练阶段被提前穷尽。
传统路径中,一项新能力通常需要先变成数据,经过示范或交互采集、训练或微调,再重新部署到机器人上。
进入工厂、实验室和家庭之后,这条链路会越来越重;尤其对于端侧运行的模型,现场频繁更新参数很难成为日常使用方式。
Fi0因此把一部分新任务的适配放到了推理阶段。
对于已经掌握的任务,模型可以直接执行;遇到训练覆盖之外的技能,人类可以使用Ego头环先完成一次demonstration。
Fi0将这段示范作为当前任务的skill context,从中理解操作对象、任务顺序、关键接触和目标状态,再结合当前环境与机器人自身的本体条件生成动作,整个过程无需更新模型参数。
这意味着,一项新技能不必先进入训练集、等待下一轮模型更新,便可以直接进入机器人的执行过程。
机器人可以带着已有的通用能力进入场景,在遇到能力范围之外的任务时,再通过上下文补充当前任务所需要的信息。
这也为具身智能提供了另一种能力扩展方式:基础模型持续扩大能够直接完成的任务范围,上下文学习则承接真实场景中不断出现的长尾需求。
随着模型能力提升,需要额外示范的任务会逐渐减少,但这条在使用过程中接收新技能的通道仍然保留。
因此,机器人不需要等到训练阶段覆盖所有可能的任务,才开始进入真实世界。

△面对陌生任务,Fi0可以将一次人类示范作为技能上下文,在推理时理解任务,并结合当前视觉与本体信息,为不同机器人身体生成相适配的动作。
从不同视角学习同一个世界
人类和机器人几乎不会从相同位置观察同一项任务。
人类示范通常来自头部第一视角,机器人则可能通过腕部、机身、头部或外部相机感知环境。
相机位置、视场和遮挡关系一旦改变,同一个物体在像素空间中的表现可能截然不同。
但它们经历的仍然是同一个物理过程。
物体具有相同的状态,抓取与释放遵循相同的接触规律,任务也沿着相同的阶段推进。Fi0需要跨过视角差异,保留这些更稳定的世界信息。
为此,Fi0引入Cross-view World Encoder。
人类第一视角和机器人视角分别经过视觉编码,再通过跨视角预测与表示对齐,学习共享的世界表示,其中包含物体与机器人状态、空间关系、接触事件、任务进程以及未来动态。
这层表示连接了人类经验与机器人执行。模型需要能够从人类第一视角和机器人腕部视角中识别“方块已经被抓住”这一相同的物理状态;同样,机器人在真机执行中获得的滑落、碰撞和接触经验,也可以继续丰富模型对人类示范的理解。
Fi0最终获得的,并不是某一个视角下的视觉特征,而是对物体和交互正在发生什么的共同表示。
只有建立了这层共享世界,人类示范中的经验才有可能跨越相机和机器人本体,真正被模型复用。

△Fi0从人类的第一视角与腕部视角中,学习关于物体、交互、任务进程和未来动态的共享世界表示。
将人类示范转化为技能上下文
一段人类示范提供的,远不止手部轨迹。
当人伸手拿起方块时,视频同时记录了对象选择、接近方式、接触建立、任务阶段变化以及目标如何一步步推进。
手部运动只是这项技能在人类身体上的具体表达,真正具有跨本体价值的,是背后的任务结构和交互逻辑。
Fi0通过Skill Encoder将这些信息编码为一组skill tokens,用来描述操作对象如何变化、任务经过哪些阶段、关键接触何时发生,以及目标状态如何逐步达成。
示范由此直接成为推理时的技能上下文,模型再结合当前环境和机器人本体生成动作。
这种设计对跨本体尤其关键。
人手、刚性机械臂、柔性机械臂和双臂系统拥有不同的结构与动作空间,一段人体轨迹很难直接转换成所有机器人的控制指令;但它所表达的任务意图、接触关系、阶段变化和目标状态,却可以被不同身体共同理解。
Fi0因此希望保留下来的是一项技能“如何成立”的结构,再由当前机器人决定它具体“如何行动”。
同一段人类示范可以由此成为多种机器人的共同任务上下文:它们共享对技能的理解,再按照各自的长度、构型、感知和驱动能力完成执行。
这也重新定义了人类数据在Fi0中的价值。
人类示范不再只用于生成更多机器人训练轨迹,它同时成为一种可以在推理时直接调用的技能载体,让一段真实世界经验有机会被不同机器人反复复用。

△Fi0将人类示范转化为推理时的技能上下文,提取任务结构和交互逻辑,而不是复制与特定身体绑定的运动轨迹。
模型不仅要控制身体,还要理解身体
跨本体模型除了理解任务,还必须知道自己正在控制怎样的身体。
一种常见做法,是给不同机器人分配Robot ID,让模型据此切换对应策略。
它可以区分设备,却很难表达身体之间更深层的结构关系:A01和A02为什么相似,增加一段柔性关节会如何改变可达空间,身体变长之后动作又应该怎样调整。
Fi0因此将机器人表示为结构化的Embodiment Graph,并通过Graph Encoder生成Body Tokens。
机器人的拓扑、节段、尺度、形态、感知方式、驱动能力和动态状态,都可以进入这一本体表示,并与语言、视觉、技能和世界状态一起参与动作生成与未来预测。
这样,Fi0面对的就不再是一组彼此孤立的机器人型号,而是一片具有结构关系的身体空间。
当节段数量增加、身体长度改变或末端执行器更换时,模型可以根据本体条件调整动作。
单臂、双臂、多臂、长臂、短臂和不同节段组合,也由此从离散的设备类别,变成一组可以共同学习的本体。
柔性机器人进一步放大了这个问题。大多数刚性机器人在一次执行中可以将机械结构视为相对稳定的常量,而柔性本体会随着动作、负载和接触持续形变。
身体状态本身成为世界状态的一部分,模型需要同时理解外部环境,以及自身正在发生怎样的变化。
这也解释了擎羽为什么选择柔性机器人作为Fi0的核心研究平台。长度、节段、形态和组合方式都可以连续变化,使模型能够更直接地观察身体参数如何改变可达空间、接触方式和动作结果。
Fi0在这样的连续本体空间中学会区分哪些知识可以跨身体共享、哪些动作必须随身体调整,其真实能力边界也不局限于A01、A02和A03,而是进一步延伸到更广泛的机器人结构。

△Fi0将机器人的形态、感知、驱动方式和动态状态表示为本体上下文,使共享技能能够转化为适合不同身体的动作。
不只是生成动作,还要预测动作的后果
对于柔性本体,同一个目标往往对应多种身体构型和运动路径。
它们都可能在几何上可达,却会产生不同的接触状态、身体形态和任务结果。
一条看似合理的路径,可能碰偏物体,也可能让机器人进入不利于后续操作的构型。
Fi0因此不会直接执行单一动作,而是先根据当前本体生成一组候选方案。
机器人的长度、自由度、实时形态和可达空间共同限定了它此刻能够采取哪些行动;身体一旦变化,候选动作也随之改变。
这些候选动作随后进入World Dynamics Model。
模型从当前世界状态出发,分别向前推演不同动作在未来若干时间步可能带来的变化,包括物体状态、接触关系和任务进程。
预测得到的候选未来,再交给Multi-objective Action-World Assessment(MAWA) 评估。
MAWA综合任务进展、成功概率、物理风险和模型不确定性,对不同未来进行评分,并据此选择下一步动作。
这样,Fi0对物理世界的理解就不再停留在感知层,而是直接进入决策。
一个动作会形成怎样的接触、能否继续推进任务、当前身体执行这条路径存在多大风险,都会影响最终选择。
同一项技能在A01和A03上,也因此可以产生完全不同的动作方案。A01可能倾向于更短、更直接的路径,A03则可以利用更多节段形成不同的身体构型。
World Dynamics Model分别预测这些动作可能带来的未来,MAWA再选择更适合当前任务和当前身体的方案。
至此,Fi0的行动链路完整连接起来:技能上下文定义当前任务,共享世界表示描述物理状态,Body Tokens提供本体条件,World Dynamics Model预测候选动作的未来,MAWA负责评估这些未来并完成最终动作选择。

△Fi0在执行之前,预测并评估候选动作在当前本体条件下可能产生的未来结果。
迈向跨本体基础智能
沿着Fi0的完整链路,任务、世界、身体和行动被组织进同一套模型框架。
语言和demonstration提供任务上下文,共享世界表示描述当前物理状态,本体信息限定机器人如何行动,未来预测则用于判断不同动作可能带来的结果。
更重要的是,这套框架让机器人经验有机会跨越单一身体继续积累。
模型已经获得的任务结构、物体关系、接触规律和世界知识,可以被不同机器人继续调用;新的本体扩展模型接触到的身体条件,真实执行产生的成功、失败、接触和恢复则继续补充模型对动作后果的理解。
面对训练中尚未覆盖的任务,人类示范还可以在推理时直接扩展机器人当下能够处理的技能范围。
柔性本体为这套能力提供了一片连续变化的验证空间。
A01、A02和A03沿长度、节段数量和自由度形成递进关系,模型可以观察身体参数的变化如何进一步改变可达空间、运动路径、接触方式和最终结果,从中学习任务知识与本体条件之间更细致的关系。
这种能力最终并不局限于柔性机器人。
制造、物流、医疗、家庭、太空和极端环境会需要形态差异很大的机器人,而任务与物理世界中的许多知识依然可以在这些身体之间延续。它改变的是每一副身体实现任务的方式。
同一项技能到了A01、A03、双臂系统或其他机器人上,可以拥有完全不同的轨迹、身体构型和接触方式,同时指向相同的任务目标。
这正是Fi0的Foundation Intelligence Across Embodiments所指向的能力:身体可以变化,技能和对世界的理解仍然能够继续积累,并在新的身体上获得新的行动表达。

下一场具身智能竞争,可能发生在身体之间
人形机器人正在尝试为通用智能找到一副足够通用的身体。
擎羽提出的则是另一个问题:当机器人开始拥有越来越多不同的身体,已经获得的智能能否在它们之间继续积累。
这个问题会随着机器人真正进入产业而变得越来越重要。
工厂、仓库、医院、家庭乃至极端环境,对尺度、负载、速度、精度、顺应性和安全的要求天然不同。
机器人身体很可能继续围绕任务分化,而行业真正需要解决的,将不只是“哪一种形态最通用”,还包括如何避免每出现一种新身体,就重新支付一遍数据、训练和适配的成本。
擎羽的技术路线正沿着这个方向展开。
FEAGINE A01、A02和A03首先把柔性身体推进到标准化产品体系;
数据持续引入新的任务和真实世界经验;
Fi0再将任务、世界和本体组织进同一套基础模型,让一项技能能够随着身体变化重新生成行动。
擎羽真正形成的资产,是任务、身体与物理世界之间不断扩大的映射关系。
这也让柔性具身智能的含义最终超出了柔性机械结构本身。
身体可以围绕任务改变长度、节段、形态和组合方式,智能则在这些变化之上持续积累,让同一种技能在不同机器人上获得各自成立的动作表达。
人形路线正在不断扩大一副通用身体能够完成的任务边界。擎羽走的是另一条同样具有野心的路线:让通用智能逐渐摆脱对某一副身体的依赖。
当机器人世界从一种身体走向许多身体,真正具有复利效应的能力,正是让每一副新身体,都能够继承此前对任务和世界的理解。
*本文系量子位获授权刊载,观点仅为原作者所有。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
🌟 点亮星标 🌟