点击下方卡片,关注“具身智能之心”公众号
具身数据采集这件事,不仅要回答“怎么把量做大”,也开始进入“什么样的数据真正能够训练模型”的阶段。
这背后有一个很实际的变化:机器人公司、数据公司、硬件团队都在补采集能力,但真正进入训练集的数据,门槛反而变高了。
第一视角视频可以规模化生产,仿真也能批量生成样本,还有介于真机和ego之间的UMI方案。但麻烦在于,很多数据采回来以后,并不能直接变成模型可用的训练资产。往往是:
1)手被遮挡时,视觉看不到指尖姿态;
2)人到底有没有发力、发了多大力,视频很难判断;
3)普通单目第一视角图像缺少直接的真实尺度信息;
4)无本体采集拿到的人手动作,最后还要跨本体重定向到灵巧手上。
模型学到了很多可能只是“看起来像操作”的信息。面向不同训练任务,数据需要尽可能保留与任务相关的动作、接触、发力和空间尺度等物理信息,并补充必要的语义信息。也要能完成时间对齐、质量清洗、任务切片和结构化组织。否则,数据规模再大,也很难变成模型能力。
所以现在看具身数据,除了采集规模,还要看物理信息是否完整、场景是否足够多样、不同模态能否准确对齐,以及数据最后能不能被处理成可追溯、可训练的数据集。
近日,在世界机器人大会(WRC)前夕,章鱼动力正式发布了 OctoSense 数采产品,想回答的正是这个问题:如何把人的动作、接触、发力和空间信息,尽量完整地转化为机器人可学习的数据。
其中最值得关注的一点,是 SYNEMG 肌电大模型:这是首个面向具身数据采集实现的肌电跨个体零样本泛化模型。
换一个人,不新增个体数据、不做增量训练,模型也能恢复手部姿态和发力状态。简单来说,肌电开始从“一模一人”,走向“一模多人”。
基于这条主线,章鱼动力推出了以鱼眼头环、肌电手环和外骨骼同构数采手套为核心硬件的 OctoSense 数采体系,并组合成 OctoS-Ego、OctoS-EgoBio、OctoS-DexUMI 三套方案。

OctoSense 数采产品:
鱼眼头环、肌电手环和外骨骼同构数采手套
鱼眼头环通过四颗鱼眼相机记录第一视角视觉,并由 AI Native 双目空间大模型恢复真实尺度与三维深度。
肌电手环采集前臂肌电信号,并由 SYNEMG 肌电大模型恢复手部姿态与发力状态。
外骨骼同构数采手套直接采集人手驱动的操作数据,并近乎无损地对齐灵巧手真机。
三个方案采集的视觉、肌电及其他传感器数据,经过物理信息恢复、多模态对齐与切片、质量清洗和语义信息生成,最终可以形成标准化、可追溯的数据集并交付下游使用。
领域稀缺的不只是原始数据,更是可训练数据
具身智能的数据采集规模正在快速增长,但总量增长并不等于模型能力同步增长。
大量原始数据会因为多模态时间戳错位、三维尺度漂移、遮挡下的姿态与力信息缺失、标注不完整等问题,无法进入训练。
这次新品发布的同时,章鱼动力也正式提出具身数据的价值公式:
具身数据价值 = 物理完备度 × 场景多样度 × 采集规模 × 数据质量
按照公式来看的话,这四项不是相加,而是相乘。
只要其中一项接近零,数据的整体价值就会被大幅削弱。因此,具身数据系统必须同时回答:如何构建数据采集路径,以及如何将原始数据处理为可训练的数据资产。
OctoSense:三种采集硬件,三大数采方案
OctoSense 是一套以真实人类操作为中心建立的数采产品体系。鱼眼头环、肌电手环和外骨骼同构数采手套三种硬件各自解决一类关键缺口:

三种硬件通过不同组合,形成三大互补的数采方案:

三大方案并不是互相替代,而是在行为自然度、采集规模、物理模态完整度与真值精度之间提供不同组合;通过不同的组合实现具身数据价值公式的最大化。
01.
SYNEMG 肌电大模型:全球首次实现肌电跨个体零样本泛化
视觉难以获取遮挡下的手部姿态与真实发力。
在真实操作中,手部经常被遮挡;即使动作可见,视觉也很难直接判断操作者是否发力以及发力大小。
肌电信号来自肌肉活动,并先于可见动作出现。它能够为模型补充两类视觉难以获取的信息:遮挡下的手部姿态和手部发力状态。


肌电手环:仅 80g、前臂16通道电极阵列,手部完全裸露、零负担
肌电规模化的真正难题是
“换一个人还能不能用”
不同人的肌肉结构、皮肤状态、发力习惯并不相同。传统肌电模型通常围绕固定用户和固定任务训练,这让肌电长期停留在“小规模实验状态”:如果每增加新个体,都要新增一轮个体数据、训练和校准,那么具身数据采集就很难进行规模化扩展。
SYNEMG 肌电大模型彻底改变了这一状态。
零数据泛化:新个体无需提供新增训练数据、无需微调标定,佩戴即用。
跨个体姿态恢复:同一模型可精准恢复不同个体的手部姿态和发力状态。
极致精度突破:相较于 Meta 开源的 emg2pose 模型,SYNEMG 在零样本跨人姿态重建上误差降低 50%,率先实现了毫米级的绝对定位精度。
端到端规模化:肌电突破不再只是“识别更准”,而是真正从“一模一人”走向“一模千人”,支撑具身数据的高效规模化采集。
SYNEMG肌电大模型实现跨个体零样本泛化
当鱼眼头环第一视角视觉与肌电手环结合,OctoS-EgoBio方案能够在手部被遮挡时继续恢复手部状态,并获得毫米级关节点与 0.1 N 级主动发力,让一次操作不再只有“看见了什么”,还包含“手部如何运动”和“实际用了多大力”。同时因为手部保持自然裸露,具备超过传统真机采集方式 1000 倍效率的规模化潜力。
02.
外骨骼同构数采手套:让人手动作与发力,近乎无损直达灵巧手真机
OctoS-Ego 与 OctoS-EgoBio 适用于规模更大、场景更多样、行为自然度更高的采集需求,例如预训练数据采集;对于后训练等对物理真值要求更高的任务,外骨骼同构数采手套则进一步提升数据精度。
它能够同步记录全掌接触力分布和亚毫米级手部姿态。更关键的是,外骨骼同构数采手套与章鱼动力自研灵巧手采用相同的关节自由度和运动结构,采集端与灵巧手本体采用一体化同构设计。

仿生外骨骼数采手套与自研灵巧手完全同构
人手数据近乎无损映射为灵巧手数据
为什么“同构”比单纯的“高精度”更重要?
通常,除真机遥操采集外,无本体操作数据要被机器人使用,需要经过跨本体重定向(Retargeting):将手部动作转换到关节数量、自由度、运动范围和结构都不尽相同的灵巧手上。这个过程会引入形变与误差,动作可以被“掰”过去,但原始接触关系、力分布和精细关节状态很难完全转换。
这就是 Retargeting Gap,它不是后处理多做几步就能彻底消除的问题,而是由采集端与执行端结构差异带来的先天损失。
外骨骼同构数采手套从源头消除这道鸿沟:人手作为动力驱动数采手套完成操作,当数采手套与灵巧手完全同构,那么采集得到的操作数据就能与灵巧手以近乎 1:1 的关系对齐。
鱼眼头环与外骨骼同构数采手套组合形成的 OctoS-DexUMI 方案,其价值不只是“采得更准”,更是让灵巧操作数据从采集之初就成为灵巧手能够直接使用的数据。
相同自由度|相同运动结构|无需跨本体重定向 | 无本体操作数据直达真机
03.
鱼眼头环:四鱼眼显著降低手部出画,鱼眼双目大模型给出真实三维尺度
具身操作不仅需要动作与发力,还需要知道操作者看见了什么、目标在哪里,以及动作发生在怎样的空间关系中。
单颗普通广角相机的视野有限,双手在大幅移动时容易出画;同时,单目图像缺少尺度信息,难以恢复真实空间尺度与距离。
章鱼这次的头环集成了四颗鱼眼相机:前方两颗、左右两侧各一颗,形成约 330°×150° 的大视场,覆盖双手、操作对象与周围环境。对于走动、转身、伸手取物等移动操作,环视视场能够显著降低手部离开画面的概率。
前视两颗鱼眼组成立体双目系统,基线为 60 mm。借助 AI Native 双目空间大模型,系统能够基于鱼眼图像恢复真实尺度与三维深度,并在保留大视场的同时实现毫米级深度估计精度,为手部、物体和环境之间建立真实三维尺度。四鱼眼解决“看不全”,前视双目解决“量不准”。

Ego 头环:环形布局集成四颗鱼眼相机,前视两颗兼作双目
OctoS-Ego 鱼眼头环 330°×150° 大视场|60 mm 双目基线|毫米级深度精度
04.
SYNData:模型算法与数据工程,让采集数据成为标准化数据集
硬件决定数据采不采得到,SYNData 决定采回来的数据最终能不能用。
SYNData 不只是一个数据处理平台,而是一套由模型算法和数据工程共同支撑的数据系统。它从图像、肌电和其他传感器信号中计算操作的物理状态与语义信息,并进一步完成多模态对齐、切片、清洗和组织,最终形成标准化、可追溯的数据集。

经过 SYNData 处理,OctoSense 三大方案采集的数据不再只是零散的视频和传感器信号,而是物理信息更加完整、多种模态相互对应、质量结果有据可查,并可供下游检索和复用的数据资产。
OctoSense 负责完整记录真实操作,SYNData 负责将多模态采集数据计算、组织为可用的数据集。
采集只是第一步,
关键是把数据处理到模型能用
回到前面的乘式,具身数据价值取决于物理完备度、场景多样度、采集规模和数据质量。任何一项短板明显,最后都会反映到模型训练里。
从这个角度看,SYNEMG 肌电大模型解决的是跨个体泛化和发力信息缺失;外骨骼同构数采手套解决的是跨本体重定向里的信息损耗;四鱼眼头环补的是第一视角的视野和真实尺度;SYNData 则负责把这些模态对齐、清洗和组织起来。
更值得看的地方在这里:它把“人完成了一次操作”拆成更完整的训练信号:看到了什么,手怎么动,什么时候接触,实际用了多大力,以及这些信息如何进入下游数据集。
对具身智能来说,数据采集的下一步会越来越工程化。采集端、执行端和数据处理端能不能接起来,决定了真实人类操作能否成为稳定、可复用的训练来源。
