点击下方卡片,关注【Xbotics具身智能实验室】公众号
你想要的这里都有~~
作者/周恒
关于我
我目前主要关注 具身智能、机器人学习与灵巧操作,尤其关心一个很具体的问题:机器人如果想真正拥有接近人手的灵巧性,究竟需要什么样的数据、这些数据应该如何采集,以及如何把"人的动作"转化成"机器人能够学习和执行的动作"。
这篇综述就是我围绕 无本体灵巧手数据采集 做的一次阶段性整理。我的视角更接近研究者、工程师与实践者的交叉位置:一边阅读论文和梳理技术路线,一边关注这些方案在真实机器人系统里到底能不能落地。
一、灵巧操作数据的概念框架与评价体系
1.1 灵巧操作数据的语义维度
机器人操作数据可以抽象为"任务条件 + Observation → Action"的时序样本。相较于一般机械臂或二指夹爪数据,灵巧操作数据最关键的增量不是增加一种新的外部观测,而是必须进一步记录手部内部的多指运动信息。也就是说,除手臂、手腕的整体运动外,还需要记录末端执行器内部各手指相对于手掌的关节运动、指尖运动以及多指协同构型变化。
| | | |
|---|
| | | |
| | | |
| | | |
| | | |
| | | |
| | | 决定手如何形成抓型、调节接触并完成精细操作;这是灵巧操作数据区别于一般操作数据的核心。 |
1.2 各类数据语义的计算机表示形式
上一节从语义上将灵巧操作数据划分为任务条件、Observation 和 Action 三个空间。 本节进一步说明,这些现实语义在计算机中通常采用什么数据结构表示。 同一种语义可以具有多种表示形式: 例如,环境既可以表示为 RGB 图像或 RGB-D 图像,也可以进一步转换为三维彩色点云; 手部运动既可以表示为各关节的状态,也可以表示为相对于手腕坐标系的指尖或手部关键点位姿。
| | | |
|---|
| | | |
| | RGB 图像、深度图、RGB-D 图像、三维彩色点云 | RGB 记录外观信息;深度记录空间距离;RGB-D 同时保留颜色与深度;彩色点云进一步将环境表示为三维空间中的带颜色点集。 |
| | | |
| | 机械臂关节角、关节速度、关节力矩;末端、手腕或手掌的六自由度位姿 | |
| | 手指关节角、关节速度;手部关键点或骨架;指尖相对于手掌坐标系的位置。 | |
| | 机械臂关节目标、关节增量;末端、手腕或手掌的目标位姿、位姿增量 | |
| | 各手指的目标关节角、关节角增量、关节速度或关节力矩 | 动作直接对应机器人灵巧手的驱动自由度,便于机器人执行,但依赖具体灵巧手的自由度与关节结构。 |
| | | 更接近手部运动本身,跨本体通用性更强,但通常需要通过逆运动学或动作重定向转换为机器人关节指令。 |
本体状态与 Action 的关系
本体状态与 Action 经常采用相似的数据形式,但二者的语义不同:
- Action描述机器人下一步应到达的目标构型、应产生的状态变化,或应执行的控制命令。
例如,当前手腕六自由度位姿和手指关节角可以作为本体状态,而下一时刻的目标手腕位姿和目标手指关节角则可以作为 Action。因此,一些数据集会直接将未来时刻的本体状态作为当前时刻的动作标签。
灵巧手内部运动的两种核心表示
关节空间表示
直接记录或求解各手指关节的角度、速度、力矩或目标位置。其优点是可以直接用于控制机器人灵巧手;局限是高度依赖具体机器人的自由度数量和关节结构。
任务空间表示
记录指尖、手指关键点或完整手部骨架相对于手腕或手掌坐标系的位置和姿态。其优点是更接近人手运动本身,并具有较好的跨本体通用性;局限是不能直接驱动机器人,通常需要经过逆运动学或动作重定向,转换为机器人关节空间表示。
文献校验:BridgeData V2、DROID 与 Open X-Embodiment 展示了机器人操作数据中视觉、本体状态和动作的常见表示;DexCap 与 DexWild 则进一步体现了手腕整体运动、手指内部运动,以及任务空间表示向机器人关节空间表示的转换关系。
1.3 灵巧操作数据的质量评价维度
灵巧操作数据的质量可以从四个层级进行判断:首先看底层信号是否可信,其次看单条轨迹是否有效,再看整个数据集是否具有足够的覆盖,最终看这些数据能否真正转化为模型能力。
| | | |
|---|
| | 视觉、位姿、关节状态和触觉等数据是否接近真实值,是否存在缺失,并且不同模态是否在时间和空间上正确对齐。 | |
| | 一条轨迹是否完整完成任务,动作是否连续、物理可行,并且能够保留多指协调、接触调节等灵巧操作信息。 | |
| | 数据是否覆盖足够多的任务、物体、场景、操作者和操作方式,同时避免样本分布严重失衡或大量重复。 | |
1.4 数据采集范式的评价维度
评价一种灵巧操作数据采集范式,核心不是只看单次采集精度,而是综合判断它能采到哪些信息、数据是否可靠、采集是否高效、能否规模化,以及所得数据是否容易转化为训练样本。
| | | |
|---|
| | 采集结果的精度、连续性、抗遮挡能力、时空同步程度,以及在不同操作者和环境下的稳定性。 | |
| | 单位时间可获得的有效轨迹数量,以及硬件、机器人、场地和人工成本。 | |
| | 系统是否便携、易标定、易佩戴,是否依赖固定场地或机器人,以及能否由多人并行采集。 | 这套方案能否从实验室小规模采集扩展到真实世界大规模采集。 |
| | 是否需要复杂的清洗、坐标对齐、动作重定向和人工标注;最终数据能否直接映射到目标机器人的 Observation—Action 空间。 | |
二、灵巧操作数据主要采集范式概览
| | | | | | | |
|---|
| 1. 任务与目标:(靠后期标注)2. 环境与接触:视觉;接触依传感器3. 本体感知:手臂/手腕;手指依平台4. Action:整体运动;手指运动学语义 | 1. 任务:自然语言指令、任务 ID、目标图像或目标状态2. 环境与接触:RGB、深度图、RGB-D(彩色 + 深度)、由深度生成的 3D 点云;可选触觉阵列、压力、滑移、六维力/力矩3. 本体:机械臂/手指关节角、速度、力矩;末端、手腕或手掌六自由度位姿4. Action:关节目标/增量;末端或手腕位姿目标/增量;夹爪宽度或手指目标关节/指尖位置 | 硬件标定与时空同步失败过滤、轨迹切分坐标与 Action 归一化必要时去抖和平滑 | 控制标签精确接触过程真实天然对齐目标机器人适合高精度任务 | 真实接触动力学Observation—Action 对齐轨迹可复现受操作者、延迟与标定影响 | 需占用真实机器人依赖人工复位GELLO 降低操作门槛仍以串行人工采集为主 | 硬件、场地与维护成本高采集速度受人工复位限制强绑定具体本体跨平台复用与并行困难 |
| 1. 任务与目标:(靠后期标注)2. 环境与接触:真实视觉;触觉(可选,多为指尖触觉)3. 本体感知:人手/代理状态;无目标机器人反馈4. Action:末端执行器运动学语义;手指运动学语义 | 1. 任务:自然语言指令、任务标签、目标图像或目标状态2. 环境与接触:第一视角 RGB、深度图、RGB-D;由 RGB-D 或 SLAM 重建的 3D 点云;接触通常表示为视觉接触事件,可选压力/触觉信号3. 本体:相机、手腕或代理末端 SE(3) 位姿;手部 2D/3D 关键点、骨架、手套关节角;通常无机器人关节反馈4. Action:手腕/手掌 SE(3) 轨迹与相对位姿增量;指尖轨迹、手指关键点或关节轨迹; | 标定与 SLAM / 手部追踪轨迹重建、坐标对齐相对 Action 构造重定向、IK 与可执行性筛选 | 与机器人本体解耦可进入真实野外场景易并行扩展保留自然、动态和双手示范 | 场景真实且多样示范自然受遮挡、SLAM 漂移影响存在标定与重定向误差 | 不占用目标机器人设备便携易多人并行后处理与转化成本较高 | Embodiment gap 明显Action 不可直接执行缺少目标机器人力觉与本体状态代理夹爪难覆盖多指协同 |
| 1. 任务与目标:2. 环境与接触:视觉、物体状态与接触真值3. 本体感知:完整机器人状态4. Action:整体运动学语义与手部内部运动学语义 | 1. 任务:任务 ID、自然语言指令、目标状态、成功条件2. 环境与接触:渲染 RGB、深度图、RGB-D、语义/实例分割图、3D 点云;物体六自由度位姿;接触点、法向、接触力或模拟触觉图3. 本体:机械臂与灵巧手关节角、速度、力矩;手腕/手掌位姿;完整模拟器状态4. Action:关节位置、速度或力矩命令;末端/手腕目标位姿;各手指目标关节、指尖位置或力矩 | 示范分段与时空变换轨迹合成、重放碰撞、可达性与成功筛选域随机化与真机校准 | 规模扩展快标签丰富可安全覆盖失败与稀有状态便于控制变量与消融实验 | 标签完整、严格同步状态可精确读取真实性依赖建模质量存在仿真偏差 | 前期建模成本较高生成边际成本低可大规模并行DexMimicGen 可由少量示范扩增 | Sim-to-Real gap复杂接触与摩擦难建模柔性物体仿真困难多样性受示范、资产与规则限制 |
| 1. 任务与目标:来自语言或视频标注2. 环境与接触:环境视觉3. 本体感知:人手/手腕状态估计;无机器人本体状态4. Action:无直接运动学语义 | 1. 任务:字幕、语言叙述、任务标签、目标帧或动作片段标签2. 环境与接触:RGB 视频与音频3. 本体:由视频估计的 2D/3D 手部关键点、骨架、手腕位姿;通常没有实测机器人关节状态4. Action:手腕位姿变化、指尖/关键点变化等伪 Action | 筛选、去重、脱敏视频切分与语言标注手物检测、姿态估计、三维重建伪 Action 与可执行性过滤 | 互联网级规模任务语义丰富覆盖真实世界长尾行为提供泛化表征先验 | 场景、任务与操作者多样标签稀疏、噪声较大存在遮挡与视角变化轨迹通常不满足机器人约束 | 公共视频边际成本最低数据规模上限最高专门采集与标注仍有成本需处理隐私与版权合规 | Action / 本体差距最大缺深度、力、接触与关节标签数据异质性强隐私与版权问题突出 |
三、无本体范式下的灵巧手数据采集方案
本部分仅讨论面向多指灵巧手操作的数据采集方案,不包含以传统二指夹爪为目标末端的 UMI 类代理末端方案。各类方案统一从系统构型、传感器配置、语义覆盖、数据表示、数据处理流程、主要优势与局限等维度展开。
3.0 无本体灵巧手数据采集的共性语义与分析主线
无本体灵巧手数据采集需要从人类操作过程中获得四类信息:视觉语义、触觉语义、手指运动学语义,以及手腕或手掌整体运动学语义。其中,触觉属于可选信息;视觉和手腕整体运动学在不同方案中的采集方式大体相近,而手指运动学的测量方式差异最大,是后续各类方案比较的核心。
3.0.1 视觉语义与触觉语义
视觉语义通常由安装在头部、胸前、手腕或手掌附近的 RGB 或 RGB-D 相机采集,用于记录操作环境、目标物体及手物交互过程。RGB-D 相机还可以进一步生成深度图或三维点云。不同系统的主要差别是相机安装位置与视角,而不是视觉信息的基本采集原理。
触觉语义并非所有方案都具备。需要触觉时,通常在指尖、指腹或手掌布置压力、力觉或视觉触觉传感器,用于记录接触位置、压力和表面形变。后文仅在具体方案确实包含触觉硬件时进行说明。
3.0.2 手腕整体运动学语义
手腕或手掌整体运动学描述整只手在环境坐标系中的六自由度运动,经过坐标对齐与动作重定向后,对应机器人末端执行器的目标位姿或位姿增量。现有方案主要通过以下几种方式获取:
| | | | | | | |
|---|
| | Intel RealSense T265/T261;DexCap、DexViTac | | | | | |
| | iPhone 15 Pro Max + ARKit/Record3D;DexUMI | | | 当 AR 会话(Session)开始时,设备所在的位置被定义为原点 (0,0,0)。(固定) | | |
| | RealSense D435/D435i/L515 + ArUco(标记物) | | | | ArUco/AprilTag 检测可在线,也可录制后离线处理 | |
| | | | | | | |
| | Vive Tracker 3.0 + SteamVR | | | 系统刚开始启动时 tracker 的初始坐标(固定) | | |
| | Apple Vision Pro, visionpro 内部的 ARkit 软件 | | | | 手部跟踪和设备 SLAM 通常集成在设备/SDK 中,采集时在线 | 是,通过"设备世界位姿 × 手腕相对设备位姿"得到 |
| | | | | | | |
| | 普通 RGB 相机、手机、头戴/腕戴相机;EgoScale 类流程 | | 2D/相对 3D 手部关键点、相机轨迹;通过 SfM/SLAM 和尺度标定估计腕部运动 | | 通常为离线后处理;可使用现成手部姿态估计和 SLAM 模块 | |
3.1 数据手套式采集方案
| | | | | |
|---|
| MANUS Metagloves Pro;价格询价制 | 电磁场 EMF 指尖追踪+手背 IMU。五个指尖分别安装六自由度 EMF 传感器,测量相对于手背磁场源的位置和姿态;采样率 120 Hz。 | 优点:1. 直接测量指尖六自由度位置和旋转2. 无视觉遮挡3. 无惯性积分漂移缺点:1. 金属、马达等可能扰动磁场2. 指关节角不是直接测得,而是由指尖位姿和人体手模型反求3. 手腕只有旋转,没有全局位置;价格和 SDK 授权成本较高 | | 1. 五个传感器相对手背的 Pose2. 21 节点标准人体手骨架3. 关节角或 ergonomics values4. 重定向后的目标骨架。原始传感器流需要相应软件许可证 | 个体手型标定 → 建立手指长度和传感器到指尖的偏移 → EMF 数据校正 → MANUS Hand Solver 反求各关节角 → 生成 21 节点骨架 → 时间同步与异常帧过滤 → 加入外部 Tracker 获得手腕全局位姿 → 通过 IK 或动作重定向映射到机器人手 |
| Rokoko Smartgloves II;约 1,995 美元/双,Device SDK 另行询价 | IMU+局部 EMF 传感器融合。每只手套 7 个传感节点;IMU 提供高频旋转,手背局部磁场发射器和 EMF 接收器估计手指相对位置;Smartgloves II 还通过磁力计校正航向。 | 优点:1. 便携、无线、无需摄像机视线2. 同时具有 IMU 响应速度和 EMF 相对定位3. 适合户外或非固定场地缺点:1. 磁性金属和电机可能干扰 EMF2. 无法采集腕部位姿 | 每个节点的加速度计、陀螺仪和磁力计读数;EMF 测量 | 四元数方向、EMF 传感器三维位置向量、原始 IMU 读数 | 姿态校准 → IMU 偏置和磁场环境检查 → 设备端 IMU/EMF 融合 → 传感节点 Pose → 人体手骨架求解 → 平滑和丢帧处理 → 与 RGB/RGB-D 相机时间同步 → 使用 Coil Pro 或外部定位补充手腕六自由度 → 根据机器人手结构进行 IK 或指尖位置匹配 (Rokoko) |
| StretchSense Studio / Pro Fidelity;Studio 约 795 美元/双,Pro Fidelity 约 5,995 美元/双 | 电容式弹性伸缩传感器。传感器随手指弯曲或横向张开而形变,电容随形变量变化。 | 优点:1. 轻、柔软、可清洗2. 没有摄像机遮挡3. 不依赖地磁,因此没有 IMU 航向漂移和磁力计环境干扰缺点:1. 电容值与关节角之间不是固定线性关系2. 受手套松紧、尺寸、穿戴位置和材料迟滞影响3. 通常不能独立输出手腕全局位置4. 算法高度依赖厂商标定和机器学习模型 | 各弹性传感器的原始电容值。但公开 Open SDK 主要提供厂商计算后的数据,底层电容是否可直接访问取决于许可证和产品版本。 | 各手指关节旋转,或相对于手腕坐标系的关节点/指尖位置;通过 OSC 实时输出 | 选择合适手套尺寸 → 开合手及规定手势标定 → 每个电容通道做零点、量程和个体归一化 → 迟滞与噪声过滤 → Hand Engine 或机器学习模型将电容向量映射为人体关节角 → 正运动学生成指尖位置 → 外部 Tracker 补充手腕六自由度 → 坐标统一和机器人动作重定向 (StretchSense) |
| 电阻式弯曲传感器。手套沿手指关节布置 18 或 22 个柔性电阻传感器,弯曲引起电阻变化,再通过 12 位 ADC 采样。 | 优点:1. 方案成熟2. 通道与特定关节对应关系清晰3. 输出频率最高约 120 Hz缺点:1. 电阻弯曲传感器存在迟滞、温漂和穿戴重复性问题2. 官方给出的跨次穿戴重复性约 3°3. 只测弯曲相关量,三维手腕位置仍需要额外 Tracker | 18 或 22 路经 12 位 ADC 数字化的弯曲传感器值;部分版本带掌弓传感器 | | 对每个使用者分别采集伸直和最大弯曲姿态 → 为每个传感通道估计偏置、增益或线性映射 → 电阻值转换为关节角 → 低通滤波和异常值处理 → 通过人体手模型补全未直接测量的自由度 → 与外部手腕 Tracker 同步 → 转换为机器人手关节范围 (CyberGlove Systems LLC) |
3.2 可穿戴外骨骼式采集方案
手部外骨骼通过读取机械结构随人手运动产生的关节角变化,恢复人体手部运动学信息。工程上最常见的三条直接测角路线是电阻式旋转位置传感、磁绝对编码和光学编码。需要注意,外骨骼单独输出的关节数据通常只构成手指 Action;要用于 VLA 或视觉模仿学习,还需要与 RGB/RGB-D、手腕位姿和任务语言进行时间同步与动作空间统一。
| | | | | |
|---|
| DexUMI:在各主动关节安装 Alps RDC506018A 旋转电阻式位置传感器。 | 应用层通常读取按固定控制通道排列的 hand_action、关节位置或电机目标值浮点向量。每一维描述目标机器人手的一个可控运动自由度,例如食指屈曲、拇指屈曲或手指侧摆,而不一定是人体某个解剖关节的角度。示例:若第 3 个通道配置为食指屈曲,hand_action[2] = 0.65 表示食指屈曲通道当前目标位置为 0.65;该数值可能是弧度、电机位置或归一化值,需要结合该机器人手的接口定义解释。 | 1. 结构简单、体积小、价格低2. 可直接读取绝对位置,断电后无需重新累计脉冲 | 1. 机械接触会产生磨损和迟滞2. 受供电电压、温漂和 ADC 噪声影响3. 外骨骼角到机器人电机值可能呈非线性,不能直接等同于机器人 Action | 读取 SDK 输出的关节位置与时间戳 → 统一关节名称、顺序、单位、零位和正负方向 → 滤波并剔除断连、越界和跳变帧 → 映射为目标机器人关节或指尖 Action → 与 RGB、手腕位姿和触觉按时间戳同步 → 动作归一化、episode 切分和任务语言标注 |
| DEXOP:在被动机器人手每个转动关节安装 iC-MH16 12 位磁角度编码器。 | 应用层读取的是被动机器人手各机械关节相对于标定零位的实时转角,通常按关节顺序组成浮点数组,并附带时间戳。每一维对应一个明确的机械关节,例如拇指屈曲、食指根部屈曲或食指中间关节屈曲。示例:若关节表规定第 3 维为食指根部屈曲关节,读取值 0.82 rad 表示该关节相对零位弯曲约 47°。由于人手通过外骨骼驱动被动手,这一数值同步反映操作者对应手指的运动,但它描述的是被动机器人手关节,而不是人体解剖关节。 | 1. 非接触测量、无滑动触点磨损2. 体积小,可直接读取绝对关节角3. 无需增量累计和每次开机寻零,适合紧凑型多关节结构 | 1. 精度依赖磁铁与芯片的同轴度、间距和装配一致性2. 邻近电机、磁铁或铁磁材料可能造成干扰3. 编码器分辨率不等于最终人体/机器人关节精度,机械间隙和佩戴滑移仍会引入误差 | 读取接口输出的关节角、关节编号和时间戳 → 统一关节顺序、单位、零位和正负方向 → 滤波并检查掉帧、越界和异常跳变 → 按外骨骼—机器人对应关系映射为机器人关节或指尖 Action → 与视觉、触觉和手腕位姿同步 → 动作限位与归一化 → episode 切分并配置任务语言 |
| HEXORR:电机端和机构轴端配置数字光学编码器,用于读取驱动轴和外骨骼机构角度。 | 应用层读取的是外骨骼驱动轴或连杆机构相对于初始姿态的位置,部分接口同时提供速度、力矩和状态。一个数值可能描述整套四指机构或拇指机构的运动,而不是某个独立人体关节。示例:finger_linkage_angle = 55° 表示四指连杆机构相对初始姿态转动了 55°;它不能直接解释为"食指 MCP 关节弯曲了 55°"。若需要人体各关节角或机器人独立关节 Action,还需结合机构运动学模型进一步拆解。 | 1. 分辨率高、线性好、噪声低、响应快2. 不受磁场干扰,适合对角度与速度估计要求较高的刚性外骨骼 | 1. 增量式编码器断电后需重新归零,并可能因漏计脉冲产生累计误差2. 对安装同心度、光栅清洁和机械空间要求较高3. 电机端读数仍会受到减速器齿隙、拉索松弛和结构变形影响 | 读取控制器或 SDK 输出的关节位置、速度和时间戳 → 确认接口输出对应电机轴还是外骨骼机构轴 → 必要时使用厂家或项目封装转换为外骨骼关节角 → 统一关节顺序、单位、零位和方向 → 滤波与异常帧检查 → 映射为机器人关节或指尖 Action → 与视觉和手腕位姿同步 → 动作归一化、episode 切分和语言标注 |
四、结语:无本体灵巧手数据采集的价值与边界
4.1 无本体灵巧手数据采集的核心价值
无本体灵巧手数据采集的核心意义,是将灵巧操作数据的生产过程从目标机器人本体中解耦出来。相较于依赖真实机器人逐条遥操作,无本体方案允许操作者直接使用人手在真实环境中完成任务,再通过数据手套、手部外骨骼、第一视角相机、视觉惯性追踪或手部姿态估计等方式,记录环境视觉、手腕整体运动以及手指内部运动。
这种解耦降低了对真实机器人、固定场地和人工复位流程的依赖,使多人、跨地点并行采集成为可能,从而提高有效轨迹的生产效率,并扩大任务、物体、操作者和场景的覆盖范围。更重要的是,人手能够自然完成快速双手协作、连续接触调整、工具使用、柔性物体操作和复杂指内操作。因此,在动作复杂度、行为自然性和长尾任务覆盖方面,无本体采集具有较高的数据上限,可以补充真机遥操作难以稳定获取的高难度灵巧操作示范。
从机器人学习角度看,无本体数据的价值不仅在于增加轨迹数量,还在于提供丰富的视觉—动作关联、手物交互模式和人类操作先验,为模型学习"在什么环境状态下应采取何种操作"提供更广泛的经验基础。
4.2 当前技术局限与适用边界
无本体数据并不等同于可以直接执行的机器人数据。人手与机器人灵巧手在自由度数量、关节结构、尺寸比例、运动范围和驱动方式上存在明显差异。即使系统能够准确恢复人体手腕和手指运动,也仍需经过坐标对齐、逆运动学或动作重定向,才能转化为目标机器人可执行的 Action。该过程可能产生关节越界、自碰撞、不可达、指尖对应关系错误以及动作失真等问题。
其次,多数无本体方案主要记录视觉和运动学信息,对接触力、摩擦、滑移、关节力矩以及机器人自身反馈的覆盖有限。对于插接、旋拧、稳定抓持、柔性物体操作等高度依赖接触状态的任务,仅有运动轨迹通常不足以完整描述成功操作。人体能够依靠触觉和顺应性完成的动作,机器人在相同运动轨迹下未必能够复现。
此外,视觉遮挡、SLAM 漂移、穿戴滑移、传感器迟滞、跨设备时间同步误差和个体手型差异都会影响底层信号质量。因此,无本体采集更适合提供大规模运动学示范和任务先验,而不能完全替代真实机器人上的动力学验证、接触校正和闭环控制数据。
4.3 无本体数据与真机数据的协同关系
无本体数据与真机数据不应被视为相互替代的两条路线,而应承担不同的数据职能。无本体数据具有成本低、扩展快、场景丰富和动作复杂度高等特点,更适合用于模型的预训练与中训练,帮助模型学习视觉表征、任务语义、手物交互模式以及跨任务的操作先验。
真机数据虽然采集成本较高,但包含目标机器人真实的本体状态、控制命令、接触动力学和执行结果,因此更适合用于动作空间对齐、机器人动力学适配、接触过程校正、策略微调和闭环验证。对于高精度或高接触敏感任务,真机数据仍是判断动作是否真正可执行的关键依据。
更合理的数据体系是:先利用大规模无本体人类数据扩大任务与技能覆盖,再通过少量高质量真机数据完成目标本体对齐,最后结合真机执行结果进行筛选、纠错和持续迭代。这样可以同时利用人类数据的规模优势与机器人数据的物理真实性,降低对大规模真机遥操作数据的单一依赖。
4.4 总体判断与发展方向
总体而言,无本体采集并不是对真机遥操作的简单替代,而是灵巧操作数据生产体系中的扩展层。真机遥操作的优势是控制标签准确、Observation—Action 天然对齐且接触过程真实,但其动作能力受到遥操作设备、控制延迟、操作者负担和目标机器人自身能力的限制。无本体采集则能够直接利用人手完成更自然、更快速和更复杂的操作,因此在任务规模、场景覆盖与动作复杂度方面具有更高的潜在上限,但需要承担更大的数据转换与物理对齐成本。
未来的发展重点将集中在四个方向: 第一,采集硬件进一步轻量化、低成本化和抗遮挡化,使大规模多人并行采集更加可行; 第二,将视觉、手部运动、触觉、压力和力觉纳入统一的多模态同步系统,提高对接触过程的描述能力; 第三,建立以手腕位姿、指尖轨迹、手部关键点或统一潜在动作空间为核心的跨本体表示,减少不同人手、灵巧手和采集设备之间的转换成本; 第四,形成"人类数据预训练—跨本体动作对齐—少量真机数据微调—真实执行反馈校正"的联合训练流程。
因此,评价一种无本体采集方案时,不能只看其传感器精度或单次轨迹质量,而应综合判断它能否在数据规模、操作复杂度、跨场景覆盖和机器人可转化性之间取得平衡。最终决定数据价值的,不是是否使用了目标机器人进行采集,而是这些数据能否经过可靠的表示、对齐和验证,转化为机器人可以学习并稳定执行的操作能力。
引用文献与论文 ID
以下统一以 arXiv ID 作为论文 ID,便于检索与引用;已正式期刊发表的论文补充 DOI。
- An Immersive Virtual Reality Bimanual Telerobotic System With Haptic Feedback — arXiv:2501.00822;DOI: 10.1049/csy2.70033
- ARCTIC: A Dataset for Dexterous Bimanual Hand-Object Manipulation — arXiv:2204.13662
- DexCap: Scalable and Portable Mocap Data Collection System for Dexterous Manipulation — arXiv:2403.07788
- DexUMI: Using Human Hand as the Universal Manipulation Interface for Dexterous Manipulation — arXiv:2505.21864
- DexWild: Dexterous Human Interactions for In-the-Wild Robot Policies — arXiv:2505.07813
- EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video — arXiv:2505.11709
- EgoMimic: Scaling Imitation Learning via Egocentric Video — arXiv:2410.24221
- EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data — arXiv:2602.16710
- UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human Videos — arXiv:2603.22264
-END-
Ask Me Anything|提问箱
对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。
怎么问:在评论区留言,或私信公众号
我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。
提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。
一起把问题变成知识,推动社区进步 🚀
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。