点击下方卡片,关注“具身智能之心”公众号

Xspark AI发布HumanTouch千小时人类触觉数据集
触觉数据的门槛,从来不是采到信号,而是证明信号值得被模型学习。
一只手捏住玻璃杯,摄像头看见了手指的动作。
但杯子到底有没有拿稳?拇指什么时候真正碰到杯壁?掌心有没有参与接触?相同的手部姿态下,接触状态是不是一样?
只看视频,这些问题很难回答。
过去几年,机器人从人类视频和真机演示中学到了大量动作。它可以看见手从哪里移动到哪里,也可以模仿一段看起来流畅的轨迹。但物理操作不是动画复刻。拿起、旋转、按压、捏合,每一步都取决于手与物体之间真实发生的接触。
动作只能告诉机器人“手去了哪里”,触觉才能告诉它“物理世界如何回应”。然而,行业目前的触觉数据远远不够。
近日,Xspark AI正式发布HumanTouch,为弥补触觉数据缺失提供了有效方案。项目构建了一套覆盖触觉、手部运动和视觉的多模态采集系统,并发布1000小时人手全掌触觉数据集。按照团队定位,这是目前全行业最大规模、最高精度的人手全掌触觉数据集。
在1000小时这个显眼的数字背后,Xspark AI追求的不仅是数量,更是质量。采到触觉信号不难,难的是分清每条信号到底来自真实接触,还是手套弯曲自己产生的噪声。
作为可信物理智能企业,Xspark AI正积极推动大规模触觉数据从“采得到”走向“信得过”。
01
让人手成为
大规模触觉数据收集的突破口
视觉和触觉提供的是两种不同的信息。
视觉擅长描述物体外观和空间关系。但手在操作物体时,最关键的接触区域经常会被手掌和手指挡住。透明、反光、柔软或容易变形的物体,也会增加视觉判断的难度。
比如,握住一颗网球,与握住一个柔软的捏捏玩具,二者的手部姿态几乎相同,却对应截然不同的接触状态——一个已经夹紧,另一个可能还没有真正碰到。
这就是为什么机器人即使模仿出正确的动作轨迹,也不一定能稳定完成操作。它学到的只是手部运动的外形,却没有得到动作成功背后的接触信息。
视觉相近的手部动作,可能对应不同接触状态
触觉则直接记录手与物体之间的物理交互,包括接触是否发生、接触位于哪里,以及相对响应如何随时间变化。
因此,大规模的触觉数据对机器学习至关重要。
问题在于,如何收集触觉数据?
最直接的办法,似乎是在机器人上安装触觉传感器,让机器人反复执行任务。
但真机采集受到硬件成本、执行速度、运行安全和动作多样性的共同限制。不同机器人的本体结构不同,传感器原理、安装位置和信号表达也不同。换一种机械手,数据接口和空间映射可能就要重新设计。
更现实的是,机器人当前能稳定完成的接触密集型任务仍然有限。让机器人自己探索复杂操作,不仅慢,还可能损坏物体或设备。
既然真机采集走不通,换一条路。Xspark AI给出的答案是:用人手来采。团队发现,人手则天然适合大规模完成多样化操作。人的手指灵活,掌面覆盖广,能快速适应物体形状和任务变化。如果能在不过度限制自然动作的前提下,把人手触觉可靠记录下来,人类示范就能成为机器人触觉学习的重要数据来源。
HumanTouch聚焦手与物体接触相关的信息。它记录的不是“手用了多少力”,而是手表面不同区域的触觉响应,再结合关节状态和手腕姿态,解释接触何时发生、发生在哪里、相对强度怎样变化。
02
柔性压阻+精准测量,
让触觉信号学会“说真话”
随之而来的问题是,应该把怎样的传感器戴在人手上,才能准确采集数据?
触觉传感器有多种路线。
视觉触觉传感器通常用内部相机观察弹性表面的形变,局部空间分辨率高。但相机、光路、照明和弹性体需要一定体积,很难覆盖整只人手。
磁式触觉传感器可以感知嵌入磁体与磁场传感器之间的位置变化,但性能会受到结构设计和周围电磁环境影响。
电容式方案灵敏度和重复性较好,但大面积柔性实现需要处理电极布线、寄生电容、屏蔽和制造复杂度。

触觉传感的典型转换原理
Xspark AI选择的是墨现科技柔性压组手套。它的优势很直接:薄、软、可穿戴,能够覆盖手指和掌心,也更适合长时间采集。这也是目前唯一能同时满足全手覆盖、佩戴舒适和规模化采集的技术路线。
但这不是一个“既柔软又精准”的轻松答案。恰恰相反,柔性带来了一整套新的测量难题。
柔性手套会随着手指弯曲而拉伸、移动和起皱。压阻材料本身还存在非线性、滞后、漂移和历史依赖。
同样一次输入,在施压和释放阶段可能出现不同响应。持续接触之后,信号也可能需要一段时间才能恢复。
佩戴松紧、手型差异、温度、重复使用和材料老化,都会改变基线。甚至在没有接触物体时,单纯弯曲手指也可能让传感材料产生响应。
也就是说,通道出现数值,不代表外部接触一定发生。
如果直接把所有原始读数当作触觉真值,采集规模越大,混入的数据偏差也越多。用一条固定的“读数到力”标定曲线,同样无法覆盖长时间、自然操作中的所有变化。
HumanTouch的核心突破,在于一套姿态与历史感知的校准模型。如果把给每个传感单元固定一个三维坐标,手套一旦发生拉伸和偏移,这种绑定就会失真。HumanTouch不这么做,它把手套上的传感点分成若干个有意义的区域,比如“食指尖”“掌心”,再判断每个区域的接触状态。系统结合三类信息估计每个区域是否真的发生了接触:当前触觉响应、当前手部姿态与姿态速度、近期触觉历史。
具体而言,姿态特征帮助识别手指弯曲导致的伪响应。时间历史不仅帮助区分接触上升、持续、下降和恢复阶段,还能纳入近期峰值与接触持续时间的影响。
模型最终输出四个量:
接触置信度(这个区域有多大概率真的碰到了东西)
区域内估计响应中心(接触发生在区域的哪个位置)
归一化相对接触幅度(这次接触比上一次强还是弱)
估计不确定性(这个判断有多少可信度)
左图为人戴手套的标定流程,右图为标定效果
这不是保守,而是让数据有价值的前提。知道一个数字能说明什么,同时判别它不能说明什么,比给所有信号套上一个看似直观的“力值”更可靠。
说到底,触觉数据的精度,不只体现在传感器能分辨多细,还体现在系统能否识别伪信号,并诚实标出测量边界。HumanTouch就做到了这一点。
精准测量的技术高光背后,是Xspark AI在触觉感知领域的系统性积累。团队前瞻研发新一代多光谱传感器和原生触觉多模态模型Spark-0——前者可无接触捕捉力态、位姿、温感、材质纹理等多维交互信号,后者则致力于实现触觉与视觉的深度融合。而HumanTouch是这条技术路线在数据层的关键一步。
03
每一次接触,
都有动作和视觉为它定位
知道“传感器是否被激活”远远不够。手套在动,通道位置也在动。一条触觉读数如果不和手部姿态、空间位置对应起来,就没有物理意义。
HumanTouch的突破之处在于,它能同步记录手指关节状态和手腕六自由度姿态。手部模型提供每个触觉区域当前的位置、方向和表面法向,让硬件通道读数可以转化成手部区域活动、近似接触位置和局部几何信息。
手部追踪本身也有取舍。纯视觉追踪会受到手套遮挡、织物厚度、褶皱、自遮挡和反光影响。即使把手套换成接近肤色的外观,也不能完全消除这些问题。HumanTouch使用电磁场手部追踪系统记录手指关节状态,不依赖惯性积分,也不会积累惯性漂移。
另一突破在于触觉辅助手部模型校准。真实手指已经互相接触时,数字手模型可能仍然分离或发生穿插。因此,系统通过多组拇指与其他指尖的自接触事件,调整手指节长度、关节偏移,以及触觉区域和手模型之间的对齐关系。标定之后,数字手才真正“长”在操作者手上。
标定后的,可以清晰看到手部如何接触袋子内部
在此之上,系统的每个采集单元包含双手柔性触觉手套、双手手指关节追踪、双腕六自由度追踪、左右腕部相机、头戴场景相机、设备状态监控、校准程序和多模态同步模块。
其中,腕部相机靠近手与物体,负责记录容易被全局视角遮挡或看不清的局部操作。
头戴相机保留工作空间、物体和任务环境。腕部追踪器补充第一人称视频缺少的深度与空间位姿信息。

HumanTouch多模态采集系统概述
这些数据只有在时间和空间上对齐,才描述的是同一次交互。
系统把数据对齐到统一的60 Hz参考时间轴。位置、触觉响应等欧氏量使用线性插值。旋转采用四元数球面线性插值。离散状态和图像帧匹配最近的有效观测。手部关节按照语义身份匹配,而不是依赖某台设备的通道顺序。

不同传感器对齐到统一的60 Hz参考时间轴
这套设计还兼容不同型号的硬件。每个采集单元维护自己的设备编号、校准记录、存储信息和运行状态。驱动层对外提供左手姿态、右腕姿态、头戴相机视频等统一语义数据流。更换具体设备时,下游处理不需要跟着全部重写。
这套架构解决的不是“多接几个传感器”,而是“怎样让不同设备共同描述同一次物理接触”。
可以说,HumanTouch所采集的,不仅是一副手套,更是完整的交互现场。
04
手套会老化,但数据质量不会
柔性压阻手套会老化。织物基底和导电线路可能疲劳、断裂,部分通道会变得不稳定或完全失效。如果只在项目开始时校准一次,无法支撑长期采集。
此外,任务不同,接触位置、响应范围和重复模式不同。操作员不同,手套贴合程度、手部姿态、接触策略和操作强度也不同。短期变化不能直接归因于材料老化,更不能只看累计录制时长判断设备状态。
规模化触觉采集必须依靠反复、标准化的设备检查,而不是凭使用时间猜手套还能不能用。
为了解决这个问题,HumanTouch为每副手套分配唯一编号,把校准历史、检查结果、采集场次和运行状态串联起来。每天采集前,手套都要接受标准检查,评估通道可用性和响应一致性。未通过检查的手套,其记录不会进入项目使用的高质量子集。
触觉手套的生命周期监测和质量控制
(绿色可用,黄色为警告,红色为失效,因为使用环境、操作员存在很大差异,上图仅为本团队采集过程中的评价结果,不能代表真实手套性能)
设备检查管的是硬件,但硬件合格不代表信号里有可学的信息。还需要回答的更深层的问题是:采到的触觉数据,怎样才算“有价值”?
HumanTouch给出的答案,是看不同任务能否形成可重复、可区分的动态接触模式。
为此,HumanTouch定义了动态接触信噪比DcSNR——它比较一类任务的平均动态接触模式,与相同操作员、任务、设备和规范采集日期下重复试验的组内波动。DcSNR越高,说明一类任务的平均接触模式相对于重复试验波动越突出,这往往意味着任务的接触特征越鲜明、越容易被模型学到。
任务动态接触和DcSNR
结果显示,十类规范任务各选择约1小时合格数据后,DcSNR落在3.61至7.19dB,全部高于0dB。跨操作员稳定性分析包含32位操作员,60分钟内跨操作员DcSNR中位数保持在7.07至8.00dB,时间标准差仅0.19dB,没有持续下降趋势。

触觉信息在跨操作员之间的稳定性
这些结果说明,经过当前筛选与表示方法处理后,任务相关的动态接触模式具有可观察的信息,并能在一小时采集过程中保持总体稳定。
05
最大规模的真正含义,
是把数据生产变成系统工程
如今,具身智能需要解决的问题,不仅是“能不能做”,更是“能不能稳定做”。触觉数据的规模化生产能力和可信度,正在成为决定机器人能不能走进真实场景的关键变量。
触觉数据下一阶段的竞争,不会只看谁的传感器通道更多,也不会只看谁录制的小时数更长。真正决定数据价值的,是采集、校准、同步、质检、表示和验证能否形成闭环。
Xspark AI此次发布的HumanTouch数据规模为1000小时。这是团队定位中最大规模、最高精度的人手全掌触觉数据集。

首批均衡子集约100小时,覆盖10类规范任务,
每类约10小时,共13469个片段
支撑1000小时规模实现的,是一套缜密且完整的技术链路:
用柔性压阻手套覆盖手指和掌心,尽量保留自然手部动作。
同步记录手指关节、双腕位姿、腕部近景和头戴全局视觉。
结合触觉、姿态速度和时间历史,区分接触活动与手套形变。
把不同模态对齐到统一时间轴,拒绝缺失严重的数据。
用设备唯一编号和每日标准检查管理手套全生命周期。
只用有效映射点分析相对动态接触模式,并明确它不是物理载荷。
从这条独特的技术链路,可以窥见Xspark AI推动具身智能在真实世界平稳、安全、可持续落地的野心。目前,Xspark AI 已完成前沿触觉感知、自建多源多模态数据集、顶尖评测体系三大底层基础设施能力的深度打通。依托原生触觉多模态创新模型架构,公司搭建起 “慢脑‑快脑‑脊髓” 可信具身智能中枢系统,旨在构建从数据采集与增广、模型训练、评测验证到真机部署的高效全链路迭代闭环。
过去,人类示范主要告诉机器人手如何移动。HumanTouch希望再补上一层,告诉机器人接触什么时候发生,发生在手的哪里,相对响应如何变化。
当动作、视觉和触觉终于被放到同一条时间线上,机器人模仿的就不再只是一个看起来正确的动作。它开始有机会理解,动作究竟如何作用于真实世界。
项目信息
项目:HumanTouch:A Multimodal System for Scalable Human-Hand Tactile Acquisition
团队:Xspark AI - SparkLAB
项目地址: https://xsparkai.com/sparklab/humantouch/
项目负责人:Chuqiao Lyu
项目核心成员:Chenze Yu, Eric J Chen, Wenxuan Zhu
通讯作者:Wenbo Ding, Tianxing Chen, Qi Xiong