点击下方卡片,关注“具身智能之心”公众号
刚从北京回来,然后足足走了10w步,日均3w步真的累坏了。
这届WRC逛下来,我们有一个很强烈的感受:
机器人本体已经挤到了聚光灯下,甚至说很卷:打拳的、cosplay啸天犬的、卖饮料的还有售卖柜上工作的比比皆是。
具身花园的那个机器人小姐姐,也承担了很多迎宾任务,也是颜值担当。

但最想看的那个大脑却依然藏在后台,或者说没有直观表现出来。
一直相信大脑能力的释放即将到来,但更多是在国外几家的技术博客上。二指夹爪的很多动作已经不是特别性感了,行业关注的是更加灵巧的设备来完成各类任务。
所以,我们去看了手和触觉设备,还有能给手做数采的产品。
最终收敛到几类产品上:触觉手套、肌电手环、当然还有灵巧手本身。现场我们也体验了很多产品,调研了信号怎么采集的、效率、价格、寿命等,这里先给大家分享一些结论:
1)肌电手环现在价格在几千元了,能采集力和手部姿态,误差10%以内(基本能满足当下具身的要求);
2)触觉手套,依然是高精度采集的首选,这一点肌电手环还替换不了;
3)具身想要scaling,只靠增加机器人数量和采集视频,可能还不够。人类操作过程中那些看不见的意图、发力和接触信息,也需要被记录下来;
4)灵巧手相关数据,正在开始走向scaling,目前还是验证阶段;
下面,我们会深入讲,什么是肌电手环?为什么可以work?它和触觉手套是什么关系?这些信号又怎样进入灵巧手和基座模型里的?
这篇文章的开头,就从这只手环开始聊起。
01.
肌电是什么?为具身带来了什么?
我们先看看肌电和肌电手环是什么?
下面是去展台现场体验的,和智能手表差不多。

这背面的金属环,每一排代表一个通道,这是16通道数据(不同产品可能会通道数不一样)。
不过这款产品没有让试戴,就去体验另外一款了。

上面2个框,一个是预测的手势,还有一个是我自己的手势,手的姿态都能通过肌电信号还原出来。
下面是具体的通道数据,16通道(这个数据就可以和视觉这类数据一起做多模态学习)。
如果细看的话,可以发现,右下角曲线开始波动了,这是因为我有个手指按在了桌上,开始发力了,检测出来了。

看到这里,其实已经明确了,带一个手环,可以读出肌电信号,然后输出手的姿态,还有发力的情况。
而且是,一个手环就够了。
现场和多家技术人员沟通了很多,发现目前市面上已经开售的手环产品,基本做到了5000多元范围,用1年没太大问题。
手环输出的力,误差做到了10%以内。
但有个问题,现场直接反馈出来的,每个人佩戴手环后,误差大小会出现不一样的波动。这个是由于肌电模型的泛化性不足和佩戴方式导致的。
肌电方案的优势是什么,上面其实已经表述的挺清晰了。
带着这个手环,不用担心视觉拍不到某个或多个手指,直接读的是人类的生物信号,然后转换出来。
还有就是,可以手部姿态、每个手指发力和接触状态scaling。
缺点是什么?
精准度不够,类比Ego数据就清晰了:ego数据可以很大规模化,但质量本身没有遥操作的高,最后一公里还得通过真机数据做后训练。
这就引出了触觉手套。
02.
和触觉手套有什么区别?
如果说肌电手环更接近“读懂人想怎么动”,触觉手套解决的则是“准确记录人究竟怎么动”。

这个是我们现场拍的,几乎1:1复刻人手。但,我的手比较大,带不上去hhh,不过现场一位同事可以轻松穿戴。
上面把肌电手环和触觉采集手套类比为ego和真机遥操数据,就是这个意思。黑色的block是触觉传感单元,因为静止,现在市面上已经开售的产品,价格比较贵,在万元和数万元不等。
这里,两类差异就很明确了。
1)肌电手环主要面向规模。
这种设备更轻、穿戴限制更少,采集者可以在相对自然的状态下完成任务。只要跨用户泛化和长期稳定性能够成立,它就有机会覆盖更多人、更长时间和更多真实场景,几乎不影响采集者的正常工作和生活。
2)触觉手套更面向高精度和保真度。
触觉采集手套能够记录更加精细的关节运动和接触过程,适合采集对手指协调、力控制和操作精度要求较高的任务。
你看,具身数据长期面临的难题,也就在规模和精度之间。
只追求规模,数据里可能缺少机器人执行任务所需的细粒度信息;只追求精度,设备成本、穿戴负担和标定流程又会限制数据量。
因此,更合理的技术关系和商业逻辑是分层采集。
对触觉和灵巧操作来说,也是这样。
03.
WRC现场的一些玩家
然后,看看现场的玩家,围绕灵巧操作任务设计的,这届WRC大致可以看到几种技术选择。
1)仅做肌电手环的;
2)仅做触觉手套的;
3)肌电手环+触觉采集手套;
4)机电手环 + 触觉采集手套 + 灵巧手 + 基座模型都做的;
其中,2)的技术逻辑是:做五指的采集手套,可以映射到客户的灵巧手、二指或者三指夹爪上(从高维往低维映射)。这个了解下来,他们内部给自己的手或者夹爪适配的误差依然有。
第四个选择,则是最重的,因为做的是整个灵巧任务了。
目前,我们了解下来的是章鱼动力是为数不多的几家之一。
就是都大龙创办的那个具身公司,地平线的第6号员工。
现场,我们看到了他们的系列产品:SYNWorld具身世界基础模型、OctoH-Hand高自由度仿生灵巧手,以及OctoSense数采方案。
开头提到的肌电手环,在章鱼动力的体系中就属于OctoSense方案。
和他们沟通后,我们了解到:OctoSense实现了肌电信号的跨个体零样本泛化,能降低设备更换使用者之后反复标定和训练的成本。除了肌电手环,这套方案还包括鱼眼头环、外骨骼同构手套等不同形态的采集设备。
OctoH-Hand则是数采孪生方案,高度仿生+全闭环力控,一手多能。
但更有意思的是,那个“脑-手-数据”闭环的技术体系。
WRC现场来的公司,做基座模型的基本不做手,纯做手的,又很少做模型。
章鱼动力这家公司看起来做得真的挺“重”!
04.
手和触觉,能够和大脑持续scaling很关键
现场聊完之后,下午去听了他们的论坛。
主要是想看看这类工作,领域的进展和商业化怎么样了,也想看看这家公司到底如何。
这次,凯哥(地平线余凯)和鹏哥(四维图新程鹏)也来了。

作为都大龙在地平线时期的前老板,也是章鱼动力的投资人,凯哥现场做出了对章鱼动力这支团队的判断来自十多年的共事经历。
评价挺高的,凯哥说:“都大龙的优势在于既经历过技术范式的变化,也具备把新技术转化为产品的能力,这也是章鱼动力敢于同时推进世界模型、灵巧手和数采体系的重要基础”。不过,技术只是起点,最终仍要通过产品交付和商业落地,证明这套“脑—手—数据”体系能够真正创造生产力。

之后,都大龙进行了他们技术和商业化路线的分享。
其中一句话,很有同感:一种稀缺能力能够被规模化调用时,生产力革命就会发生。
对物理AI来说,这种能力来自“通用大脑×通用双手”:大脑负责理解环境、预测结果和生成动作,双手负责进入物理世界,并把真实的接触与执行结果重新反馈给模型。
这也意味着,具身基础模型的Scaling不能只围绕参数量和视频数据展开。
都大龙把它进一步拆成两个维度:时序Scaling和模态Scaling。时序上的扩展,让模型能够在更长的动作链中理解状态变化,学习动作与结果之间的因果关系;模态上的扩展,则要求模型能够持续接入视觉、触觉、力觉和肌电等信号,同时保持原有架构的可扩展性。
他在现场举了一个很直观的例子:轻轻擦桌子和用力擦桌子,从视觉上看可能几乎一样,产生的物理结果却完全不同。只有视觉,模型可以看到手的运动轨迹;加入触觉和力觉后,模型才能知道手与桌面是否接触、施加了多大的力,以及这个动作有没有达到预期效果。
所以,手在这套体系中也承担着数据入口的作用。
回到他们的产品线就能明白他们的战略,OctoH-Hand执行模型生成的动作,触觉与力控系统记录真实反馈;OctoSense则通过肌电手环、同构手套和鱼眼头环采集人的操作意图、关节运动与接触信息。

这些数据如果能够回流到SYNWorld,就有机会把一次真实操作变成下一轮模型训练的材料。
都大龙把这种数据能力称为“物理完备度”。
任务会变化,但动作、接触与结果之间的因果规律可以迁移。
章鱼动力同时推进世界模型、灵巧手和数采体系,就是在做这一点:手和触觉进入大脑的Scaling路径后,模型增长的不只是“看过多少视频”,还有对物理交互的理解深度。
能做这个事情,要具备模型能力、产品能力还有复杂工程的能力,这也回到了凯哥之前对都大龙的评价。
之后的圆桌,我还记录了一些很有价值的观点,特别是程鹏总的。

程鹏说:“模型能力可以持续 Scaling,不代表整个系统就能一直扩展。数据能否复用、算力能否下沉、成本能否降下来,决定了“脑—手—数据”这个闭环究竟能转多快、多持久。
期间,他拿ImageNet和自动驾驶做了一个对比。ImageNet通过统一的数据集和评测标准,让不同团队可以在同一套基础设施上训练、验证和迭代;到了自动驾驶阶段,很多公司都在独立采集、标注和存储数据,整个行业为重复建设付出了很高的成本。
这对具身智能尤其重要。
像手部操作涉及视觉、肌电、关节姿态、触觉和力觉,数据模态更多、采集成本也更高。如果每换一只灵巧手、一个机器人本体或一套传感器,都要重新采集和标注,数据规模越大,系统反而可能变得越重。
之后他也提到,四维图新正在和章鱼动力讨论数据开源与标准建设,希望联合产业中的头部公司,建立一套类似ImageNet的多模态数据基础设施。
不仅仅是四维图新,现场我们还了解到章鱼动力和帕西尼感知、快乐e工、无问智科等产业伙伴都在推进合作,覆盖多模态感知、规模化数据、仿真验证和场景应用。
05.
这套闭环,又新又重,为什么要做?
把论坛上的观点,分析结束后,这里就明白他们做“脑-手-数据”的动机了。
物理世界还没有统一的数据格式、传感器接口和动作空间。只做模型,真实执行的数据很难回来;只做灵巧手,又很难让硬件能力进入模型的迭代过程。
具身智能里的大量问题,仍然需要软硬件共同解决。他们做的是系统协同:采集设备为模型提供数据,模型为灵巧手生成动作,灵巧手在真实世界中的执行结果继续回流。
这条路线的优势,是每一层都可以围绕同一个目标联合设计。
而这,正是都大龙的优势。
