最新!机器人终于开始“看见”触觉:一篇近240个工作的综述讲透视触觉智能的最新动态。

具身智能之心 2026-08-20 23:00

点击下方卡片,关注“具身智能之心”公众号


过去几年,具身智能把大量注意力放在了视觉、语言和动作上。

相机负责看,语言模型负责理解,动作模型负责把判断变成关节轨迹。这套链路已经越来越完整。

但机器人真正开始干活以后,最容易出问题的地方往往不在“看见物体”,而在接触发生的那一刻。

插销有没有对准孔位,杯子是不是正在从指尖滑走,抓住的是硬壳还是柔软包装,拧紧螺丝时力有没有继续增加。这些信息,要么被手掌和物体挡住,要么根本无法仅凭外部图像判断。

触觉本来应该补上这块缺口。

问题是,传统触觉传感器常常只输出几个力或压力数值。对控制器来说够用,对今天习惯处理高维图像和视频的基础模型来说,却有点像让一个视觉模型只看几行仪表盘数字。

8月16日,大湾区大学周鹏、胡军,香港大学陈思涵等研究者,联合清华大学、南洋理工大学、香港理工大学、华南理工大学、瑞典皇家理工学院和伦敦国王学院,发布了一篇20页的综述。

论文叫《Vision-Based Tactile Intelligence for Robotics: Sensing, Learning, and Embodied Manipulation》,讨论的就是机器人如何从视觉触觉传感,一路走向学习和具身操作。

最新!机器人终于开始“看见”触觉:一篇近240个工作的综述讲透视触觉智能的最新动态。图1
  • 论文链接:https://arxiv.org/pdf/2608.15490

他们一口气梳理了视觉触觉传感器的硬件设计、AI学习方法、仿真平台、数据集和具身操作应用。

从头读完,我们觉得这篇工作最有价值的地方,不是又做了一次传感器名录,而是提出了一条更完整的主线:

视觉触觉正在从一个独立硬件,变成“传感器—模型—数据—策略”共同构成的触觉智能系统。

最新!机器人终于开始“看见”触觉:一篇近240个工作的综述讲透视触觉智能的最新动态。图2

而这条链路一旦成立,触觉就有机会像视觉一样,进入基础模型和VLA的主干网络。


01.

视觉触觉做的第一件事,

是把接触变成一张图


视觉触觉传感器,英文叫 Vision-Based Tactile Sensor,论文里缩写为 VBTS。

它的基本结构不复杂。最外面是一层会变形的弹性体,内部放置光源、成像镜头和摄像头。物体碰到弹性体以后,表面发生形变;光照、阴影、反射或内部标记点随之变化;摄像头把这些变化拍下来,模型再从图像中反推接触发生了什么。

最新!机器人终于开始“看见”触觉:一篇近240个工作的综述讲透视触觉智能的最新动态。图3

它不是用摄像头看外面的世界,而是让摄像头盯着机器人的“皮肤内侧”。

这里可以编码三层信息。

第一层是直接几何信息。接触位置、面积、局部表面方向、纹理和形变,可以从单帧图像中读出来。

第二层是间接的力学信息。法向力、剪切力、扭矩和柔软程度,需要结合弹性体特性、标定数据或学习模型推断。

第三层是时间信息。把连续帧放在一起,才能判断刚刚接触、开始打滑、持续滑动还是已经脱离。

综述把常见的光学读出方法分成四类:追踪弹性体里的标记点,用光度立体法恢复表面法线,用双目视差重建深度,以及从阴影变化中学习形状。

最新!机器人终于开始“看见”触觉:一篇近240个工作的综述讲透视触觉智能的最新动态。图4

GelSight、DIGIT 和 TacTip 虽然外形不同,底层逻辑都在做同一件事:把原本难以结构化的接触,转换成现代视觉模型熟悉的图像。

这也是视觉触觉真正重要的地方。

传统触觉输出是几路电信号,视觉触觉输出则天然拥有空间结构。CNN、ViT、视频模型和多模态模型过去十年积累的能力,可以比较顺畅地迁移过来。触觉由此第一次拥有了接近视觉模态的信息密度和算法生态。


02.

传感器没有统一答案,

每改一层硬件都在交换能力


综述对硬件的梳理没有按公司或产品排队,而是围绕三个相互耦合的设计维度展开:弹性体、传感器尺寸与形状、光学系统。

最新!机器人终于开始“看见”触觉:一篇近240个工作的综述讲透视触觉智能的最新动态。图5

这套分类比记住几十个传感器名字更有用,因为它揭示了视觉触觉硬件的基本矛盾。

最新!机器人终于开始“看见”触觉:一篇近240个工作的综述讲透视触觉智能的最新动态。图6

弹性体越软,通常对微小接触越敏感,但耐久性和测量范围可能下降。

研究者会改变材料硬度、表面结构和内部标记图案。有的使用稀疏圆点追踪剪切和滑移,有的用密集编码图案恢复三维形状,还有的把压电、振动等额外感知机制一起塞进弹性体。

覆盖面积越大,触觉越完整,但相机、布线和数据带宽也越难处理。

指尖大小的 DIGIT 易于集成,却只能看见局部接触;覆盖手指、手掌甚至机械臂的大面积皮肤可以记录更多接触,但会带来视野拼接、光路设计和计算负担。综述列出了从 GelBelt、HydroPalm 到大面积触觉皮肤的一系列探索。

光学系统越追求高分辨率,通常越难做薄、做小。

更大的镜头和相机有利于图像质量,却会挤占手指内部空间。MiniTac 把传感器直径压到8毫米,DIGIT Pinki 通过光纤束把成像单元移出狭小末端,ThinTact 则尝试用无透镜成像进一步压缩厚度。

还有一个很重要的结论:视觉触觉传感器并不存在一个“性能最好”的统一形态。

做插孔,需要高空间分辨率和快速接触反馈;做大面积抓取,需要更广覆盖;做手术,需要极小尺寸;做灵巧手,还要同时考虑重量、布线、耐磨和手指运动空间。

传感器的身体,已经在决定模型最终能学到什么。


03.

真正的变化,是触觉算法

从“测一个数”走向“直接决定动作”


如果只看硬件,视觉触觉并不是突然出现的新技术。GelSight的早期工作可以追溯到2009年前后,DIGIT和TacTip也已经发展多年。

但真正让它重新成为具身智能热点的,是后面的学习链路变了。

综述把触觉学习能力按层级梳理下来,大致经历了四步。

最新!机器人终于开始“看见”触觉:一篇近240个工作的综述讲透视触觉智能的最新动态。图7

先读懂基础物理量。

模型从触觉图像估计形变、法向力、剪切力、扭矩和滑移。早期方法依赖标定和接触力学,现在越来越多工作直接用卷积网络、时序模型或有限元与学习结合的方法恢复三维力场。

再理解接触对象。

触觉图像能够补足外部视觉看不到的局部信息。机器人可以识别纹理、材质、硬度和柔软程度,也可以通过多次触摸拼出物体三维形状,在遮挡严重时追踪物体位姿。

然后进入操作策略。

触觉不再只作为一个检测结果显示出来,而是直接改变下一步动作。抓取即将打滑时增加握力,插孔受阻时调整方向,处理柔软物体时用触觉判断变形,灵巧手旋转物体时根据接触变化持续修正。

综述列出的案例覆盖重新抓取、非抓持推动、手内旋转、插孔、模仿学习和动态操作。它们的共同点是:任务的成功条件隐藏在接触里,视觉只能告诉机器人“手到了”,触觉才告诉它“这一步做对了没有”。

最后,触觉开始进入基础模型。

Sparsh使用超过46万张触觉图像做自监督预训练;T3使用超过300万样本和11类任务学习跨传感器表示;UniTouch、AnyTouch开始把触觉与视觉、语言空间对齐;OmniVTLA、T-Rex和UniTacVLA则继续把触觉接进视觉—语言—动作策略。

最新!机器人终于开始“看见”触觉:一篇近240个工作的综述讲透视触觉智能的最新动态。图8

这条演进路径很清楚:

触觉先是一种测量手段,后来是一种感知模态,现在正变成动作模型的一部分。


04.

触觉基础模型最大的敌人,

是每块“皮肤”看到的世界都不一样


视觉基础模型能够规模化,一个重要前提是不同相机拍出的图像虽然有差异,但大体共享同一个自然图像空间。

触觉没有这么幸运。

换一种弹性体硬度、换一组LED、改变标记点密度,甚至同一型号的两块传感器出现制造误差,最终图像分布都可能变化。相同的接触力,在GelSight、DIGIT和TacTip上长得不是一回事。

这也是综述里反复提到仿真、数据集和跨传感器适配的原因。

真实触觉数据采集成本高,而且力、形状、材质和任务结果很难同时标注。TACTO、Taxim、DiffTactile、Tactile Gym 2.0 等仿真平台试图在虚拟环境中生成触觉图像;YCB-Sight、Touch and Go、Touch100K、TVL 等数据集,则分别补充物体、视觉—触觉配对和触觉—语言对齐数据。

最新!机器人终于开始“看见”触觉:一篇近240个工作的综述讲透视触觉智能的最新动态。图9

但仿真规模上来了,Sim2Real gap 也跟着出现。

视觉触觉图像同时取决于弹性体力学、摩擦、照明、光学结构和制造差异。仿真里少算一个材料迟滞,现实图像的形变模式就可能变掉。综述总结的解法包括域随机化、图像翻译、少样本校准和跨传感器生成映射。

这里决定了触觉基础模型的上限。

最新!机器人终于开始“看见”触觉:一篇近240个工作的综述讲透视触觉智能的最新动态。图10

如果每换一块传感器都要重新采集、标定和训练,所谓基础模型仍然只是多个专用模型的集合。只有当模型能把不同硬件产生的触觉图像映射到共享的接触语义,例如接触区域、力变化趋势、滑移风险和操作阶段,触觉才真正具备规模化预训练的条件。


05.

综述留下的七个问题里,

最关键的是“触觉有没有进入闭环”


综述最后列出了机器人手兼容设计、大面积触觉皮肤、触觉基础模型与VTLA、Sim2Real、多模态触觉智能、触觉反馈和第一视角触觉数据七个方向。

这些方向看起来分散,背后其实指向同一个问题:

触觉能不能从机器人手指上的一个传感器,进入完整的学习与控制闭环。

硬件端,传感器必须足够小、轻、耐磨,不能因为加了触觉就牺牲灵巧手的工作空间。

数据端,行业需要的不只是成功抓取后的触觉图片,还包括接触建立、微滑、失败、调整和恢复的完整时序。

模型端,触觉既要支持毫秒级的局部纠错,也要能参与高层决策。机器人一边需要在打滑时立即加力,一边还要理解“这个塑料杯太软,应该换一种抓法”。前者是控制,后者已经接近触觉—语言推理。

还有一个容易被忽略的问题,是人类示教时的触觉反馈。

现在很多机器人通过遥操作采集数据。人类老师能看见机器人,却不一定能感受到机械手正在承受的接触力。示教者缺少触觉,记录下来的接触动作就可能不自然。综述因此提出,未来的触觉系统不仅要让机器人“摸到”,也要想办法让示教者“感觉到”。

第一视角人类触觉数据则是更远的一步。头戴相机、手部追踪器和可穿戴触觉传感器如果能同步采集,人类在拧、插、擦、扣、调整抓握时的接触经验,就有可能进入机器人训练。

难点也很清楚:人的手和机器人末端不一样,触觉数据必须先跨过本体差异,才能变成可执行策略。


06.

写在最后


读完这篇综述,我们最大的感受是,触觉正在经历一次和视觉相似、又比视觉更难的变化。

视觉从相机硬件走向ImageNet,再走向视觉基础模型;视觉触觉也在从传感器、任务数据集,走向跨硬件表示和VTLA。

两者的区别是,视觉模型观察世界,触觉模型必须和世界发生接触。

材料、摩擦、形变、磨损以及传感器制造误差,都会进入数据。这让触觉更难规模化,却也让它成为机器人真正理解物理世界的一条近路。

所以,这篇综述值得记住的并不是哪一种视觉触觉传感器更好,而是这个结论:未来的触觉能力不会单独来自一块更好的“皮肤”,而是来自硬件、模型、仿真、数据和控制策略共同组成的系统。


END

 推荐阅读 :

最新!机器人终于开始“看见”触觉:一篇近240个工作的综述讲透视触觉智能的最新动态。图11


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
机器人
more
拆透具身智能100万小时:真能喂出一个“聪明”机器人吗?|AI100闭门会
具身数据底座开卖,首发5100元:机器人训练数据有了新解法
宇树科技登陆科创板首日暴涨460%,人形机器人赛道资本化提速
WRC上,机器人开始折叠了
世界机器人大会观察,银河星脑的愿景:让所有机器人共享「大脑」
中国首次实现火箭陆地回收;宇树上市,市值最高超 4000 亿;蔡明同款机器人亮相,9.9 万元|极客早知道
Physical Token经济学:下一项能力更便宜,机器人才能真正规模化
不拍大片、不表演,这家公司把行业级四足机器人的实用性做到极致
WRC洞察:当深耕8年的机器人力控技术开始走向C端
2026上半年人形机器人出货激增,智元领跑全球市场
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号