点击下方卡片,关注“具身智能之心”公众号
过去几年,具身智能把大量注意力放在了视觉、语言和动作上。
相机负责看,语言模型负责理解,动作模型负责把判断变成关节轨迹。这套链路已经越来越完整。
但机器人真正开始干活以后,最容易出问题的地方往往不在“看见物体”,而在接触发生的那一刻。
插销有没有对准孔位,杯子是不是正在从指尖滑走,抓住的是硬壳还是柔软包装,拧紧螺丝时力有没有继续增加。这些信息,要么被手掌和物体挡住,要么根本无法仅凭外部图像判断。
触觉本来应该补上这块缺口。
问题是,传统触觉传感器常常只输出几个力或压力数值。对控制器来说够用,对今天习惯处理高维图像和视频的基础模型来说,却有点像让一个视觉模型只看几行仪表盘数字。
8月16日,大湾区大学周鹏、胡军,香港大学陈思涵等研究者,联合清华大学、南洋理工大学、香港理工大学、华南理工大学、瑞典皇家理工学院和伦敦国王学院,发布了一篇20页的综述。
论文叫《Vision-Based Tactile Intelligence for Robotics: Sensing, Learning, and Embodied Manipulation》,讨论的就是机器人如何从视觉触觉传感,一路走向学习和具身操作。

论文链接:https://arxiv.org/pdf/2608.15490
他们一口气梳理了视觉触觉传感器的硬件设计、AI学习方法、仿真平台、数据集和具身操作应用。
从头读完,我们觉得这篇工作最有价值的地方,不是又做了一次传感器名录,而是提出了一条更完整的主线:
视觉触觉正在从一个独立硬件,变成“传感器—模型—数据—策略”共同构成的触觉智能系统。

而这条链路一旦成立,触觉就有机会像视觉一样,进入基础模型和VLA的主干网络。
01.
视觉触觉做的第一件事,
是把接触变成一张图
视觉触觉传感器,英文叫 Vision-Based Tactile Sensor,论文里缩写为 VBTS。
它的基本结构不复杂。最外面是一层会变形的弹性体,内部放置光源、成像镜头和摄像头。物体碰到弹性体以后,表面发生形变;光照、阴影、反射或内部标记点随之变化;摄像头把这些变化拍下来,模型再从图像中反推接触发生了什么。

它不是用摄像头看外面的世界,而是让摄像头盯着机器人的“皮肤内侧”。
这里可以编码三层信息。
第一层是直接几何信息。接触位置、面积、局部表面方向、纹理和形变,可以从单帧图像中读出来。
第二层是间接的力学信息。法向力、剪切力、扭矩和柔软程度,需要结合弹性体特性、标定数据或学习模型推断。
第三层是时间信息。把连续帧放在一起,才能判断刚刚接触、开始打滑、持续滑动还是已经脱离。
综述把常见的光学读出方法分成四类:追踪弹性体里的标记点,用光度立体法恢复表面法线,用双目视差重建深度,以及从阴影变化中学习形状。

GelSight、DIGIT 和 TacTip 虽然外形不同,底层逻辑都在做同一件事:把原本难以结构化的接触,转换成现代视觉模型熟悉的图像。
这也是视觉触觉真正重要的地方。
传统触觉输出是几路电信号,视觉触觉输出则天然拥有空间结构。CNN、ViT、视频模型和多模态模型过去十年积累的能力,可以比较顺畅地迁移过来。触觉由此第一次拥有了接近视觉模态的信息密度和算法生态。
02.
传感器没有统一答案,
每改一层硬件都在交换能力
综述对硬件的梳理没有按公司或产品排队,而是围绕三个相互耦合的设计维度展开:弹性体、传感器尺寸与形状、光学系统。

这套分类比记住几十个传感器名字更有用,因为它揭示了视觉触觉硬件的基本矛盾。

弹性体越软,通常对微小接触越敏感,但耐久性和测量范围可能下降。
研究者会改变材料硬度、表面结构和内部标记图案。有的使用稀疏圆点追踪剪切和滑移,有的用密集编码图案恢复三维形状,还有的把压电、振动等额外感知机制一起塞进弹性体。
覆盖面积越大,触觉越完整,但相机、布线和数据带宽也越难处理。
指尖大小的 DIGIT 易于集成,却只能看见局部接触;覆盖手指、手掌甚至机械臂的大面积皮肤可以记录更多接触,但会带来视野拼接、光路设计和计算负担。综述列出了从 GelBelt、HydroPalm 到大面积触觉皮肤的一系列探索。
光学系统越追求高分辨率,通常越难做薄、做小。
更大的镜头和相机有利于图像质量,却会挤占手指内部空间。MiniTac 把传感器直径压到8毫米,DIGIT Pinki 通过光纤束把成像单元移出狭小末端,ThinTact 则尝试用无透镜成像进一步压缩厚度。
还有一个很重要的结论:视觉触觉传感器并不存在一个“性能最好”的统一形态。
做插孔,需要高空间分辨率和快速接触反馈;做大面积抓取,需要更广覆盖;做手术,需要极小尺寸;做灵巧手,还要同时考虑重量、布线、耐磨和手指运动空间。
传感器的身体,已经在决定模型最终能学到什么。
03.
真正的变化,是触觉算法
从“测一个数”走向“直接决定动作”
如果只看硬件,视觉触觉并不是突然出现的新技术。GelSight的早期工作可以追溯到2009年前后,DIGIT和TacTip也已经发展多年。
但真正让它重新成为具身智能热点的,是后面的学习链路变了。
综述把触觉学习能力按层级梳理下来,大致经历了四步。

先读懂基础物理量。
模型从触觉图像估计形变、法向力、剪切力、扭矩和滑移。早期方法依赖标定和接触力学,现在越来越多工作直接用卷积网络、时序模型或有限元与学习结合的方法恢复三维力场。
再理解接触对象。
触觉图像能够补足外部视觉看不到的局部信息。机器人可以识别纹理、材质、硬度和柔软程度,也可以通过多次触摸拼出物体三维形状,在遮挡严重时追踪物体位姿。
然后进入操作策略。
触觉不再只作为一个检测结果显示出来,而是直接改变下一步动作。抓取即将打滑时增加握力,插孔受阻时调整方向,处理柔软物体时用触觉判断变形,灵巧手旋转物体时根据接触变化持续修正。
综述列出的案例覆盖重新抓取、非抓持推动、手内旋转、插孔、模仿学习和动态操作。它们的共同点是:任务的成功条件隐藏在接触里,视觉只能告诉机器人“手到了”,触觉才告诉它“这一步做对了没有”。
最后,触觉开始进入基础模型。
Sparsh使用超过46万张触觉图像做自监督预训练;T3使用超过300万样本和11类任务学习跨传感器表示;UniTouch、AnyTouch开始把触觉与视觉、语言空间对齐;OmniVTLA、T-Rex和UniTacVLA则继续把触觉接进视觉—语言—动作策略。

这条演进路径很清楚:
触觉先是一种测量手段,后来是一种感知模态,现在正变成动作模型的一部分。
04.
触觉基础模型最大的敌人,
是每块“皮肤”看到的世界都不一样
视觉基础模型能够规模化,一个重要前提是不同相机拍出的图像虽然有差异,但大体共享同一个自然图像空间。
触觉没有这么幸运。
换一种弹性体硬度、换一组LED、改变标记点密度,甚至同一型号的两块传感器出现制造误差,最终图像分布都可能变化。相同的接触力,在GelSight、DIGIT和TacTip上长得不是一回事。
这也是综述里反复提到仿真、数据集和跨传感器适配的原因。
真实触觉数据采集成本高,而且力、形状、材质和任务结果很难同时标注。TACTO、Taxim、DiffTactile、Tactile Gym 2.0 等仿真平台试图在虚拟环境中生成触觉图像;YCB-Sight、Touch and Go、Touch100K、TVL 等数据集,则分别补充物体、视觉—触觉配对和触觉—语言对齐数据。

但仿真规模上来了,Sim2Real gap 也跟着出现。
视觉触觉图像同时取决于弹性体力学、摩擦、照明、光学结构和制造差异。仿真里少算一个材料迟滞,现实图像的形变模式就可能变掉。综述总结的解法包括域随机化、图像翻译、少样本校准和跨传感器生成映射。
这里决定了触觉基础模型的上限。

如果每换一块传感器都要重新采集、标定和训练,所谓基础模型仍然只是多个专用模型的集合。只有当模型能把不同硬件产生的触觉图像映射到共享的接触语义,例如接触区域、力变化趋势、滑移风险和操作阶段,触觉才真正具备规模化预训练的条件。
05.
综述留下的七个问题里,
最关键的是“触觉有没有进入闭环”
综述最后列出了机器人手兼容设计、大面积触觉皮肤、触觉基础模型与VTLA、Sim2Real、多模态触觉智能、触觉反馈和第一视角触觉数据七个方向。
这些方向看起来分散,背后其实指向同一个问题:
触觉能不能从机器人手指上的一个传感器,进入完整的学习与控制闭环。
硬件端,传感器必须足够小、轻、耐磨,不能因为加了触觉就牺牲灵巧手的工作空间。
数据端,行业需要的不只是成功抓取后的触觉图片,还包括接触建立、微滑、失败、调整和恢复的完整时序。
模型端,触觉既要支持毫秒级的局部纠错,也要能参与高层决策。机器人一边需要在打滑时立即加力,一边还要理解“这个塑料杯太软,应该换一种抓法”。前者是控制,后者已经接近触觉—语言推理。
还有一个容易被忽略的问题,是人类示教时的触觉反馈。
现在很多机器人通过遥操作采集数据。人类老师能看见机器人,却不一定能感受到机械手正在承受的接触力。示教者缺少触觉,记录下来的接触动作就可能不自然。综述因此提出,未来的触觉系统不仅要让机器人“摸到”,也要想办法让示教者“感觉到”。
第一视角人类触觉数据则是更远的一步。头戴相机、手部追踪器和可穿戴触觉传感器如果能同步采集,人类在拧、插、擦、扣、调整抓握时的接触经验,就有可能进入机器人训练。
难点也很清楚:人的手和机器人末端不一样,触觉数据必须先跨过本体差异,才能变成可执行策略。
06.
写在最后
读完这篇综述,我们最大的感受是,触觉正在经历一次和视觉相似、又比视觉更难的变化。
视觉从相机硬件走向ImageNet,再走向视觉基础模型;视觉触觉也在从传感器、任务数据集,走向跨硬件表示和VTLA。
两者的区别是,视觉模型观察世界,触觉模型必须和世界发生接触。
材料、摩擦、形变、磨损以及传感器制造误差,都会进入数据。这让触觉更难规模化,却也让它成为机器人真正理解物理世界的一条近路。
所以,这篇综述值得记住的并不是哪一种视觉触觉传感器更好,而是这个结论:未来的触觉能力不会单独来自一块更好的“皮肤”,而是来自硬件、模型、仿真、数据和控制策略共同组成的系统。
