点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
作者供稿直发 | 编辑:3D视觉工坊
3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:
上海交通大学、南洋理工大学等机构联合提出UniPR-3D,首次将三维几何感知引入视觉地点识别框架,在单帧和序列两种检索任务上均刷新了多个基准的最优性能。

1.视觉地点识别的处境与困境:传统方法的上限
视觉地点识别(Visual Place Recognition, VPR)要解决一个的核心问题:给定一张查询图像,从数据库中检索出对应的历史位置。VPR 是机器人导航、SLAM、自动驾驶的基础能力之一,直接影响系统能否在复杂真实环境中长期稳定运行。 想象一个自动驾驶车辆或机器人,在晨雾中经过一条熟悉的街道——光线变了,树叶的颜色变了,甚至行驶方向都反了。它还能认出这里是哪吗?
过去十年,VPR 方法从手工特征一路演进到基于ViT的大模型(如DINOv2),性能显著提升。但几乎所有主流方法都有一个共同局限:只从单张图像提取二维纹理特征。
这意味着:
换了光照、换了季节,纹理变了,识别就容易失败 无法利用多视角带来的空间几何信息 序列匹配往往只是帧级相似度的后处理,缺乏真正的跨帧推理

多视图融合虽然理论上更优,但一直是个"相对未被探索的方向"——直到VGGT(Visual Geometry Grounded Transformer)这类三维感知骨干网络的出现,打开了新的可能。

作者:
Tianchen Deng, Xun Chen, Ziming Li, Hongming Shen, Shuhao Zhai,Danwei Wang, Javier Civera, Hesheng Wang'
名称:UniPR-3D: Towards Universal Visual Place Recognition with Visual Geometry Grounded Transformer
机构:上海交通大学、南洋理工大学、萨拉戈萨大学、澳门大学
开源地址:https://github.com/dtc111111/UniPR-3D
2. 核心技术:首个基于三维Token的通用VPR框架
UniPR-3D的核心思路是:在提取图像特征时,同时获取二维纹理token和三维几何token,并针对它们各自的特性设计不同的聚合策略,最终拼接成一个统一的全局描述子。
2.1 局部三维特征提取
每张输入图像先经过DINOv2编码器,提取三类二维token:
cls token(全局语义) register token(稳定的辅助特征) patch token(细粒度局部纹理)
随后,patch token被送入VGGT的交替注意力块(帧注意力+全局注意力),配合相机token和额外的register token,产生三类三维token:三维相机token、三维register token、三维patch token。
关键设计:为了让描述子对视角变化保持鲁棒,最终丢弃了三维相机token,只保留三维register token和三维patch token参与描述子构建。值得一提的是,UniPR-3D不需要任何相机内外参作为输入,所有几何感知特征均从纯 RGB 图像中自然涌现。
2.2 特征聚合:为不同token量身定制策略
不同 token 的数量和特性差异很大,因此不能用同一套聚合方法一把梭。
对cls token和register token(数量少):采用GeM广义均值池化,前后接轻量MLP,生成紧凑的全局描述子。
对patch token(数量多、空间细节丰富):采用最优传输(Optimal Transport)方案,借助Sinkhorn算法计算软匹配矩阵,保留局部空间对应关系,同时引入“垃圾桶”条目过滤无信息区域。
最终,五类描述子(2D cls、2D register、2D patch、3D register、3D patch)直接拼接,形成统一的全局描述子:

2.3 序列匹配:变长序列的灵活融合
序列级检索的难点在于:训练和测试时序列长度往往不同,传统方法通常要求固定长度。
UniPR-3D提出了变长序列融合框架:定义一个“锚帧”和若干“支撑帧”,对register token跨帧做GeM池化+MLP投影,对patch token跨帧先聚类再做最优传输聚合。这样设计使得模型在推理阶段可以接受任意长度的序列,而无需重新训练。

3. 实验验证:多项基准全面刷新最优
3.1 单帧匹配(10个数据集)
与NetVLAD、SALAD、MegaLoc等主流方法对比,UniPR-3D在绝大多数数据集和指标上均取得最优结果。

Nordland数据集拍摄于挪威,横跨四季——同一段铁路,春夏秋冬外观迥异。UniPR-3D在此类极端视觉变化场景下的提升尤为显著,正是三维几何感知发挥作用的地方。
3.2 序列匹配(4个数据集)
与SeqSLAM、SeqNet、CaseVPR等序列方法对比,UniPR-3D全面领先。

在要求更严格的2米距离阈值下(Oxford 数据集),UniPR-3D的R@1超出此前最优方法10个百分点以上,差距相当显著。

3.3 消融:每一块积木都有其价值
2D和3D patch token缺一不可:2D擅长纹理丰富场景,3D在光照/天气变化下更鲁棒 cls/register token提供语义层面的额外增益,对整体性能有持续正向贡献 显式注入三维位姿信息反而适得其反:说明3D token本身已经隐式编码了足够的空间关系,多此一举会引入噪声


4. 总结与展望
UniPR-3D的工作给了我们一个清晰的信号:地点识别不只是“看图找图”,更是“理解空间、感知结构”。当描述子从二维纹理升维到三维几何,系统在面对光照骤变、季节更迭、视角翻转这类极端条件时,展现出了明显更强的韧性。
当然,这条路还有很多值得继续走下去的地方。目前UniPR-3D引入3D token的代价是推理延迟的小幅上升,如何在精度与实时性之间找到更好的平衡,仍是面向实际部署的重要课题。此外,VGGT本身是在大规模数据上预训练的通用模型,针对VPR场景的专项预训练或许能进一步释放其潜力。更长远来看,将几何感知描述子与层级式定位、地图维护等下游任务打通,让机器人真正具备“走过一次就记住”的能力,是这个方向最令人期待的目标。
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。