ECCV'26 开源 | UniPR-3D:首个基于3D基座模型的视觉识别框架,不用标定、不看纹理,单帧序列全面碾压SOTA!

3D视觉工坊 2026-08-07 07:00

点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达

作者供稿直发 | 编辑:3D视觉工坊

3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:ECCV'26 开源 | UniPR-3D:首个基于3D基座模型的视觉识别框架,不用标定、不看纹理,单帧序列全面碾压SOTA!图1

上海交通大学、南洋理工大学等机构联合提出UniPR-3D,首次将三维几何感知引入视觉地点识别框架,在单帧和序列两种检索任务上均刷新了多个基准的最优性能。

ECCV'26 开源 | UniPR-3D:首个基于3D基座模型的视觉识别框架,不用标定、不看纹理,单帧序列全面碾压SOTA!图2

1.视觉地点识别的处境与困境:传统方法的上限

视觉地点识别(Visual Place Recognition, VPR)要解决一个的核心问题:给定一张查询图像,从数据库中检索出对应的历史位置。VPR 是机器人导航、SLAM、自动驾驶的基础能力之一,直接影响系统能否在复杂真实环境中长期稳定运行。 想象一个自动驾驶车辆或机器人,在晨雾中经过一条熟悉的街道——光线变了,树叶的颜色变了,甚至行驶方向都反了。它还能认出这里是哪吗?

过去十年,VPR 方法从手工特征一路演进到基于ViT的大模型(如DINOv2),性能显著提升。但几乎所有主流方法都有一个共同局限:只从单张图像提取二维纹理特征

这意味着:

  • 换了光照、换了季节,纹理变了,识别就容易失败
  • 无法利用多视角带来的空间几何信息
  • 序列匹配往往只是帧级相似度的后处理,缺乏真正的跨帧推理
ECCV'26 开源 | UniPR-3D:首个基于3D基座模型的视觉识别框架,不用标定、不看纹理,单帧序列全面碾压SOTA!图3

多视图融合虽然理论上更优,但一直是个"相对未被探索的方向"——直到VGGT(Visual Geometry Grounded Transformer)这类三维感知骨干网络的出现,打开了新的可能。

ECCV'26 开源 | UniPR-3D:首个基于3D基座模型的视觉识别框架,不用标定、不看纹理,单帧序列全面碾压SOTA!图4

作者:Tianchen Deng, Xun Chen, Ziming Li, Hongming Shen, Shuhao Zhai,Danwei Wang, Javier Civera, Hesheng Wang'
名称:UniPR-3D: Towards Universal Visual Place Recognition with Visual Geometry Grounded Transformer
机构:上海交通大学、南洋理工大学、萨拉戈萨大学、澳门大学
开源地址:https://github.com/dtc111111/UniPR-3D

2. 核心技术:首个基于三维Token的通用VPR框架

UniPR-3D的核心思路是:在提取图像特征时,同时获取二维纹理token和三维几何token,并针对它们各自的特性设计不同的聚合策略,最终拼接成一个统一的全局描述子。

2.1 局部三维特征提取

每张输入图像先经过DINOv2编码器,提取三类二维token:

  • cls token(全局语义)
  • register token(稳定的辅助特征)
  • patch token(细粒度局部纹理)

随后,patch token被送入VGGT的交替注意力块(帧注意力+全局注意力),配合相机token和额外的register token,产生三类三维token:三维相机token、三维register token、三维patch token。

关键设计:为了让描述子对视角变化保持鲁棒,最终丢弃了三维相机token,只保留三维register token和三维patch token参与描述子构建。值得一提的是,UniPR-3D不需要任何相机内外参作为输入,所有几何感知特征均从纯 RGB 图像中自然涌现。

2.2 特征聚合:为不同token量身定制策略

不同 token 的数量和特性差异很大,因此不能用同一套聚合方法一把梭。

对cls token和register token(数量少):采用GeM广义均值池化,前后接轻量MLP,生成紧凑的全局描述子。

对patch token(数量多、空间细节丰富):采用最优传输(Optimal Transport)方案,借助Sinkhorn算法计算软匹配矩阵,保留局部空间对应关系,同时引入“垃圾桶”条目过滤无信息区域。

最终,五类描述子(2D cls、2D register、2D patch、3D register、3D patch)直接拼接,形成统一的全局描述子:

ECCV'26 开源 | UniPR-3D:首个基于3D基座模型的视觉识别框架,不用标定、不看纹理,单帧序列全面碾压SOTA!图5

2.3 序列匹配:变长序列的灵活融合

序列级检索的难点在于:训练和测试时序列长度往往不同,传统方法通常要求固定长度。

UniPR-3D提出了变长序列融合框架:定义一个“锚帧”和若干“支撑帧”,对register token跨帧做GeM池化+MLP投影,对patch token跨帧先聚类再做最优传输聚合。这样设计使得模型在推理阶段可以接受任意长度的序列,而无需重新训练。

ECCV'26 开源 | UniPR-3D:首个基于3D基座模型的视觉识别框架,不用标定、不看纹理,单帧序列全面碾压SOTA!图6

3. 实验验证:多项基准全面刷新最优

3.1 单帧匹配(10个数据集)

与NetVLAD、SALAD、MegaLoc等主流方法对比,UniPR-3D在绝大多数数据集和指标上均取得最优结果。

ECCV'26 开源 | UniPR-3D:首个基于3D基座模型的视觉识别框架,不用标定、不看纹理,单帧序列全面碾压SOTA!图7

Nordland数据集拍摄于挪威,横跨四季——同一段铁路,春夏秋冬外观迥异。UniPR-3D在此类极端视觉变化场景下的提升尤为显著,正是三维几何感知发挥作用的地方。

3.2 序列匹配(4个数据集)

与SeqSLAM、SeqNet、CaseVPR等序列方法对比,UniPR-3D全面领先。

ECCV'26 开源 | UniPR-3D:首个基于3D基座模型的视觉识别框架,不用标定、不看纹理,单帧序列全面碾压SOTA!图8

在要求更严格的2米距离阈值下(Oxford 数据集),UniPR-3D的R@1超出此前最优方法10个百分点以上,差距相当显著。

ECCV'26 开源 | UniPR-3D:首个基于3D基座模型的视觉识别框架,不用标定、不看纹理,单帧序列全面碾压SOTA!图9

3.3 消融:每一块积木都有其价值

  • 2D和3D patch token缺一不可:2D擅长纹理丰富场景,3D在光照/天气变化下更鲁棒
  • cls/register token提供语义层面的额外增益,对整体性能有持续正向贡献
  • 显式注入三维位姿信息反而适得其反:说明3D token本身已经隐式编码了足够的空间关系,多此一举会引入噪声

ECCV'26 开源 | UniPR-3D:首个基于3D基座模型的视觉识别框架,不用标定、不看纹理,单帧序列全面碾压SOTA!图10ECCV'26 开源 | UniPR-3D:首个基于3D基座模型的视觉识别框架,不用标定、不看纹理,单帧序列全面碾压SOTA!图11

4. 总结与展望

UniPR-3D的工作给了我们一个清晰的信号:地点识别不只是“看图找图”,更是“理解空间、感知结构”。当描述子从二维纹理升维到三维几何,系统在面对光照骤变、季节更迭、视角翻转这类极端条件时,展现出了明显更强的韧性。

当然,这条路还有很多值得继续走下去的地方。目前UniPR-3D引入3D token的代价是推理延迟的小幅上升,如何在精度与实时性之间找到更好的平衡,仍是面向实际部署的重要课题。此外,VGGT本身是在大规模数据上预训练的通用模型,针对VPR场景的专项预训练或许能进一步释放其潜力。更长远来看,将几何感知描述子与层级式定位、地图维护等下游任务打通,让机器人真正具备“走过一次就记住”的能力,是这个方向最令人期待的目标。

本文仅做学术分享,如有侵权,请联系删文。

ECCV'26 开源 | UniPR-3D:首个基于3D基座模型的视觉识别框架,不用标定、不看纹理,单帧序列全面碾压SOTA!图12ECCV'26 开源 | UniPR-3D:首个基于3D基座模型的视觉识别框架,不用标定、不看纹理,单帧序列全面碾压SOTA!图13ECCV'26 开源 | UniPR-3D:首个基于3D基座模型的视觉识别框架,不用标定、不看纹理,单帧序列全面碾压SOTA!图14ECCV'26 开源 | UniPR-3D:首个基于3D基座模型的视觉识别框架,不用标定、不看纹理,单帧序列全面碾压SOTA!图15

添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
IP 开源
more
阿里拟对千问大模型商业化用户收取分成,开源免费时代或迎变局
长鑫科技批量造富:12名核心成员身家过亿,碧桂园却卖飞痛失490亿;哈啰电车骑行中断电落锁致博士十级伤残;月之暗面开源Kimi K3模型
Kimi K3开源彻底了!权重、技术报告和训练Infra应开尽开
重磅开源GeoStereo:双目几何大一统,视差+表面法线+点云重建三位一体,破解反光、透明、弱纹理场景,实现高精度3D几何恢复!
8位工程师花一年、耗资近千万的工作,这个开源AI系统7天搞定了
硅谷发起开源联盟,黄仁勋、马斯克带头站队,中国开源模型引发行业主导权之争
Transformer开始构建三维世界:开源模型几张图片秒级生成可探索3D场景
00后创客黄一获近5亿融资,RoboParty加速具身智能开源生态布局
京东开源JoyAI-Video-Edit:视频“边播边改”成现实,流式编辑性能全球领跑
天翼云成为openEuler香港用户组首批成员,共谱开源生态国际化新篇
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号