点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
来源:3D视觉工坊
星球内有20多门3D视觉系统课程、3DGS独家系列视频教程、顶会论文最新解读、海量3D视觉行业源码、项目承接、求职招聘等。想要入门3D视觉、做项目、搞科研,欢迎加入!
论文信息
标题:GeoMix: Descriptor-Free Visual Localization via Global Context and Multi-Detector Training
作者:Yejun Zhang, Xinjue Wang, Zihan Wang, Esa Rahtu, Juho Kannala
机构:Aalto University、Tampere University、University of Oulu
原文链接:https://arxiv.org/abs/2607.02486
代码链接:https://github.com/YejunZhang/Geomix
导读
无描述符的视觉定位方法无需存储高维描述符,能够保护场景隐私并简化地图维护工作,但其精度仍远远低于基于描述符的定位方法。我们认为,造成这一差距的原因是仅依靠几何特征进行匹配时,几何特征的区分度不足。在没有视觉信息的情况下,现有方法无法充分利用局部几何特征,也无法把握关键点之间的整体结构,同时还容易过度依赖某个特定的关键点检测器。我们进一步发现,无描述符匹配方法天然适合多检测器训练——因为不同的关键点可以在共享的几何空间中得到优化,而无需对描述符空间进行对齐处理。基于这些见解,我们提出了GeoMix这一无描述符的2D-3D匹配框架,该框架从三个层面提升了几何特征的区分度:在局部层面,通过方向和距离信息来增强邻域聚合效果,从而形成更精细的空间结构;在全局层面,通过可学习的上下文节点,利用交叉注意力机制整合并重新分配整个场景的信息,从而解决局部感知范围之外的模糊问题。在训练层面,Mix-Training算法则利用这种与检测器无关的几何空间,帮助学习多个关键点检测器的特征表示。在MegaDepth、Cambridge Landmarks、7Scenes以及Aachen Day-Night等数据集上的实验表明,GeoMix在无描述符方法中达到了新的最佳水平:其75百分位旋转误差降低了89%,平移误差则降低了90%,同时还能实现零样本适配,即无需针对特定检测器进行训练,从而缩小了与基于描述符的定位方法的差距。
效果展示
视觉定位流程的比较。(a)基于描述符的方法可实现高准确性,但需要大量存储空间,引发隐私担忧,且地图维护成本高昂。(b-i)无描述符的方法提供紧凑、保护隐私的定位功能,但在准确性上有所欠缺。(b-ii)GeolMix通过具有方向性和距离感知的几何嵌入、全局上下文节点以及Mix-Training策略来弥合这一差距。Dir.:方向;Dist.:距离;GC:全局上下文。

引言
精确的相机定位是自主导航、增强现实和大规模建图的基础。主流范式通过视觉描述子将局部图像特征与预先构建的三维地图进行匹配,并使用PnP-RANSAC求解器恢复位姿,从而实现高精度。然而,这一成功是有代价的:为数百万个三维点存储高维描述子会消耗大量内存,描述子可被反推以揭示敏感场景内容,且每当观测到新图像时需要重新计算描述子来更新地图。这些限制推动了无描述子定位的发展,该方法通过关键点位置和空间关系等几何线索来表示关键点,从而实现紧凑且保护隐私的地图。尽管有这些实际优势,无描述子方法在精度上仍显著落后于基于描述子的方法,致使其无法应用于对精度要求严格的系统。
精度差距反映了一个根本性挑战。在没有视觉外观的情况下,网络必须仅从几何中提取足够有判别力的信号,而现有方法在这一过程的每个阶段都存在不足。在局部层面,图神经网络中的邻域聚合依赖于基本的空间关系,忽视了能够增强逐点判别力的方向和度量线索。在全局尺度上,局部图卷积算子的感受野有限;走廊或建筑立面等重复结构在局部几何上难以区分,因此会产生模糊的对应关系。在训练层面,现有方法使用单一关键点检测器进行训练,导致网络吸收了检测器特有的模式,而不是学习可在不同条件下迁移的几何知识。
然而,我们观察到,无描述子这一形式本身隐藏着一个未被发掘的优势。在基于描述子的流程中,每个关键点检测器与其自身的描述子空间紧密耦合,因此切换检测器需要调和互不兼容的表示。无描述子设置则完全消除了这种耦合:由于匹配完全依赖于几何关系,来自任何检测器的关键点都可以互换。这种与检测器无关的特性尚未被先前的方法所利用,但它为更强的泛化能力开辟了一条自然的路径——同时在多种检测器上训练,迫使网络学习超越任何单一检测器特性的几何知识。
基于这一观察,我们提出了GeoMix,一个无描述子的二维-三维匹配框架,它通过丰富的局部-全局表示以及在多个检测器上的混合训练,在三个层面增强了几何判别力。在局部层面,方向感知和距离感知的嵌入通过细粒度的空间结构丰富了邻域聚合。在全局层面,可学习的全局上下文节点通过交叉注意力聚合和重新分配全局信息,使每个特征能够解决其局部感受野之外的歧义。在训练层面,我们的混合训练策略在多个关键点检测器上联合优化,利用无描述子设定独有的检测器无关特性,学习稳健的几何表示。在MegaDepth、Cambridge Landmarks、7Scenes和Aachen Day-Night上的大量实验表明,GeoMix在无描述子方法中树立了新的最优水平,将第75百分位的旋转误差降低了89%,平移误差最多降低了90%,大幅缩小了与基于描述子流程的差距。
主要贡献
我们的贡献如下:
– 我们提出了GeoMix,一个无描述子的二维-三维匹配框架,在局部和全局层面增强了几何判别力:方向感知和距离感知的嵌入在邻域聚合中锐化了逐点判别,而可学习的全局上下文节点通过交叉注意力聚合和重新分配场景全局信息,以消除重复结构的歧义。
– 我们提出了混合训练,一种由无描述子设定独特支持的多检测器训练策略:由于来自任何检测器的关键点在没有描述子时均可互换,联合优化迫使网络学习可泛化到测试时完全未知检测器的几何知识。
– 在四个基准上的大量实验表明,GeoMix将第75百分位旋转误差相比此前最佳的无描述子方法降低了89%,平移误差最多降低了90%,同时可零样本泛化至未见过的检测器。
方法
图2展示了我们的架构,它建立在无描述子的A2-GNN骨干网络之上。该模型包含一个方位/RGB特征编码器、一个使用角-环形卷积和最大池化进行局部结构建模的几何聚合GNN、一个全局上下文机制、一个用于可微对应估计的最优传输层以及一个外点剔除模块。在继承A2-GNN的编码器、局部聚合、最优传输和外点剔除模块的同时,我们的GeoMix引入了图1(b-ii)中的三个关键组件:方向与距离边嵌入、可学习的全局上下文节点和混合训练策略。这些组件增强了局部和全局几何嵌入,并提高了鲁棒性。

不同的关键点检测器采用不同的检测策略,产生显著不同的关键点分布。如图3所示,SIFT偏好斑点状结构,SuperPoint偏好角点区域,而DISK则针对可重复的局部特征,导致在同一张图像上共享的关键点很少。然而,现有的无描述子方法通常使用单一检测器进行训练,导致网络过拟合于该检测器的关键点分布,并难以泛化到其他检测器。
为解决这一问题,我们引入了混合训练,一种由无描述子设定独特支持的多检测器训练策略。在基于描述子的方法中,每个检测器与其自身的描述子空间紧密耦合,在不调和互不兼容表示的情况下混合检测器是不现实的。无描述子形式化消除了这一限制:由于匹配纯粹基于二维-三维对应之间的几何关系,来自任何检测器的关键点都可以直接作为输入,无需修改匹配流程。具体而言,我们维护一个包含L个检测器的池 S = {D_l}(实践中L=3)。对于每张查询图像,我们独立地应用全部L个检测器,生成L组不同的二维关键点。每组关键点与相同的三维场景点配对,为每张图像产生L个训练样本。注意,我们固定三维一侧,仅改变二维查询端的检测器,因为三维地图是通过SfM使用SIFT重建的,为每个检测器重新生成地图将过于昂贵。通过让网络在共享三维几何下接触多样化的关键点分布,混合训练促使网络进行检测器不变的几何推理,并提升在测试时对未知检测器的泛化能力。在推理时,使用单个检测器仍为每个查询产生1024个关键点,与单检测器训练相同,因此增益来源于检测器的多样性,而非更大的关键点预算。

实验结果
匹配与定位结果。表1比较了在不同测试时检测器下单一训练(仅SIFT)和混合训练(SIFT、SuperPoint、DISK)的表现。单一训练遭受严重的跨检测器性能退化,暴露出强烈的检测器特定偏置。混合训练解决了这一问题:它不仅大幅缩小了跨检测器差距,还提升了同检测器性能,表明多样化的检测器接触充当了一种正则化手段,增强了几何推理。

我们进一步在MegaDepth上使用k=10张检索图像,与先前的无描述子方法进行比较,如表5所示。GeoMix以显著优势超越所有基线,相较于A2-GNN,AUC@5/10px提升了+11.20/+11.52%。位姿估计的增益同样惊人:第75分位旋转误差从4.60°降至0.52°,平移误差从0.48降至0.05,两者均减少了约90%。为了独立于PnP-RANSAC评估匹配器质量,我们还在补充材料中报告了MegaDepth上仅匹配器的指标(精确率、召回率、F1值),GeoMix在所有三项上均取得最佳分数,与基于位姿的排名一致。

为了验证跨数据集迁移能力,我们在Cambridge Landmarks和7Scenes上进行了评估,如表2和表3所示。GeoMix在所有场景的无描述子方法中均取得了最优结果,在具有挑战性的场景上增益最大,如Old Hospital的平移误差降至27厘米,比A2-GNN低54%;Stairs场景下GeoMix达到45厘米/11.1°,而A2-GNN为72厘米/17.0°。这些结果大幅缩小了与基于描述子的方法(如SuperPoint+SuperGlue)的差距,同时仅需69 MB存储空间(对比3215 MB),并且从设计上保护了隐私。场景坐标回归器如DSAC*也很紧凑,但必须为每个场景重新训练(每个场景数小时),而GeoMix在MegaDepth上训练一次后即可零样本复用;即便是32维紧凑描述子,所需的存储仍大约是我们纯几何地图的6倍。


总结 & 未来工作
我们提出GeoMix,一个无描述子的二维-三维匹配框架,它在三个互补的层面增强了几何判别力:局部层面通过方向和距离感知嵌入,全局层面通过可学习的上下文节点聚合和重新分配场景全局信息,训练层面通过混合训练利用无描述子设定独有的检测器无关特性,来学习能泛化到已见甚至未见检测器的几何知识。在四个基准上的大量实验表明,GeoMix在无描述子方法中树立了新的最优水平,大幅缩小了与基于描述子流程的差距,同时保持了紧凑的存储、隐私性和零描述子维护开销。尽管取得了这些进展,但与基于描述子的方法之间仍存在性能差距,特别是在离群点比例较高的情况下,纯粹的几何线索缺乏足够的判别力。此外,三维地图是用固定的检测器重建的,可能对特定的点分布引入残留偏差。地图仍然可以增量扩展:新图像仅以其位姿和三维点关联加入,任何用于三角化新几何的描述子仅临时使用并被丢弃。未来的工作可以联合多样化三维重建端,并融入轻量级外观线索,在不损害无描述子范式优势的前提下进一步缩小差距。
对更多实验结果和文章细节感兴趣的读者,可以阅读一下论文原文~
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。