港科大&阿里开源Glob3R:显式优化前馈几何预测,全局SfM重建新SOTA!

3D视觉工坊 2026-07-21 07:00

点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达

来源:3D视觉工坊

星球内有20多门3D视觉系统课程、3DGS独家系列视频教程、顶会论文最新解读、海量3D视觉行业源码、项目承接、求职招聘等。想要入门3D视觉、做项目、搞科研,欢迎加入!港科大&阿里开源Glob3R:显式优化前馈几何预测,全局SfM重建新SOTA!图1

论文信息

标题:Glob3R: Global Structure-from-Motion with 3D Foundation Models

作者:Junyuan Deng, Heng Li, Kejie Qiu, Lingteng Qiu, Rui Peng, Weichao Shen, Weihao Yuan, Siyu Zhu, Zilong Dong, Ping Tan

机构:The Hong Kong University of Science and Technology、Tongyi Lab, Alibaba Group、Nanjing University、Fudan University

原文链接:https://arxiv.org/abs/2607.09225

代码链接:https://junyuandeng.github.io/Glob3r/

导读

近年来出现的各种3D几何基础模型,如VGGT,能够通过直接从输入图像中预测相机姿态和3D场景点,从而实现高效的3D重建。不过,这些模型的重建结果仍不够精确;而且,当处理长序列或大规模的无序图像集时,通常需要采用分块处理的方式,而这会导致误差和不一致性。我们提出了Glob3R,这是一种基于3D基础模型的全局SfM风格重建方法。我们的核心思路是优化前馈式的几何预测过程。为此,我们在已固定的Pi3X架构上添加了一个轻量级的密集匹配模块,该模块可用于预测选定参考帧与相邻视图之间的图像变形情况。这些密集的变形信息会被转化为稀疏但可靠的多视图特征轨迹,为全局优化提供对应关系约束。此外,我们还引入了一种基于关键帧的滑动窗口关联策略,该策略能够将特征轨迹及相对姿态在重叠的窗口之间传递,从而实现可扩展的重建。最后,通过全局运动平均和束调整技术,我们可以进一步优化相机姿态,减少尺度不一致性问题,并恢复出精确的3D场景结构。在室内、室外、大规模驾驶场景以及无序SfM数据集上的大量实验表明,Glob3R能够实现稳定且精确的重建效果。它的性能优于现有的前馈式基础模型以及最新的可扩展重建方法,同时也比传统的SfM流程更具稳定性。经过优化的相机姿态还能提升神经渲染的质量,这进一步证明了将基础模型先验知识与全局几何优化相结合的优势。

效果展示

对新视角合成的定性比较。我们的方法生成更干净的渲染结果,并减少由姿态引起的伪影。

港科大&阿里开源Glob3R:显式优化前馈几何预测,全局SfM重建新SOTA!图2

KITTI Odometry上的相机轨迹比较。我们的方法更好地保持全局轨迹形状,并减少长驾驶序列中的漂移。

港科大&阿里开源Glob3R:显式优化前馈几何预测,全局SfM重建新SOTA!图3

引言

从图像集合中重建三维场景始终是计算机视觉领域的一个基本挑战,也是增强现实、机器人、自主导航和神经渲染等应用的基石。近年来,基于学习的三维几何基础模型,包括DUSt3R、VGGT、Pi3X以及其他近期方法,已作为一种新的重建范式出现。与传统的流程不同,这些模型以端到端的方式,直接从任意图像集预测相机位姿以及稠密的逐像素几何信息,即深度或场景坐标。这种能力为有序图像序列和无序图像集合的三维重建提供了稳健且高效初始化。尽管取得了这些进展,现有的三维几何基础模型仍然受限于精度和可扩展性的不足。它们的前馈预测提供了强有力的全局先验,但所估计的相机位姿和尺度通常只是近似正确,这限制了它们在神经辐射场和其他视图合成流程等高保真应用中的使用。一个关键原因是,许多模型采用运动恢复结构生成的监督进行训练,其中位姿和几何由COLMAP等工具生成,而非真实测量的真值,从而将重建流程的噪声和偏差传递到了学习到的预测中。同时,GPU内存限制使得在单次前馈中处理长序列或大规模图像集合变得困难。近期基于VGGT的方法通过将输入分块并对块级预测进行简单的SE(3)或Sim(3)变换对齐来解决此问题,但这种拼接策略提供的跨块约束有限,并会累积位姿和尺度误差。其他基于测试时训练、循环记忆或序列特定架构的方法提高了可扩展性,但通常需要重新训练骨干网络或假设顺序输入,从而降低了它们在无序图像集合上的灵活性。

与基于学习的前馈预测相比,经典的SfM流程通常能通过显式建立对应关系并借助优化精化几何,得到更高的位姿精度。其精度主要来源于显式的几何约束,如三角化和光束法平差。现有的SfM流程通常分为增量式和全局式两种范式。增量式SfM,如COLMAP,逐张注册图像并反复进行光束法平差,使其对噪声较大的成对几何具有鲁棒性,但计算代价高且对注册顺序敏感。全局式SfM,如GLOMAP,则从成对相对运动构建位姿图,并通过旋转平均、平移平均以及后续的光束法平差来联合估计所有相机位姿,这使其比增量式重建快得多。然而,其性能仍依赖于位姿图的质量,在具有挑战性的场景中,不可靠的对应或离群相对位姿会使重建变得脆弱。

这些观察指出了一个自然的方向:利用三维基础模型预测多视图对应关系以及相对运动和稠密几何,然后采用全局SfM的原则来优化重建。这一结合方式恰好能应对两种范式的局限性。基础模型提供稳健的几何初始化,包括相机位姿、点图以及置信度估计,这使得构建可靠的位姿图成为可能。更重要的是,其中间特征编码了跨视图的几何与结构线索,使其能有效用于对应关系预测并减少离群匹配。基于这些对应关系和生成的位姿图,全局位姿估计和光束法平差可以联合精化相机位姿和场景结构,从而大幅提升重建精度。

具体来说,我们以Pi3X为基础构建框架,并引入一个稠密匹配头,用于预测选定帧与其他视图之间的图像扭曲和置信度。稠密扭曲被转换为稀疏但可靠的多视图轨迹,为全局优化提供显式的对应约束。为有效选择关键帧并关联长序列,我们进一步提出了一种基于关键帧的滑动窗口策略,该策略利用预测的局部点图、相机位姿和置信度图。与仅仅拼接独立块不同,我们的方法利用重叠窗口在整个序列中传播轨迹和相对位姿,并在帧级别执行后续优化。这些局部预测和轨迹关联首先被转换为一个初始的全局位姿图。然后,我们进行运动平均(包括旋转平均和平移平均),接着进行光束法平差,以减少尺度不一致、精化相机位姿,并从优化后的重建中恢复稠密几何。在多个基准数据集上的广泛实验证明了我们流程的有效性。与端到端基线相比,我们的方法在新视角合成中将PSNR提高了2–3 dB,比基于COLMAP的位姿高出约1 dB。在KITTI数据集上,与近期的流式方法相比,它将轨迹RMSE降低了10%–50%。在ETH3D数据集上,与最新的基于学习的SfM基线相比,它大幅提升了旋转精度,并使平移精度几乎翻倍。

主要贡献

我们的主要贡献总结如下:

• 我们提出了一个以基础模型为指导的框架,将前馈三维预测转化为可优化的几何约束,将鲁棒的学习先验与全局SfM精化相结合。

• 我们引入了一个稠密变形模块以及基于关键帧的滑动窗口关联策略,以在长序列和无序图像集合中提取可靠的特征轨迹。

• 在室内、室外、大规模驾驶以及无序SfM基准上的大量实验表明,我们的方法在几何精度上显著优于先前的方法。

方法

图1展示了我们方法的流程。给定一个图像集合,我们的目标是估计全局一致的相机位姿并恢复场景几何。我们基于Pi3X的网络架构:图像由冻结的三维基础模型处理,以获得粗略的几何先验,包括相机位姿、局部点图和置信度图。为预测多视图特征匹配,我们进一步引入一个稠密匹配头,该头预测选定关键帧与其他帧之间的图像扭曲和置信度。滑动窗口关联策略选择关键帧,将稠密扭曲转化为稀疏的多视图轨迹,并将局部窗口连接成一个位姿图。全局优化阶段包括运动平均、光束法平差和稠密重建。

港科大&阿里开源Glob3R:显式优化前馈几何预测,全局SfM重建新SOTA!图4

实验结果

我们将我们的方法与一系列重建和SLAM基线进行比较,包括经典的SfM方法COLMAP和GLOMAP,前馈三维基础模型如DA3和Pi3X,流式SLAM系统如DROID-SLAM,以及近期的长序列或SfM风格的学习方法,如VGGT-Long、VGGT-SLAM、LingBotMap、LoGeR、SCAL3R、SAILRecon、MASt3R-SLAM和AMB3R。更多基线细节和额外对比请参阅补充材料。

Tanks and Temples。表1报告了在T&T上的新视角合成结果,其中更高的PSNR表示更准确且一致的相机位姿。我们的方法取得了最佳的平均PSNR,平均上超越了经典的SfM系统COLMAP和GLOMAP,以及基于学习的重建方法。尽管GLOMAP在几个场景上获得了很强的结果,但由于位姿图中不准确的边和离群值,其性能不够稳定。相比之下,我们的方法受益于基础模型的几何先验,这为后续优化提供了稳健的初始位姿和点图。与DA3和Pi3X等前馈方法相比,我们的方法实现了更优的重建质量,表明仅靠前馈的全局推理不足以实现高精度的位姿估计。近期的流式或后优化流程,包括LingBotMap、LoGeR、Scal3R和SAILRecon,在该基准上同样处于劣势。这揭示了我们的动机:三维基础模型提供了稳健但粗糙的位姿初始化和几何感知特征,而经典的全局SfM可以精化几何,但对不可靠的位姿图敏感。通过将稠密扭曲转化为可靠的多视图轨迹,我们的方法弥合了这两者,并使得稳定的全局SfM式优化能够服务于高保真重建。

港科大&阿里开源Glob3R:显式优化前馈几何预测,全局SfM重建新SOTA!图5

TUM RGB-D。表2评估了小规模RGB-D室内序列的位姿精度。在这些未标定的方法中,我们的方法取得了最佳平均RMSE,且与近期的SLAM和重建系统相比仍具竞争力。该基准包含频繁旋转、有限基线和外观变化的短室内轨迹,对特征匹配及随后的几何优化构成了挑战。虽然我们的方法需要显式特征匹配,但在这些困难的运动设定下仍然保持稳定。这些结果表明,我们的方法对于需要精确局部位姿精化的紧凑室内序列是有效的。

港科大&阿里开源Glob3R:显式优化前馈几何预测,全局SfM重建新SOTA!图6

KITTI。表3评估了长序列驾驶场景。我们的方法在所有KITTI序列上取得了最佳平均RMSE。该基准具有挑战性,因为前向的车辆运动通常产生较小的视差、弱的三角化和不稳定的特征匹配。因此,经典的SfM方法在此类场景中容易失败或产生高昂的计算代价。近期的可扩展或流式重建方法,包括VGGT-Long、Scal3R、LoGeR和LingBotMap,通过分块处理、测试时优化或流式更新缓解了内存问题,但在长驾驶序列中仍会累积轨迹误差。相比之下,我们的滑动窗口关联将稠密扭曲转换为稀疏轨迹,并通过重叠窗口传播这些轨迹,从而在整个序列上实现帧级别的位姿优化。

港科大&阿里开源Glob3R:显式优化前馈几何预测,全局SfM重建新SOTA!图7

ETH3D。表4报告了在无序SfM风格图像集合上的结果。我们首先在使用相同视图图连通性的条件下与GLOMAP进行比较。尽管我们的优化遵循类似的全局SfM公式,GLOMAP在该场景下表现明显下降,因为视图图中的错误边会严重影响旋转平均和平移平均。相反,我们的方法受益于几何基础模型先验和置信度感知的稠密匹配,为全局优化提供了更可靠的轨迹。我们的方法也显著超越了强大的基于学习的基线如AMB3R-SfM。在宽松的5°阈值下,我们的方法在大多数场景上达到了饱和或接近饱和的RRA@5和RTA@5;在更严格的1°阈值下,其RRA@1和RTA@1仍远高于AMB3R,表明高精度SfM评估中的相对位姿更为准确。

港科大&阿里开源Glob3R:显式优化前馈几何预测,全局SfM重建新SOTA!图8

总结 & 未来工作

我们提出了一个以基础模型为指导的全局SfM框架,将前馈三维预测转化为可优化的几何约束。我们的方法利用冻结的基础模型预测的几何和跨视图特征,来构建可靠的对应关系和初始位姿图。通过基于关键帧的滑动窗口策略,这些约束被传播到长序列和无序图像集合中。全局位姿估计和光束法平差随后精化位姿,减少尺度不一致,并恢复稠密几何。在多个基准上的实验表明,我们的框架将三维基础模型的鲁棒性与全局SfM式优化相结合,实现了高效且高保真的重建。

未来工作。我们当前的滑动窗口策略采用固定的窗口大小。根据运动类型、视觉重叠和匹配置信度自适应调整窗口大小,可能进一步提升效率和鲁棒性。此外,匹配头仍依赖于底层基础模型的几何预测。减少这一依赖,并提高对不完美初始几何的鲁棒性,仍是未来研究的重要方向。

对更多实验结果和文章细节感兴趣的读者,可以阅读一下论文原文~

本文仅做学术分享,如有侵权,请联系删文。

港科大&阿里开源Glob3R:显式优化前馈几何预测,全局SfM重建新SOTA!图9港科大&阿里开源Glob3R:显式优化前馈几何预测,全局SfM重建新SOTA!图10港科大&阿里开源Glob3R:显式优化前馈几何预测,全局SfM重建新SOTA!图11港科大&阿里开源Glob3R:显式优化前馈几何预测,全局SfM重建新SOTA!图12

添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。

声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
开源 阿里
more
Hausdorff降低18.8%!华科开源SubdivAR,暴涨三维网格细分精度!
ICML 2026|全球首个「信息瓶颈适配器」VLA鲁棒性架构开源,星尘智能StableVLA让机器人再不怕「眼花」
港科大沈劭劼团队重磅开源!CO-Calib:揭秘鱼眼标定失败真凶,成功率从68.1%飙至99.3%!
国产最大端侧模型独角兽官宣进军具身智能,一口气发布并开源两款具身模型
像聊天一样做CAD建模!浙大开源智能体让建模变打字,已登国际CAD顶刊
1.5B开源通用VLA模型,冲进具身智能第一梯队
全球首个小时级世界模型来了!中国造,已开源
仅用开源工具,国产大模型48小时完成芯片设计!EDA 巨头股价大跌
2.8万亿参数!Kimi开源大模型破纪录了
刚刚,首个空间原生的具身视觉基模开源!机器人更会看我们的世界了
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号