AerialMegaDepth:面向空中-地面跨视角三维重建与视图合成的混合伪合成-真实数据学习框架

3D视觉工坊 2026-09-19 00:00

点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达

来源:3D视觉工坊

3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:AerialMegaDepth:面向空中-地面跨视角三维重建与视图合成的混合伪合成-真实数据学习框架图1

1. 引言

配准、重建或一般性地推理多视角图像的能力一直是计算机视觉的基石任务。虽然经典流程利用了手工设计的特征和匹配机制,其后续版本已纳入若干基于学习的组件,例如学习特征或学习的“分身”检测器。最近,方法已偏离这种经典流程,直接以端到端方式学习多视角任务,如2D对应、相机估计、点图预测和新视角合成。这种向基于学习的组件和方法的转变带来了令人印象深刻的进展,特别是在具有挑战性的场景中,例如稀疏采样的输入或变化的光照。

这一进展的大部分是由像MegaDepth这样的大型众包图像集合推动的,它提供了使用运动恢复结构(SfM)从数千张游客上传的图像在各种地标处构建的精确3D重建。这种3D数据为几何任务提供了宝贵的监督,并对多视角学习算法产生了变革性影响。然而,由于这些图像主要由游客拍摄,它们大多覆盖地面级视角,在某些情况下覆盖航空视角,但很少同时覆盖两者。因此,像DUSt3R和MASt3R这样的方法,尽管在包括MegaDepth在内的多样化“野外”数据集上训练,但在手持(地面级)和无人机(航空)视角之间的大视角变化下表现不佳,如图1所示。例如,在我们的评估中,预训练的DUSt3R在从地面-航空对配准相机(旋转误差小于)时仅达到约的成功率。

我们的核心假设是,这一限制源于缺乏包含共配准地面-航空图像对的训练数据。虽然独立的地面和航空相机位姿容易获得,但将它们合并到统一坐标系中通常需要专用传感器或手动操作,限制了可扩展性。为解决这一问题,我们提出了一种灵活且可扩展的数据生成框架,利用像Google Earth这样的地理空间平台,这些平台渲染城市和地标的3D纹理网格——提供了另一个庞大的数据源。我们将这些网格渲染称为伪合成,因为它们是从实际地标的3D网格渲染而来,并用真实照片纹理化。我们通过从这些纹理网格以不同高度渲染航空-地面视角来构建伪合成数据。虽然仅使用这些图像显示出有希望的改进,但从地面级视角的此类网格渲染并不那么逼真,由于光照、纹理和其他视觉细节的差异,与真实图像存在域差距。为缓解这一问题,我们提出将大量可用的真实地面图像(例如来自MegaDepth)与伪合成图像在同一坐标系中共配准。伪合成数据在不同高度捕获,模拟了广泛的航空视角,而真实的众包图像有助于提高视觉保真度,特别是对于网格渲染缺乏细节的地面级图像。我们将此混合数据集称为AerialMegaDepth,图1展示了我们数据中的一些地标,包含137个场景中的132,137张共配准的真实和伪合成图像。

AerialMegaDepth:面向空中-地面跨视角三维重建与视图合成的混合伪合成-真实数据学习框架图2

从该数据集,我们生成了超过150万个空-地图像对,并微调了若干最先进的重建算法,在真实世界混合高度图像上显示出显著改进(示例见图1)。定量上,微调像DUSt3R和MASt3R这样的3D预测模型将相机配准成功率(旋转误差小于)从仅提高到近。此外,我们的数据集还改进了具有挑战性的空-地场景中的新视角合成(见图1)。最后,我们强调我们的框架灵活且可扩展,不仅适用于MegaDepth,还适用于其他众包数据集和地理空间平台,使得利用几乎无限的数据源来学习空-地3D重建成为可能。

AerialMegaDepth:面向空中-地面跨视角三维重建与视图合成的混合伪合成-真实数据学习框架图3

2. 相关工作

多视角3D与几何数据集。过去十年发布的若干数据集推动了多视角3D几何的前沿。互联网来源的地标数据集如MegaDepth和IMC-PT大多具有地面级视角。但这些数据集(其真值使用SfM构建)仍然推动了单目深度估计、多视角立体、学习特征匹配、学习位姿回归等。像BlendedMVS这样的数据集通过混合来自纹理3D网格的渲染图像与输入真实图像来生成训练图像。然而,这些数据集中的场景仅从无人机或地面捕获,而非同时从两者捕获。这是因为捕获具有剧烈视角变化的数据具有挑战性,需要专用传感器或手动操作。相反,我们的伪合成数据与真实地面图像配对,以同时具有航空和地面视角来锚定场景。

基于3D城市网格的数据集也已被提出。相比之下,我们的数据集在统一坐标系中包含同一地标的真实和伪合成数据。虽然纯合成数据已用于各种3D学习任务,但这些数据集未锚定到真实场景,使得难以弥合仿真到现实的差距。使用3D网格与图像查询的方法已被探索用于其他任务,如视觉位置识别和定位。

多视角3D学习。在大规模监督的驱动下,基于学习的方法产生了更稳健的特征匹配、位姿估计和统一坐标系中3D点图的直接回归。同样,从输入视角以相机位姿为条件生成新视角也由像MegaScenes这样的大型数据集实现。然而,由于监督数据有限,这些方法在极端地面-航空视角下表现不佳。我们表明,我们的混合真实和伪合成数据显著提高了此类基于学习的方法在真实混合高度图像上的性能。

空-地配准。先前工作使用专门的经典和基于学习的方法解决了空-地配准。我们的工作是正交的,因为我们提出了一个混合数据集,可能改进这些方法以及其他任务。同样,共配准的地面-航空数据集非常少。MAVREC和University1652不提供深度或位姿信息,GrAco仅包含单色图像且规模较小。我们还将我们的工作与卫星-地面定位区分开来,因为卫星视角是正交且遥远的,而我们数据中的视角更接近无人机视角,与地面视角共享共同(尽管很小)的视场。

3. 生成空-地3D数据

为解决空-地3D数据的稀缺性,我们引入了一种方法,将来自3D城市级网格模型的渲染与真实众包图像相结合。3D网格生成跨越不同高度和方向的伪合成渲染,特别是航空视角,而真实图像则补充了地面级

AerialMegaDepth:面向空中-地面跨视角三维重建与视图合成的混合伪合成-真实数据学习框架图4

3.1 伪合成数据生成

我们选择Google Earth作为主要数据源,因为其质量和地标覆盖范围,允许我们从任意视角渲染图像。然而,我们的框架与任何地理参考的3D纹理网格兼容。这些图像被称为伪合成,因为它们是使用真实照片纹理化的3D网格的渲染。

自动生成查询视角。我们的目标是渲染与彼此以及与MegaDepth的真实图像具有足够视觉重叠的图像。我们从MegaDepth的场景开始,它包含196个地标的SfM重建,每个地标有数千张互联网来源的图像。虽然这些图像中的EXIF GPS标签不够精确,无法用于准确的共配准或对齐,但我们使用它们来粗略采样Google Earth的渲染视角,确保它们对应于同一建筑或地标。这是通过使用从噪声GPS数据计算的相似变换将局部3D重建地理参考到全局ECEF帧来实现的。为确保渲染图像之间的共可见性,我们从地理参考点云中采样200个点作为注视目标,用于生成查询视角。这确保了我们渲染的伪合成图像彼此之间以及与MegaDepth的真实图像之间保持足够的视觉重叠。

生成伪合成3D重建。虽然用户可以从任何位置和方向指定和渲染图像,但Google Earth不提供对底层3D网格的直接访问。因此,为了从渲染的伪合成图像(其相机外参和内参已知)中恢复场景几何,我们提取关键点并在伪合成渲染图像之间匹配特征,以三角化3D点云。通过这个过程,我们从137个站点或地标生成了数据,每个站点有600张图像,取自不同高度,范围从1米到350米,总共82,220张伪合成图像。我们称之为伪合成重建。

3.2 共配准真实众包图像

虽然来自3D纹理网格的伪合成图像可以直接改进几何预测任务——如第5节所示——但我们做出两个关键观察,有助于进一步提高下游性能。首先,由于这些网格通常从航空图像纹理化,它们从高处的无人机视角看起来往往很逼真,但在地面级往往缺乏视觉保真度,低视角会在建筑立面上引入伪影。地面级伪合成与真实图像之间也存在域差距,例如缺乏瞬态物体和简化的光照模型,这可能限制对真实世界数据的泛化。其次,尽管有这些限制,基于网格的视觉定位方法表明,使用最先进的特征匹配,真实图像仍然可以准确地配准到伪合成重建,如图3所示。因此,为了结合真实和伪合成图像的优点,我们将真实的地面级图像配准到伪合成重建中,从而得到对齐的真实(地面)MegaDepth和伪合成(航空)图像。

AerialMegaDepth:面向空中-地面跨视角三维重建与视图合成的混合伪合成-真实数据学习框架图5

具体来说,我们遵循标准视觉定位流程,首先为每个真实MegaDepth查询图像检索前个最相似的伪合成图像。2D对应关系使用伪合成3D点提升为2D-3D匹配,每个查询图像的6-DoF位姿使用基于RANSAC的PnP求解器估计。我们通过优化定位的MegaDepth图像同时保持伪合成相机固定来细化对齐。使用COLMAP的MVS,我们生成半稠密深度图用于监督。总共,我们在137个场景中将49,937张MegaDepth图像与82,200张伪合成图像配准,形成了AerialMegaDepth——一个包含132,137张图像、具有多样视角和光照变化的混合数据集,如图4所示。

4. 学习空-地3D重建

我们探索我们的数据对多视角3D重建和新视角合成的监督学习的影响。

选择图像对作为监督数据。我们的目标是选择提供足够重叠以进行有效监督的图像对,特别是对于具有高度差的地面到航空对,确保重叠既不太高(使任务太容易)也不太低(使任务太难)。为实现这一点,我们为每个场景计算一个共视矩阵,其中每个元素

AerialMegaDepth:面向空中-地面跨视角三维重建与视图合成的混合伪合成-真实数据学习框架图6

表示图像中在图像中可见的点的百分比。对于地面到航空设置,我们优先选择具有显著视角差异的对,这意味着共视是不对称的:我们选择对使得小且大,或反之。我们用分数量化这种差异,其中AM是的算术平均,HM是调和平均。高分表示具有大视角差异的对,非常适合具有挑战性的跨视角任务,符合我们优先选择地面到航空对的目标。使用这种方法,我们生成了一个包含150万图像对的变化高度数据集,每个图像对都带有相机内参、相机位姿和深度图,用作学习几何任务的监督。

多视角位姿与几何估计。我们考虑从一组张无约束图像中估计内参、外参相机参数和3D场景的问题。遵循DUSt3R的架构,我们回归图像对的点图,其中每个像素与第一帧坐标系中的3D点相关联。这允许我们使用PnP计算每相机焦距(在中心主点的针孔模型下)和每个图像对的6-DoF相对位姿。对于张图像,DUSt3R的全局对齐(GA)步骤结合所有图像的点图,优化3D中的稠密成对图,以在全局坐标系中对齐点图。我们使用在来自八个数据集的数百万图像对上训练的DUSt3R检查点初始化,并在我们的数据上微调,从而在地面-航空相机配准方面取得显著改进。我们还观察到通过微调MASt3R并将其用作前端提供2D-2D对应关系,然后将其馈入COLMAP进行捆绑调整(类似于MASt3R-SfM中的方法),也取得了类似的改进。

新视角合成。对于单图像新视角合成(NVS),我们的目标是从参考航空图像合成合理的目标地面视角。Tung等人在MegaScenes上微调了ZeroNVS,使用来自32K场景的超过200万图像对,与以物体为中心的设置相比,在场景级视角合成方面取得了显著改进。通过在我们的变化高度数据集上进一步微调ZeroNVS,我们在航空到地面视角合成方面取得了显著改进。

5. 实验

5.1 多视角位姿估计与重建

数据集。我们使用成对3D点图作为监督,在我们的数据上微调基线模型。对于评估,我们关注地面-航空设置,并包括来自ULTRRA Challenge的数据,该数据由地面级相机和无人机捕获的图像组成,全部使用受RTK校正GPS坐标约束的SfM进行校准,达到厘米级精度。此外,我们使用来自ACC-NVS1的数据,该数据捕获了各种城市场景,其真值位姿通过GNSS/IMU系统获得,并由固定RTK基站校正。总体而言,评估数据包括六个站点,超过5,000张校准的地面-航空图像。

评估指标。遵循相关文献,我们使用相对旋转精度(RRA)和相对平移精度(RTA)评估相机位姿。RRA测量预测与真值相对旋转之间的角度差,RTA计算预测与真值平移向量之间的角度差。我们报告,即RTA/RRA低于阈值的相机对百分比。我们还通过使用基于RANSAC的最优相似变换将DUSt3R的预测点图与MVS的真值对齐来评估重建精度。我们报告 @ [0.5m, 1m, 2m],表示误差在0.5m、1m和2m以内的点百分比。

双视角位姿与几何估计。我们评估我们的数据在双视角情况(一张航空和一张地面图像)下对地面-航空配准的影响。对于DUSt3R,相对位姿使用PnP从预测的2D-3D匹配计算。我们还展示了使用SuperPoint + SuperGlue(SP+SG)的2D对应匹配基线、使用LoFTR的半稠密匹配以及MASt3R,其中对于MASt3R,2D对应关系通过其稠密局部特征图的相互最近邻提取。对于这些方法,我们假设已知真值内参,使用从2D匹配估计的本质矩阵计算相对位姿。

表1显示,所有基线方法,包括SP+SG、LoFTR、DUSt3R和MASt3R,在地面-航空对上表现不佳。例如,基线DUSt3R仅以良好精度(RRA@5°)恢复了总图像对的。虽然在像MatrixCity这样的合成数据上微调显著改进了基线方法,但在伪合成渲染(具有更真实的纹理,包含来自Google Earth的变化高度网格渲染,表示为DUSt3R/MASt3R + PSynth)上微调更有效,将RRA@5°的精度提高到。但最大的改进来自在混合数据上训练(将对齐伪合成网格渲染与真实世界图像以构建对),表示为DUSt3R/MASt3R + Hybrid,将性能提升到超过。这表明我们新颖的真实和伪合成数据混合框架显著改进了地面-航空相机配准。我们注意到,虽然我们的主要评估集中在地面-航空设置,但补充材料中的额外结果表明,即使在使用我们的变化高度数据微调后,DUSt3R和MASt3R在相似视角对(例如地面-地面和航空-航空)上仍然表现良好。

除了位姿精度,我们还观察到3D几何预测的显著改进,特别是DUSt3R的3D点图精度。如表1所示,在我们的组合数据集(DUSt3R + Hybrid)上微调将1米误差内的3D点百分比相比基线DUSt3R提高了。由于我们将

AerialMegaDepth:面向空中-地面跨视角三维重建与视图合成的混合伪合成-真实数据学习框架图7
AerialMegaDepth:面向空中-地面跨视角三维重建与视图合成的混合伪合成-真实数据学习框架图8
AerialMegaDepth:面向空中-地面跨视角三维重建与视图合成的混合伪合成-真实数据学习框架图9

预测和真值点图使用基于RANSAC的相似变换对齐,基线DUSt3R模型即使难以准确配准它们(如位姿精度所示),仍可通过为至少一个视角产生良好的深度估计来达到合理的几何精度。通过在我们的数据上微调,我们在3D点图精度和地面-航空位姿配准方面都看到了显著改进,突显了对位姿和几何预测的影响。我们在图5和图6中展示了定性结果,并鼓励读者查看网站获取更多结果。我们强调这是在未见数据上的零样本性能,因为我们的训练和评估场景之间没有重叠。

将地面图像与航空上下文共配准。我们评估多视角地面-航空相机配准,其中一张航空图像与张地面图像匹配。为了执行多视角位姿估计,我们探索了两种方法:1)DUSt3R的全局对齐(GA)过程,将同一坐标系中的所有预测成对点图合并,2)MASt3R-SfM方法,使用MASt3R作为前端提取2D对应关系,然后进行COLMAP捆绑调整。在表2中,我们报告了仅地面图像的精度。也许不出所料,当地面图像稀疏()时,它们通常缺乏视觉重叠,使得位姿估计特别具有挑战性。在这种情况下,我们观察到使用我们的数据微调的模型性能显著提高(时,从14.63%提高到56.10%)。这种改进的关键原因是,即使地面图像之间几乎没有重叠,单张航空图像也可以作为“俯视图”,帮助将地面图像“拼接”或对齐到共同

AerialMegaDepth:面向空中-地面跨视角三维重建与视图合成的混合伪合成-真实数据学习框架图10
AerialMegaDepth:面向空中-地面跨视角三维重建与视图合成的混合伪合成-真实数据学习框架图11

坐标系中。图7展示了一个示例,证明了我们的方法在这种场景中的有效性。

5.2 新视角合成

数据集。我们关注具有挑战性的航空到地面合成任务。我们将我们的数据集与MegaScenes结合,在微调时使用3:1的比例以帮助防止过拟合。对于评估,我们使用真实世界航空-地面对以及来自Google Earth的伪合成数据,后者包括在各种高度捕获的广泛图像,使我们能够评估模型在多样地面-航空设置中合成视角的能力。

微调细节。我们遵循ZeroNVS进行新视角合成,它以外参矩阵和视场角作为输入,在目标位姿生成新视角。平移向量根据参考图像的第20深度分位数进行缩放(评估时我们使用MVS深度)。从在MegaScenes上训练的ZeroNVS开始,我们在我们的数据集上微调模型,显著改进了地面-航空上下文中的新视角。

评估指标。我们使用标准图像重建指标评估视角合成质量,包括LPIPS、PSNR和SSIM。此外,我们还包括DreamSim分数,它与人类感知判断更一致。

结果与讨论。表3显示了单图像航空到地面新视角合成的显著定量改进。从图8的定性结果中,我们看到ZeroNVS(Ours)生成了逼真且准确的图像,遵循了期望的位姿。相比之下,仅在MegaScenes上微调的ZeroNVS(MS)在此类视角上表现不佳,再次突显了将地面-航空数据纳入训练过程的有效性。我们强调这仍然是一个非常具有挑战性的任务,因为参考和目标位姿之间的视角差异很大。网络必须学会保留底层场景结构,同时为场景的未见部分生成合理的图像和/或展示正确的遮挡。我们的结果表明模型在一定程度上成功解决了这一挑战,但该任务仍有许多研究要做。

AerialMegaDepth:面向空中-地面跨视角三维重建与视图合成的混合伪合成-真实数据学习框架图12
AerialMegaDepth:面向空中-地面跨视角三维重建与视图合成的混合伪合成-真实数据学习框架图13

6. 结论

尽管基于学习的3D重建取得了显著进展,但从稀疏混合的无人机和地面图像进行大面积重建仍然是一个挑战。正如过去十年所示,在以前数据很少的地方添加大量数据可以提高基于监督学习的网络的性能。我们工作的关键创新在于理解地理空间平台和众包图像如何结合,为训练大型空-地3D模型提供潜在无限的数据。使用我们的数据仔细微调现有3D模型在相机估计和配准方面显示出近的改进,这是大规模重建问题的核心。我们希望我们的混合数据框架将有助于推动该领域的进一步研究。

未来,航空无人机视角可以作为地面和卫星视角之间的桥梁,后者数据广泛可用。将它们全部结合起来可以让我们更接近行星级3D重建的宏伟目标。

本文仅做学术分享,如有侵权,请联系删文。

AerialMegaDepth:面向空中-地面跨视角三维重建与视图合成的混合伪合成-真实数据学习框架图14AerialMegaDepth:面向空中-地面跨视角三维重建与视图合成的混合伪合成-真实数据学习框架图15AerialMegaDepth:面向空中-地面跨视角三维重建与视图合成的混合伪合成-真实数据学习框架图16AerialMegaDepth:面向空中-地面跨视角三维重建与视图合成的混合伪合成-真实数据学习框架图17

添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
黄仁勋预判2030年中国突破光刻瓶颈,与蔡司观点存技术维度差异
纳米压印三十年:突破光刻极限的纳米制造革命
亮点展品 | 从光交换到纳米光刻:九维光子相变光子技术亮相CIOE 2026
为什么欧洲做得出光刻机,却做不出大模型?
【IDAS 2026 峰会 · 回顾】 | 东方晶源亮相IDAS 2026:以AI重构先进制程光刻热点检测体系
【一周热点】晶圆代工大厂公布最新财报;先进封装新瓶颈浮现;三星披露下一代光刻技术路线图
国产光刻机量产落地,阿斯麦暴跌8%
黄仁勋力挺美国公司使用中国AI模型;高通拟将芯片价格上调两位数;俄罗斯自研150nm电子束光刻原型机
12英寸掩模版来了!三大晶圆厂光刻机时间表出炉
下一代EUV光刻机,三星定了!
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号