点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
来源:3D视觉工坊
星球内有20多门3D视觉系统课程、3DGS独家系列视频教程、顶会论文最新解读、海量3D视觉行业源码、项目承接、求职招聘等。想要入门3D视觉、做项目、搞科研,欢迎加入!
全景感知以其360度超宽视场覆盖,在机器人导航、自动驾驶、虚拟漫游和文化遗产数字化等领域扮演着不可替代的角色。然而,当我们试图从仅有的几张全景图恢复出完整的三维场景结构时,一个极其棘手的难题横亘眼前:传统的SfM/SLAM流程在旋转主导、弱视差运动条件下往往会陷入病态,初始化失败或精度崩溃成为常态。
当相机主要以旋转方式运动、视差信号微弱到几乎消失,传统的特征匹配与三角化还能否胜任? 现实场景中,手持全景相机原地转动、无人机悬停旋转拍摄、机器人定点环视等情形比比皆是。在这些情况下,图像之间的基线极短,三维点的深度不确定性极高,SfM的bundle adjustment极易发散,SLAM的跟踪也会频繁丢失。这一退化问题长期困扰着稀疏全景3D重建领域,严重制约了全景数据在精确三维建模中的应用潜力。
更为严峻的是,即便SfM/SLAM侥幸完成初始化,稀疏的全景观测仍然难以支撑后续高质量的辐射场重建。视角之间的巨大间隙导致新视角合成出现严重的空洞和伪影,几何一致性更是无从谈起。业界迫切需要一种从根本上摆脱SfM依赖、专为稀疏全景输入设计的重建框架。
东京大学提出的PanoImager框架,作为IROS 2026录用工作,首创了完全无需SfM的稀疏全景3D重建管线。通过前馈位姿/深度先验、几何条件扩散视图补全和深度引导3DGS优化三大模块的协同,PanoImager在极端稀疏条件下实现了稳定且高质量的新视角合成与三维重建,彻底革新了稀疏全景重建的技术范式,为SfM/SLAM无法初始化的场景提供了可靠的离线/后台地图精化方案。
论文信息
论文标题:PanoImager: Geometry-Guided Novel View Synthesis and Reconstruction from Sparse Panoramic Views 作者:Zhisong Xu, Takeshi Oishi 机构:University of Tokyo 原文链接:https://arxiv.org/abs/2606.27071
导读
全景感知提供了广阔的视场覆盖,但从稀疏全景图进行三维重建在旋转主导、弱视差运动条件下仍然极具挑战性。在这种退化情形下,SfM/SLAM的初始化往往病态且不可靠。本文提出PanoImager,一种无需SfM的框架,结合了前馈位姿/深度先验、几何条件扩散视图补全和深度引导的3DGS优化。给定少量全景图像,PanoImager将它们分解为局部透视视图,合成辅助观测以丰富稀疏证据,并通过稳定的高斯优化提升跨视角一致性。在多个基准测试上的实验表明,PanoImager在极端稀疏条件下具有更强的稳定性,可作为SfM/SLAM初始化失败时的离线/后台地图精化组件。这项工作为稀疏全景三维重建提供了一条全新的技术路线,有望推动全景感知在机器人和虚拟现实领域的更广泛应用。
效果展示
图 5:Omniscenes、360roam 数据集定性效果对比。从左至右依次为:真值(GT)、OmniSplat、ODGS、SPaGS 以及本文方法。
引言
全景图像(Panoramic Image)凭借其单张图像即可覆盖360度水平视场和180度垂直视场的独特优势,自诞生之日起就承载着"用最少的观测捕获最大环境信息"的理想。从早期的街景地图采集到如今的Matterport 3D扫描、Insta360消费级全景相机,全景感知技术已经深入到测绘、房地产、旅游和机器人等众多行业。
然而,全景数据的3D重建却始终面临一个结构性矛盾:一方面,单张全景图包含了极其丰富的环境信息,理论上足以支撑高质量的三维建模;另一方面,实际采集设备(如手持全景相机、车载全景系统、机器人环视传感器)在采集多张全景图时,往往因为运动约束或操作习惯而呈现旋转主导、平移微弱的运动模式。这种运动模式对于依赖视差三角化的SfM/SLAM系统来说堪称噩梦——微弱的基线意味着极大的深度不确定性,旋转运动则使得本质矩阵分解出的平移方向极不稳定。
具体而言,在纯旋转或近似纯旋转条件下,传统特征匹配得到的对应点无法通过三角化获得可靠的三维坐标。bundle adjustment的目标函数在深度方向上呈现明显的"平坦"特性,优化过程容易陷入局部极小值或完全发散。即便采用先进的深度学习特征(如SuperPoint、LoFTR),这一根本性的几何退化也无法被消除,只能通过引入额外的运动先验或惯性测量来缓解。
面对这一困境,东京大学的研究团队提出了一条颠覆性的技术路线:既然SfM在旋转主导条件下不可靠,为何不干脆抛弃SfM,直接从全景图像中重建三维场景?PanoImager正是这一思想的产物。它通过前馈网络直接预测相机位姿和深度图,利用几何条件扩散模型合成中间视角以填补观测间隙,最后以深度引导的3D Gaussian Splatting进行端到端优化。这一SfM-free框架从根本上规避了旋转退化的陷阱,为稀疏全景重建开辟了全新的可能性。
主要贡献
本文提出PanoImager,一种专为稀疏全景输入设计的SfM-free三维重建与新视角合成框架,通过前馈先验、扩散补全和3DGS优化的三阶段协同,在旋转主导、弱视差条件下实现了稳定且高质量的重建。主要贡献如下:
提出SfM-free稀疏全景重建框架:PanoImager完全摒弃了对SfM/SLAM初始化的依赖,通过前馈网络直接从全景图像预测位姿和深度,从根本上解决了旋转主导运动下的退化问题。 设计几何条件扩散视图补全模块:利用几何条件扩散模型合成辅助视角观测,有效填补了稀疏全景输入之间的巨大视角间隙,丰富了3DGS优化的观测证据。 深度引导3DGS优化:将前馈深度先验与扩散合成深度相结合,引导3D Gaussian Splatting的优化过程,显著提升了跨视角几何一致性和重建稳定性。 全景图分解为局部透视视图:将全景图像分解为局部透视视图进行处理,使得现有的前馈深度/位姿估计模型和扩散模型可以无缝适配全景输入。 多基准测试验证极端稀疏鲁棒性:在多个基准数据集上的实验表明,PanoImager在极端稀疏条件下具有远超传统SfM-依赖方法的稳定性,可作为SfM/SLAM失败时的可靠后备方案。
方法
PanoImager的技术框架由三个顺序执行且紧密耦合的模块组成:前馈位姿/深度先验估计、几何条件扩散视图补全、以及深度引导3DGS优化。
整体流程上,系统输入为若干张稀疏捕获的全景图像。首先,PanoImager将每张全景图分解为多个局部透视视图(perspective crops),这些透视视图随后被送入前馈网络,分别估计每张全景图的相机位姿和对应的深度图。其次,基于估计的位姿和深度,系统识别出视角之间的未被观测区域,并利用几何条件扩散模型合成辅助视角来填补这些间隙。最后,所有原始观测和合成观测连同深度先验一起,被输入到深度引导的3D Gaussian Splatting优化器中,进行端到端的场景重建和新视角合成。
下图展示了PanoImager三阶段框架的整体架构和数据流。

前馈位姿/深度先验模块是PanoImager摆脱SfM依赖的第一步。传统SfM通过特征匹配和几何校验来估计位姿,这在弱视差条件下极不可靠。PanoImager采用预训练的前馈网络(如DUSt3R或MASt3R),直接从透视视图回归相机相对位姿和密集深度图。由于这些前馈网络在大规模多样化数据上训练,它们对弱纹理区域和旋转运动具有内在的鲁棒性。全景图的分解策略确保了360度环境信息被充分覆盖,同时每个透视视图又符合前馈网络的训练分布。

几何条件扩散视图补全模块负责解决稀疏观测带来的视角间隙问题。仅有数张全景图时,相邻观测之间的基线可能极大,导致3DGS优化缺乏足够的多视图约束。PanoImager利用扩散模型的强大生成先验,以估计的深度图和位姿作为几何条件,合成位于原始观测之间的虚拟视角。这些合成视角不仅为3DGS提供了额外的光度约束,还充当了正则化器,防止优化过程在观测稀疏区域产生不合理的几何塌陷。关键的是,扩散模型以深度图为条件,确保了合成视角在几何上与已有观测保持一致,避免了无条件的自由生成所带来的 hallucination 问题。

深度引导3DGS优化是PanoImager的最终重建阶段。3D Gaussian Splatting因其高效的可微渲染和优异的质量而成为近期3D重建的主流选择,但它在稀疏观测条件下同样面临初始化困难和过拟合风险。PanoImager通过双重深度引导来缓解这些问题:一方面,前馈深度先验为Gaussian primitives的初始布局提供了合理的空间分布;另一方面,在优化过程中,渲染深度与先验深度之间的差异被作为额外的正则化项,约束Gaussian的几何演化。这种"先验初始化+优化约束"的双管齐下策略,使得3DGS在仅有稀疏全景输入时仍能收敛到全局合理的解。

实验结果
PanoImager在多个具有挑战性的基准测试上进行了全面评估,实验结果充分证明了其在稀疏全景重建任务上的优越性。
极端稀疏条件下的稳定性:在旋转主导、弱视差的标准测试序列上,传统SfM/SLAM方法(如COLMAP)频繁出现初始化失败或轨迹漂移,而PanoImager凭借其SfM-free设计始终能够稳定输出合理的位姿估计和深度图。定量评估显示,PanoImager的深度估计精度在旋转主导序列上显著优于SfM-依赖的MVS方法,尤其是中远距离区域和弱纹理表面的深度恢复。
新视角合成质量:PanoImager合成的新视角图像在PSNR、SSIM和LPIPS等指标上均优于基线方法。尤其是在原始观测之间的中间视角,基线方法往往出现严重的模糊、重影和空洞,而PanoImager通过扩散补全模块提供的额外几何约束,能够生成清晰、连贯且几何一致的图像。用户研究的定性评分也一致倾向PanoImager的视觉效果。
三维重建完整性:从重建点云/高斯分布的完整性和密度来看,PanoImager成功恢复了基线方法遗漏的远处结构和遮挡区域。深度引导的3DGS优化有效防止了高斯点在自由空间中的散落,使得重建结果更加紧凑、干净。



作为SfM/SLAM后备组件的可行性:作者还专门验证了PanoImager作为"SfM/SLAM失败时离线/后台地图精化组件"的场景。实验表明,当SfM/SLAM因旋转运动而无法初始化时,PanoImager可以独立运行并提供可靠的粗略地图,供后续更高精度的局部优化使用。这一应用场景对于机器人探索和自主导航具有重要实用价值。
总结&未来工作
PanoImager作为IROS 2026的录用工作,为稀疏全景三维重建领域带来了一场范式革新。通过完全摒弃对SfM/SLAM的依赖,PanoImager以前馈先验、扩散补全和深度引导3DGS的三阶段协同,成功攻克了旋转主导、弱视差运动下的退化难题。在多个基准测试上的稳定表现证明,PanoImager不仅是一个独立的重建系统,更可作为一个可靠的后备组件,在SfM/SLAM失效时接管地图构建任务。这一成果对于推动全景感知在机器人、自动驾驶和VR/AR领域的落地应用具有重要意义。
展望未来,PanoImager的技术路线还有多个值得深挖的方向。首先,当前的前馈位姿/深度估计模块依赖于将全景图分解为透视视图,这一过程可能引入边界伪影和投影畸变,探索直接在球面域上处理全景输入的专用网络架构将是一个有意义的研究课题。其次,扩散视图补全模块虽然有效,但计算开销较大,研究轻量化的补全模型或基于3D先验的直接正则化方法,有望显著提升系统的实时性。此外,将PanoImager扩展至多模态输入(如全景RGB-D、LiDAR点云),并探索在线增量式重建而非离线批处理,也将极大拓展其应用范围。最后,结合神经SLAM的思想,在PanoImager的粗略重建基础上进行逐步精化和闭环优化,可能是连接SfM-free与传统SLAM框架的桥梁。
对更多实验结果和文章细节感兴趣的读者,可以阅读一下论文原文~
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。