点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:
一、当卫星影像遇上扩散模型:一个被忽视的巨大机会
高质量、沉浸式、语义合理的3D城市场景,对于游戏、电影制作、导航规划和机器人等领域具有至关重要的价值。能够创建一个大规模且基于3D的环境,可以支持逼真的渲染和沉浸式体验,用于讲故事、演示和具身物理仿真。
然而,由于缺乏大规模、高质量的3D-informed数据,构建一个用于真实且可导航3D城市的生成模型仍然极具挑战。获取城市的大规模3D纹理重建,需要耗费巨大的人力和物力;而使用互联网图像集合则面临相机姿态配准困难和数据噪声过大(如瞬态物体、不同时段光照)等问题。这些限制使得现有的3D城市生成框架无法创建真实且多样化的外观。
卫星影像提供了一个极具吸引力的替代方案。 以Maxar的WorldView-3卫星为例,它每天捕获约680,000平方公里的影像,分辨率高达31厘米/像素。这些数据编码了大量真实世界环境语义,能够实现可扩展的3D城市场景创建。
然而,论文指出,直接将3D重建方法应用于卫星影像,不足以创建可导航且沉浸式的3D城市。大量的不可见区域(如建筑立面)和有限的卫星视角视差,会产生错误的几何结构和伪影。
论文还研究了城市生成领域的几项前沿方法(CityDreamer、GaussianCity),这些方法由于强假设——特别是仅依赖语义图和高度场作为输入,以及在小规模、领域特定数据集上过拟合——产生了过于简化的建筑几何和不真实的外观。这一观察促使研究团队寻求开放域基础视觉模型作为外部信息源,以提供更好的零样本泛化和多样性。
有没有一种方法,能够仅从卫星影像出发,生成可自由飞行导航的沉浸式3D城市?
这正是Skyfall-GS要回答的问题。这项由国立阳明交通大学、UIUC、萨拉戈萨大学和UC Merced合作完成的工作,被接收为ECCV 2026。它是首个仅从多视角卫星影像合成沉浸式、实时自由飞行导航3D城市场景的方法,无需领域特定的3D训练数据。项目页面已全面开放,代码采用Apache-2.0许可证开源。项目页面:https://skyfall-gs.jayinnn.dev/。

给定多视角、多日期的卫星影像,Skyfall-GS利用3D高斯泼溅结合预训练文本到图像扩散模型,在迭代精炼框架中从有限的卫星视角输入生成逼真的3D街区级城市。该方法显著提升了视觉保真度、几何锐度和语义一致性,实现了实时沉浸式探索。
二、问题剖析:为什么卫星影像直接重建行不通?
论文通过实验展示了直接应用现有方法的局限性。

Sat-NeRF和朴素3DGS由于卫星视角视差有限,生成模糊或扭曲的建筑立面。
CityDreamer和GaussianCity产生过于简化的建筑几何和不真实的外观,主要由于对输入数据的强假设以及在小规模领域特定数据集上的过拟合。
从卫星视角重建的场景在地面级新视角渲染时会出现严重退化,包括浮空伪影和纹理拖影,这是由于在卫星视角视差有限的区域中,高斯图元约束不足导致的。
为了解决这个问题,Skyfall-GS采用开放域基础图像生成模型,直接将这些退化的渲染结果精炼为逼真且几何一致的输出,利用模型丰富的视觉先验恢复合理的外观。精炼后的输出作为伪真值来监督迭代式3DGS场景优化,逐步提升整个场景的视觉保真度和几何一致性。
为了稳定收敛,论文精心设计了一个基于课程学习的视角选择和迭代精炼过程,采样的视角角度随着时间的推移逐渐从天空下降到地面。正是基于这一设计,研究团队将框架命名为 Skyfall-GS(天降-高斯泼溅)。
三、核心技术:两阶段混合框架

Skyfall-GS整体流程:方法分两个阶段从多视角卫星影像合成沉浸式、可自由飞行导航的街区级3D场景。
3.1 第一阶段:卫星影像的初始3DGS重建
初始3DGS重建必须忠实保留卫星影像的纹理和几何,为合成提供坚实基础。研究团队采用外观建模处理多日期影像的变化,并应用正则化技术约束纹理和几何。
相机参数近似。 卫星影像通常使用有理多项式相机(RPC)模型,直接将图像坐标映射到地理坐标。为了与3DGS流程集成,研究团队采用SatelliteSfM从RPC近似透视相机参数(外参和内参),并生成稀疏SfM点作为初始3DGS点。论文补充材料中定量验证了该近似的有效性:与严格RPC模型的最大前向投影误差平均仅0.126像素,三角化3D点差异通常小于5厘米,Bundle Adjustment达到亚像素精度(中位重投影误差0.864像素)。
外观建模。 多日期卫星影像由于全局光照变化、季节因素和瞬态物体而呈现显著的外观变化。研究团队参考WildGaussians,使用可训练的逐图像嵌入和逐高斯嵌入来捕捉光照变化和局部外观变化。轻量级MLP计算仿射颜色变换参数:
其中 是逐图像嵌入, 是逐高斯嵌入, 是零阶球谐系数。变换后的颜色为 。为避免将外观变化建模为视角相关效应,球谐系数限制为零阶和一阶。推理时,通过选择固定图像嵌入 ,将学习到的外观融合到标准3DGS中,生成静态颜色,使得表示可移植到标准3DGS渲染器,在MacBook Pro M4 Pro上实现60 FPS(1920×1080) 实时渲染。
不透明度正则化。 论文观察到重建场景中大量浮空物呈现低不透明度。为鼓励几何紧贴实际表面,提出基于熵的不透明度正则化:
该正则化促进二元不透明度分布,使低不透明度高斯在加密过程中更积极地被剪枝,显著锐化几何重建。
伪相机深度监督。 为进一步减少浮空伪影,在优化过程中采样靠近地面的伪相机。从这些伪相机渲染RGB图像和alpha混合深度图,然后使用MoGe预测尺度不变深度,通过Pearson相关系数监督深度:
优化。 重建阶段总损失为:
其中 为D-SSIM和L1损失的组合(式1),,。重建阶段运行30,000次迭代,在单张RTX A6000上约需1小时。
伪相机深度监督的动机:初始3D重建从不同仰角渲染时,随着视角降低呈现渐进退化
3.2 第二阶段:基于课程学习的迭代数据集更新
迭代数据集更新(IDU)技术反复执行渲染-编辑-更新循环,逐步合成3D场景。与之前从原始训练视角或简单轨道采样相机姿态的方法不同,Skyfall-GS引入了一个基于课程学习的精炼调度,专门解决卫星影像固有的几何和视觉限制。
课程学习策略。 如上图所示,研究团队观察到从卫星影像训练的3DGS在较高仰角产生较高质量渲染,但在低仰角退化。基于此洞察,引入课程合成策略,在优化周期中逐步降低视角。具体地,在场景中均匀放置 个注视点,沿轨道轨迹均匀采样 个相机位置,IDU过程从高仰角开始,逐步下降至低视角。这种方法逐渐揭示之前被遮挡的区域,改善几何细节和纹理真实感。
课程策略的动机:初始3D重建从不同仰角渲染时,随着视角降低呈现渐进退化
基于文本到图像扩散模型的渲染精炼。 如下图所示,初始3DGS渲染包含模糊纹理和伪影。研究团队利用提示词到提示词编辑与预训练T2I扩散模型合成去遮挡区域、去除伪影并增强几何。具体使用FlowEdit配合FLUX.1 [dev]扩散模型。源提示描述原始退化特征,目标提示指定所需高质量属性。这产生了更锐利的几何、更丰富的纹理和物理一致的阴影。
渲染精炼。(a) 原始3DGS渲染,包含伪影和模糊纹理;(b) 精炼结果,展现增强的几何和纹理质量。
多重扩散采样。 虽然扩散模型能有效精炼单个3DGS渲染,但独立地在不同视角应用扩散模型会引入不一致性。此外,3DGS容易在单视图上过拟合。研究团队为每个视角合成 个独立精炼样本,在优化过程中,光度损失隐式地对这些样本取平均,使3DGS优化找到平衡个体样本保真度和跨视图几何一致性的共识表示。消融实验确认 达到最优视觉结果。
迭代数据集更新算法。 如算法1所示,IDU在 个周期内优化3DGS。每个周期渲染课程引导的视图,使用FlowEdit精炼生成新训练集。随着课程下降到更低高度,渲染质量稳步提升,特别是在之前被遮挡的区域。
算法1:通过迭代数据集更新精炼3DGS
IDU阶段使用损失:
每个周期10,000次迭代,共 个周期。训练图像采样策略为75%来自IDU精炼视图,25%来自原始卫星视图,确保最终3DGS场景忠实遵循输入卫星影像的语义和布局。
四、实验验证:全面领先的性能
4.1 数据集与评估指标
论文在两个高分辨率RGB卫星影像数据集上评估。DFC2019包含WorldView-3拍摄的佛罗里达州杰克逊维尔影像,使用四个标准AOI(JAX_004、JAX_068、JAX_214、JAX_260)。GoogleEarth数据集包含纽约城市场景,选择四个AOI(004、010、219、336),训练视图以80°仰角渲染以近似卫星条件。Google Earth Studio渲染作为两个数据集的地面真值。
评估指标包括:FIDCLIP、CMMD(分布度量,最适合生成任务)、PSNR、SSIM、LPIPS(像素级度量,作为次要参考),以及用户研究。
4.2 定量比较
表1——DFC2019定量比较。分布度量基于GES参考计算。
| Ours | 27.03 | 2.110 |
Skyfall-GS在DFC2019上将FIDCLIP从次优的~84降至27.03,CMMD从~4.8降至2.110,优势极其显著。
表2——GoogleEarth数据集定量比较。
| Ours | 10.29 | 1.959 | 14.42 | 0.302 |
Skyfall-GS在GoogleEarth上同样取得最佳分布度量,FIDCLIP仅10.29,远低于次优的16.09。
表3——重建阶段消融。外观建模确保收敛,不透明度正则化和深度监督提升视觉保真度和几何精度。
| 38.01 | 2.307 | 2.250 | 3.483 |
外观建模对多日期收敛至关重要,不透明度正则化去除浮空伪影,深度监督锐化平面区域几何。
表3——合成阶段消融。
| Ours (Nc=2) | 28.35 | 2.875 | 6.37 |
达到最优视觉结果。无课程或逆课程均显著更差,确认课程策略和其高到低方向共同驱动增益。
表4——对输入卫星视图的重投影一致性(4个AOI,62个视图)。
| 0.121 | |||
| Ours | 29.67 | 0.934 |
Skyfall-GS在PSNR和SSIM上匹配或超越最强重建基线Mip-Splatting,表明IDU精炼在不牺牲卫星锚定几何的情况下增加近景立面细节。
表5——迭代 vs 单次精炼在JAX_068上的对比。
| 迭代IDU(Ours) | 28.35 | 2.875 |
单次扩散已比所有重建基线好40%,但迭代IDU进一步降低约45%,因为每个周期从更新的3DGS重新渲染,后续编辑在逐步更干净的输入上操作——这是单次变体无法利用的自增强循环。
4.3 用户研究
论文进行了两项用户研究,各44名参与者,评估几何精度、空间对齐和整体感知质量。在DFC2019上,Skyfall-GS在所有三个标准上获得约90-94% 的胜率;在GoogleEarth上获得约79-82% 的胜率,确认了人类偏好的一致性优势。
用户研究结果。Skyfall-GS在DFC2019和GoogleEarth上均取得主导性胜率,特别是在几何精度和整体感知质量方面
4.4 定性比较
(a)DFC2019和(b)GoogleEarth上的定性比较。最左列显示代表性输入卫星图像。Skyfall-GS在低空新视角下持续超越基线在几何精度和纹理质量方面的表现。在DFC2019上,Sat-NeRF产生严重雾状,EOGS过度暗淡,CoR-GS严重模糊,Mip-Splatting有明显浮空物和伪影;在GoogleEarth上,CityDreamer和GaussianCity过于简化建筑几何并遗漏场景特定细节,而Skyfall-GS提供更锐利的几何、更丰富的立面细节,并正确恢复场景010中的红色铺装等特征。
DFC2019额外定性比较
GoogleEarth额外定性比较
4.5 性能与可扩展性
训练效率。 完整流程在单张NVIDIA RTX A6000上约6小时45分钟完成(重建1小时35分钟 + 合成5小时10分钟)。这与重建基线(Sat-NeRF/EO-NeRF报告10-20小时)相当,且可摊销到无限次实时渲染中。
渲染效率。 方法在入门级NVIDIA T4上达到11 FPS,显著优于CityDreamer的0.18 FPS(后者在更强大的A100上运行)。融合表示在消费级硬件(MacBook Air M2)上实现40 FPS实时渲染。
内存消耗。 合成阶段峰值内存达到46 GB(加载FLUX.1扩散模型和临时高斯加密的开销),最终训练内存显著降低至28.04 GB。精炼过程将场景加密约27% ,高斯数量从约165万(重建阶段)增加到约210万,专门针对初始卫星重建中缺失的垂直立面几何。
多区块可扩展性。Skyfall-GS从两个相邻卫星瓦片联合优化约1km × 512m的无缝场景,插图显示共享建筑无拼接伪影。
合并JAX_214和JAX_260 AOI的多区块重建。Skyfall-GS产生约1km × 512m城市区域的无缝、无伪影3D场景。
在跨越两个瓦片的边界轨道上,两个单AOI模型分别得分为50.13/3.54和53.18/3.57(FIDCLIP/CMMD),而合并模型达到32.15/2.42,FIDCLIP降低约**36-38%**。
五、深入分析:更多技术细节与发现
5.1 瞬态物体处理
多日期卫星重建的一个关键挑战是处理动态元素(如移动车辆和行人),它们会引入鬼影伪影。Skyfall-GS通过可训练的逐图像外观嵌入解决这一问题。
使用逐图像嵌入可视化瞬态物体处理。用20个不同的学习外观嵌入渲染同一视角,观察到瞬态物体(如道路上的车辆)在不同嵌入中呈现不同程度的可见性(有些清晰可见,有些淡化或消失),而静态建筑几何保持一致。这定性证明逐图像外观建模有效将瞬态元素与底层静态3D结构解耦,防止动态伪影污染几何重建。

5.2 提示词敏感性分析
敏感性分析使用的文本提示列表。评估六种提示策略。
使用不同提示策略的精炼渲染结果。视觉质量在所有策略间基本一致,仅细粒度纹理细节有微小差异。这种鲁棒性表明方法不要求精细的提示工程。由于优化通过75/25采样将场景锚定到输入卫星影像,文本提示充当外观正则化器,引导伪影去除和细节恢复,而非场景内容的自由控制器。
5.3 复杂几何与特殊结构
复杂几何上的定性结果如下图所示。给定多视角卫星影像,方法合成不规则历史结构的新视角,展示了Neuschwanstein Castle和Wells Cathedral。这些场景因非曼哈顿几何(尖顶、哥特式细节)而极具挑战,但Skyfall-GS成功解耦底层几何并幻觉出合理的高频立面细节。

桥梁上的定性结果如下图所示。展示JAX_068、JAX_214和JAX_175中桥梁的渲染结果,方法成功恢复桥跨的连通性,同时合成逼真的水面纹理,有效正则化几何,防止卫星-only重建中常见于薄结构的“融化”伪影。

5.4 跨视图一致性与随机外观多样性
跨视图一致性。 遵循VBench的subject-consistency协议(使用DINOv2替代DINO),计算连续帧DINOv2 ViT-L/14特征之间的1-cos值。GES参考(oracle)得分0.0213,而方法渲染从的0.0340改善到的0.0264,缩小了约60% 与oracle的差距。
在保持几何一致性的同时展示随机外观多样性。通过改变扩散精炼阶段的随机种子,方法为相同底层结构生成多样但合理的表面细节。例如,红色建筑标识上的文字变化明显(“Outeil” vs “CUTAN”),而建筑足迹保持几何固定,确认框架成功解耦了基于卫星约束的几何重建与高频外观的生成合成。

5.5 课程策略有效性量化
Episode-vs-Coverage分析如下图所示。累积表面覆盖率从Episode 1的约0.50稳步增加到Episode 5的约0.75。这一持续增益确认课程策略(逐步将相机仰角从85°降至45°)成功揭示和重建了初始俯视卫星视图中被遮挡的垂直立面几何。

六、开源与使用
Skyfall-GS的代码、数据集和预训练模型已全面开源:
项目页面:https://skyfall-gs.jayinnn.dev/
代码仓库:https://github.com/jayin92/skyfall-gs
论文:https://arxiv.org/pdf/2510.15869
数据集:https://huggingface.co/datasets/jayinnn/Skyfall-GS-datasets
PLY模型:https://huggingface.co/jayinnn/Skyfall-GS-ply
安装
git clone --recurse-submodules https://github.com/jayin92/Skyfall-GS.git
cd Skyfall-GS
conda create -y -n skyfall-gs python=3.10
conda activate skyfall-gs
conda install cuda-toolkit=12.8 cuda-nvcc=12.8 -c nvidia
pip install -r requirements.txt
pip install --force-reinstall torch torchvision torchaudio
pip install submodules/diff-gaussian-rasterization
数据集结构
data/
├── datasets_JAX/
│ ├── JAX_004
│ ├── JAX_068
│ └── ...
└── datasets_NYC/
├── NYC_004
├── NYC_010
└── ...
每个场景目录包含:images/(RGB图像)、masks/(可选二进制掩码)、transforms_train.json(训练相机参数)、transforms_test.json(测试相机参数)、points3D.txt(3D点云)。
训练与评估
GitHub仓库提供了完整的自动化训练脚本,涵盖重建阶段(Stage 1)和IDU合成阶段(Stage 2),以及评估脚本。PLY文件可用于Mip-Splatting Viewer或SuperSplat等高斯泼溅查看器进行可视化。
七、局限性与未来方向
论文诚实地列出了几个限制:
固定启发式相机轨迹在一般情况下效果良好,但在复杂几何中可能留下盲点,偶尔在极端街景视角产生轻微伪影。
严格的行人级合成(<10°,贴近立面)超出当前范围,因为多日期捕获中的瞬态物体和低仰角下GES参考的畸变妨碍了忠实的近距重建和可靠评估。
合成立面需要离轴视角——虽然大多数卫星影像都是离轴的(如WorldView覆盖约±40°),但纯正射输入仍是一个开放挑战。
未来方向包括城市级规模扩展和动态场景建模。
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。