点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
来源:3D视觉工坊
3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:
引言:当3D高斯泼溅遇上SLAM
2023年,3D高斯泼溅(3D Gaussian Splatting, 3DGS)的横空出世彻底改变了辐射场重建的游戏规则。它用显式的各向异性高斯椭球替代了NeRF中隐式的神经网络,实现了实时的渲染速度和可解释的场景表示。几乎在同时,SLAM(即时定位与地图构建)社区敏锐地意识到:这种既能表达精细几何、又能快速渲染的表征方式,正是长期以来“定位精度”与“地图保真度”之间难以调和的矛盾的终极解药。
于是,3DGS-SLAM迅速成为计算机视觉与机器人领域最炙手可热的方向之一。从2024年初的首批探索,到2025-2026年的系统级突破,这个领域以惊人的速度演进。本文将深度解析该方向最具代表性的六篇前沿工作,它们分别从频域分析、系统解耦、传感器扩展、表示学习、初始化策略和视觉-惯性融合六个维度,共同勾勒出3DGS-SLAM技术版图的完整轮廓。
我们将看到:一个领域如何在短短两年内从“能不能做”迅速演进到“怎么能做得更好”,以及这些技术突破对机器人、AR/VR、自动驾驶等应用的深远影响。

备注:方向+单位+昵称,进3D视觉交流群
一、3DGS-SLAM的技术挑战与演进脉络
在深入各篇工作之前,有必要先理解这个领域面临的共同挑战。
3DGS-SLAM的核心矛盾在于:SLAM要求实时在线(每一帧都要在毫秒级完成定位),而高质量3DGS重建通常需要离线迭代优化(数万次梯度下降)。如何在在线场景中兼顾“定位的实时性”和“地图的保真度”?这要求系统设计者在初始化策略、优化窗口、地图更新机制等各个环节做出精妙的设计取舍。
六大核心难题构成了3DGS-SLAM技术演进的主线:
高斯初始化——高斯点的初始位置和尺度如何设定?随机初始化会导致大量冗余;稀疏初始化又会留下“空洞”。
系统架构——跟踪(Tracking)和建图(Mapping)应该耦合还是解耦?耦合虽然简单,但牵一发而动全身;解耦虽灵活,但需精心设计通信机制。
传感器融合——纯视觉在运动模糊、低纹理、光照变化时极易失效,如何引入IMU、全向相机等多模态信息?
表示学习——固定的高斯集合无法适应场景的几何复杂度,如何动态调整高斯的密度和分布?
计算效率——数万乃至数十万的高斯如何在消费级GPU上实时优化和渲染?
闭环一致性——当检测到闭环时,如何高效地将位姿校正传播到成千上万个高斯图元?
这六篇工作,正是对这些难题的针对性突破。
二、初始化策略的演化:从“随机生长”到“一步到位”
2.1 FGS-SLAM:用傅里叶频域分析指导高斯初始化
核心洞察:现有3DGS-SLAM方法(如SplaTAM、MonoGS)在初始化高斯点时,要么在整张图像上均匀采样,要么依靠残差驱动的稠密化(densification)——哪里渲染误差大就在哪里加高斯。但这两种方式都存在问题:均匀采样在纹理丰富的区域“密度不足”,在平坦区域又“密度过剩”;残差驱动则导致早期优化目标不稳定(拓扑结构不断变化),收敛缓慢。

FGS-SLAM提出了一种全新的思路:利用傅里叶变换将图像从空间域转换到频域,在频域中分析场景的频率分布,据此指导高斯的初始化。
具体地,对于输入图像 ,其频域表示为:
经过高斯高通滤波后,高频成分被提取出来。该团队观察到:高频成分集中的区域(纹理丰富、边缘锐利)应该用密集的小高斯表示;而低频区域(平坦表面、天空、墙壁)则适合用稀疏的大高斯覆盖。
基于这一观察,FGS-SLAM通过三角阈值法将图像分割为高频区域 和低频区域 ,在高频区域以更小的采样间隔 ($m<n$)布置高斯点,在低频区域以更大的采样间隔 $n$="" 布置。高斯半径也相应调整:<="" p="">
其中 是深度, 是焦距, 表示3D高斯投影到2D图像上约1个像素大小对应的尺度。

创新点:为了进一步避免“高斯爆炸”,FGS-SLAM还设计了高斯缺失区域检测策略。通过融合不透明度渲染掩码()、深度掩码()和颜色掩码()来综合判断哪些区域需要补充高斯:
这意味着:只有在透明度低(表示未被高斯覆盖)、深度差异大(表示有前景物体遮挡)或颜色差异大(表示新物体出现)的区域,才会添加新的高斯点。

效果:在Replica数据集上,FGS-SLAM实现了33.04 FPS的实时性能,在定位精度(ATE RMSE 0.15m)和渲染质量(PSNR 38.75 dB, SSIM 0.974, LPIPS 0.041)上均达到SOTA水平。其单次映射迭代仅需0.7ms,比SplaTAM的50.1ms快了两个数量级——频域初始化让高斯参数从一开始就接近最优解,大幅减少了迭代次数。
关键数据:消融实验显示,移除频域自适应稠密化后,PSNR从42.73降至39.78(Office0场景),证明了频域信息对高斯分布优化的关键作用。
2.2 RGS-SLAM:一次性密集初始化替代残差驱动
核心洞察:如果说FGS-SLAM是对“如何布置高斯点”的优化,那RGS-SLAM 则是从根本上质疑了“是否需要在优化过程中不断添加高斯”这一范式。
RGS-SLAM认为,残差驱动的稠密化本质上是“试错”式的——系统先渲染、发现误差、再补高斯、重新渲染,导致优化目标在早期极度不稳定(拓扑结构不断变化),收敛速度慢且容易陷入局部最优。

解决方案:RGS-SLAM提出了“一次三角化、一步初始化”(one-shot triangulation)的策略。当新关键帧到来时,它利用DINOv3密集描述子在关键帧窗口内建立多视角密集对应关系,再通过多视角三角化直接生成完整、分布均匀的高斯种子集,然后固定拓扑结构,只优化高斯的参数(均值、协方差、不透明度、颜色)。

密集对应关系的建立过程如下:对于参考帧 及其邻居集合 ,密集匹配器输出位移场 和置信度图 。通过置信度加权聚合:
然后对每个保留的像素点进行多视角线性三角化:对于投影矩阵 和齐次像素坐标 ,构建矩阵 :
得到3D点后,每个有效三角化生成一个高斯点,其世界均值为 ,协方差通过局部平面拟合初始化。

为什么这是突破:RGS-SLAM将传统方法中的“动态稠密化”完全移除,优化目标从一开始就是固定的。这使得:
收敛速度提升约**20%**(TUM RGB-D训练时间从14.8分钟降至12.0分钟) 定位精度提升(ATE从1.47cm降至1.02cm) 渲染吞吐量达到925 FPS(MonoGS为769 FPS) 在纹理丰富和杂乱场景中表现尤其突出

关键数据:对TUM fr1/desk序列,PSNR从MonoGS的19.67dB提升至23.11dB(+17.5%),LPIPS从0.33降至0.232(-29.7%)。
2.3 两种初始化策略的对比
共同的理念:两篇工作都认识到——好的初始化胜过千万次迭代。与其在错误的起点上反复优化,不如花一点计算资源把起点找准。
三、系统架构的解耦演进:让跟踪和建图各司其职
3.1 GBG-SLAM:关键帧锚定高斯实现异步全局优化
核心洞察:绝大多数3DGS-SLAM系统(如MonoGS、SplaTAM)采用“地图中心”(map-centric)架构——所有帧直接注册到全局地图上。这种架构虽然实现简单,但存在致命缺陷:跟踪和建图高度耦合,当位姿发生漂移时,整个地图需要重新优化(甚至完全重训练),计算开销巨大。

GBG-SLAM提出了一种全新的“跟踪中心”(tracking-centric)解耦架构,其核心思想是:将每个3D高斯锚定到生成它的关键帧上,而不是锚定到全局坐标系。
具体地,GBG-SLAM的跟踪线程基于DROID-SLAM的稠密光流和可微束调整(DBA),独立于建图线程运行,负责估计相机位姿和低分辨率深度。建图线程则维护一个关键帧索引的高斯地图——每个高斯点都记录其来源关键帧的ID。当跟踪线程通过局部BA或闭环检测更新某个关键帧的位姿时,该关键帧关联的所有高斯点只需应用相同的刚体变换即可自适应更新:
对于关键帧 ,设闭环前后的位姿分别为 和 ,尺度变化为 。对于从关键帧 初始化的高斯点 ,其均值和协方差的更新为:
协方差更新为:
这种“一次变换、全局生效”的更新方式,无需重新训练整个高斯地图,使得闭环校正的代价从“数十分钟的重训练”降为“毫秒级的批处理变换”。
几何增强模块:GBG-SLAM的另一个核心创新是深度提示(depth prompting)模块。由于输入深度通常存在噪声或稀疏性问题,该模块从跟踪线程的低分辨率深度 推断出高保真深度图 :
然后通过反投影生成高质量的高斯初始化点云,有效抑制了高斯“浮空物”(floaters)的产生。
效果:在TUM RGB-D数据集上,GBG-SLAM的定位误差(ATE RMSE)仅为1.08cm,显著优于SplaTAM的3.25cm和MonoGS的1.48cm。在渲染质量上,PSNR达到28.24dB,SSIM 0.883,LPIPS仅0.017——在fr3/office序列上,LPIPS低至0.066,证明了该架构在真实世界复杂场景中的优越性。
3.2 PointSLAM++:分层锚点与视角依赖补偿
核心洞察:如果说GBG-SLAM解决了“地图如何随位姿更新”的问题,那**PointSLAM++**则进一步解决了“地图如何随场景复杂度自适应”的问题。

PointSLAM++提出了分层锚点(Hierarchical Anchor Points) 机制:
主锚点(红色):从ORB特征点生成,在整个SLAM过程中不可分裂、不可删除,以较小的学习率优化,保证长期稳定性 副锚点(黄色):从深度传感器数据和更小体素生成,可根据场景复杂度动态添加或删除,负责捕捉精细细节

副锚点的添加由体素梯度监控触发:构建大小为 的体素网格,对每个体素计算 次训练迭代中的平均梯度 。如果 且该体素中没有锚点,则利用深度信息在该体素中心部署新的副锚点;如果已有副锚点,则降低其不透明度直至删除。
视角依赖补偿(View-Dependent Compensation):传统高斯模型假设颜色与视角无关,但实际场景中存在镜面反射等视角依赖现象。PointSLAM++将相机视角方向 编码到锚点的外观特征中:
其中 是锚点的RGB颜色特征, 由MLP实现。这使得同一个3D点在不同视角下能渲染出不同的颜色,显著提升了复杂光照条件下的重建质量。
效果:在ScanNet++大规模数据集上,当其他方法(GS-ICP SLAM、SplaTAM、MonoGS)因跟踪失败而无法完成重建时,PointSLAM++实现了26.51 dB的PSNR和6.73cm的ATE RMSE,证明了分层锚点机制在大规模、稀疏纹理场景中的鲁棒性。在TUM RGB-D上,PointSLAM++取得了1.08cm的ATE RMSE和26.16dB的PSNR,全面超越所有对比方法。
3.3 两种解耦架构的对比
共同的理念:两篇工作都认识到——跟踪和建图应该解耦。耦合架构虽然简单,但限制了系统的灵活性和可扩展性。解耦后,两个模块可以独立优化、异步运行,并支持闭环、重定位等高级功能。
四、传感器扩展:从有限视场到全景感知
4.1 ODGS-SLAM:全向3DGS-SLAM的开山之作
核心洞察:上述所有方法都假设输入是透视相机(perspective camera) 图像,视场角(FoV)通常在90°左右。这种有限视场在机器人导航、AR/VR等需要360°环境感知的应用中存在天然局限——盲区意味着安全隐患。

ODGS-SLAM是首个将3DGS-SLAM扩展到全向(omnidirectional)输入的系统,支持全景RGB/RGBD图像序列(如Insta360等消费级全景相机)。
将3DGS扩展到全向相机的核心挑战在于投影模型的变化。透视相机的投影是平面投影,而全向相机(尤其是等矩形投影,equirectangular projection)将球面映射到平面,存在显著的畸变——靠近两极的区域被严重拉伸。
ODGS-SLAM基于ODGS的球面高斯泼溅方法,将其扩展为支持相机外参优化的SLAM系统。具体来说,对于球面上的高斯点 ,其角度坐标为:
投影到等矩形图像平面为:
关键创新:ODGS-SLAM在损失计算中引入了纬度权重 来补偿等矩形投影的畸变:
靠近两极的像素( 接近0或 )权重较低,因为它们在球面上对应的面积实际更小。
闭环与关键帧管理:ODGS-SLAM还提出了一种基于图分析的关键帧冗余检测策略。在全向视觉中,从相似位置但不同朝向拍摄的图像包含大量相同内容。ODGS-SLAM构建关键帧冗余图,通过旋转对齐的相似度评分来识别和删除冗余关键帧,有效控制了全景图像带来的内存压力。

效果:在自建的全向SLAM数据集上,ODGS-SLAM在跟踪精度上显著优于MonoGS(透视版本)和PMSP(基于ORB特征的全向SLAM)。统计检验(Kruskal-Wallis H检验,)证实了ODGS-SLAM的改善具有统计学显著性。在渲染质量上,ODGS-SLAM与透视3DGS方法相当。
4.2 VIGS-SLAM:视觉-惯性紧耦合的3DGS-SLAM
核心洞察:另一个重要的传感器扩展方向是IMU(惯性测量单元) 。IMU在现代设备上几乎无处不在——智能手机、AR头显、无人机都内置了低成本MEMS IMU(每颗芯片成本不到1美元)。它能提供高频(100-400Hz)的加速度和角速度测量,在视觉退化场景(运动模糊、低纹理、曝光变化)中提供稳定的运动先验。
但将IMU融入3DGS-SLAM并非易事。现有方法(如VINGS-Mono、DBA-Fusion)采用级联式融合——先独立求解视觉BA,再将Schur补Hessian作为线性化因子注入IMU优化器。这种分离引入线性化误差,且缺乏真正的视觉-惯性协同。

VIGS-SLAM提出了真正的紧耦合视觉-惯性3DGS-SLAM。其核心是:将视觉重投影残差和IMU预积分残差在同一个非线性最小二乘问题中联合优化,每步迭代同时更新相机位姿、速度、深度和IMU偏置。
视觉残差(来自DROID-SLAM的稠密光流):
IMU残差(预积分约束,基于[Forster et al., 2015]):
三阶段IMU初始化:
纯视觉初始化:用前10个关键帧估计位姿和深度(全局尺度任意) 仅惯性优化:继续跟踪至20个关键帧,固定视觉位姿,优化重力方向、速度、IMU偏置和全局log尺度 视觉-惯性联合优化:将相机位姿纳入优化,联合精修所有变量
闭环高斯更新:当检测到闭环时,VIGS-SLAM执行位姿图BA(PGBA)更新所有关键帧位姿,然后通过批处理变换将所有高斯点更新到新坐标系(与GBG-SLAM类似),无需重新训练高斯地图。

效果:VIGS-SLAM在EuRoC数据集上取得了2.79cm的平均ATE RMSE,显著优于ORB-SLAM3(4.30cm)、VINS-Mono(11.00cm)、DBA-Fusion(16.97cm)和VINGS-Mono(24.47cm)。在RPNG AR Table数据集上,ATE仅1.68cm,相比第二好的VINS-Mono(3.46cm)减半。在FAST-LIVO2户外挑战数据集上,VIGS-SLAM是唯一在所有序列上都成功初始化的方法(ATE 6.08cm),而ORB-SLAM3、VINS-Mono、OPEN-VINS全部失败。



4.3 两种传感器扩展的启示
共同的理念:纯视觉3DGS-SLAM虽然在实验室标准数据集上表现优异,但在真实世界的复杂条件下——运动模糊、低纹理、光照变化、有限视场——单一传感器的局限性暴露无遗。ODGS-SLAM和VIGS-SLAM分别从“空间全向”和“时间惯性”两个维度扩展了系统的感知边界。
五、综合对比与关键洞察
5.1 六篇工作全景对比
| FGS-SLAM | |||||
| GBG-SLAM | |||||
| ODGS-SLAM | |||||
| PointSLAM++ | |||||
| RGS-SLAM | |||||
| VIGS-SLAM |
5.2 核心技术贡献总结
FGS-SLAM的核心贡献在于将频域分析引入3DGS初始化。它证明了:场景的频域特性与最优高斯分布之间存在明确的对应关系——高频区域需要密集小高斯,低频区域适合稀疏大高斯。这一发现为所有3DGS-SLAM系统提供了“如何高效布置高斯”的理论指导。
RGS-SLAM的核心贡献在于质疑了残差驱动稠密化的必要性。它证明:利用现成的密集匹配(DINOv3)和多视角三角化,一步即可生成足够好的高斯种子集。移除动态稠密化后,优化更稳定、收敛更快。
GBG-SLAM的核心贡献在于系统架构层面的创新。它将3DGS地图从“全局统一”变为“关键帧锚定”,使得闭环校正、位姿更新等操作从“全地图重训练”降为“批处理变换”。这种解耦思想为后续所有3DGS-SLAM系统提供了架构参考。
PointSLAM++的核心贡献在于将神经表示引入高斯地图。通过锚点+MLP预测高斯属性,并结合分层锚点和视角依赖补偿,它实现了更好的场景自适应性和视角一致性。
ODGS-SLAM的核心贡献在于首次将3DGS-SLAM扩展到全向视觉。它解决了球面投影、等矩形畸变、全景关键帧管理等核心问题,为360°环境感知提供了全新的技术路线。
VIGS-SLAM的核心贡献在于在系统级实现视觉-惯性紧耦合。它通过三阶段初始化和联合优化,使得系统在视觉退化场景中依然稳定——这是从“实验室玩具”走向“真实世界部署”的关键一步。
5.3 演进趋势:从方法创新到系统集成
纵观这六篇工作,可以清晰地看到3DGS-SLAM领域的演进轨迹:
第一阶段(2024年) :可行性验证。SplaTAM、MonoGS等工作首次证明3DGS可以用于实时SLAM。
第二阶段(2025年) :方法优化。FGS-SLAM(频域初始化)、RGS-SLAM(一次性初始化)从初始化策略入手优化;GBG-SLAM(关键帧锚定)、PointSLAM++(分层锚点)从系统架构入手优化。
第三阶段(2026年) :系统集成与传感器扩展。ODGS-SLAM和VIGS-SLAM将3DGS-SLAM推向“真实世界部署”——更大的视场、更多样的传感器、更严苛的环境条件。
未来的方向清晰可见:多模态融合(视觉+IMU+LiDAR+GPS)、大规模场景(千米级轨迹)、动态场景(移动物体检测与分离)、边缘部署(轻量化模型与推理优化)。3DGS-SLAM正在从一个“令人兴奋的学术概念”演进为“可部署的工程系统”。
六、总结:范式转变与未来展望
从FGS-SLAM的频域分析到VIGS-SLAM的视觉-惯性融合,这六篇工作共同勾勒出3DGS-SLAM技术的完整版图。它们分别回答了六个核心问题:
如何初始化? → FGS-SLAM说“看频域”,RGS-SLAM说“靠三角化” 如何架构? → GBG-SLAM说“关键帧锚定、跟踪建图解耦” 如何自适应? → PointSLAM++说“分层锚点、按需添加” 如何扩展视场? → ODGS-SLAM说“球面投影、畸变补偿” 如何融合多传感器? → VIGS-SLAM说“紧耦合联合优化”
它们共同的启示是:3DGS-SLAM的突破不在于某一种算法的改进,而在于系统层面的整体设计——从初始化到优化,从跟踪到建图,从单传感器到多模态融合,每一环节的精妙设计共同决定了系统的最终性能。
3DGS-SLAM正在从一个“实验室原型”向“工业级部署”演进。当实时的高保真3D重建不再需要昂贵的设备或漫长的后处理时,AR/VR、机器人导航、自动驾驶、数字孪生等应用将迎来质的飞跃。而这六篇工作,正是这一变革的重要推动者。
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。