3D Gaussian Splatting(3DGS)以数百万可学习的各向异性高斯椭球显式表征场景,凭借可微分光栅化实现了实时渲染,在渲染速度上比NeRF快8~12倍。然而,3DGS的“原罪”在于:它本质上是一个过参数化的逐场景优化器——对每个场景需要大量高斯椭球来拟合训练视角,且优化过程高度依赖稠密的、覆盖充分的输入视角。
这直接导致了三个环环相扣的瓶颈:
稀疏视角下,弱几何约束使优化问题严重欠定,高斯椭球的位置、尺度、透明度缺乏足够的监督信号,导致浮点伪影、尺度漂移和细节退化。更棘手的是,真实部署场景中往往连精确的相机位姿都难以获取,传统SfM在稀疏视角下因重叠区域不足而失效,位姿估计本身就成为不可靠环节。
伪影问题不仅是“视觉瑕疵”,而是底层三维表示错误的症状。浮点、背景塌缩、边缘裂缝、结构跳变闪烁——这些现象在相机偏离训练视角时暴露,本质是几何与外观失去内在一致性。而标准3DGS的无控致密化策略(densification)在训练迭代中会不断产生新的浮点,使问题随训练加深而恶化。
端侧算力瓶颈是双重维度的:计算上,alpha混合依赖耗时的高斯深度排序,是首要计算瓶颈;存储上,单个高斯场景可超50MB,城市级场景更是可达数百MB,在移动网络上不可行。
三者并非独立问题:稀疏视角加剧伪影,伪影修复又依赖额外的计算开销(如扩散模型推理),而端侧算力限制反过来又制约了稀疏视角和伪影修复算法的部署。破局需要在这三个维度上同时推进。
稀疏视角:从“硬猜”到“有约束地推断”
顶会前沿:三类技术路线的演进
路线一:几何先验注入——用单目深度模型“锚定”几何
稀疏视角的核心困难是几何约束不足。最直接的思路是引入单目深度估计(如Depth Anything V2)作为几何先验。但单目深度是“相对深度”,缺乏绝对度量尺度,与3DGS的度量空间存在尺度-偏移模糊性。Pearson Correlation Loss的创新在于:不在深度空间做L1/MSE的刚性对齐,而是在视差空间最大化预测深度与先验深度的线性相关性,避免全局尺度差异引发的优化冲突。
SPDGS(MultiMedia Modeling 2026)在此基础上进一步设计了三个互补模块:空间一致性引导的剪枝(训练两个并行的Gaussian估计器在3D空间交叉验证,剪除不稳定点)、体积感知的尺度正则化(惩罚各轴尺度的乘积以抑制体积膨胀)、以及Patch-Global结构一致性监督(利用DepthAnything先验对齐patch结构,无需绝对深度即可稳定全局尺度)。
路线二:扩散模型作为“生成式修复器”——但需要降本增效
扩散模型在修复稀疏视角渲染伪影上展现出了强大能力,但传统方案(如DIFIX)的问题在于:扩散微调和修复步骤计算开销极大,且修复出的“伪GT”与真实输入之间存在3D不一致性。
WaveletGaussian(IEEE 2026)提出了一个巧妙的效率方案:将扩散过程迁移到小波域——扩散仅作用于低频LL子带,高频子带用轻量网络精炼,并设计了在线随机掩码策略替代低效的leave-one-out策略来构造训练对,在大幅降低训练时间的同时保持了竞争性的渲染质量。
S2D(CVPR 2026)则从另一个角度切入:利用视觉基础模型(VGGT、π3等)生成视角无关的稠密点云作为结构一致性的引导,用一个点云引导的单步扩散修复器清理新视角伪影,再通过带随机样本丢弃和加权梯度的重建策略避免过拟合到修复偏差上。其效果令人印象深刻:仅需1张图即可重建30°视角范围,不到10张图可覆盖180°以上。
路线三:分层引导——从图像到特征的全局正则化
HeroGS(CVPR 2026)提出了一个三级分层引导框架:图像级将稀疏监督转换为伪稠密引导,全局正则化高斯分布;特征级通过Feature-Adaptive Densification and Pruning在高频区域自适应致密化、在背景区域剪枝;参数级通过Co-Pruned Geometry Consistency以参数冻结和协同剪枝引导几何一致性。这种“由粗到细”的策略有效解决了稀疏视角下高斯分布“全局稀疏覆盖、背景模糊、高频区域扭曲”的典型退化模式。
工业界实践:工程化的降维打法
如视(Realsee)的工程方案采用了“分而治之”的思路:将大型空间切成多个规模可控、可独立训练的分块,每块获得充分的高斯表达后统一对齐融合,场景规模因此不再受单次训练上限约束。这一方案的本质是用空间分割换取局部视角密度,将全局稀疏问题转化为局部稠密问题。
另一个值得关注的工业路径是LiDAR监督:在数字孪生等工业场景中,LiDAR扫描可直接提供度量级深度监督,通过直接LiDAR监督的表面对齐正则化损失同时约束高斯位置和形状,并引入自适应致密化和多视角深度引导剪枝来抑制浮点。这绕开了单目深度先验的尺度模糊问题,在精度要求高的工业检测场景中具有不可替代性。
伪影:从“视觉修补”到“表示层修复”
问题的重新定义
伪影修复的一个关键认知转变是:伪影不是二维画面噪声,而是底层三维表示错误的可见化。ArtifactWorld(ACM MM 2026,贝壳找房)明确指出,浮点、拉伸、裂缝、跳变闪烁这些现象意味着底层三维表示仍然存在问题,仅在二维帧上修复远远不够。
顶会前沿:三类修复范式
范式一:正则化约束下的优化过程修复
这是最“原生”的方案——在训练过程中加入几何正则化,从源头抑制伪影产生。
AD-GS(Alternating Densification)识别出标准3DGS的无控致密化是浮点产生的根本原因,提出交替致密化策略:低致密化阶段进行激进的透明度剪枝,然后通过伪视角一致性和边缘感知深度平滑正则化几何。
DropGaussian(CVPR 2026)则采用了结构正则化的思路,通过随机丢弃高斯来抑制过拟合和浮点增长,实验显示能有效抑制浮点。
SparseGS(IEEE 2025)集成了深度先验、新颖深度渲染技术、剪枝启发式以及不可见视角正则化模块,在Mip-NeRF360、LLFF、DTU数据集上仅用12张(无界场景)和3张(前向场景)输入图像即可实现高质量重建。
范式二:生成式先验驱动的修复-回灌闭环
ArtifactWorld构建了完整的闭环系统:先系统组织稀疏视角3DGS的典型伪影分类(Artifact Taxonomy),再通过物理模拟与生成式扩展构造107.5K组配对视频数据,利用artifact heatmap和视频扩散模型对novel-view渲染视频进行区域自适应修复,最后将修复结果回灌到3DGS优化过程中真正改善底层三维表示。
在DL3DV 5% views设置下,PSNR从原始3DGS的22.75提升到24.56;在跨域Mip-NeRF 360 5% views下达到19.97,高于GSFixer的18.73。视频修复的FVD为33.92,显著低于Difix3D的66.76和GSFixer的114.53。
范式三:弱纹理区域的几何-外观一致性约束
ICO-GS将稀疏视图3DGS的退化归因为“几何与外观失去内在一致性”,先用特征域多视图光度一致性(配逐像素top-k选择和边缘感知平滑)约束几何,再用循环一致性过滤可靠深度合成虚拟视图来反向监督外观。消融实验显示,去掉循环一致性深度过滤模块在DTU上掉0.52 dB并出现明显渲染伪影。
工业界实践:透明/反射材质的专项治理
玻璃反射是工业场景(尤其是建筑和自动驾驶仿真)中的“伪影重灾区”。GlassSplat(ICMR 2026)指出标准3DGS的多视角一致性假设在玻璃反射场景下失效,会在自由空间中分配虚假的高斯作为浮点伪影。其方案是结合对极几何约束和几何一致性剪枝来实现无反射伪影的重建。
Isaac Sim集成验证方面,中村航的验证文章系统梳理了3DGS在产业用仿真中的本质弱点与回避策略,为工业仿真场景的伪影治理提供了工程参考。
端侧算力:从“跑不动”到“手机116 FPS”
瓶颈的精确诊断
端侧部署面临两个核心瓶颈:
计算瓶颈:alpha混合是首要计算瓶颈,因为它依赖耗时的高斯深度排序过程。这一排序操作在移动端GPU上成为实时渲染的最大障碍。
存储瓶颈:单个高斯场景可超50MB,城市级场景数据量更大。LFGS的测量显示,3DGS固有的高维高斯表示导致显著的存储和计算需求,严重阻碍了资源受限移动设备上的部署。
顶会前沿:五条技术路线的协同突破
路线一:免排序渲染——从根源上消除计算瓶颈
Mobile-GS(ICLR 2026)识别出alpha混合中的深度排序是首要瓶颈,提出深度感知的免排序渲染方案直接消除排序需求,大幅加速渲染。但免排序渲染可能在几何重叠区域引入透明度伪影,为此引入神经视角依赖增强策略,基于观察方向、3D高斯几何和外观属性更准确地建模视角依赖效应。
路线二:模型压缩——剪枝 + 量化 + 蒸馏三管齐下
Mobile-GS在压缩端的完整方案包括:一阶球谐蒸馏(降低SH阶数)、神经向量量化(压缩高斯表示)、贡献度剪枝(减少高斯数量)。最终将3DGS压到4.6 MB,在桌面端跑到1100+ FPS,首次在骁龙8 Gen 3手机上实现116 FPS的实时高斯泼溅渲染。
LFGS(Elsevier 2025)提出了三阶段轻量框架:高斯剪枝和不透明度正则化 → 动态球谐调整 → 熵约束向量量化,在deep blending数据集上实现超过90倍的内存压缩,同时渲染质量与原始3DGS可比。
路线三:边缘协同渲染——算力卸载
ECO-GS提出了一个务实的思路:用户可以在本地小GS模型(保证及时性)和远程大GS模型(保证保真度)之间切换。核心挑战是如何决定何时启用大模型——这涉及渲染需求与资源条件之间的相互依赖。ECO-GS通过集成渲染与通信(IRAC)框架联合优化协作状态和边缘功率分配,并开发了模仿学习优化算法将计算时间降低100倍以上。
在XR房地产导航系统中,通过将高负载3DGS渲染任务卸载到基于gNB的移动边缘计算节点,实现了WebRTC同步的逼真浏览体验,终端设备无需本地渲染。
路线四:LOD自适应——空间换时间的精细化
MobileSplat将大规模3DGS数据分区为空间瓦片层次结构,配合质量保持的LOD,以及资源优化的渲染管线实现层级缓存管理策略,在消费级移动硬件上达到30+ FPS。
Portals系统(CVPR 2026)则围绕LOD自适应高斯泼溅(SPAG)和共享空间媒体计算基底构建了已部署在iOS上的系统架构。
路线五:虚拟内存与流式加载——打破内存墙
虚拟内存+ LOD方案允许在移动设备上渲染大型场景而无需全部加载。StreamingGS基于体素的流式方案配合内存优化和架构支持,在移动Ampere GPU上实现了62.9倍的能耗节省。Vega提出了对象级选择性计算思路,服务端关键帧存储完整场景数据、残差帧仅编码动态对象信息以减少冗余,客户端按需解码。
工业界实践:国产化平台与端侧迁移
CCF YOCSEF青岛论坛上展示的校企合作成果值得关注:通过PyTorch + SlangGS优化后端、Vulkan + SlangGS增强前端性能,成功实现了从PC向苹果手机等移动设备的迁移。这标志着国产化端侧三维重建平台从实验室走向了工程化部署阶段。
NVIDIA的TokenGS(CVPR 2026)则针对端侧重建的特定缺陷——移动端拍摄的相机位姿抖动和传感器噪声易导致刺状伪影、端侧微调易出现旧场景信息遗忘——借鉴DETR的可学习Token范式来打破传统3DGS像素绑定带来的端侧重建缺陷。
总结与展望
| 稀疏视角 | |||
| 伪影 | |||
| 端侧算力 |
三座大山正在从“各自为战”走向“协同破局”。一个值得关注的趋势是:稀疏视角的解决方案(如扩散修复)本身需要端侧算力支撑,而端侧压缩(如量化剪枝)又可能加剧伪影——未来的破局点可能不在于单一维度的极致优化,而在于联合优化框架的设计:让稀疏视角重建、伪影抑制和端侧部署在统一的表示学习和推理管线中被同时考虑。
另一个深层趋势是从“逐场景优化”向“前馈泛化”的范式迁移。S2D利用视觉基础模型生成视角无关的点云引导、TokenGS用可学习Token替代像素绑定——这些信号暗示,3DGS可能正在从“每个场景训练一个模型”走向“用基础模型直接预测高斯表示”,这将从根本上改变稀疏视角和端侧算力问题的性质。当然,这条路径的代价是牺牲部分场景特定的保真度,如何在泛化能力和重建质量之间找到平衡,将是下一个阶段的核心命题。
那么,该如何系统学习三维视觉、具身智能等前沿3D视觉技术呢?今天就给大家推荐一个专业、干货满满的学习圈子————「3D视觉从入门到精通」知识星球,这里不仅有SLAM和3DGS的学习资料,还覆盖了自动驾驶、具身智能、无人机、机械臂抓取等方向的干货资料。
经常有粉丝问这样一个问题:
「3D视觉从入门到精通」知识星球,里面有什么内容? 加入星球,是不是可以学习视频课程呢?有哪些会员权益? 以下将给大家详细介绍?(注:扫码加入后,可在知识星球APP/网页端微信登录,即可进入星球)
今天,咱们一起聊一聊这个沉淀了近9年的3D视觉技术圈子。
一 什么是知识星球?
知识星球是一个高度活跃的社区平台,在这里你可以和相同研究方向的小伙伴一起探讨科研工作难题、交流最新领域进展、分享3D视觉最新顶会论文&代码资料、分享视频(讲解3D视觉重要知识点)、发布高质量的求职就业信息,承接项目等,当然还可以侃侃而谈,吐槽学习工作生活。
二 「3D视觉从入门到精通」知识星球
目前已有近6300+活跃成员,主要涉及方向:工业3D视觉、SLAM、自动驾驶、三维重建、无人机、具身智能、大模型等科技前沿方向。


细分方向众多,包括但不限于:工业3D视觉、三维重建、自动驾驶、具身智能、大模型、扩散模型等科技前沿方向,也涉及视觉竞赛、硬件选型、视觉产品落地经验分享、学术&求职交流等。我们也会紧跟最新前沿科技发展,也是我们星球里的热门讨论话题。

三 星球内全系列视频教程汇总

视频教程分为两大板块:第一板块为核心主线课程,精心打磨了近20门系列视频教程,内容系统、循序渐进,更是大家学习的重点,带你学习工业3D视觉、SLAM、3DGS、自动驾驶与无人机等3D视觉技术,下面我们会详细介绍这部分内容;第二板块为前沿技术分享,特邀行业大咖与学术大牛开展直播分享,内容全面覆盖具身智能、自动驾驶、三维重建、数字人、扩散模型、3D生成等热门前沿方向,本部分为非重点内容,不再做详细介绍。
3.0 3DGS独家视频教程
3.0.1 3DGS三维重建系列视频教程

3.0.2 基于NeRF、3DGS三维重建的SLAM算法视频教程
本视频教程从理论和代码实现两方面展开,带你从零入门NeRF/Gaussian Based SLAM的原理学习、论文阅读、代码梳理等。理论层面,从线性代数入手到传统的计算机图形学,让大家明了现代三维重建的理论基础和源头;代码层面通过多个练习手把手教会大家复现计算机图形学、NeRF相关工作。

3.1 基础课程
3.1.1 高精度相机标定从理论到实战系统教程
本课程主要包含两部分,分别是相机标定和3D视觉,相机标定包含单目、双目和鱼眼相机标定;3D视觉包含立体视觉、结构光和TOF,以立体视觉为主。课程提供对应数据与代码。
课程亮点:除了相机标定的基础原理和代码之外,星球里还补充了高精度相机标定的改进方法以及实战技巧,这是相当硬核的。

3.1.2 ROS2从入门到实战视频教程
ROS2从入门到实战视频教程,从小白方式介绍到高阶使用讲解,对ROS2进行全面的实操教学训练,为大家提供系统性的学习机会。

3.1.3 四旋翼飞行器:算法与实战

3.1.4 C++从零基础入门到进阶
力求通过视频教程的学习,彻底搞懂C++较难的一些模块,掌握SLAM等算法的编写套路,学会C++相关岗位的面试技巧。学懂本课程,并且对其中的疑难点能够较好的理解运用,可以达到1-2年的C++开发工程师的经验水平。

3.2 工业3D视觉系列视频课程
3.2.1 基于面结构光三维重建系列视频


3.2.2 机械臂抓取、三维点云、三维重建等

3.2.3 线结构光(单双目)三维重建系统教程等
本门课程面向实战教学,手把手带你从零实现一套属于自己的线激光3D扫描系统。几乎每一个章节都配备有相应的讲义、代码,帮助大家更好地理解线激光三维重建技术。

3.3 SLAM系列视频
3.3.1 如何轻松拿捏LIO-SAM?(提供注释版本代码)

3.3.2 彻底剖析激光-视觉-IMU-GPS融合SLAM算法
本视频课程从理论和代码实现两个方面对激光雷达-视觉IMU-GPS融合的SLAM算法框架和技术难点进行讲解,并且博士大佬会根据自己多年的机器人工程经验,向大家讲解在实际机器人应用中多模态融合的方法和技巧。

3.3.3 ORB-SLAM3理论基础+关键技术详解

3.3.4 视觉-惯性SLAM:VINS-Fusion原理精讲
视觉-惯性SLAM的入门与实践视频教程,结合VINS-Fusion源码,系统地对视觉-惯性SLAM的基础理论知识进行梳理。整套课程由一线算法工程师教授,从基础理论到代码剖析,保姆级教学,助力学员一步步从小白成长为大牛。

3.4 自动驾驶
3.4.1 面向自动驾驶领域的多传感器融合系统教程
主要分两个大模块:理论篇和实战篇,理论篇部分主要介绍自动驾驶中常用的传感器硬件、传感器间的时间同步和空间同步以及多传感器间的信息融合理论知识;实战篇更多偏向工程应用,工程中传感器间同步与融合如何实现等。

3.4.2 面向自动驾驶领域的3D点云深度学习目标检测
本视频教程以3D点云深度学习为主,对Point-based和Voxel-based系列的3D目标检测网络架构进行系统剖析和代码梳理,助力各位同学在点云深度学习更快的入门和更深的理解。

3.4.3 单目深度估计方法:理论与实战视频
视频教程主要分为两大部分:理论篇和实战篇,由于有监督方法的深度真值获取困难,且无监督方法的效果与有监督方法几乎相当,我们将课程的重心放在了无监督方法上。

3.4.4 自动驾驶中的深度学习模型部署实战视频
本视频教程将采用理论和实践相结合的思路,首先对TensorRT的编程模型以及GPU/cuda的相关知识进行讲解,带领大家达到知其所以然的程度;之后课程将用分类、检测、分割三个例子来展示详细编程流程,并给出相关代码,达到真正能落地的工业级分享。

四 3D视觉基础入门
考虑到很多初学者在配置3D视觉软件或者视觉库可能会有困难,我们已经为大家梳理了各个模块的配置教程文档,供学习参考。

五 3D视觉源码汇总

下面为大家节选展示星球内的3D视觉行业相关源码:


六 高质量项目发布与对接
下面为大家节选展示星球内的项目承接:



七 专业的智囊团为星球成员答疑解惑
下面为大家节选展示星球内的答疑解惑:




八 最新前沿顶会论文分享
下面为大家节选展示星球内的前沿顶会:







九 精华问题100问
下面为大家节选展示星球内的精华问题100问:
结构光


相位偏折术


BEV与Occupancy


MVSNet


线结构光


Transformer


机器人规划控制

四旋翼建模与控制

十 3D视觉方向求职招聘
下面为大家节选展示星球内的求职招聘内容:


十一 星球会员权益
项目、学习、求职中遇到的问题,免费获得解答。 终身免费学习星球往期已更新完毕的所有视频内容。 星球每月之星给予丰厚的现金奖励。 优先承接来星球内部项目对接。 终身免费下载星球往期分享的文献和项目代码。 优先获得3D视觉企业(与工坊深度合作企业)内推资格。 快速找到志同道合的学习伙伴,不再单打独斗,抱团取暖,走得更快更远。 不定期星球内部会组织项目实训,包括相机标定、机械臂抓取、三维重建优化等
写在最后
目前已有6400多名3D视觉从业者正在星球里一起交流、分享、进步,我们也欢迎您一道同行!

