一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向

量子位 2026-07-27 11:31
3DGS团队 投稿 
量子位 | 公众号 QbitAI

过去三年,3D Gaussian Splatting(3DGS)几乎成为实时3D场景重建与新视角合成的“默认答案”。

与需要沿每条光线反复查询神经网络的NeRF不同,3DGS使用数百万个可学习的各向异性高斯显式表示场景,再通过可微、分块式光栅化器直接生成图像,在视觉质量与实时渲染之间取得了难得的平衡。

但当场景从一个房间扩展到城市级环境,从静态走向4D动态,从桌面GPU走向移动端、机器人和边缘设备,问题也随之改变:系统不仅要“重建得出来”,还要在有限显存、带宽和功耗下稳定跑起来。

此时,真正限制3DGS上限的,往往不只是高斯表示本身,而是投影、分块、排序、混合和梯度回传组成的整条光栅化流水线

为回答“3DGS的瓶颈究竟在哪里”,香港科技大学(广州)3DAgentWorld Lab、南洋理工大学、阿里巴巴集团和其域创新科技近日联合发布《3D Gaussian Splatting Rasterization: A Survey》。这项工作不再按照传统综述数字人、自动驾驶、SLAM等下游任务简单分析,而是把可微光栅化器视为3DGS的核心计算引擎,从底层数据流重新组织快速增长的技术版图。

一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向图1

从“做什么”转向“在哪里改”:重新理解3DGS技术演进

已有3DGS综述大多围绕应用场景展开。这种方式便于寻找特定任务的解决方案,却容易掩盖不同工作背后的共同问题:稀疏视角重建、抗锯齿、几何致密化、大场景渲染,看似属于不同赛道,实际都可能反复遭遇相同的投影误差、可见性排序、透明度混合和梯度传播难题。

联合团队因此提出一种“光栅化中心”的分类方式:不再只问一种方法用于什么任务,而是追问它究竟改动了流水线的哪个位置、缓解了哪类系统瓶颈,以及这些改动如何影响画质、速度、显存和存储成本。

一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向图2
论文提出的三层光栅化分类体系:表示与优化、光栅化流水线、场景驱动扩展。

整套技术版图被划分为三个层次。

拆开实时渲染“黑盒”:五个环节,五类瓶颈

标准3DGS之所以能够实现高速渲染,核心在于一条经过高度优化的、基于瓦片的可微光栅化流水线。3D高斯基元首先被投影到二维屏幕,系统随后判断它会覆盖哪些图像分块,并将其复制到对应的“瓦片”中。

接下来,每个瓦片内的高斯按照深度排序,再由CUDA线程块逐像素完成α混合。进入训练阶段后,图像损失还需要沿着同一路径反向传播,最终更新高斯的位置、尺度、旋转、不透明度和球谐函数颜色等参数。

一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向图3
基于瓦片的光栅化流程:投影后复制到多个瓦片,按深度排序,再进行逐像素α混合。

这条流水线中的每个环节,都对应着不同的工程难题。投影阶段需要处理混叠和几何畸变。瓦片分配会带来大量的高斯复制和内存访问。逐瓦片深度排序不仅增加计算延迟,还可能导致画面出现“跳变”。α混合除了处理透明度,还需要兼容语义特征和物理材质。反向传播则依赖大规模梯度累积,并频繁使用原子操作。

论文的一项关键价值,就是把散落在不同研究中的优化方法重新放回一个统一的框架中,系统比较它们的作用位置、性能收益和额外代价。

四个典型问题,光栅化优化如何落地

投影与深度:二维化并不等于问题消失

把3D高斯压缩为二维可以增强表面表达,但也会引入深度近似误差。相机旋转可能改变光线方向上的相对次序,造成可见性翻转和跳变。

一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向图4
3D高斯压缩为2D splat后的深度简化问题。

瓦片分配:减少无效复制和访存

宽松的包围区域会把大量并未与椭圆相交的高斯复制到瓦片中。Speedy-Splat通过SnugBox和AccuTile逐步收紧候选区域,从源头减少无效分配与访存。

一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向图5
不同瓦片分配策略。SnugBox与AccuTile逐步缩小候选区域,减少无效高斯复制。

α混合:从采样值走向体渲染一致性

传统3DGS用高斯在采样点的函数值近似不透明度。Vol3DGS改为沿相机光线积分一维高斯密度,使α与真实覆盖更一致,对半透明结构和几何表面也更稳定。

一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向图6
Vol3DGS沿相机光线积分高斯密度,计算体渲染一致的α。

致密化:高斯并非越多越好

标准致密化容易让像素数量快速膨胀。Taming 3DGS结合多视角显著性、梯度和高斯属性进行评分,并用可预测增长曲线控制新增数量,让模型预算在训练前就可设定。

一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向图7
Taming 3DGS通过显著性评分和可预测增长曲线控制致密化预算

统一评测:不寻找“万能冠军”,找到效率-质量的共赢

为了让不同设计能够在同一坐标系中比较,联合团队在Mip-NeRF 360、Tanks&Temples和Deep Blending三个常用基准数据集的11个场景上,使用统一的3DGS光栅化实现评估27种代表性方法,并报告了对应的指标及其可视化图表。

实验结果证明团队不应该也无法在所有指标上找到通吃的“冠军”,但可以找到某些子方向的专精:

从整体趋势看,多数效率导向方法可将像素数量减少约40%—70%,但极端压缩仍会带来明显质量风险。存储方面,标准3DGS的典型全分辨率场景可能需要约700—800MB。论文汇总的代表性方法中,HAC++、PyramidGS等可在特定设置下实现约15—20倍压缩,层级或锚点式方案通常可达到约3—5倍缩减。

从论文走向可复现的系统比较

为了降低复现和横向比较的门槛,团队同步开源Github仓库,面向代表性3DGS方法提供统一的训练、渲染和评测流程,支持数据集路径配置、GPU与系统资源检查、场景级/数据集级/方法级指标汇总,并持续接入新的方法和开源实现。

对于研究者,这套框架可以帮助快速定位一种工作究竟改动了表示、投影、排序、混合还是存储;对于工程团队,它提供了一份更接近部署现实的检查清单:不能只看重建指标,还要同时考察训练时长、峰值显存、高斯数量、排序延迟、模型体积和设备能耗。

3DGS的未来:从“看起来更好”走向“系统跑得更好”

基于整套光栅化分析,论文提出五个值得关注的方向:

如果说3DGS技术的第一阶段证明了显式点基表示能够以实时速度逼近高质量神经渲染,那么下一阶段的竞争极有可能下沉到系统层:谁能用更少排序、更少访存、更稳定的梯度,在同一硬件预算下承载更大的场景、更多的属性和更复杂的动态。

这无疑也是这篇综述试图回答的核心问题:3DGS的未来,不只取决于“高斯还能如何设计”,更取决于光栅化器如何与算法、内存和硬件协同演进。

作者团队

这篇论文由一支横跨3D视觉研究、基础模型研发和产业化部署的联合团队完成。作者单位包括香港科技大学(广州)、南洋理工大学、阿里巴巴集团和其域创新科技。

详细介绍:

论文:https://www.preprints.org/manuscript/202607.0776
代码:https://github.com/3DAgentWorld/Advanced3DGS
Github仓库:https://github.com/3DAgentWorld/Advanced3DGS

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目/主页链接,以及联系方式

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
存储
more
存储转折点,将是这一年
小米手机2026年出货目标上调至1.1亿部,主要来自低端机型,存储涨价到拐点?
长鑫存储突围HBM封锁,押注3D DRAM定制化赛道
SK海力士Q2利润创新高却未达预期,HBM4量产提速AI存储战局
关于存储的五个误区
上市暴涨的长鑫存储,直接把美国股市干崩了
存储巨头又一项目敲定!10月开工!
手机巨头集体拒涨,存储芯片博弈进入深水区
天天追货源,月月看涨价——存储芯片从业者的困局如何解?
AI智能体时代来了,哪种存储器机会最大?
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号