点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
来源:3D视觉工坊
3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:
前馈3D高斯泼溅(3D Gaussian Splatting, 3DGS)近年来在高效可泛化的3D重建领域取得了显著进展,能够从多视角图像中快速生成高质量的新视角合成结果。然而,当我们将目光转向更复杂的场景理解任务时,现有的前馈3DGS方法仍面临着根本性的局限。
当前用于场景理解的前馈3DGS方法主要停留在以类别为导向的语义层面,缺乏对场景中独立实例的感知能力。而那些具备实例感知能力的3DGS方法,又大多依赖耗时的逐场景优化,且将重建与实例、语义学习解耦处理,使得三者之间无法相互促进,整体性能受到严重制约。
这种割裂的设计范式导致重建质量与场景理解精度都无法达到最优。如何在一次前向传播中同时实现高质量3D重建和实例级场景理解,并让两者相互增益,成为了一个亟待解决的关键问题。
InstanceSplat提出了一个统一的前馈3DGS框架,在单次前向传播中构建实例感知的高斯表示,通过实例中心学习策略将重建、实例分割和开放词汇语义理解三大任务紧密耦合,在多个基准上达到SOTA。

导读
前馈3D高斯泼溅(3DGS)实现了高效可泛化的3D重建,但当前用于场景理解的前馈3DGS方法仍主要以类别为导向。而实例感知的3DGS方法通常依赖逐场景优化,且往往将重建与实例和语义学习解耦,限制了它们之间的相互促进。本文提出InstanceSplat,一个统一的前馈3DGS框架,从无位姿多视角图像中实现可泛化的3D重建和实例感知场景理解。在单次前向传播中,InstanceSplat构建实例感知的高斯表示,联合编码外观、几何、实例身份和语言对齐语义。共享的3D高斯在视角间建立实例身份的关联,产生可渲染且跨视角一致的实例特征。为进一步让重建和场景理解相互受益,设计了实例中心学习策略,通过共享实例结构连接重建、实例学习和语义学习。实验在新视角合成、实例分割和开放词汇语义理解上达到SOTA。
效果展示
图 3:基于实例生成的边界权重可视化。亮度越高,代表实例边界附近的权重数值越大。
图 6:实例表征定性分析。左侧子图展示语义感知难样本重加权带来的效果,并附真值掩码作为参考;中间与右侧子图分别对比 IGGT 和 InstanceSplat 经 PCA 投影后的特征与跟踪掩码。
引言
3D高斯泼溅作为一种显式的3D表示方法,凭借其高效的光栅化渲染和高保真的视觉质量,已成为3D重建领域的重要技术。前馈3DGS进一步突破了传统3DGS需要逐场景优化的限制,通过学习跨场景泛化的前馈网络,实现了从多视角图像到3D高斯的端到端推理。
然而,场景理解不仅仅需要类别级的语义信息,更需要实例级的精细感知。在复杂的真实场景中,多个同类物体可能同时存在,仅靠类别语义无法区分它们。现有的前馈3DGS方法大多将语义信息以类别标签的形式附加到高斯上,无法实现实例级的区分。
另一方面,已有的实例感知3DGS方法虽然在重建质量上有所提升,但通常需要在每个场景上进行耗时的优化,难以实现快速泛化。更重要的是,这些方法往往将重建与实例学习、语义学习分别处理,未能充分利用三者之间的协同关系。
因此,如何设计一个统一的前馈框架,在保持高效泛化的同时实现实例感知的场景理解,并让重建与理解相互促进,是一个具有重要研究价值的问题。
主要贡献
本文的核心贡献在于提出了一个将3D重建与实例感知场景理解统一在前馈框架中的方案,具体包括以下几个方面:
提出InstanceSplat,首个统一的前馈3DGS框架,从无位姿多视角图像中同时实现可泛化3D重建和实例感知场景理解,在单次前向传播中完成全部推理。 设计实例感知的高斯表示,在3D高斯中联合编码外观、几何、实例身份和语言对齐语义,通过共享高斯在视角间建立实例身份关联,产生跨视角一致的实例特征。 提出实例中心学习策略,以共享的实例结构为桥梁连接重建、实例学习和语义学习,使三者相互受益,避免了解耦设计带来的次优问题。 在新视角合成、实例分割和开放词汇语义理解三个任务上均达到SOTA,验证了统一框架的有效性。
方法
InstanceSplat的整体框架从无位姿多视角图像出发,通过前馈网络直接预测3D高斯表示。与传统的仅编码外观和几何的前馈3DGS不同,InstanceSplat为每个高斯额外引入了实例身份特征和语言对齐语义特征,使其具备实例感知和开放词汇理解能力。
在实例特征的设计上,InstanceSplat利用共享的3D高斯作为跨视角的信息载体。由于同一3D空间中的高斯在多个视角中被一致地观测,其上附加的实例身份特征自然地建立了视角间的关联,从而产生跨视角一致的实例特征场。这种设计避免了后处理中跨视角实例匹配的复杂性。
为了实现重建与场景理解的相互促进,InstanceSplat设计了实例中心学习策略。该策略以共享的实例结构为连接枢纽,将重建损失、实例学习损失和语义学习损失统一在实例中心的框架下。重建过程为实例和语义学习提供几何基础,而实例和语义信息反过来约束高斯的空间分布,指导更精确的重建。
整个框架在单次前向传播中完成,无需逐场景优化,同时支持新视角合成、实例分割和开放词汇语义理解等多种下游任务的推理。


实验结果
在新视角合成任务上,InstanceSplat凭借实例感知的高斯表示和实例中心学习策略的几何约束,在渲染质量上取得了具有竞争力的结果,验证了实例信息对重建的正面反馈作用。
在实例分割任务上,InstanceSplat通过跨视角一致的实例特征场,实现了高质量的3D实例分割,显著优于现有的前馈3DGS方法,证明了统一框架在实例感知方面的优势。
在开放词汇语义理解任务上,InstanceSplat通过语言对齐的语义特征实现了灵活的文本查询,在多个基准上达到SOTA,展示了其在开放场景理解中的潜力。
综合三个任务的实验结果,InstanceSplat验证了将3D重建与实例感知场景理解统一在前馈框架中的有效性和优越性。





总结 & 未来工作
本文提出了InstanceSplat,一个统一的前馈3DGS框架,通过实例感知的高斯表示和实例中心学习策略,在单次前向传播中同时实现了可泛化的3D重建和实例感知场景理解。该方法在新视角合成、实例分割和开放词汇语义理解三个任务上均达到SOTA,充分证明了重建与场景理解相互促进的设计理念。
未来工作中,InstanceSplat有望进一步扩展到更大规模的室外场景和动态场景,探索时序信息在实例感知中的作用。此外,将更多模态(如深度、法向)融入实例感知的高斯表示,以及探索与大规模语言模型的更深层次结合,都是值得深入研究的方向。
对更多实验结果和文章细节感兴趣的读者,可以阅读一下论文原文~
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。