点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
来源:3D视觉工坊
3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:
太长不看版:ZeroSplat 首次把 3DGS 指代表达分割扩展到 0、1 或 N 个目标,而且无需训练、无需给高斯点存语义特征;在 GR-ScanNet 达到 41.2 mIoU,在 LERF 达到 52.4 mIoU、比此前最佳高 2.0。
导读
3D Gaussian Splatting(3DGS)的最新进展已经让语言引导的场景理解成为可能。然而,现有指代式 3D Gaussian Splatting(R3DGS)方法从根本上受限于单目标查询。为了反映真实世界指令的歧义性,作者提出广义指代式 3D Gaussian Splatting 分割(Generalized Referring 3D Gaussian Splatting Segmentation,GR3DGS)任务:模型必须动态分割任意数量的目标,即 0 个、1 个或 N 个。为全面评估这一新任务,作者构建了 GR-LERF 和 GR-ScanNet 两个新基准。

更关键的是,既有 R3DGS 范式存在两个从根本上限制 GR3DGS 性能的技术瓶颈:其一,它只在二维渲染像素上操作,缺少内在的三维点级理解;其二,它需要逐场景优化来嵌入沉重的语义特征,计算开销高得难以承受。
为拆解这些瓶颈,作者提出 ZeroSplat:一个无需训练、零额外特征的全新框架。ZeroSplat 通过稳健的多视图几何约束,把二维视觉语言模型(VLM)的先验提升到三维空间;这一策略无需增加任何特征存储,便可获得内在的点级理解。大量实验表明,ZeroSplat 在广义场景和单目标场景中都显著超过现有最先进方法,同时保持出色效率。
▲ 图 1:传统 R3DGS 仅限单目标情形;GR3DGS 则能处理任意数量的目标,包括无目标、单目标和多目标查询。
效果展示
▲ 图 3:GR-LERF 数据集上的目标选择定性结果。ZeroSplat 能按照复杂指令找全多个目标,并减少相邻实例被合并或漏检的问题。
▲ 图 4:GR-ScanNet 数据集上的目标选择定性结果。对空间关系和功能描述较复杂的查询,ZeroSplat 仍能在三维点级别给出边界清晰、语义纯净的结果。
▲ 图 10:真实世界场景泛化结果。面对复杂光照、严重遮挡、长文本指令以及场景中不存在的目标,ZeroSplat 均能作出相应预测;无目标查询会输出空结果。
引言
3D Gaussian Splatting(3DGS) 使用显式三维高斯表示场景,从而实现高质量实时渲染。除视觉合成外,近期研究也在持续为 3DGS 增加语义理解能力。早期的开放词汇 3DGS 理解方法把二维基础模型特征蒸馏到三维空间,使用户可以用文本查询场景。然而,这些方法通常依赖固定类别名称或简单名词短语。该限制妨碍了自由形式语言理解,而这种能力对具身智能 和多模态大语言模型智能体至关重要,因为用户查询往往带有细粒度属性和复杂空间关系。因此,指代式 3D Gaussian Splatting(R3DGS)通过根据复杂文本提示分割目标,填补了这一空白。
然而,现有 R3DGS 范式有一个关键限制:它被严格局限于“单目标”设定。如 Figure 1 所示,这类方法预设每条指令在场景中恰好对应一个目标。这个假设严重削弱了它们在真实场景中的灵活性,因为用户指令本来就具有不确定性,可能要求多个目标(例如“找出所有红色椅子”),也可能根本没有目标,即所指物体并不存在。为此,作者提出广义指代式 3D Gaussian Splatting 分割(GR3DGS)任务。该任务要求解析指令并分割任意数量的目标(0、1 或 N 个),因而对语义判别能力以及抵抗歧义的稳健性提出了更高要求。为便于评估,作者构建 GR-LERF 用于像素级测评,并通过三维标注构建 GR-ScanNet,用于内在的点级测评。
除任务定义之外,现有技术范式用于 GR3DGS 时还会遭遇明显瓶颈,主要有两个关键限制。其一,缺少三维点级理解:当前 R3DGS 方法以二维渲染像素而非离散三维高斯点作为语义处理的基本单元;从根本上说,它仍被限制在二维图像级理解中,无法利用场景显式的三维几何结构来消解复杂空间歧义。其二,计算与内存开销难以承受:既有方法需要耗时的场景专属优化,还要把高容量语义特征嵌入数百万个高斯点。庞大的存储占用与峰值内存消耗,使其很难用于实时应用,也难以在资源受限设备上规模化部署。
为弥合这些差距,作者提出 ZeroSplat,一个专为 GR3DGS 设计、无需训练且零额外特征的新框架。ZeroSplat 不再沿用附加语义参数与场景表示耦合的主流范式,其核心洞见是:稳健的三维语义理解并不一定要改动场景的内在表示;通过几何约束把二维基础模型先验提升到三维空间,同样可以实现这一目标。该方法把二维视觉语言模型(VLM)给出的语义线索投影到三维结构上,直接在原始三维高斯集合中筛选并定位目标。
概括而言,本文贡献如下:
作者提出一个名为广义指代式 3D Gaussian Splatting 分割(GR3DGS)的新任务。 为支持未来的 GR3DGS 研究,作者构建 GR-LERF 和 GR-ScanNet,分别从像素级与点级进行评估。 针对 GR3DGS 的挑战,作者提出 ZeroSplat,一个零额外特征、无需训练且能获得内在点级理解的框架。 实验表明,该方法在广义场景与单目标场景中均超过现有方法。
主要贡献
作者提出一个名为广义指代式 3D Gaussian Splatting 分割(GR3DGS)的新任务。 为支持未来的 GR3DGS 研究,作者构建 GR-LERF 和 GR-ScanNet,分别从像素级与点级进行评估。 针对 GR3DGS 的挑战,作者提出 ZeroSplat,一个零额外特征、无需训练且能获得内在点级理解的框架。 实验表明,该方法在广义场景与单目标场景中均超过现有方法。
方法
ZeroSplat 的巧妙之处,是没有再给 3DGS 背一套沉重语义特征,而是把现成 VLM 当“侦察员”、把多视图几何当“证据链”。二维模型负责理解自由文本并指出可疑区域,三维投影负责跨视图核验;遇到场景里根本没有目标时,证据不足就输出空集,而不是被迫猜一个答案。
给定由多视图图像重建、并以 3DGS 场表示的场景,以及一条自由形式自然语言表达,GR3DGS 要为每个高斯点分配二值语义标签。不同于默认文本一定对应单个目标的标准 R3DGS,表达式可以指向任意数量的实例:多个、一个,或者场景中不存在目标时输出空掩码。
ZeroSplat 用三个阶段把非结构化文本逐层连接到三维几何锚点。第一阶段依据场景几何曲率,贪心选取能够覆盖高价值几何区域的关键帧;VLM 先从复杂指令中提取精炼语义标签,再结合原指令和关键帧输出二维目标框。第二阶段把语义标签交给 SAM3,经过置信度驱动的自适应视图选择和掩码融合后,利用 3DGS 体渲染贡献将二维前景/背景响应反投影到每个高斯点,并通过跨视图背景冲突比例剔除伪影。第三阶段使用 VLM 预测框进行多视图复核,再以基于 KD-Tree 的三维 KNN 标签扩散填补遮挡或掩码边缘误差造成的内部空洞。

▲ 图 2:ZeroSplat 总体流程。(a)从输入场景提取关键帧,VLM 先做语义标签提取,再结合标签、指代表达和关键帧生成二维框;(b)标签引导 SAM3 从场景视图提取二维掩码,并把目标反投影为三维点组;(c)利用 VLM 二维框过滤错误高斯,再用 KD-Tree KNN 空间标签扩散补全内部结构。
附录进一步公开了两阶段 VLM 的提示词设计:第一阶段要求模型进行空间推理,并把自然语言统一为“颜色 + 名词”的语义标签;第二阶段负责跨图像二维定位,同时强制无目标情形输出 -1,避免模型硬找一个并不存在的物体。
▲ 图 11:第一阶段提示词——语义标签提取。提示词要求空间推理,并把自然语言描述标准化为“Color + Noun”形式。
实验结果
作者构建的 GR-LERF 在 LERF 场景上提供像素级评估,GR-ScanNet 则基于 ScanNet 的 10 个代表性室内场景提供三维点级评估;两套基准的全部指令均经过人工标注与交叉核验。ZeroSplat 在单张 NVIDIA RTX 4090D 上以 PyTorch 实现,默认选择 30 个几何关键帧,并使用 qwen3-vl-30b-a3b-instruct 完成标签提取和二维框生成。
在 GR-LERF 上,ZeroSplat 的像素级分割显著超过全部基线;在 GR-ScanNet 上,它以 41.2 mIoU 建立新的内在三维点级分割最优结果。在标准 Ref-LERF 单目标任务上,无需训练的 ZeroSplat 达到 32.7 平均 mIoU,比全监督 ReferSplat 高 3.5。在并非其主要设计目标的开放词汇任务上,ZeroSplat 在 LERF 达到 52.4 mIoU,比此前最佳高 2.0,并在 ScanNet 的 19 类和 15 类协议下都取得最佳表现。
消融显示,单纯掩码提升基线为 24.7 mIoU;加入 VLM 空间锚定后增至 38.6(+13.9),只加三维 KNN 扩散则增至 26.2(+1.5),二者结合达到最佳的 41.2。若去掉语义标签提取,性能会跌至 24.3;将几何关键帧换成均匀随机采样会降至 39.6;去掉二维框过滤则降至 40.1。固定半径三维搜索只得到 39.8,而能适应局部点密度的 KNN 扩散保持 41.2。
▲ 图 5:Ref-LERF 数据集上的单目标指代表达分割定性对比。
▲ 图 6:LERF 数据集上的开放词汇目标选择定性对比。
▲ 图 7:ScanNet 数据集上的三维开放词汇目标选择定性对比。
总结 & 未来工作
本文提出广义指代式 3D Gaussian Splatting 分割(GR3DGS)任务。与传统单目标范式不同,GR3DGS 通过处理多个目标和场景中不存在的物体,面向真实世界的复杂情况。针对这一任务,作者提出 ZeroSplat,一个用于内在点级三维场景理解、零额外特征且无需训练的框架。ZeroSplat 通过多视图几何约束和空间扩散,把二维视觉语言模型(VLM)先验提升到三维空间,从而不再需要昂贵的逐场景优化和辅助语义特征存储。此外,作者构建 GR-LERF 与 GR-ScanNet 两个基准,分别从像素级和点级评估性能。大量实验表明,ZeroSplat 在广义、单目标和开放词汇场景下都显著超过现有最先进方法,同时作为即插即用方案保持高效率。作者相信,该框架和基准将为未来具身智能与交互式三维场景理解研究提供坚实基础。
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。