不要相机位姿、不要逐场景训练,上交开源InstanceSplat:一次前向看懂3D实例

3D视觉工坊 2026-09-15 07:00

点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达

来源:3D视觉工坊

3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:不要相机位姿、不要逐场景训练,上交开源InstanceSplat:一次前向看懂3D实例图1

太长不看版:InstanceSplat 在一次前向中从无相机位姿多视图生成“实例感知”3D Gaussians,同时编码外观、几何、实例 ID 与开放词汇语义;实例结构反过来帮助边界重建,语义也帮助区分同类不同实例。

导读

前馈 3D Gaussian Splatting 可以高效、可泛化地重建三维场景,但现有面向场景理解的方法仍主要停留在类别层面;实例感知方法又通常依赖逐场景优化,并把重建、实例和语义学习彼此拆开,限制相互促进。

作者提出 InstanceSplat,一个从无位姿多视图图像出发,同时完成可泛化三维重建与实例感知场景理解的统一前馈框架。一次前向中,它构建联合编码外观、几何、实例身份与语言对齐语义的实例感知 Gaussian 表示。

不要相机位姿、不要逐场景训练,上交开源InstanceSplat:一次前向看懂3D实例图2

共享三维 Gaussians 在不同视图间为实例身份提供统一落点,生成可渲染且跨视图一致的实例特征。为了让重建与理解彼此受益,作者设计实例中心学习策略:实例线索指导重建,语言语义帮助区分容易混淆的同类别实例,实例区域再把语义证据聚合成连贯的物体级预测。

在不同输入视图数量和未见数据集上,关于新视图合成、实例分割和开放词汇语义理解的实验均展示最先进性能、实用效率与强泛化。

不要相机位姿、不要逐场景训练,上交开源InstanceSplat:一次前向看懂3D实例图3▲ 图 1:无位姿多视图一次前向得到带紧凑实例/语义特征的 3D Gaussians,支持 NVS、实例分割和开放词汇理解。

效果展示

不要相机位姿、不要逐场景训练,上交开源InstanceSplat:一次前向看懂3D实例图4▲ 图 4:与前馈 3DGS 基线的新视图渲染和语义分割对比,并展示去掉实例级语义聚合的 InstanceSplat。

不要相机位姿、不要逐场景训练,上交开源InstanceSplat:一次前向看懂3D实例图5▲ 图 5:三维特征场 PCA 投影;InstanceSplat 显示实例特征,其他方法显示语义特征。

不要相机位姿、不要逐场景训练,上交开源InstanceSplat:一次前向看懂3D实例图6▲ 图 6:实例表征定性分析,包括语义感知困难负样本重加权,以及 IGGT 与 InstanceSplat 的 PCA 特征和追踪掩码对比。

引言

对三维环境的结构化理解支持机器人导航和物理交互等多种下游应用。在现有三维表示中,3DGS 因高保真新视图合成和高效渲染尤其有吸引力。然而,标准 3DGS 主要为视觉重建设计,不显式编码实例结构或语义信息。这一缺口推动研究在保留渲染保真度的同时,用实例级结构增强 3DGS。

现有场景理解 3DGS 主要有两类范式。场景专属方法给优化后的 Gaussian 场景附加语义或实例特征;它们虽然支持语义查询和实例分割,却依赖逐场景优化,通常把重建与实例学习分成不同阶段,效率低,也限制相互促进。前馈 3DGS 则直接从图像重建未见场景,近期无位姿模型还移除了标定相机需求。其场景理解扩展把语言对齐特征加入模型,但表示仍偏向类别,难以区分物体实例并保留清晰边界。结果是:现有方法要么高效可泛化,却没有显式实例建模;要么实例感知,却依赖昂贵逐场景优化。仍缺少联合学习重建、实例结构和语义的统一前馈框架。

为此,作者提出 InstanceSplat,一个从无位姿多视图图像进行可泛化三维重建和实例感知场景理解的统一前馈框架。如 Figure 1 所示,InstanceSplat 在一次前向中把输入视图映射为实例感知 Gaussian 表示。它联合编码外观、几何、实例身份和语言对齐语义,把实例身份当成 Gaussian 的内在属性,而不是重建后再学习的特征。因此,它为 NVS、实例分割和开放词汇语义理解提供统一可泛化表示。

此外,实例结构可作为三维重建和语义理解之间的共享接口。作者提出 3D-Consistent Instance Grounding,学习可渲染、跨视图一致的实例特征。附着于共享 Gaussians 的紧凑实例嵌入经可微渲染进入监督视图,基于原型的对比学习促进实例内紧凑、实例间分离和跨视图对齐。不同视图的观察通过同一三维 Gaussians 耦合,因此实例特征既可渲染又跨视图一致。在此基础上,Instance-Centric Coupling 让重建、实例和语义学习彼此增强:实例线索指导边界感知重建;实例结构与语言语义相互细化,语义帮助区分同类别实例,实例区域把语义证据聚合为连贯物体级预测。

贡献有三项:

  1. 作者提出 InstanceSplat,从无位姿多视图构建实例感知 Gaussian 表示,实现实例级场景理解。
  2. 作者提出 3D-Consistent Instance Grounding 与 Instance-Centric Coupling,建立跨视图一致实例结构,让三维重建与场景理解相互促进。
  3. 不同输入视图数量和未见数据集上的 NVS、实例分割和开放词汇理解实验展示 SOTA、实用效率和强泛化。

主要贡献

  1. 作者提出 InstanceSplat,从无位姿多视图构建实例感知 Gaussian 表示,实现实例级场景理解。
  2. 作者提出 3D-Consistent Instance Grounding 与 Instance-Centric Coupling,建立跨视图一致实例结构,让三维重建与场景理解相互促进。
  3. 不同输入视图数量和未见数据集上的 NVS、实例分割和开放词汇理解实验展示 SOTA、实用效率和强泛化。

方法

InstanceSplat 把“实例身份”变成重建与语义之间的共同接口。共享 Gaussians 既承载颜色和几何,也承载跨视图一致的对象身份;边界重建反过来逼实例分得更干净,实例区域又帮助语义去碎片化。三项任务不是并排外挂,而是在同一组三维基元上互相提供监督。

前馈骨干从多视图直接预测每像素对应的三维 Gaussian 参数、颜色、不透明度、紧凑实例嵌入和语言对齐语义特征,并联合估计相机几何。所有视图共享同一显式三维基元,因此同一物体的实例身份可以跨视图落到相同 Gaussians。

3D-Consistent Instance Grounding 把实例嵌入渲染到训练视图,用原型对比目标使同实例特征聚拢、不同实例分离。语义感知困难负样本重加权专门加强同类别不同物体之间的辨别。跨视图一致性项约束同一三维实例在不同视图的渲染特征。

Instance-Centric Coupling 用实例边界生成 RGB 重建权重,在物体边缘施加更强监督;语义特征帮助实例分开,而聚类得到的实例区域又对语义进行物体级聚合,减少同一物体内部类别预测碎片。

不要相机位姿、不要逐场景训练,上交开源InstanceSplat:一次前向看懂3D实例图7▲ 图 2:InstanceSplat 总体架构。前馈骨干构建实例感知 Gaussian;三维一致实例落地学习可渲染跨视图特征;实例中心耦合连接边界重建、实例身份和语言语义。

不要相机位姿、不要逐场景训练,上交开源InstanceSplat:一次前向看懂3D实例图8▲ 图 3:实例边界权重可视化,越靠近实例边界响应越亮、重建权重越大。

实验结果

ScanNet 在不同输入视图数量下同时评估新视图质量、实例与语义;训练未见的 LERF 用不同上下文视图测试开放词汇实例定位;IGGT 基准检验跨视图实例追踪;Uni3R 检验实例边界感知 RGB 目标。

InstanceSplat 在三类任务上取得最先进结果,并保持单次前向效率。相对只做语义的前馈 3DGS,实例表示显著改善同类物体分离与边界;相对逐场景 OpenGaussian/InstanceGaussian,在未见 LERF 场景中展示更强效率与泛化。消融确认联合 3DGS 优化、跨视图一致性、语义困难负样本和边界加权均有贡献。

不要相机位姿、不要逐场景训练,上交开源InstanceSplat:一次前向看懂3D实例图9▲ 表 1:ScanNet 不同输入视图下,与前馈 3DGS SOTA 和消融的定量比较。

不要相机位姿、不要逐场景训练,上交开源InstanceSplat:一次前向看懂3D实例图10▲ 表 2:未见 LERF 上与 OpenGaussian、InstanceGaussian 在不同上下文视图数下比较,报告 mIoU 与 Acc@0.25。

不要相机位姿、不要逐场景训练,上交开源InstanceSplat:一次前向看懂3D实例图11▲ 表 3:IGGT 基准上的比较,以及 3DGS 联合优化和跨视图一致性项消融。

总结 & 未来工作

作者提出 InstanceSplat,一个从无位姿多视图构建实例感知 Gaussian 表示的统一前馈 3DGS 框架。共享 Gaussians 联合编码外观、几何、实例身份和语言对齐语义。3D-Consistent Instance Grounding 学习可渲染、跨视图一致的实例特征;在此结构上,Instance-Centric Coupling 让三维重建和实例感知理解相互促进,同时改善重建质量和理解表现。不同输入视图数量和未见数据集上的 NVS、实例分割与开放词汇理解实验展示 SOTA、实用效率和强泛化。剩余限制是,视图和 Gaussian 数量增加时,特征聚类成本会变高;未来将研究更紧凑的场景表示。

本文仅做学术分享,如有侵权,请联系删文。

不要相机位姿、不要逐场景训练,上交开源InstanceSplat:一次前向看懂3D实例图12不要相机位姿、不要逐场景训练,上交开源InstanceSplat:一次前向看懂3D实例图13不要相机位姿、不要逐场景训练,上交开源InstanceSplat:一次前向看懂3D实例图14不要相机位姿、不要逐场景训练,上交开源InstanceSplat:一次前向看懂3D实例图15

添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
开源 相机 CES
more
国仁对话杨元庆: 联想CES秀一票难求,美国芯片四巨头捧场
前馈3DGS新突破!InstanceSplat:实例感知场景理解,三任务SOTA!
不要相机位姿、不要逐场景训练,上交开源InstanceSplat:一次前向看懂3D实例
CES 2026,追觅洗地机上演「水与火之歌」
影石Insta360成 CES2026 最大显眼包?它把影像创作做成了“人人可用”的工具
贾跃亭携新车亮相CES:很快回国/雷军:小米今年或推出自研重磅产品/商务部回应审查Meta收购Manus
暴走两万步逛遍中国版CES!AI养龙虾、人形机器人火爆,追觅手机上手
逛完CES 2026我绷不住了,AI产品一个比一个抽象,简直是华强北年度述职大会
智能厨电成CES最卷品类:AI接管一切,人人都能当「甩手掌柜」
技嘉CES 2026发布四款OLED电竞显示器,刷新率最高达360Hz
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号