点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
来源:3D视觉工坊
星球内有20多门3D视觉系统课程、3DGS独家系列视频教程、顶会论文最新解读、海量3D视觉行业源码、项目承接、求职招聘等。想要入门3D视觉、做项目、搞科研,欢迎加入!
太长不看版:IGGT4D把在线4D场景理解变成"几何+实例"的流式统一预测——因果时空建模复用历史上下文,轻量在线聚类维持物体身份,100帧长序列聚类显存恒定约0.7GB(前作IGGT直接OOM);并配套147K场景、60M掩码的InsScene4D-147K数据集,重建、位姿、实例跟踪、开放词汇分割全面刷新流式方法最优。
论文信息
论文标题:IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer
作者:Zhengyu Zou, Hao Li, Kuixuan Jiao, Liu Liu, Tingyang Xiao, Xiaolin Zhou, Fangzhou Hong, Zhizhong Su, Dingwen Zhang, Ziwei Liu
机构:Horizon Robotics; S-Lab, Nanyang Technological University; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center
论文链接:https://arxiv.org/abs/2607.19228
项目链接:https://iggt4d.github.io
导读
现实世界的空间智能,要求智能体从连续不断的视频流中理解场景——物体在其中运动、持续存在、消失又重现。尽管近期的空间基础模型已经实现了可泛化的前馈式3D重建,但大多数流式方法仍然"以几何为中心",缺乏时间上一致的物体级理解能力。换句话说,它们知道"哪里有什么形状",却不知道"这个物体还是不是上一帧那个物体"。
与此同时,现有的语义重建和3D感知视觉语言方法,大多依赖外部提取的2D语义线索或松散耦合的几何输入,这限制了长动态场景中统一的几何-实例学习。语义是"贴"上去的,而不是从几何里"长"出来的。
本文提出IGGT4D,一个用于在线4D场景理解的流式实例锚定几何Transformer。IGGT4D逐帧顺序处理视频帧,通过因果时空建模复用历史上下文,并增量式地更新相机运动、场景几何与物体身份的统一表示。这使得模型能够在动态环境中进行具有几何-实例一致性的长序列前馈重建。
为了解决高质量4D监督缺失的问题,作者进一步构建了InsScene4D-147K——一个横跨真实/合成、静态/动态场景的大规模数据集,包含RGB图像、深度、位姿,以及由自动化几何引导标注流水线生成的时序一致实例掩码。在3D重建、位姿估计、实例空间跟踪和开放词汇分割上的实验表明,IGGT4D优于现有流式基线,同时保持了面向长动态序列的可扩展在线推理能力。
IGGT4D的在线几何-实例预测总览。IGGT4D逐帧处理动态视频流,增量式构建统一捕捉相机运动、3D几何与时序一致实例特征的4D表示,支撑多样下游应用(实例空间跟踪、开放词汇分割、场景Grounding等);作者还构建了含几何引导实例掩码的大规模数据集InsScene4D-147K(147K场景、60M掩码)用于训练与评估。

效果展示
IGGT4D在7Scenes和ETH3D上的3D重建定性对比:相比LingBot-Map和Stream3R,IGGT4D重建的点云结构更完整、细节更清晰。
7Scenes和ETH3D数据集上3D重建的定性对比(GT / Ours / LingBot-Map / Stream3R,TSDF融合点云,无效真值深度区域已掩码)。

实例空间跟踪定性结果:在长序列动态场景中,IGGT4D的4D一致掩码能够稳定"咬住"目标物体,而SAM2、SpaTrackerV2+SAM等基线出现目标丢失或身份漂移。
实例空间跟踪的定性可视化结果(GT掩码 / IGGT4D / IGGT / SAM2 / SpaTrackerV2+SAM)。

开放词汇语义分割定性结果:无论是桌子、柜子、椅子还是键盘、显示器,IGGT4D的分割边界与语义预测都更接近真值。
开放词汇语义分割的定性可视化结果(RGB图像 / GT标签 / IGGT4D / Feature3DGS / LSeg / OpenSeg)。

引言
现实世界的空间智能本质上是在线的、动态的。具身智能体接收的是连续的视频流,其中的物体会运动、被遮挡、离开视野,并随时间重新出现。在这样的环境中行动,仅仅估计相机运动和场景几何是不够的:智能体还必须维持时间上一致的物体身份。因此,我们将4D场景理解定义为流式几何-实例预测,即从长而动态的视频流中联合更新场景几何与物体身份。
空间重建与场景理解正在经历从基于优化的流水线向数据驱动前馈预测的转变。传统的几何流水线——从离线的SfM到在线及神经SLAM——依赖逐场景的迭代优化。同样,语义重建系统——从离线场景图到在线语义建图——往往通过相互独立的模块来构建几何与物体级线索。这些系统虽然有效,但其针对特定场景的优化限制了长序列效率,而模块化的设计使得在动态场景中难以进行时序一致的实例推理。
近期的空间基础模型通过学习可泛化的先验、直接从图像进行3D预测,解决了上述局限。对于在线长序列感知,这一范式正进一步从全局固定集合推理转向流式重建。然而,仅有流式3D预测对具身智能体而言仍然不够。当前的流式模型在很大程度上仍以几何为中心:它们估计深度、位姿和点图,但并不维持时序一致的物体身份。所缺失的能力,是一个将物体身份与几何一同作为一等预测目标的前馈流式模型。
为什么流式几何-实例理解一直鲜有探索?一个关键原因是缺乏合适的监督。2D视觉语言模型提供了可扩展的开放词汇线索,但其预测是视角相关的,且缺乏度量级3D锚定。语义重建方法通过将2D语义提升到3D来改善空间一致性,但其语义保真度受限于外部2D预测器的能力。3D感知视觉语言模型引入几何进行空间推理,但并不能为训练流式模型提供稠密、时序一致的几何-实例监督。真正缺失的,是以统一形式提供度量几何、相机运动和时序一致实例标签的大规模4D监督。
为弥补这些空白,我们提出IGGT4D——一个用于在线4D场景理解的流式实例锚定几何Transformer。IGGT4D将几何-实例重建从一个全序列离线问题转化为因果流式预测问题。它逐帧顺序处理视频帧,通过因果时空建模复用历史上下文,并在统一表示中增量式更新相机运动、场景几何与实例嵌入。通过将实例关联锚定在重建几何之上,IGGT4D能够在视角变化、遮挡和重现的情况下维持物体身份。
我们进一步构建了InsScene4D-147K,一个用于4D场景几何-实例学习的大规模数据集。它横跨真实/合成与静态/动态数据来源,提供RGB图像、深度图、相机位姿、点云以及序列级一致的实例掩码。为降低标注成本,我们设计了一条自动化几何引导标注流水线,能够大规模生成多视图一致的几何与实例标签。我们的贡献有三点:
主要贡献
– 流式几何-实例预测。我们将在线4D场景理解定义为从连续视频流中对相机运动、场景几何和持久物体身份进行因果预测。
– 物体一致的流式重建。我们提出IGGT4D,一个前馈流式Transformer,将因果几何建模与几何锚定的实例预测及在线聚类相耦合,无需全序列推理即可维持一致的物体身份。
– 可扩展的4D实例监督。我们构建了InsScene4D-147K,一个大规模真实/合成、静态/动态数据集,其实例标注具有几何一致性,由一条可扩展的重建、投影与掩码精修流水线生成。
方法
问题形式化。 给定RGB图像序列及可选的相机参数,IGGT4D执行前馈式序列推理,对每一帧输出四类结果:相机参数(平移、旋转、视场角)、射线图(射线原点与方向)、深度图,以及8维实例特征图。随着图像逐帧流入,逐帧预测被整合为时空一致的场景表示,支撑在线4D重建与理解。
因果几何-实例Transformer。 作者将DA3的统一几何Transformer从固定集合3D预测改造为因果流式4D理解:每张图像被编码为图像token,并与相机token拼接(有相机参数时由参数编码得到,否则使用共享可学习token);随后经过40个视角内注意力与跨视角注意力交错的Transformer块。与DA3的双向固定视角推理不同,IGGT4D在跨相机和跨视角注意力上施加因果掩码,使每一帧只能关注当前及过去的观测——训练时也使用同样约束来模拟流式推理。推理阶段帧按序处理,相机与跨视角KV缓存复用历史上下文,避免冗余重算,支撑可扩展的长序列几何与实例预测。
IGGT4D总览。给定动态视频序列与可选相机位姿,IGGT4D提取时空一致的表示;Tri-DPT头增量式预测几何与实例特征,流式聚类算法推导实例掩码,实现在线4D场景理解。

Tri-DPT几何-实例头。 为从流式多尺度token中联合解码深度、射线图与实例特征图,作者设计了Tri-DPT头:所有分支逐步恢复空间分辨率,而实例分支通过几何感知注意力与几何分支耦合——以深度和射线特征作为结构先验,将实例嵌入锚定到3D几何中,提升物体身份的时间一致性。
Tri-DPT头。该头联合解码深度、射线与实例特征,几何感知注意力在四个融合阶段将深度与射线先验注入实例分支,最终阶段再以实例注意力精修实例特征。

高效流式实例聚类。 IGGT所用的离线HDBSCAN聚类在长序列上复杂度为平方级,代价过高。IGGT4D提出两阶段流式聚类策略,维护一个轻量全局实例码本(每个实例保存特征中心与累计像素数):第一阶段帧内聚类,用高余弦相似度将像素聚成核心区域,再通过更宽松阈值上的连通分量扩展为局部掩码;第二阶段将局部中心与全局码本匹配——匹配上的掩码继承全局ID成为4D一致掩码,未匹配的实例成为新的全局条目,未匹配的背景区域则作为独立静态实体被自然忽略(隐式解耦动态前景与静态背景)。中心通过面积加权融合进行常数时间更新。这一机制无需显式运动建模,即可在物体运动与部分遮挡下维持实例一致性。
4D场景理解应用。 4D一致掩码与时序关联的实例特征构成可复用的物体级表示:帧间持久实例对应关系无需额外关联启发式即可实现稳定空间跟踪;用掩码聚合逐帧2D视觉语言特征,可得到时空一致的语言特征用于开放词汇语义分割;这些掩码与特征还可提供给大型多模态模型,支撑动态物体分割、视野外物体推理等4D场景Grounding任务。
训练目标。 训练时采用首帧几何归一化(所有位姿对齐到首帧相机坐标系,用首帧点云计算序列级尺度,避免流式重建的尺度歧义);几何监督包含深度(L1回归+置信度正则+空间梯度一致性)、射线、点与相机损失;实例特征则采用多视图对比损失优化——视角内将像素特征拉向其实例中心、推离不同中心,视角间拉近匹配中心、推开不同中心。
InsScene4D-147K数据集。 数据集包含147K条精选视频序列,横跨四大领域:静态-真实(RealEstate10K、ScanNet++)、静态-合成(Aria Synthetic Environments、SceneNet、Infinigen、Hypersim)、动态-真实(HOI4D、Waymo、Aria Digital Twin)、动态-合成(RoboTwin 2.0、Kubric、DynamicReplica、PointOdyssey、VKITTI2)。每条序列提供RGB图像、深度图、相机位姿、点云与帧间持久身份的4D一致实例掩码。标注流水线以DA3估计多视图一致深度(以离线真值位姿为条件避免长序列位姿漂移),经TSDF融合重建静态3D网格;将网格顶点投影到图像平面、经深度一致性保留可见顶点并反向映射全局ID形成继承图;再由SAM2提供类别无关掩码,经过滤、去重叠并与继承区域按IoU匹配完成ID继承。对HOI4D等动态场景,先用给定掩码移除动态区域重建静态网格,再用可用的动态物体标注覆盖动态区域的投影伪标签。
InsScene4D-147K数据构建流水线。真实/合成、静态/动态来源统一经过3D重建、基于投影的ID继承与基于分割的全局ID精修三步处理;右侧面板汇总了数据集划分(静态真实10.2K、静态合成120.0K、动态合成10.2K、动态真实6.41K)。

实验结果
所有实验在单张32GB NVIDIA RTX 5090 GPU上完成。评估序列均在场景/序列级别与训练数据隔离。
相机位姿估计与3D重建。 遵循DA3的评估协议,在HiRoom、ETH3D、7Scenes和ScanNet++上评估,对比离线全注意力模型(VGGT、MapAnything、Pi3X、DA3)与在线流式模型(CUT3R、StreamVGGT、Wint3R、Stream3R、LingBot-Map)。位姿估计上,IGGT4D取得流式模型中的最优平均性能(AUC@3平均0.4464,大幅领先LingBot-Map的0.3060),在因果流式设定下显著缩小了与全注意力模型的差距,甚至超过VGGT、MapAnything等离线基线。3D重建方面,无论使用预测位姿(w/op.平均F1为0.6678)还是真值位姿(w/p.平均F1为0.7225),IGGT4D均优于全部流式基线;注入真值位姿后重建质量进一步提升,说明模型能有效利用流式相机输入。
HiRoom、ETH3D、7Scenes和ScanNet++上的几何基准。(a)相机位姿估计(AUC@3、AUC@30);(b)不使用(w/op.)与使用(w/p.)真值相机位姿的3D重建(F1分数)。方法分为全注意力(离线)与流式(在线)两组,最优与次优分别加粗与下划线标出。

实例空间跟踪。 在HOI4D、Waymo、PointOdyssey三个动态数据集与ScanNet++静态数据集上,遵循IGGT协议对比SpaTrackerV2+SAM、SAM2与IGGT,报告时序mIoU(T-mIoU)与时序成功率(T-SR)。长序列设定(约100帧,HOI4D为40帧)下,IGGT直接因显存溢出(OOM)无法运行,而IGGT4D凭借流式推理与聚类机制可扩展至4D长序列,平均T-mIoU达58.84、T-SR达85.41,大幅领先SAM2的45.38/58.65;短序列(约16帧)下同样全面领先(平均T-mIoU 59.25 vs. IGGT的51.68)。
HOI4D、Waymo、ScanNet++和PointOdyssey上的实例空间跟踪。(a)长序列(约100帧,HOI4D为40帧);(b)短序列(约16帧)。最优与次优分别加粗与下划线标出。

实例特征与掩码的可视化进一步说明:3D一致的实例特征PCA投影与流式聚类生成的掩码高度对应,物体身份在帧间保持稳定。
实例特征与掩码可视化。3D一致实例特征的PCA结果与流式聚类生成的对应实例掩码并列展示。

开放词汇语义分割。 在Waymo与ScanNet++上对比2D视觉语言模型(OpenSeg、LSeg)与3D语义重建方法(逐场景优化的Feature-3DGS、前馈的IGGT)。IGGT4D在长短两种序列设定下均取得最高mIoU与mAcc:长序列平均mIoU 40.08、mAcc 73.84(IGGT长序列OOM),短序列平均mIoU 39.11、mAcc 72.25,在动态户外与复杂静态室内场景中都展现出更强的分割性能。
Waymo和ScanNet++上的开放词汇语义分割。(a)长序列(约100帧);(b)短序列(约16帧)。最优与次优分别加粗与下划线标出。

消融实验。 在ScanNet++上使用轻量模型进行消融:移除几何感知注意力(Geo-Attn)后实例与语义性能下降,证明实例特征确实受益于几何先验;移除首帧几何归一化(FF-Norm)后流式重建出现严重尺度歧义,破坏统一的几何-实例表示,导致所有指标全面下滑(如AUC@3从0.2984跌至0.2334)。
ScanNet++上的消融实验。Geo-Attn:几何感知注意力;FF-Norm:首帧几何归一化。首帧几何归一化的可视化对比显示:没有FF-Norm时,实例特征PCA与掩码在流式预测中明显退化;加入FF-Norm后预测恢复稳定。

首帧几何归一化(FF-Norm)。对比不使用与使用首帧几何归一化的流式预测效果。

流式聚类效率。 在504×336分辨率下对比IGGT的离线HDBSCAN:IGGT4D凭借轻量聚类码本与逐帧余弦聚类,显存占用恒定约0.7GB、耗时随帧数线性增长(N=100时仅7.43秒);而HDBSCAN在N=8就需105.8秒/13.2GB,N=16需418.3秒/25.85GB,帧数再多直接OOM。
总结 & 未来工作
我们提出了IGGT4D,一个用于在线4D场景理解的流式几何-实例框架。IGGT4D通过因果时空建模与几何锚定的实例预测,联合预测相机运动、场景几何与时序一致的实例特征。我们还提出了InsScene4D-147K,一个横跨真实/合成与静态/动态场景、具有几何一致实例标注的大规模数据集。在重建、位姿估计、实例跟踪与开放词汇分割上的实验表明,IGGT4D在保持可扩展流式推理的同时,提升了物体级一致性。
局限。InsScene4D-147K扩展了4D实例监督的规模,但要获得更强的鲁棒性与泛化能力,还需要更广泛的数据覆盖。IGGT4D目前仍主要依赖有监督学习,这激励我们未来探索自监督学习与更大规模的精选监督。此外,我们的评估仍以感知为中心;将具身动作与交互反馈整合进来,是迈向具身场景理解的关键一步。
对更多实验结果和文章细节感兴趣的读者,可以阅读一下论文原文~
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。