点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
来源:3D视觉工坊
3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:
人类环境中的机器人导航需要一种时空语义表示,能够兼顾开放词汇感知与长期环境变化。虽然基础模型提供了强大的零样本识别能力,但其预测是间歇性的且依赖于视角,将其直接集成到建图管道中会导致身份漂移和语义信息随时间过时。本文提出SuperMap——一种用于语言引导导航的4D时空建图框架,将高频几何SLAM与异步开放词汇感知相结合。我们的核心贡献是一个一致性驱动的建图引擎,它结合了3D感知的实例关联/重激活以及原则化的存在性与标签置信度更新,以在遮挡和场景变化下维持稳定的目标身份并修剪过时的地图内容。SuperMap生成一个可查询的4D场景图表示,通过支持对目标语义、关系和历史进行组合式查询,自然地与视觉语言模型对接。我们在基准测试和真实机器人上展示了SuperMap,包括包含物体出现/消失和重新定位的动态场景,并提供了消融实验和运行时分析。我们将整个系统开源,为社区提供一个可用于部署的开放词汇时空建图基线。


引言
部署在人类环境中的机器人越来越多地被期望执行开放词汇的导航指令,例如“去白板旁边的显示器”或“回到之前放在植物附近的那把椅子”。稳健地执行此类指令需要的不仅仅是精确的位姿估计和几何重建:机器人必须维护一个以目标为中心的时空地图表示,该表示能够保留实例身份、语义属性和随时间的空间关系,并且随着环境演变保持有效。这一要求在现实中难以满足,因为真实场景是动态的——物体可能在运行过程中被遮挡、重新放置、移除或新引入。因此,主要依赖逐帧识别或静态语义地图的系统通常在长时间跨度上性能下降:实例身份碎片化,语义内容过时,语言基础所需的关系结构不可用或不一致。
近年来,语义SLAM和开放词汇感知的进展产生了强大的组件——状态估计与稠密重建、2D跟踪以及开放词汇检测/分割。然而,简单地将这些模块组合起来很少能产生对导航可靠可用的地图。许多系统仍然保持封闭词汇和类别级别,限制了实例身份的跟踪,而动态SLAM方法通常关注短期运动(如移动的人)而忽略长期变化,如物体在机器人视野外的重新放置。在实际中,漏检和遮挡导致身份碎片化,场景变化引入过时的地图内容,且大多数表示缺乏供下游任务(如语言引导导航)有效查询的接口。因此,“语义建图输出”与机器人可用的、可在线查询和操作的地图表示之间仍存在差距。
最近的场景图方法引入了开放词汇检测器以支持自然语言导航,但其构建耗时(数分钟至数小时)且不适合实时建图。此外,它们难以捕捉目标之间的动态关系,限制了建模场景演变的能力。
总之,现有方法主要关注动态变化检测(如识别移动的人或车辆)或静态目标识别(如识别目标及其关系),然而鲜有方法同时应对这两个挑战:理解哪些目标发生了变化以及它们如何在空间和时间上演变。应对这一双重挑战对于机器人有效感知和适应动态真实环境至关重要。
为应对这一挑战,我们提出SuperMap:一个开源系统,在线构建可查询的开放词汇4D场景记忆。我们在公开基准上评估了SuperMap的开放词汇语义和实例建图性能,并在真实机器人部署中评估了包含物体出现/消失和长时变化的动态室内环境。我们提供消融实验以将建图改进归因于特定维护组件(关联、更新和图构建),并提供运行时分析以明确哪些模块占主导计算量。最后,我们展示了由场景图查询驱动的语言引导机器人导航,其中结构化的4D场景记忆相比使用原始检测或纯视频输入提高了鲁棒性。
我们的贡献如下:
开放词汇的时空语义SLAM:一个在线机器人系统,构建持久、可查询的开放词汇4D场景记忆,适用于下游语言条件任务。 时空目标跟踪:一个在线流水线,集成2D-3D关联、验证和变化感知更新,以在遮挡、部分观测、标签变化和场景变化下维持实例一致性。 实例级场景图:我们的4D场景图无缝集成每个目标的时空信息,为机器人配备实例级时空推理能力(例如,定位移动的物体、回忆过去的场景)。 开源框架:我们将发布变化检测基准、全面的消融实验和运行时分析,以及真实机器人视觉语言导航流水线,以促进机器人社区的可重复研究。
相关工作
语义建图
为移动机器人配备感知和理解周围环境的能力对于现实世界应用至关重要。为此,研究者开发了语义地图以捕获环境意义和上下文。然而,许多近期方法依赖离线处理,需要预先收集的环境数据(图像和深度)来构建语义标注地图,如表I所示。
例如,OpenScene使用OpenSeg提取CLIP嵌入,然后训练场景特定的3D模型,但需要完整的场景扫描,因此是离线的。OpenMask3D从多个视图反投影2D目标掩码以形成3D分割,而SeeGround结合2D-VLM与3D几何线索进行实例分割。尽管提高了3D精度,但这些方法假设完整的场景数据,限制了在线可用性。
LERF和LangSplat采用辐射场构建基于CLIP特征的3D地图,提供灵活的语义查询,但由于计算需求缺乏实时能力。RayFronts支持室外环境的在线语义建图,但在变化检测方面存在困难,且未能实现实例级3D语义。
语义SLAM
为了在流水线中联合估计位姿,我们将建图流水线转变为SLAM流水线。近年来,许多SLAM系统在建图过程中集成了语义信息。一个典型例子是Kimera,它通过构建3D场景图提供实时语义建图解决方案,但依赖于封闭集CNN分割,限制了泛化到新类别。基于LiDAR的SLAM方法(如SuMa++和LIOM)将基于CNN的逐点标签融入LiDAR地图。尽管有效,但这些方法不支持开放词汇分割,限制了其适应不同环境的能力。SlideSLAM和OVO-SLAM采用开放词汇检测器进行实例分割,允许更灵活的场景理解,但在处理长期和短期动态目标时面临挑战。
开放词汇场景图
HOV-SG、ConceptGraphs和CLIO使用SAM和CLIP从完整点云中分割并标注目标,将其组织成具有开放标签的分层图。然而,HOV-SG和ConceptGraphs需要离线3D重建后再应用SAM和CLIP,不适合在线SLAM或实时动态任务。CLIO实现了实时开放词汇场景图生成,但缺乏时空能力。
时空语义SLAM
最近,Khronos在地图表示中同时处理了短期和长期动态。然而,该方法局限于封闭集目标且缺乏实例级跟踪能力。此外,Khronos难以实时运行,不适合机器人操作。据我们所知,SuperMap是第一个实时的、时空的、开放词汇的、实例级目标建图框架,能够有效处理短期和长期动态目标。
时空SLAM问题
时空SLAM问题旨在提供一种显式的场景表示,通过增量数据采集捕获目标级变化在空间和时间上的演变。我们将场景建模为目标的组合,表示为场景图,其中节点对应目标,边表示时空关系。
在我们的设定中,系统处理连续的RGB-D视频序列或点云视频序列,其中RGB帧 和深度(LiDAR)帧 作为输入, 为序列长度, 为时间索引。相机位姿 需要被估计。在每个时间 ,系统输出一个一致性的全局地图 ,由语义实例级目标 组成,其中 索引目标, 为时间 的目标数量。
时空SLAM问题定义如下:给定当前观测 和已有地图 ,估计位姿 ,确定实例ID 并更新地图 ,通过最大化(或估计)
应用链式法则,得到
这涉及三个任务:位姿估计、时空目标实例关联和在线地图更新。
方法
我们的时空SLAM系统SuperMap的架构如图2所示。给定同步的深度测量、IMU数据和RGB图像,SuperMap完全在板载运行,联合估计机器人状态并维护实例级时空地图表示,同时环境不断演变。我们描述三个主要组件:(1)用于稠密几何建图的在线3D重建,(2)用于稳健实例关联的时空目标更新,以及(3)将地图暴露为VLN可查询接口的时空场景图构建。

几何层:在线3D重建
我们使用SuperOdometry从图像、深度/LiDAR和IMU流中获得机器人位姿 和彩色稠密3D重建。观测 需要准确的相机位姿 和深度观测 。对于每个时间 ,我们估计机器人在 中的状态,记为 ,其中 为世界坐标系, 为机体坐标系。给定固定外参 ,相机位姿 推导为:
该估计位姿和同步深度 构成观测 。这些几何先验对于以下方面至关重要:(i)将2D语义观测反投影到3D世界,(ii)执行运动补偿以进行时间跟踪,以及(iii)维护全局地图一致性。通过将所有后续实例级检测锚定在此度量基础上,我们确保生成的时空地图具有物理基础并适用于下游导航任务。
实例层:时空实例关联
对于每个图像帧,我们首先使用视觉模型推断2D实例级检测和分割,然后通过求解 来处理实例ID 的估计。目标是通过利用3D空间一致性为2D检测分配唯一的实例ID。
1) 混合跟踪状态
我们将轨迹状态 (若包含尺度速度则为 )定义为解耦向量:
其中 是2D图像质心, 表示边界框宽度和高度, 是图像平面中的平移速度。
2) 3D到2D运动补偿状态
由于标准2D跟踪器(如ByteTrack)在快速自运动下表现不佳,我们通过定义混合跟踪状态 并通过3D到2D运动补偿进行更新来解决这一问题。
我们不是采用线性运动模型,而是通过使用当前位姿 将实例在 中的3D质心 投影,来推导预测质心 :
卡尔曼滤波状态转移使用该投影作为先验:
其中 为状态转移矩阵, 为过程噪声。这种基于投影的先验使系统能够在遮挡和剧烈机器人运动下保持身份。
3) 概率几何一致性更新
观测 通过评估后验 来更新地图 。我们将每个点 的深度观测建模为随机变量。
设 为点在当前相机帧中的期望(投影)深度, 为投影像素 处的原始传感器深度。深度残差定义为:
我们假设高斯传感器噪声下的测量似然 。地图点的占据状态 通过对数几率公式更新以确保数值稳定性和递归更新能力:
其中 。逆传感器模型 由阈值化几何一致性 确定:
被分类为动态的点在对数几率更新中受到惩罚,从而有效地从全局地图中修剪瞬态或移动的物体,以维持环境的一致表示。这实现了动态场景中的变化检测,并为跨帧融合语义推断提供了几何线索。
4) 贝叶斯语义融合
为处理视觉模型输出的不确定性,每个实例维护一个类别分布 。给定来自开放词汇检测器的观测 ,后验置信度为:
其中 是检测器的混淆矩阵。
对于(9)中可观测的点,我们使用(10)更新语义标签,并相应地移除后验置信度过小的目标点。这种融合抑制了瞬时的误分类。
拓扑层:时空场景图
地图 被抽象为图 。节点 表示目标实例。
空间边 *:通过类别相关的几何谓词建立。对于目标 :。
时间边 :基于 结果跨时间链接节点,追踪目标轨迹。
为实现实时操作,我们首先根据目标质心距离进行聚类,然后在目标对满足类别相关几何谓词(如 on、beside、under)时添加空间边。时间边根据我们的目标关联结果追踪目标的轨迹,在整个序列中保持其身份。生成的图紧凑地捕获了瞬时布局和长期动态,为场景提供了一种易于推理的抽象表示。完整构建细节见补充材料。
D. 通过4D场景图的视觉语言导航
4D场景图 提供了原始传感器数据与视觉语言模型所需的符号输入之间的高级接口。通过将几何细节委托给时空地图,VLM可以在不处理原始点云或视频流的情况下,对长期场景动态进行零样本推理。
a) 时空序列化
我们将局部子图序列化为结构化文本表示以进行语言推理。每个节点 由其实例ID、语义标签和3D质心 编码。空间和时间边表示为符号关系(例如,Instance_1 on Instance_2)。通过(1)前置定义图结构和坐标框架的模式,以及(2)注入明确的时空线索以鼓励轨迹和关系感知推理,提高了可靠性。
b) 接地驱动和航点生成
为了将VLM输出转换为确定性控制信号,模型必须在 <answer></answer> 标签内返回目标实例ID。解析器提取这些ID并从地图 中检索其3D质心 ,然后用作导航航点。此过程将高级语言指令转换为精确的、有根据的机器人动作。
实验
实验设置
a) 硬件配置
我们在一个为室内敏捷导航设计的定制麦卡纳姆轮移动平台上评估SuperMap。传感器套件包括一个Livox Mid-360 LiDAR(提供 视场)和一个全景相机(提供 RGB覆盖)。我们实现基于软件的时间戳对齐以关联视觉和LiDAR流。所有计算,包括LVI里程计、实例跟踪、4D图维护和VLM接口,均在板载实时运行于Intel i9-14900H CPU和NVIDIA RTX 4090笔记本电脑GPU(16GB显存)。我们旨在通过实验回答以下研究问题:
语义质量:SuperMap的增量式目标中心建图与ScanNet基准上最先进的离线和在线3D语义建图方法相比如何(第V-B节)? 时空一致性:4D图能否在长期轨迹中准确检测场景变化(出现/消失),同时为静态目标维持持久身份(第V-C节)? 接地推理:结构化的场景图表示相比视频输入是否提高了VLM推理的准确性和令牌效率(第V-F节)? 在线视觉语言导航:集成流水线能否仅使用板载计算支持端到端、零样本、语言引导导航(第V-G节)?
语义质量:类别级和实例级分割的定量结果
为评估SuperMap的语义保真度,我们与最先进的开放词汇建图框架进行了比较分析,重点关注类别级精度和实例级一致性。
a) 类别级分割
表II总结了在ScanNet基准上的性能。SuperMap达到了 的竞争性准确率,优于既定目标中心基线如ConceptGraphs和ConceptFusion。虽然我们的准确率略低于点特征融合方法RayFronts,但SuperMap保持了显著更低的计算开销,使其更适合高频率机器人反馈回路。这些结果证明了其在目标中心建图方法中开放词汇分割的有效性。
表I:语义建图和语义SLAM方法的能力清单。 表示支持, 表示有限或不支持
表II:ScanNet上的类别级分割基准。最佳结果用第一和第二高亮显示。
| 27.42 | 43.50 |
b) 实例级分割
与依赖全局场景上下文的离线框架不同,SuperMap面向在线机器人部署,其中增量数据融合和零样本泛化至关重要。这一设定要求从部分、流式观测中实时建立目标对应关系。为实现零样本感知,我们集成了GroundingDINO进行语言引导检测和SAM2进行稳健实例分割。我们在表III中报告了与HOV-SG和ConceptGraphs的比较结果。SuperMap显著优于这些基线,特别是对于相机瞬时视场内包含的离散目标。这一增益证明了我们的3D感知检测跟踪方法相对于依赖点特征聚类或过分割几何的方法的有效性。
表III:ScanNet上的实例级分割基准。最佳结果用第一和第二高亮显示。
| 63.76 | 74.72 | 42.20 | 67.92 | 62.50 |
时空一致性:定性评估
我们评估了SuperMap在长时间跨度内维护地图完整性并识别环境变化的能力。在一个10分钟的真实世界实验中( 室内区域),我们引入了结构变化:移除了三个物体(一盆植物、一个垃圾桶和一把椅子),并添加了三个物体(一个水桶、一辆手推车和一个安全标志)。
a) 定性性能
图3定性地展示了SuperMap在消失和出现事件下的长时实例一致性。第一行显示了三个从场景中消失的物体。在所有情况下,实例ID随时间保持一致,表明系统即使在物体不再被观测到时仍能保留其身份。
例如,第一行显示了三个新出现在场景中的物体。左上角示例中,我们在Chair 155和Chair 203之间放置了一个新的水桶实例(bucket 1964)。左下角示例中,Chair 7在table 1和chair 4之间消失。尽管如此,Rerun可视化中的小ID标签保持不变,表明系统在消失事件前后维持了相同的实例关联。这证明了在长时间跨度上一致的目标跟踪和身份维护。
时空一致性:定量评估
我们使用六个目标物体(图3)对照手动标注的3D边界框和语义标签,对SuperMap进行了定量评估。我们定义了两个主要指标:
目标检测召回率:在出现区间(物体存在时)测量。真阳性要求3D IoU 、质心距离 以及正确的语义标签。 变化检测召回率:评估系统在物体出现期间检测到它并在消失区间确认其移除的能力。真阳性要求前者检测到且后者无假阳性检测。
如表IV所示,DualMap由于2D分割不稳定和3D框估计不一致,目标检测召回率接近零,导致大多数实例被其建图模块过滤掉。虽然它保持了标称的 变化检测召回率,但这是数学上的假象:该方法在消失区间“成功”仅仅是因为它最初未能检测到该物体。同时,Khronos由于潜在的语义推理瓶颈导致显著丢帧和语义掩码质量下降,未能产生一致的3D估计结果(详情见补充材料)。相比之下,SuperMap在两个指标上均保持高召回率,展示了稳健的实例检测。
表IV:时空变化检测性能。
| 1.000 | 0.262 | ||
| 1.000 | 0.622 |
SuperMap系统消融研究
我们评估了各个子模块的贡献,具体为2D跟踪、几何一致性更新和贝叶斯语义融合。使用一个包含41个标注物体的场景,我们通过精度、召回率和F1分数量化了时空目标地图的性能。
表V:消融研究的性能比较
| 0.8677 | 0.4955 | 0.6308 |
如表V所示,完整系统在所有指标上均优于所有基线配置,产生了最准确的目标地图。这一改进源于两个主要因素。2D跟踪器在显著视角变化期间维持一致的身份关联,防止目标碎片化。此外,几何和语义融合的集成使系统能够抵抗短暂的检测失败。通过在多帧中对照新证据重新评估过去的推断,地图有效地自我校正并过滤检测噪声。
接地推理
我们使用Gemini 2.0 Flash评估了4D场景图作为大型视觉语言模型接地引擎的效果。我们比较了结构化的场景图输入(序列化谓词)和原始视频输入(RGB序列)之间的推理性能。如图4所示,4D场景图在复杂查询上提供了优越的准确性:
空间逻辑(提示1):在火灾应急场景中,VLM利用图的度量边来消除相对于“锥形桶”和“植物”的特定“灭火器”的歧义。原始视频受透视失真和目标混淆的影响,而场景图实现了精确的距离计算和实例检索。
时间逻辑(提示2):在追踪“包”的过去轨迹以找到掉落物品时,VLM遍历图的时间边 。结构化的历史允许对动态状态进行过滤、带时间戳的检索。相反,基于视频的推理依赖于不可靠的“常识”启发式,并随着时间深度的增加而遭受幻觉。
视觉语言导航
我们通过零样本、语言引导导航在先前未见环境中评估了SuperMap的下游实用性。使用实时4D场景图,机器人仅基于3D目标之间的空间关系即可可靠导航。
a) 板载接地与执行
在自主探索过程中,机器人增量式构建实例级语义地图。当给定自然语言指令(例如,“去油画旁边的白板,然后去冰箱旁边的油画”)时,VLM解释4D场景图中编码的空间关系以消除歧义,并为导航堆栈输出精确的3D目标坐标。
b) 实验验证
如图5所示,我们的系统支持在视觉模糊环境中导航:
空间排序:机器人通过推理其相对空间场景图,在四个视觉相同的白板中选择正确的目标(左子图)。 关系检索:机器人识别冰箱和油画之间的关系以到达预期的相邻目的地(右子图)。


运行时间和内存
为评估系统的计算效率,我们测量了每个模块的吞吐量。位姿估计模块保持稳定的 输出,而2D实例分割由于语义分割的重推理需求运行在 。架构的其余部分执行3D建图和4D场景图更新,分别约为 和 。
结论
本文提出SuperMap——一种实时的、开放词汇的SLAM系统,构建并维护实例级4D语义地图。通过将SLAM的几何约束与2D基础模型的语义特征相结合,SuperMap在线执行联合2D-3D目标跟踪、实例验证和变化检测。这一统一流水线确保了在遮挡、部分观测或动态环境变化下的时空一致性。生成的4D场景图提供了显式的、持续更新的世界模型,使机器人具备长期记忆、稳健的时空推理和语言引导导航能力。
局限性
虽然SuperMap为时空建图提供了稳健的框架,但其在跟踪高度动态目标方面的性能仍然有限。未来的迭代可以通过集成专门的检测跟踪模块或高效的基于分割的跟踪来改善时间连贯性。此外,我们当前的流水线依赖于预定义的目标提示列表进行开放词汇2D检测。集成基于开放世界目标发现的自动提示机制将显著增强系统的适应性,使其能够在没有先验语义知识的情况下在真正新颖的环境中运行。
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。