SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!

3D视觉工坊 2026-08-05 07:00

点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达

来源:3D视觉工坊

3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图1

紧耦合激光-视觉-惯性里程计通过融合精确的几何深度与互补的视觉测量实现鲁棒定位,但其外部传感器面临独立的失效模式。激光雷达退化发生在扫描几何约束不足时;视觉测量在不良光照或纹理缺失条件下退化。现有应对措施,包括二值退化检测、协方差膨胀和场景级质量门控,均在模态层面操作,未解决联合信息矩阵的方向依赖结构。因此,视觉残差进入了激光雷达已经良好约束的位姿方向,而在不足的方向上,视觉补偿分散到整个状态空间而非集中到需要的地方。本文提出 SA-LIVO,一个完整的激光-惯性-视觉里程计系统,通过方向选择性融合和信息高效传感器处理来解决这些局限性。子空间感知信息融合框架计算联合激光-视觉信息矩阵的特征分解,并对每个特征方向应用单阈值线性钳位软门控,在衰减退化方向的同时以全强度保留可观测方向。激光和视觉残差随后在单个 InEKF 循环中在共享线性化点处联合优化,消除了顺序更新的线性化点不匹配问题。效率直接源于融合策略:由于视觉信息仅在激光雷达不足的方向上贡献,光度雅可比只需在 InEKF 循环之前组装一次,并在所有迭代中重用,避免了传统迭代滤波器的每迭代视觉处理成本。在三个公开基准(HILTI'22、New College、Oxford Spires)的 29 个序列以及额外的并发退化场景上的实验表明,精度与最强基线相当,并且在竞争性激光-视觉-惯性系统发散的顺序中保持有界漂移。SA-LIVO 在笔记本电脑 CPU 上平均每帧 ,在无 GPU 加速的嵌入式 ARM 板上为 ,峰值内存相比竞争方法降低  倍。

SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图2

I. 引言

SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图3图1:SA-LIVO在多样化环境中的代表性建图结果——(a1)-(c3) Oxford Spires 室外和室内场景;(d)-(f) 自采集室内和地下序列;(g)-(h) FAST-LIVO2 数据集

在未知环境中运行的自主机器人和车辆,同时定位与建图是一项基础能力。在最近的 SLAM 范式中,激光-惯性-视觉里程计通过紧耦合三种互补模态受到越来越多的关注:激光雷达提供精确的深度和密集几何约束;相机提供丰富的视觉测量;IMU 提供高频运动学先验。在几何结构化的环境中,这种紧耦合实现了远超单模态方法的精度。然而在实际中,一个或两个外部传感器都可能退化。激光雷达退化发生在观测几何无法在一个或多个位姿方向上提供足够约束时,例如点面匹配变得近似共面,使某些平移或旋转自由度未被观测到。相机退化发生在成像条件抑制可用图像梯度时:黑暗、运动模糊、过曝光或无纹理表面都可能使视觉测量不可靠。由于这些失效模式由独立的环境因素(几何 vs. 光照)驱动,并发退化不仅可能而且常见。在这种情况下,现有的紧耦合系统往往会发散,而不是优雅地退化到最可靠的可用约束。

自然的应对是通过紧融合实现相互补偿,但现有传感器退化处理方法在传感器模态层面而非联合信息矩阵的方向层面起作用。二值退化检测通过拒绝或约束激光雷达更新来响应病态扫描匹配 Hessian,放弃了近乎退化的扫描仍然提供的部分约束。协方差膨胀和标量降权各向同性地衰减传感器的整体贡献,在良好约束和不良约束的位姿方向上同等降低其影响。场景级质量门控决定是否在给定帧中应用视觉更新,但不控制其残差在状态空间中的作用位置。实际的失效结构本质上是逐方向的:单次激光雷达扫描可能同时过约束某些旋转方向,同时使某个平移自由度未被观测到;视觉梯度可能强约束某些位姿轴,而在其他方向贡献可忽略的信息。模态级干预无法解决这种方向不匹配:光度残差进入激光雷达已经可靠的区域,而视觉补偿无差别地扩散,而非集中在激光雷达约束真正不足的方向上。

在这种方向盲融合下,计算也被错误分配。视觉-惯性里程计流水线包含跟踪、雅可比组装和滤波器更新,无论场景几何如何,每帧都产生固定成本。然而其在良好约束方向上的边际精度增益有限,在退化方向上则稀释到所有方向。因此计算按帧数而非按产生的精度增益比例消耗。

本文提出 SA-LIVO(子空间感知激光-惯性-视觉里程计),一个可部署的实时激光-惯性-视觉里程计系统,其核心贡献是方向选择性传感器融合,并辅以匹配此融合策略的激光和视觉流水线,使系统足够高效以在笔记本电脑和嵌入式硬件上实时部署。SA-LIVO 的贡献包括:

1)子空间感知信息融合(SAIF)。我们通过单一标量阈值对联合激光-视觉信息矩阵的每个特征方向按其信息幅度进行门控。这将四个需手工调参的每传感器参数替换为一个,并产生一个可证明半正定的融合矩阵,能连续退化为单传感器更新而无需模式切换。

2)统一单循环联合 InEKF 更新。激光和视觉残差在公共线性化点处共享一个 InEKF 循环,消除了顺序每传感器更新的线性化点不匹配,并将迭代次数限制在固定预算内,无论融合的模态数量如何。

3)高效预计算视觉信息形式。光度雅可比在传播状态处计算一次,并在所有 InEKF 迭代中重用,消除了迭代光度滤波器中占主导的每迭代 VIO 成本。该形式在滑动窗口上累积以跨越比任何单一视点更丰富的子空间,并带有每观测去相关因子以防止重用膨胀视觉信息矩阵。

4)高效多尺度平面建图。每体素充分统计量实现常数时间多尺度 PCA 和无量纲平面性准则,将平面拟合成本与点数解耦,并消除了每序列重调固定特征值测试的需要。平面对应关系在第一次 InEKF 迭代后缓存,使后续迭代仅重新计算点到平面距离,而饱和优先策略有利于长期冻结体素,防止漂移污染的新近表面主导激光信息矩阵。

我们在 HILTI'22、NCD 和 Oxford Spires 基准的 29 个序列以及自采集数据集和 FAST-LIVO2 数据集上评估 SA-LIVO。SA-LIVO 在评估基准上达到有竞争力的精度,并在 R3LIVE 和 SR-LIVO 发散的顺序上保持有界漂移。我们的代码和数据集将公开。

II. 相关工作

A. 激光里程计与退化

基于迭代最近点或点面匹配的直接激光里程计在结构化环境中达到高精度。然而,当扫描几何沿一个或多个方向提供不足约束时(如长走廊、大开放楼层或隧道),扫描匹配 Hessian 变为奇异或近奇异,导致无约束状态更新和快速漂移。几项工作通过匹配 Hessian 的特征谱检测此条件,并通过切换到降自由度更新或拒绝扫描来响应。更近期的可定位性感知配准在 ICP 层面应用方向约束滤波,但门控仍停留在激光流水线内部,未传播到融合的多传感器信息形式中。虽然能有效防止发散,但二值切换是全有或全无的,忽略了近乎退化方向仍提供的部分约束。轻量级现代激光里程计如 KISS-ICP 表明,简单的点点匹配配合自适应运动模型在良好约束场景中具有竞争力,但未提供部分退化的显式处理机制。除退化检测外,匹配中使用的平面表示的可靠性构成单独挑战。VoxelMap 引入自适应体素分辨率和平面不确定性,但其平面接受准则使用绝对特征值阈值,需针对不同体素大小、点密度和场景尺度重调。相比之下,我们的平面性比是无量纲且尺度不变的,单一阈值可跨体素大小、点密度和场景尺度迁移而无需重调。

B. 视觉-惯性里程计

基于滤波的 VIO 可追溯到 MSCKF,现代开源流水线如 OpenVINS 和 ROVIO;后者在无激光耦合的迭代 EKF 内部应用直接光度更新。基于关键帧的 VIO 系统如 VINS-Mono、ORB-SLAM3 和 OKVIS 从多帧三角化或立体基线恢复地图点深度,深度不确定性随距离增长。流形上的 IMU 预积分是关键帧 VIO 的标准;在我们的系统中,同一角色由 InEKF 流形上的中点积分填补。

当激光深度可用时,特征像素很少与稀疏激光点重合,因此基于特征的跟踪必须从附近点插值深度,并带有几何相关的误差。直接方法通过在直接从激光扫描获取的预锚定 3D 点处采样光度残差来规避此问题,使其成为紧耦合激光-视觉的自然选择,但代价是需要精确的位姿先验。

即使激光点作为深度锚点,深度本身并非严格可靠:扫描线间隙、镜面表面如玻璃和水都可能产生缺失、虚假或有偏差的回波。单像素光度残差也对图像噪声和光照变化敏感。基于面片的光度公式缓解了这两个问题:对小邻域内的残差求平均可吸收孤立的锚点误差和每像素噪声,同时增加每个激光锚定点贡献的信息。DSO 引入首次估计雅可比技术和每帧仿射亮度校正,但在纯单目设置中运行,无激光深度锚定。我们的直接、基于面片的 VIO 将每个地图点锚定到激光测量,并在 InEKF 循环前计算一次雅可比。每观测信息去相关和每帧仿射亮度补偿保持视觉信息形式无偏且对光照变化鲁棒。

C. 基于不变滤波器的估计

不变扩展卡尔曼滤波器将导航状态置于矩阵李群上,并利用群仿射系统对称性获得独立于系统轨迹的传播雅可比。Brossard 等将其表征为可观测性保持性质:全局偏航和绝对位置的非可观子空间在所有滤波器迭代中保持不变。相比之下,标准左不变 EKF 在快速运动下可能将信息投影到不可观方向,引入线性化偏差。Hartley 等在全腿式机器人状态估计系统上验证了该公式,表明 IMU、运动学和接触残差可在单个右不变循环内一致融合。InvLIO 随后将 InEKF 扩展到激光-惯性里程计,在李代数中表达点面残差以保持右不变结构。SuIn-LIO 进一步将 InEKF 与 surfel 建图结合,在公开基准上展示了一致的状态估计和实时扫描配准。SA-LIVO 将混合右不变 InEKF 公式应用于联合激光-视觉设置:光度残差在同一右不变误差约定下公式化,并在单个统一迭代循环中与激光残差融合,据我们所知是首批这样做的 LIVO 系统之一。

D. 激光-视觉-惯性融合

松耦合 LIVO 系统使用一个传感器的输出初始化另一个;它们轻量且易于实现,尽管紧耦合通常在挑战性场景中带来更好精度。紧耦合系统联合优化所有传感器的残差,但融合架构差异显著。LIC-Fusion 开创了 MSCKF 风格的特征级激光-相机-IMU 融合,而后续基于滤波的流水线转向使用稀疏激光锚定点的直接光度更新。FAST-LIVO2 通过顺序迭代 EKF 循环处理激光和视觉残差实现强精度,但两种模态在不同状态估计处线性化,顺序结构增加了相对于联合循环的总迭代次数。R3LIVE 通过像素级光度模型构建稠密彩色地图,以更高每帧计算为代价提供丰富场景表示。LVI-SAM 在因子图中组合激光和视觉因子以实现灵活的多会话建图,性能取决于两种模态中可靠的特征提取。基于平滑的系统在因子图后端中为状态增加语义或运动学模态,展示了紧耦合范式的通用性。然而,在这些设计中,激光和视觉信息之间的权重统一应用于所有位姿方向:没有现有工作分析联合信息矩阵的方向依赖谱结构,或在传感器不可靠的特定方向上衰减其贡献。现有退化感知方法在模态层面做二值接受/拒绝决策。协方差加权方法缩放整体传感器置信度但仍是各向同性注入。场景级门控决定是否使用视觉更新,但不控制其在状态空间中的作用位置。SA-LIVO 通过在单个统一信息形式中结合联合特征基线性钳位软门控与场景级 VIO 质量因子和每观测去相关来解决此差距。

SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图4图2:SA-LIVO系统概述——LiDAR、相机和IMU流从顶部进入;IMU测量驱动连续状态传播。蓝色路径为激光-惯性里程计;橙色路径为VIO;红色路径为SAIF+联合更新;绿色路径为体素地图

III. 系统概述

SA-LIVO 包含两个并行信息流水线——激光-惯性和视觉——它们馈入联合 InEKF 更新,如图2所示。系统处理激光(10 Hz;支持其他频率)、相机(10 Hz)和 IMU(200 Hz)数据流。异步采样的激光点通过 IMU 后向传播以相机速率重组成扫描,确保激光和图像数据之间的时间对齐。激光和视觉测量随后通过联合右不变迭代扩展卡尔曼滤波器紧耦合。

在激光分支(第V节)中,下采样激光点匹配到自适应体素地图中的平面。每个匹配产生一个点面残差  及其完全传播的方差 。经  门控后,存活的匹配累积为激光信息矩阵  和向量 。饱和体素(平面已良好收敛的)优先于新构建的体素,以抑制漂移污染的约束。

在视觉分支(第VI节)中,激光锚定的 3D 地图点投影到当前图像。每帧仿射亮度模型补偿曝光变化,之后光度残差与滑动窗口中的参考观测进行比较。雅可比在传播状态处计算一次并在所有迭代中重用。经每观测信息去相关和多门控离群点剔除后,跟踪点累积为  和 。场景级 VIO 质量因子  在融合前门控视觉信息。

SAIF(第VII节)对联合信息矩阵  进行特征分解以识别总可观测性结构。每个特征方向随后通过  进行软门控,产生融合形式 。InEKF 求解所得线性系统以得到状态修正。收敛后,体素地图用精修位姿更新。

表I:符号汇总表——包含状态、协方差、旋转、位置、速度、偏置、流形算子、信息矩阵、质量因子、特征值、门控权重、点坐标、法线、残差、雅可比等符号定义SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图5

IV. 状态表示与 IMU 传播

我们基于不变扩展卡尔曼滤波器构建,将导航状态置于矩阵李群上,并利用其对称性减少标准左不变 EKF 产生的线性化偏差。我们采用混合右不变参数化,以适应本文核心的联合信息形式融合。姿态误差遵循右不变约定,给出单位姿态自转移,消除了左不变 EKF 每步的姿态误差旋转;而位置和速度误差保持欧氏。这种欧氏选择是刻意的:它使激光和视觉信息形式以及基于它们的 SAIF 特征分解保持在单个线性误差空间中,而完整的  参数化会非线性地重参数化速度误差并破坏该兼容性。完整的群仿射一致性保证是完整  InEKF 的性质;我们采用混合形式以便整个误差状态保持在单个线性空间中,这是 SAIF 特征分解(第VII节)在相干误差表示上操作的先决条件。一个后果是轨迹相关的速度-旋转耦合块,将在本节后面精确给出。我们的关键修改是统一的联合更新:激光和视觉信息形式在单个线性化点处融合,并在一个迭代循环中求解,消除了顺序每模态更新的线性化点不匹配。

A. 状态与流形

我们取 IMU 坐标系为机体坐标系,世界坐标系为全局参考系,与文献[8]一致。状态流形为 ,状态向量为:

其中  为 IMU 到世界坐标系旋转, 为世界坐标系位置和速度, 为陀螺和加速度计偏置, 为在线估计的重力向量。误差状态为 ,其中  算子采用右不变约定:,状态更新 。我们采用混合右不变参数化,其中旋转误差为右不变的,而速度和位置误差保持欧氏 。除了上述融合兼容性理由外,此选择还简化了传播:旋转自转移变为单位矩阵 ,消除了 FAST-LIO2 的左不变约定中每步姿态误差的旋转,并简化了协方差传播。一个结构后果是速度-旋转耦合块变为 (世界中心的比力斜对称)而非左不变公式的机体框架 。两者等价于耦合方向的一个旋转,不引入额外近似。完整的  Barrau-Bonnabel 构造将进一步给出轨迹无关的 ,但它需要重参数化速度误差本身 ;我们保留欧氏  以与下游信息形式融合兼容。

B. IMU 传播

在连续传感器帧之间,高频 IMU 测量提供运动学连续性的唯一来源;前向传播将状态估计推进到激光扫描终点,并通过后向积分去畸变点云。第  个 IMU 测量的离散状态转移模型为:

其中  为原始 IMU 测量, 为过程噪声,运动学函数  按文献[8]定义。状态协方差传播为:

其中  和  为式(2)的状态和噪声雅可比,在当前估计处求值。扫描间隔内获取的激光点通过 IMU 后向传播进行运动补偿,然后进入测量更新步骤。

V. 尺度不变漂移鲁棒 LIO

激光信息形式  通过将下采样的机体框架点匹配到体素地图中的平面表面,并累积加权点面残差来组装。本节推导残差和右不变雅可比,描述自适应地图结构和平面拟合流水线,呈现信息一致的噪声模型,并详述多尺度对应搜索策略。

A. 点面残差

每个下采样的机体框架点  通过激光-IMU 外参  和当前状态  转换到世界坐标系:

给定体素地图中匹配的平面 ,有符号点面距离为:

其中 。在右不变误差约定  下,关于  的雅可比为:

推导如下。将  扰动到一阶,得到 ,因此 ,其中  由 SO(3) 伴随恒等式给出。旋转块因此依赖于世界框架位置  而非机体框架点;直接使用  会将旋转不确定性错误地投影到平面法线上。

B. 自适应体素地图结构

地图采用由每个条目包含八叉树的哈希表组织的自适应体素结构,其边长根据点的机体框架距离  自适应:

其中  为无量纲比率, 为最大体素大小。对数量化缩放匹配旋转激光雷达的波束足迹增长:在距离  处相邻波束间隔约 ,其中  为角分辨率,因此单位面积点密度按  下降。固定单元大小因此会将远场回波隔离到单个体素中,点数太少无法可靠拟合平面。通过每次  翻倍时使单元大小翻倍,每体素期望点数保持大致恒定,使主成分分析在传感器全范围内保持良好条件。平面性准则、增量 PCA 和不确定性模型共享相同的每体素充分统计量。

C. 尺度不变平面性准则

当点分布足够各向异性时,体素被接受为平面表面。传统测试  将最小 PCA 特征值与固定  阈值  比较。因为  随体素体积(大致 )和局部点密度缩放,同一  不能跨传感器配置或场景尺度迁移。

我们改用无量纲比率:

其中  为体素中  点样本协方差。 为完美平面; 为各向同性。作为特征值之比, 是尺度不变的:同一阈值  适用于任何体素大小或距离。体素仅在两个条件都满足时才被接受为平面:

其中  为可配置的绝对保护值。 测试是主要的尺度不变门控; 防止接受绝对平坦度仍受传感器噪声主导的拟合,独立于点计数或体素尺度。一旦两个条件都满足,体素统计被冻结,不再执行进一步的点更新。

SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图6图3:平面性感知体素冻结——随着激光点在体素内累积,局部平面结构逐渐变得可观测,估计法线稳定。一旦平面性比满足 ,体素统计被冻结,不再进行进一步更新

D.  多尺度 PCA 通过充分统计量

单个体素可能包含太少的点而无法可靠估计平面,尤其是在回波稀疏的远距离。自然的补救是聚合邻近体素进行更粗尺度的拟合。朴素地,这需要从邻域收集所有点并重新运行 PCA:一个  操作,当邻域包含数千个累积点时是 prohibitive 的。

我们观察到 PCA 仅需要三个聚合量,即充分统计量,因为它们捕获了协方差公式所需的一切,并省去了保留原始点本身。样本协方差可从以下精确恢复:

使得 。每个体素在每次新点插入时增量维护 ,无论当前是否满足平面性测试。关键是,即使未能通过  的体素也维护有效的充分统计量,可贡献于邻域拟合。聚合  邻域然后仅需要  次哈希表查找和向量加法,每体素一次,与每个体素包含多少点无关。 对称特征值求解器在  内完成 PCA。

E. 噪声与不确定性模型

为了形成信息一致的 ,每个残差必须按其真实期望噪声方差缩放。遵循文献[12]中引入的双分量波束对齐分解,每个机体框架激光点  被视为受两个独立噪声源影响:沿波束方向  的测距噪声 ,由飞行时间量化引起;以及垂直于波束的角度噪声 ,将编码器噪声和波束发散扩展吸收到单个各向同性横向项中。这些给出机体框架点协方差:

其中 。横向项按  缩放,因此远场点具有显著大于近场点的垂直不确定性。传播到世界框架并合并当前状态不确定性:

其中  为右不变雅可比  所需的世界中心 IMU 框架向量(在剧烈运动下此处使用  会将旋转不确定性错误投影到平面法线上)。此耦合在状态不确定性大时自动衰减信息贡献,防止过度自信的更新。

从小型、有噪声或分布不良的点簇拟合的平面不如从数百个分布良好的回波构建的可靠;将所有平面视为同等可信会导致过度自信的信息贡献和有偏的状态更新。对每个接受的平面 (单位法线和质心),我们通过一阶特征向量扰动理论将每点不确定性  传播通过 PCA,获得平面参数协方差 。敏感性由 (垂直于平面)与面内特征值之间的特征间隙控制:厚实、分布良好的簇牢固地固定法线,而薄或细长的簇让小的扰动显著旋转它。具体地,最小特征向量  对点  的敏感性为:

对  为零。每行  记录  每单位扰动向  倾斜多少,幅度为 ,符合特征间隙直觉。堆叠法线和质心敏感性:

其中  收集特征向量。 平面协方差为:

F. 激光信息矩阵组装

总残差方差,传播平面不确定性和点噪声:

其中 。经  新息门控  拒绝离群点) 后,激光信息形式为:

其中  为通过门控的点索引集。式(17)中的负号遵循梯度下降约定 ,与视觉信息向量(32)一致。此流水线将波束级噪声通过机体框架、世界框架和平面参数传播到每点残差方差。所得  是信息一致的:每个条目反映真实期望平方信息梯度,而非固定的临时标量。

体素搜索、法线查找和式(6)中的雅可比  仅依赖于匹配平面 ,在 InEKF 迭代中不变。这些对应关系因此在第一次迭代  后缓存;后续迭代仅重新计算标量点面距离 ,将每迭代激光成本从  降低到 。对于  个下采样点和  次迭代,这消除了每帧  次体素哈希查找。

G. 饱和优先多候选平面选择

每个下采样激光点必须匹配到地图上的一个平面。匹配策略必须回答两个问题:在地图上的何处寻找平面,以及多个看似合理的匹配中保留哪一个。两个选择都决定了地图中积累的漂移有多少能泄漏到激光信息形式  中。我们的策略是将匹配偏向于过去被观测多次的平面,因为这些平面有效地平均了短期位姿漂移,而仅由少数最近扫描构建的平面继承了插入时存在的任何位姿误差。

对每个查询点,在两个空间尺度上搜索候选平面,使密集近场和稀疏远场几何由同一程序处理。

SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图7图4:用于几何约束关联的分层体素搜索——查询点首先探测中心体素(Scale-0),然后扩展到同心Chebyshev壳层(Scale-1)

在 Scale-0 我们仅探测包含查询点的单个体素,若该体素为空则偏移一个体素。这在局部表面已经良好采样时足够,这是短距离的常见情况。

在 Scale-1 我们围绕查询体素以同心壳层向外扩展,并在每添加新壳层时在累积点集上重新拟合平面。壳层  是距中心 Chebyshev 距离为  的体素集。扩展在双重平面性准则(9)满足或达到最大壳层索引  时停止 。稀疏远场簇因此只需付出所需数量的壳层;密集近场簇在  停止。当 Scale-0 已返回饱和平面且  和  时,Scale-1 完全跳过,避免在稳定区域中的冗余工作。

当两个尺度的候选都存活时,仅保留法线在最近平面候选法线  内的候选。这移除了恰好在查询点几何附近但属于不同物理表面的匹配。

剩余候选按作为无漂移锚点的可信度排序,而非按距离远近。当体素的累积点数达到每体素上限时称为饱和,此时其平面参数被冻结不再更新。饱和平面因此总结了来自不同视点的许多过去观测,对任何单帧的瞬时位姿误差 largely insensitive。新近插入的平面则相反,由仅少数近邻位姿贡献的少量点构建,因此这些位姿中的任何漂移直接传播到平面。

最终选择按四个有序轮次进行;仅当较早轮次返回空时才咨询后一轮次:

  • 第1轮:仅接受饱和平面(长期锚点)。
  • 第2轮:添加仍满足平面性准则  的非饱和平面。
  • 第3轮:接纳任何几何有效平面。
  • 第4轮:当无平面候选合格时,回退到归一化残差  最小的候选。

此排序将  偏向于已被许多过去观测交叉验证的平面,防止地图中最新的、漂移污染的表面主导滤波器更新。

VI. 激光锚定的直接光度 VIO

直接光度 VIO 避免了特征提取和深度三角化不确定性。然而,在迭代滤波器内部朴素应用它,会在每次迭代重新计算昂贵的雅可比,并在滑动窗口帧间累积时间相关性。本节展示如何通过设计消除这两种成本。该模块围绕三个信息效率原则构建。首先,视觉雅可比在 InEKF 迭代循环前计算一次并在所有迭代中重用,利用光度梯度对收敛期间亚度状态变化的不敏感性。其次,每观测使用计数去相关因子防止被重复跟踪的点在连续帧间膨胀 。第三,多门控离群点滤波(视差、绝对残差、 和视角门控)确保只有几何和光度上可靠的观测贡献。与场景级质量因子 (第 VI-F 节)一起,这些形成跨空间、时间和计算域的多级信息过滤机制。

SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图8图5:信息高效直接光度VIO流水线——(a)传感器输入;(b)视觉地图准备;(c)循环前光度模型;(d)多级滤波;(e)VIO信息

A. 激光锚定的视觉地图点

在纯视觉系统中,3D 地图点从图像对应关系三角化,产生随距离增长的深度不确定性,在远处降低  的可靠性。我们通过直接重用激光扫描点作为视觉地图点来消除此不确定性:每个视觉点  是转换到世界坐标系的激光扫描点,3D 位置精确到激光噪声,协方差继承自(11)-(12)。激光体素地图在每个视觉点处提供表面法线 ,用于深度连续性和视角准入准则。

B. 点选择

激光锚定的地图点在  体素网格中管理;每个单元最多一个点进入滑动窗口,按梯度能量分数选择:

其中  为投影位置的中心差分图像梯度。这种确定性、富纹理的选择最大化每观测贡献的 Fisher 信息。

点在准入前经过两个几何滤波器。深度连续性:若其  邻域(半径 )中任何像素携带的有效深度与点自身深度相差超过 ,则拒绝该点,防止遮挡边界附近的观测进入窗口。视角:仅当表面法线  与视线方向  之间的夹角低于  时点才被准入:

C. 每帧仿射亮度模型

时间亮度变化引入系统性光度偏差,若未补偿则会破坏直接残差并偏移 。我们将参考观测  与当前图像  之间的亮度传递建模为仿射函数:

其中  对每帧  独立估计。参数通过对每个观测的所有面片像素进行梯度加权最小二乘获得:

其中  为属于帧  的滑动窗口观测集合, 为稀疏面片模式中的像素数, 表示观测  面片的第  个像素强度, 为观测  在参考帧(创建时冻结)的平均梯度幅度。像素级累积考虑面片内强度方差,因此高纹理观测对增益估计  的影响比例上大于均匀强度观测。所得的  正规方程以闭式求解。为防止退化估计, 和  钳位到允许范围  和 。来自亮度变化极端的相机的观测  接受指数惩罚以减少其对状态更新的影响。仿射参数在传播状态处估计一次,作为 InEKF 迭代循环之前的视觉预计算的一部分。

D. 光度残差与循环前雅可比

在每个 InEKF 迭代重新评估完整光度雅可比是主要的 VIO 成本,但产生可忽略的精度收益,这促使本节开发的循环前雅可比冻结。每个观测使用以投影位置  为中心的稀疏 9 像素交叉模式:

半径为 (默认 ),每个像素通过双线性插值采样,每像素残差平均形成标量 。对滑动窗口中 3D 点  的每个观测 ,仿射补偿后的光度残差为:

其中  为相机坐标系中的点, 为观测创建时冻结的参考帧位置。关于  的  雅可比遵循链式法则 。下面推导的目标是将扰动  用相机坐标系量表达,使图像梯度(原生在相机坐标系中)耦合到状态扰动时无需在每个迭代重新评估的残余机体框架旋转。关键工具是 SO(3) 伴随恒等式 ,它将斜对称算子移过旋转,并将机体框架斜对称  重写为相机框架向量 。在右不变扰动  下应用,得到:

其中第二行应用伴随恒等式将斜对称从机体框架推到相机框架。与图像到 3D 梯度  为相机模型投影雅可比)组合,得到:

整个视觉信息形式  在 InEKF 循环前在传播状态  处组装一次,并在所有  次迭代中冻结。在本文使用的收敛阈值  下,500 px 焦距相机每迭代最多将投影像素位移 ,远低于双线性插值采样间隔。冻结  因此每观测消除  次冗余评估,精度损失可忽略。与跨帧固定雅可比以保持估计器一致性的首次估计雅可比技术不同,此冻结限于单个更新循环,纯由效率驱动,利用光度残差及其雅可比对 InEKF 收敛的亚度、亚毫米增量不敏感的特性。相比之下,激光残差在每个迭代重新评估,因此联合更新仍跟踪最新状态。

每观测光度噪声方差是深度条件的:

其中  为固定每像素光度噪声基底(所有实验设为 ), 为图像到 3D 梯度链, 为相机坐标系中的点不确定性,通过相机外参从(12)传播。深度条件项确保位置不确定性较大的远场点对  的贡献比例较小。

E. 带信息去相关的滑动窗口

视觉模块维护最近  帧的滑动窗口, 作为典型值。每帧存储从激光锚定地图点选择的至多  个观测,通过均匀步长下采样保持空间覆盖。

滑动窗口是信息形式融合的结构要求而非启发式改进。单帧光度信息矩阵  严重病态:因为所有图像雅可比  共享单一视点,信息集中在图像平面方向,而沿光轴方向和弱投影的旋转方向接收接近零的信息。在 SAIF 线性钳位门控中, 的方向被  衰减,因此  的每个特征方向必须携带足够的联合信息才能以全强度贡献。如果  在  较弱的特征方向上贡献可忽略(正是视觉模态应稳定化的方向),门控将比例地衰减这些方向,激光与视觉之间的互补性仅在联合幅度升至  以上时才实现。在  帧不同相机基线上累积雅可比跨越更丰富的子空间,提高  在单帧观测无法达到的方向上的特征值。滑动窗口因此直接决定了 SAIF 操作的  的秩和方向覆盖。

重复帧抑制防止近乎相同的帧进入窗口:若新帧与前一帧的旋转变化低于  且平移变化低于 ,则拒绝新帧。当窗口超过  帧时,最旧的帧被驱逐,其观测被丢弃。与被驱逐帧 ID 关联的仿射参数被修剪以防止无界内存增长。

同一 3D 点在多个滑动窗口帧中的观测引入时间相关性,违反 InEKF 的测量独立性假设。为缓解此问题,每个观测维护一个使用计数器 ,每次贡献给  时递增。去相关因子:

确保点的第一次贡献以全尺度进入,而后续重用被逐步衰减。这由第 VII-E 节描述的收敛后协方差膨胀  补充,共同补偿去相关单独无法消除的残余相关性。

F. VIO 质量因子

在信息形式进入融合阶段前,场景级质量因子  门控视觉信息形式,防止退化或损坏的 VIO 贡献给状态更新。三个乘法分量捕获互补失效模式:

其中

惩罚大平均光度残差(灰度级单位);阈值  和  分别设为 12 和 8 灰度级,值来自训练序列的经验光度残差分布; 随有效观测数达到最小支撑阈值  线性升至 1;以及

其中  为离群点拒绝率。这些阈值在所有序列上固定,刻意粗糙: 仅提供场景级阻尼,精细的逐方向加权留给 SAIF,因此它们作为粗略保护而非精细调参。当  时(例如黑暗或严重运动模糊),系统优雅退化为仅 LIO 更新,无需任何显式模式切换逻辑。

G. 视觉信息矩阵

观测在贡献给  前经过顺序多门控滤波器:(i) 投影有效性(深度 ,像素在界内);(ii) 视角门控 ,拒绝  擦掠视图);(iii) 视差门控 ,其中  为最小所需像素视差;(iv) 绝对残差门控 ,其中  为面片像素 RMS);(v)  新息门控 

存活的观测与信息去相关因子(26)和仿射置信因子  组合,得到复合标量:

视觉信息形式在通过所有门控的观测集合  上累积:

由于  在 InEKF 循环前组装一次, 的谱结构在所有迭代中保持固定,而激光残差在每个迭代重新评估。SAIF 依赖此固定方向覆盖来计算每特征方向门控权重 

VII. 子空间感知信息融合

方向不可知融合将每个传感器的信息统一注入所有位姿方向,无视每方向可靠性。本节推导解决方案:对联合信息矩阵进行特征分解,对每个特征方向应用线性钳位软门控,并重构融合矩阵,在可靠方向保留每个传感器的全部贡献,同时平滑衰减退化方向并将其推迟到 IMU 先验。视觉信息按质量因子  预缩放后进入。虽然  在退化场景中降低  的整体幅度,但统一应用于所有六个位姿方向。SAIF 在  缩放后的联合特征谱上操作,进一步仅衰减那些仍低于  的特定方向。两种机制互补: 在场景级作用,SAIF 在逐方向级作用。门控重构通过构造半正定,因为它仅保留非负特征值, 具有直接的物理解释。

A. 信息不一致性问题

组合  和  而不考虑其谱结构会产生引言中提到的两类失效。在激光雷达可靠约束的方向上( 的大特征值),无条件视觉融合将光度偏差注入已精确的估计;在退化方向(近零特征值),视觉修正分散到所有六个位姿维度,在最需要的方向上被稀释。融合估计在每种传感器各自可靠约束的方向上可能比任一传感器单独使用更差。

SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图9图7:通过线性钳位软门控的子空间感知信息融合——联合信息矩阵被特征分解;每个方向由  门控,可观测方向  保留全权重,退化方向平滑衰减到 IMU 先验

SAIF 和质量因子  通过分工解决这两种不一致。第二类不一致是谱门控的主要目标。因为门控作用于联合谱 ,任一模态约束的方向都以全权重通过。因此视觉可以提升退化的激光方向超过门控,而两种模态都无法解决的方向被衰减到 IMU 先验。第一类不一致设计上不是门控的责任,因为它将良好观测的联合方向保持全强度。在那里,视觉污染被另外两个效应控制。在激光雷达可靠的区域,其特征值主导联合方向,因此  缩放的视觉项仅是小的相对扰动。场景级因子  在视觉流全局退化时进一步收缩 。图7说明了谱机制:联合信息矩阵在连续加权的特征基中重构,保留联合可观测约束并抑制两种模态都无法解决的方向。

B. 问题表述

我们寻求一个融合信息矩阵 ,通过满足三个期望来解决信息不一致:(D1) 在传感器可靠约束的方向上保留其信息;(D2) 在传感器无信息的方向上衰减其信息;(D3) 融合应对称(对两种传感器处理类似)、保证 PSD 且谱连续。

如第II节所述,三种常见替代方案(二值退化处理、传感器级协方差加权、场景级模态门控)各自违反至少一个期望,要么不连续地要么各向同性地在状态上作用。因此我们的目标更严格:逐方向保留或抑制每个传感器,同时保持完整融合信息矩阵 PSD 且跨变化可观测性连续。

为形式化这些目标,我们在联合信息矩阵的特征基中工作。设:

其中  为 VIO 质量因子(27), 为正交。使用联合特征基而非仅激光基确保特征值  编码组合激光-视觉测量的总每方向可观测性,而非偏向激光雷达几何。每个特征值的平方根  是沿  的信息幅度:它等于该方向的逆后验标准差 ,是从平方根信息滤波器分解  在特征基中得到的对角项。将求和信息向量投影到同一基:

产生一个六维解耦系统,其中每个坐标对应位姿空间中一个有几何意义的方向 

C. 平方根信息线性钳位软门控

在联合特征基中,信息平方根因子(SRIF 幅度)的对角为 ,即后验标准差的倒数: 是沿  在无信息先验时的  不确定性。阈值  因此是一个信息幅度阈值:当 SRIF 幅度等于  时方向达到全权重,低于时线性衰减:

因此  当 (可观测), 当 (退化,部分衰减)。此连续斜坡将先前每传感器软门控的四个手工调参阈值替换为一个阈值,其含义独立于方向信息来自哪个传感器。界限  是相同的信息幅度(逆后验标准差),无论信息由激光雷达平面几何、光度梯度还是它们的和贡献。在 18 维状态上的典型设置为 。直观上,这放置可观测性边界在单位后验标准差:由于 ,当单次更新将方向约束到优于 (平移)或 1 rad(旋转)时,方向以全强度通过,否则推迟到 IMU 先验。良好观测的方向聚合数百个激光或光度约束 ,而退化的方向坍缩到 ,因此联合谱间隙跨越单位值,这就是为什么图11的敏感性最小值位于  附近。因为  混合旋转  和平移  维度, 不是维度纯粹的,此简化与先前的特征谱退化检测器共享;其值还与状态的 SI 单位相关,因此转移的是超过一个数量级的鲁棒平台(图11),而非精确位置。

当方向低于  时,其测量贡献被比例降权;IMU 先验  在  时越来越多地支配该方向,协方差在过程噪声下平滑增长。可观测方向  以完整信息贡献而不衰减,不同于压缩所有低于单位的方向的 sigmoid 型门控。

D. 特征基重构

门控后,融合信息形式通过将  的不可观测对角项和  的对应项置零,然后旋转回来重构:

重构通过构造半正定:由于  且 ,每个 ,因此无需正则化 。门控特征值保持  的特征向量不变,并按  缩放每个——一个连续加权投影而非硬二值划分。

与分别投影  和  的每传感器方案相比,这里仅对求和量  和  进行特征分解/投影。这将融合阶段的密集  矩阵工作量减半,并消除了跟踪每个方向的信息有多少来自激光与视觉的需要。门控是联合几何的性质,InEKF 随后通过  将门控更新分布到 18 维状态,无关来源。设  由(35)定义, 由(36)-(37)定义。四种工作模式直接遵循门控定义:

1)完全可观测,因此 。融合退化为质量门控直接求和;两种传感器都以全强度贡献。

2)部分退化(某些 ):沿  的联合更新被  衰减;IMU 先验  在可观测性减弱时越来越多地支配该方向。强方向  保持其求和信息不变。

3)单传感器或无传感器极限:若激光失效 ,门控仅依赖于视觉幅度,退化为质量门控 VIO 更新;若两者都退化  且激光较弱)则  对多数 ,IMU 先验主导,一个无需显式逻辑的优雅失效模式。

算法1:子空间感知信息融合(线性钳位软门控)——输入 、可观测性阈值 ;输出 *SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图10

转换随联合信息幅度  相对于物理阈值  连续变化,给出可解释的场景驱动衰减而非调参的传感器特定二值开关。

E. 带谱门控的统一联合 InEKF 更新

两种模态产生标量残差但以结构不同的子空间贡献信息: 编码场景的几何可观测性,而  受图像梯度方向支配。直接求和  混淆这些结构而无视每方向可靠性。相反,激光信息形式  和视觉信息形式  分别组装并通过算法1融合,产生方向选择性的 。融合形式嵌入完整的 18 维状态空间,InEKF 更新一次求解:

式(40)的三项具有不同的物理作用。第一项  是测量更新本身:它通过精度缩放增益将门控融合梯度  注入完整的 18 维状态。第二项  是原始传播状态  与当前迭代  之间通过  算子在流形上表达的位置;它将迭代锚定到 IMU 先验,使后续线性化不会漂离它。第三项  减去测量更新已通过紧凑增益  解释的那部分位移,防止先验偏移被双重计数为先验和观测。此单次求解联合更新具有两个结构性质。

算法2:SA-LIVO联合InEKF更新——输入传播状态和协方差、激光点、图像、滑动窗口;输出精修状态和协方差SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图11

首先,两种传感器进入单个信息形式求解而非顺序每模态更新:激光平面对应关系和每点协方差项从传播状态准备并在第一次迭代后重用,而紧凑激光信息形式随残差变化重新组装;视觉信息形式在循环前在  处组装一次并重用。这避免了顺序传递的传感器间排序不匹配,其中视觉更新在完成激光更新后于  处线性化。其次,所有模态在至多  步的单个迭代循环内处理;顺序每传感器循环会将迭代预算乘以模态数。在每个联合迭代中,激光平面对应关系在第一次迭代后缓存 ,仅  重新计算点到平面距离;视觉信息形式  在循环前组装一次并在所有迭代中重用,利用光度雅可比对收敛期间亚度、亚毫米增量的不敏感性。每迭代成本因此由单个  线性求解和  激光残差重新评估主导。当  和  连续两次迭代满足时声明收敛。收敛后,协方差更新为 ,位姿块膨胀  以补偿滑动窗口观测中的时间相关性。完整过程见算法2。

VIII. 实验

A. 实验设置

SA-LIVO 用 C++ 和 ROS 实现,在笔记本电脑(Intel i9-13900HX,32 GB RAM)和 ARM 平台(NVIDIA Jetson Orin,12 核 ARM Cortex-A78AE @ 2.2 GHz,64 GB RAM)上评估。

SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图12图8:用于自采集数据集的手持数据采集平台

我们的自采集序列使用图8所示的手持平台获取。包含 Livox AVIA 固态激光雷达(10 Hz,非重复扫描模式)带内置 IMU(200 Hz)和工业相机(10 Hz),刚性安装在手持外壳上,带机载嵌入式 PC。激光雷达通过 PPS+GPRMC 信号时间戳,相机外部触发,提供所有传感器的硬件级同步。

我们在三个公开数据集的 29 个序列上评估 SA-LIVO:HILTI 2022(15 序列)、New College(7 序列)和 Oxford Spires(7 序列)。基线为 FAST-LIO2、FAST-LIVO、FAST-LIVO2、R3LIVE 和 SR-LIVO,使用官方开源实现。对所有三个公开数据集,图像流下采样到  以匹配激光雷达扫描率;更高图像速率下激光扫描将被分割成图像对齐的子区间,每个区间携带太少点无法稳定平面拟合。此预处理统一应用于所有方法,包括基线。HILTI 使用官方稀疏 survey-point 评估器;其余数据集通过绝对位姿误差进行 SE(3) 轨迹对齐评估。

B. 定量精度

表II:所有数据集上的绝对平移RMSE(m)——与FAST-LIO2、FAST-LIVO、FAST-LIVO2、R3LIVE、SR-LIVO对比; 表示未能完成序列SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图13

在 HILTI'22 上,仅 SA-LIVO 和 FAST-LIVO2 完成全部 15 个序列;R3LIVE 和 SR-LIVO 在约一半室内退化运行中失败(exp03、exp09-10、exp14-16、exp18)。最难的是建筑楼梯(exp03)和两个圆顶运行(exp09-10),激光和相机同时退化:近共面扫描线对着低照度下的无特征墙壁。在 exp03 上 SA-LIVO 达到 ,对比 FAST-LIVO2 的  和 FAST-LIVO 的  漂移,R3LIVE 和 SR-LIVO 未能完成;在其余退化序列(exp15-16、exp18)上 FAST-LIVO 漂移到米级或失败,而 SA-LIVO 保持 RMSE 低于 

在 New College 上,SA-LIVO 在两种压力场景下均一致:开放草坪 Quad 环(稀疏激光结构让视觉提供横向可观测性)和低照度地下地窖运行。它在 Quad Easy()、Quad Hard()、Underground Medium()和 Underground Hard()上排名第一,在其他地方与最佳差距在  以内。FAST-LIVO2、R3LIVE 和 SR-LIVO 全程保持接近;FAST-LIVO 是例外(Quad Hard 上 ,Underground Medium 上 )。

Oxford Spires 强调序列长度:每次运行是长时间室内-室外穿越,复合漂移并反复改变跨视点光照。SA-LIVO 在七个序列中的五个上排名第一,在另外两个上与最佳差距在  以内,全程 RMSE 低于 。FAST-LIVO 在每个序列上超过 (keble-college-05 上高达 );FAST-LIVO2、R3LIVE 和 SR-LIVO 在大多数上保持竞争力。

C. 消融实验

表III:消融实验——每数据集平均RMSE(m); 为相对于完整系统的相对退化SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图14

表III:消融实验 报告了四种消融变体的每数据集平均 RMSE:w/o VIO 移除视觉更新;w/o affine 禁用每帧亮度补偿 ;w/o sub. 将子空间感知融合替换为朴素信息求和;w/o s.w. 使用单帧视觉更新而无滑动窗口去相关。每个组件在不同基准上主导,跨数据集平均退化 

子空间融合和滑动窗口在 HILTI'22 的走廊和画廊场景上最重要。移除子空间融合(w/o sub.)使 HILTI'22 RMSE 提高  到 ),在 exp16 上峰值达  到 ):朴素信息求和在观测不良的方向引入跨传感器耦合,而逐方向门控限制了该效应。滑动窗口在 exp18 上贡献最大的 HILTI'22 退化 ,单帧回退使 RMSE 从  升至 ,因为一个视点提供太少视差来稳定沿走廊方向。

在 New College 上 VIO 项影响最大(平均 ),证实视觉约束在激光平面结构稀疏的开放户外场景中最重要。仿射亮度补偿产生最小的跨数据集退化 ,与 HILTI'22 和 New College 的室内固定曝光相机一致,但在 Oxford Spires 上达到峰值  到 ,那里跨视点光照变化最大。消融支持预期的分工:子空间融合处理方向退化,滑动窗口添加时间视差,VIO 在开放环境中提供约束,亮度补偿在光照变化下稳定光度残差。

D. 自采集数据集上的建图质量

图9:自采集数据集indoor-chairs序列上的定性建图对比——(a1)-(a2)完整SA-LIVO彩色点云地图的两个视点;(a3)柱子和椅子区域特写;(b1)-(b4)相同区域来自FAST-LIVO、FAST-LIVO2、SR-LIVO和R3LIVE;SR-LIVO和R3LIVE未能完成序列SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图15

图9:自采集数据集上的建图质量对比 展示了自采集数据集上的定性地图对比。传感器在中心柱子附近近距离操作,导致近乎退化的激光几何:扫描线近乎共面,沿切向方向提供不足约束。FAST-LIVO 和 FAST-LIVO2 由于这些退化方向上的无约束漂移产生模糊表面和不完整椅子结构,而 SR-LIVO 和 R3LIVE 完全未能完成序列。SA-LIVO 的线性钳位软门控连续衰减病态激光方向并按比例融合视觉约束,产生更密集、几何更一致的重建,椅子座和周围柱子边界更锐利。

E. 运行时与信息效率分析

点云下采样叶大小(HILTI'22 为 ;其他为 )和地图体素大小(HILTI'22 为 ;其他为 )直接控制点数和地图复杂度,因此控制运行时和内存。所有其他参数跨序列固定。内存测量时所有方法禁用屏幕可视化;完整累积地图保留在进程内存中,因此 R3LIVE 和 SR-LIVO 存储的稠密彩色特征地图作为其算法的一部分包含在报告数字中。所有 SA-LIVO 计时为仅 CPU;笔记本电脑和嵌入式 ARM 平台均不使用 GPU 加速。

表IV:所有数据集上的每序列运行时(ms/帧)和峰值内存RSS(MB)——与FAST-LIVO2、R3LIVE、SR-LIVO对比; 表示未能完成SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图16

在 HILTI'22 上,SA-LIVO 达到每帧 (每序列平均),峰值内存低于 ,对比竞争方法超过  和 。在大型户外序列(Oxford Spires)上,竞争方法积累稠密特征地图,内存差距进一步扩大:SA-LIVO 使用 ,对比 R3LIVE 在 observatory-quarter-02 上的  降低)。在 New College Quad 上,SR-LIVO 需要高达  每帧,而 SA-LIVO 保持在  以下( 加速)。在 ARM 平台上,SA-LIVO 每帧  内完成每个序列,内存 ,在嵌入式硬件上无需算法修改即可满足  实时预算。

在所有基线完成运行的共同 HILTI'22 子集(exp01-exp07 和 exp21)上,SA-LIVO 每帧处理 ,比 FAST-LIVO2 快 ,比 SR-LIVO 快 ,比 R3LIVE 快 ,峰值内存降低 

SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图17图10:7个HILTI'22序列上的运行时 vs. 峰值内存——SA-LIVO在每个序列上快且内存效率高

效率增益源于三个设计选择。表V 报告了每个对应模块消耗的每帧墙钟时间份额。三者合计占每帧预算的 ,证实优化针对主导热路径。

(i) 联合 InEKF 更新消耗每帧预算的 ,约占相对于 FAST-LIVO2 双循环迭代 EKF 观察到的墙钟时间减少的一半。(ii) 带缓存激光对应关系的循环前雅可比组装将信息形式构建保持在预算的 ,尽管承载完整的 LIO 和 VIO 测量成本。(iii) 饱和优先平面选择将体素地图更新保持在预算的 ,即使地图从 HILTI'22 增长到 Oxford Spires,这也解释了长序列上的大 RSS 优势。这些选择共同将计算按边际信息产出的比例分配,以资源成本的一小部分提供有竞争力的精度。

表V:每模块占每帧预算的比例——(i)联合InEKF;(ii)循环前雅可比;(iii)饱和优先;按数据集分组SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图18

F. 退化场景分析

逐方向门控携带单一阈值 ,实际关注点是需要按场景重调。不需要:我们在三个 HILTI 2022 序列上对  进行两个数量级的扫描,激光退化递增:exp01(良好条件施工)、exp07(走廊)和 exp10(结构退化圆顶)。图11 绘制了 ATE 按默认  处的值归一化,揭示三种模式。首先,曲线在可观测性改善时变平:exp01 在  上变化低于 ,因为每个方向满足 ,门控从不介入。其次,敏感性随退化加深成浴缸形:低于带时,不可观测子空间泄漏和漂移(exp10 在  时  ATE);高于时,即使可观测方向也被饿死,重建扭曲( 时 )。第三,最重要的是,最小值不移动:在两个退化序列上最优值与默认  重合,位于即使最难情况的安全带  内。因此相同阈值在良好可观测性下是惰性的,仅在退化下有选择性,单一固定值跨场景迁移无需每序列调参。

SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图19图11:SAIF门控阈值对ATE的敏感性——ATE按默认处的值归一化;阴影区域标记最难序列上的安全范围

SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图20图12:LIO/VIO信息互补性——(a)完整序列彩色点云地图,标注VIO主导、LIO主导和高增益区间;(b)堆叠LIO/VIO贡献分数;(c)VIO信息提升;(d)SAIF谱热图

在阈值鲁棒性之外,我们检查两种模态在状态空间中互补的位置。图12 检查 HKU_Cultural_Center_01 序列上跨三种区间类型的跨模态互补性:视觉主导、激光主导和高增益(视觉挽救退化激光方向)。

面板(d)揭示两种不同的退化机制。持续退化表现为方向  和  上持续较暗的带,反映平坦室内几何。瞬态退化表现为  跨度中的实心暗块:特定位姿轴上的方向信息坍缩事件,而非低总信息时期。

G1 区间使跨模态互补性具体化。传感器扫描文化中心的外立面,一个承载印刷文字和标牌的大平面墙。扫描线正面撞击表面,激光雷达在墙法线方向提供强深度约束,但无法沿墙解析位置,导致墙平行方向退化: 行落入门控区。然而面板(d)中的阴影 VIO-挽救模式显示联合矩阵恢复超过 :相机观测到的印刷字符和标牌提供激光几何无法提供的沿墙约束。G1 位置的重建证实了这一点:墙面文字保持锐利可读,使视觉贡献的几何有效性在地图中直接可见。

面板(b)和(d)之间的比较暴露了标量融合度量的根本局限。面板(b)中迹分数看似平常的几个区间在面板(d)中已呈现暗色较低行,信号方向坍缩,任何聚合质量分数都无法察觉。一种模态可以主导总信息预算,同时完全无法约束特定位姿方向。逐方向线性钳位门控在源头检测并按比例衰减这些失效,而标量质量乘数统一缩放所有方向,在退化轴旁放大良好约束轴。

总之,分析证实了 SAIF 背后的架构选择:可靠的跨模态融合需要在单个特征方向层面解析信息,而非聚合。谱线性钳位门控连续加权可观测方向的全强度,同时平滑衰减退化方向到 IMU 先验,无需模式切换或每传感器阈值调参。关键的是,此分解不是边缘情况保护,而是持续活跃的每帧机制:在正常、激光退化和视觉挑战段中,门控自主地将融合权限重新分配给持有更强方向约束的模态。

IX. 结论

本文提出 SA-LIVO,一个激光-惯性-视觉里程计系统,其关键组件均为效率而设计。SAIF 以单一阈值按特征方向解析融合,消除了模式切换和每传感器调参,同时保持更新可证明 PSD;统一的单循环联合 InEKF 在单个线性化点融合激光和视觉残差,无论模态数量如何都将迭代次数限制在固定预算;循环前雅可比缓存、每观测去相关、常数时间增量 PCA、饱和优先平面选择和激光锚定地图点各自消除一个占主导的每帧成本。

收益在所有三个资源轴上清晰可见。在精度上,SA-LIVO 在结构化基准上具有竞争力,在 R3LIVE 和 SR-LIVO 发散的退化走廊和圆顶上保持有界漂移。在运行时间上,它在笔记本电脑 CPU 上每帧处理 ,在 Jetson Orin 上无 GPU 加速 ,比竞争 LIVO 系统快 。在内存上,峰值 RSS 降低 ,在大型户外地图上扩大到 ,并在嵌入式硬件上无需算法修改满足  实时预算。将当前的测量重用启发式替换为严格的边缘化是自然的下一步。通过仅在其可靠约束的方向上接纳每个传感器的信息,并独立于场景复杂度限制计算,SA-LIVO 将并发激光-视觉退化从失效模式转变为常规处理的工况。

本文仅做学术分享,如有侵权,请联系删文。

SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图21SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图22SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图23SA-LIVO:激光雷达和相机「按方向选择性融合」,无GPU稳跑10Hz,12.3ms/帧且内存暴降6.3倍!图24

添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
GPU 内存 激光雷达 相机
more
4.0T V8插混动力,“瑞麟之眼”,激光雷达,长轴距旗舰SUV就位!
车顶激光雷达,5米车长,近3米轴距,5座SUV看看这辆!
激光雷达+非承载式车身?豪华越野SUV等等这辆!
激光雷达+8295P座舱芯片,Nappa真皮座椅,限时17.99万起,轿跑SUV看看这辆!
车长近6米,轴距3米4多,896线激光雷达,无B柱对开门,科幻感拉满!
激光雷达战火为何烧向自研芯片?
3040mm轴距,896线激光雷达,46.3英寸巨幕,6座布局,奇瑞+捷豹路虎=?
单腔空气悬架+激光雷达,6L冷暖箱+52L车载大冰柜,17.3英寸3K后排折叠屏,这价格你心动吗?
一种新型的激光雷达
专家辟谣!L3/L4 必须配激光雷达?官方给出标准答案
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号