点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
来源:3D视觉工坊 | 文末进3D视觉交流群
3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:
太长不看版: UPAL 在单一轻量网络中联合提取关键点、线段与描述子,相较 ALIKED + DeepLSD 管线实现约 4× 加速、内存占用小一个数量级,且在点与线任务上匹配或超越 SOTA。
论文信息
论文标题:Unified and Efficient Point-Line Local Features
作者:François Costa, Raphael Kreft, Eckhard Goedeke, Felix Möller, Hardik Shah, Ramanathan Rajaraman, Shaohui Liu, Rémi Pautrat, Marc Pollefeys
机构:1 Department of Computer Science, ETH Zurich, Switzerland; 2 Microsoft Spatial AI Lab
论文链接:https://arxiv.org/abs/2608.19894
代码链接:https://github.com/francois141/upal
导读
多视角计算机视觉管线通常依赖准确的稀疏关键点与鲁棒的描述子。尽管引入线特征已被证明能为匹配与位姿估计带来明显收益,但现有的点-线方法仍然低效:它们分别检测点与线,使用越来越庞大的网络,并依赖受 CPU 限制的启发式方法,阻碍了实时性能。
我们提出 UPAL(Unified Efficient Points and Lines,统一高效点与线)特征提取器,在单一轻量架构中联合提取关键点、线段与特征描述子。一个共享的骨干网络提供通用表征,并分别送入点与线特征的不同分支。线段则通过一个加速的后处理阶段——LSD 算法的一个增强且高效变体——来恢复。
UPAL 在点与线的应用中都匹配或超越当前最优(SOTA)性能,同时显著降低计算开销:例如,相比 ALIKED + DeepLSD 管线,实现了 4× 加速与 10× 更小的内存占用。代码已在https://github.com/francois141/upal 公开。
效果展示

▲ 在本文中,我们提出了UPAL这一点线特征联合提取器。与现有的大多数方法相比,它在混合点线视觉定位任务上的性能更优——定位精度可达到5厘米/5度以内——同时其计算量也大幅降低。

▲ Line detection examples:尽管高效,UPAL 输出的通用线段质量与更昂贵的方法相近(Stairs 场景等)。

▲ Line detection examples:不同于仅关注结构线的 wireframe 方法,UPAL 产生更通用、可复现的线检测,更好地支持下游任务,同时显著更轻量。

▲ Point matching on HPatches(黄=正确,红=相对于真值单应错误;仅显示最显著匹配):UPAL 在视角与光照变化下都能可靠匹配关键点。
引言
提取显著点及其对应描述子,是许多涉及多视角几何的视觉任务中的基础步骤。除 2D 点之外,线段是另一类可以补充点的特征,因为其在人造结构中十分普遍,能为几何任务带来信息更丰富的图像表征。由于若干挑战——例如线段在图像中跨度大、易受遮挡、对视角变化敏感——准确地在图像中定位线段至今仍是活跃的研究领域。尽管有这些挑战,近期结合点与线的方法已在多个领域展现出 SOTA 结果,如特征匹配、3D 重建、视觉定位、相对位姿估计,以及同步定位与建图(SLAM)。
尽管有效,这类同时使用点与线的视觉管线仍存在显著的计算缺陷。它们常常需要两个独立的提取器:一个用于关键点检测与描述,另一个用于线段定位。这种做法低效,因为两个任务高度相关、本可共享计算——点与线都定位在具有强图像梯度的区域。此外,近期的网络架构趋于增大,使得点与线的提取都很昂贵,需要高端 GPU 才能获得满意吞吐。同时,近期的线检测器虽推动了特征提取与匹配的性能,却很少投入精力去缩小网络规模、提升效率。再者,某些 SOTA 深度线检测器复用经典算法(如 LSD)来提取线段;然而 LSD 是仅 CPU 的算法,包含可在 GPU 上更高效实现的操作,且其对图像尺寸具有二次复杂度。
受上述观察启发,我们提出 UPAL(Unified Efficient Points and Lines)局部特征——一种新颖的轻量特征提取器,在单次前向传播中联合提取关键点、线段与特征描述子。UPAL 借助点特征提取器的架构,并在其上加一个轻量的线检测分支。我们主张,不依赖昂贵的“学习型线描述子或匹配器”,线可以通过先匹配其端点、再寻找最优分配来高效匹配,因此无需额外的线描述子。虽然我们并非首个提出联合点-线特征提取的工作,但此前的尝试未能在两个特征上都达到 SOTA,尽管保持了高吞吐。借助 UPAL,我们展示了如何用精简的设计达成这一目标。通过蒸馏,UPAL 兼具两者之长:它使用高效轻量的神经网络,同时由强大的 SOTA 模型监督。我们仔细审视了迄今最佳的点与线提取器,并选出性能最佳的组合,将其知识蒸馏进我们的架构。通过消除两类特征(点与线)提取中的冗余计算,UPAL 在保持 SOTA 性能的同时提升了效率与内存占用。具体而言,我们证明:仅需在已有点提取器上增加三层卷积,即可达到 SOTA 的线检测性能。
受 DeepLSD 启发,我们借助基于 LSD 算法的后处理步骤来提取最终线段。我们相对原始 LSD 与 DeepLSD 实现引入了三项主要改进。第一,我们证明:丢弃预测角度场的分支,既能简化架构,又能同时提升性能。第二,我们将 LSD 的大部分图像处理移至 GPU,仅把“线生长”阶段留在 CPU。第三,我们提出一个简单而有效的启发式方法,减少 LSD 中的种子点数量,在不损失性能的前提下提升检测器效率。
我们在低级指标与几何下游任务上评估 UPAL,在多个具有挑战性的数据集上证明其有效性。结合我们优化的线提取模块,UPAL 相比当前 SOTA 实现了 4× 加速,且性能相当或更优。此外,性能相近的方法,其内存占用也至少高出一个数量级。
主要贡献
我们展示了如何将 SOTA 的点与线检测器及描述子蒸馏进单一轻量网络,保持甚至提升其原始精度;该设计大幅简化现有管线,线提取仅需少量额外卷积。 我们引入 LSD 的增强变体,通过 GPU 加速处理显著提升效率。 UPAL 在点与线特征上均取得 SOTA 性能,覆盖低级指标与下游任务,同时比多数此前方法快得多、轻得多,更适用于嵌入式应用。
方法
一句话核心思路: 用一个单一轻量网络,在前向一次的过程中同时产出关键点、线段与描述子,直接取代“点提取器 + 线提取器 + CPU 后处理”的多级管线。
(a) 统一提取,一次前向。 UPAL 把“点检测 + 线检测 + 描述子”三件事压进同一次推理。它沿用 ALIKED 的点提取器架构,只在其上追加一个轻量线分支:关键点与描述子由 SuperPoint/DaD 教师以加权 BCE 热图监督蒸馏而来,线分支则预测距离场(distance field),再交给一个加速版 LSD 还原线段。线匹配不做“学习型线描述子”,而是端点提描述子 + Sinkhorn 最优分配,省掉额外参数。
(b) 共享骨干,消除冗余计算。 点、线本就都落在强图像梯度区域,理应共享计算。UPAL 用共享卷积编码器(含 DCN 形变卷积与多尺度上采样拼接瓶颈 F)生成多尺度特征,分别接三个解码头:关键点分支(SMH 得分图 + DKD 可微检测,含 NMS 与 3×3 softargmax 亚像素定位)、稀疏可变形描述子头 SDDH、以及线距离场分支。线距离场由 DeepLSD 真值图以 L1 损失监督。关键点得分图与线距离场在可视化上高度相似(见图 3),印证了联合预测的合理性。
(c) 为什么能快 4×、省 10× 内存。 三处关键设计把成本砍下来:① 线分支只预测距离场,角度场改用 GPU 图像梯度计算——作者发现 DeepLSD 的角度场预测反而有害,去掉它既降复杂度又提性能;② 线解码器仅 3 层卷积(BN+ReLU),因为距离场是低层任务,无需 DeepLSD 那种参数量约多 10× 的重 U-Net 主干;③ 后处理把种子点提取搬上 GPU、丢弃低梯度种子、以 stride 2 降采样并保留距离场最低的前 20% 像素,将线提取延迟从原始 DeepLSD 的 233ms 降到 11ms,并把原本 O(图像边长²) 的 CPU 排序改为 GPU 实现。共享骨干 + 轻量线头 + GPU 后处理三者叠加,换来相对 ALIKED+DeepLSD 约 4× 加速、内存小一个数量级。

▲ 网络结构总览:共享卷积编码器生成多尺度特征图,三个解码分支分别预测关键点得分图(SMH+DKD)、描述子(SDDH)、距离场(送入快速 LSD 提取线段)。

▲ 网络输出可视化:共享骨干接收输入图 (a) 编码为瓶颈特征 (b);预测的关键点得分图 (c) 与线距离场 (d) 表现出一定相似性(如关键点常位于线端点或交点),印证了联合预测的合理性。
笔者理解。 UPAL 的聪明之处不在某个新模块,而在“删冗余”:点线共享骨干 + 砍掉角度场 + 轻量线解码 + 把 LSD 搬上 GPU,每一步都直指“独立管线到底贵在哪”。对 SLAM 而言,点线联合提取的意义不只是快——关键点更稳地落在线上、线与点相互补充,能显著提升弱纹理/结构化场景下的位姿鲁棒性;而对工程落地,真正拉开差距的往往不是网络规模,而是后处理与实现细节。它再次证明,许多点线任务用极少参数(780K 级)就能解决,嵌入式端侧实时 SLAM 因此变得可行。
实验结果
UPAL 在低级指标与几何下游任务上均匹配或超越 SOTA,同时把推理开销压到极低。下面给出最具代表性的三组结果。

▲ HPatches 单应估计:各像素误差阈值下的单应估计 AUC 与延迟(ms);lightweight / heavyweight 分组,最佳加粗、次佳下划线。

▲ 7Scenes 中 Stairs 场景的视觉定位:中位平移/旋转误差(cm/deg)与 5cm/5° 阈值下的位姿精度;UPAL(点+线)达到 4.4/1.23 与 54.6%,在联合方法中居首。

▲ 运行效率评估:参数量与延迟(RTX 2080 Ti + i9-13900K);UPAL 仅 0.78M 参数、GPU 70ms,相较 ALIKED+DeepLSD 约 4× 加速、内存小一个数量级。
效率是 UPAL 最硬的指标(Table 7):在 RTX 2080 Ti 上平均 GPU 推理仅 70ms、参数量仅 0.78M,相比 SOTA 组合 ALIKED+DeepLSD 实现约 4× 加速,内存占用小一个数量级;相对 Wireframe/PLNet 等更早的联合提取器,参数量低一个数量级、GPU 延迟再低 37%。这 4×/10× 的提升并非来自更大网络,而来自两处工程减法:线分支砍掉角度场(距离场改由 GPU 图像梯度计算),以及把 LSD 后处理搬上 GPU——仅后者就把线提取延迟从原始 DeepLSD 的 233ms 降到 11ms,且性能不降反升。
精度并未因此牺牲。在 HPatches 单应估计(Table 1)上,UPAL 的 AUC 与主流点提取器持平;在 7Scenes 的 Stairs 场景(Table 5),点+线联合的 UPAL 取得 4.4cm/1.23° 中位误差与 54.6% 的 5cm/5° 精度,超过 ALIKED+DeepLSD(5.1/1.48,49.6%)并追平更强的 Wireframe(4.6/1.30,53.8%)——印证“联合训练让关键点更稳地落在线上”带来互补收益。对端侧 SLAM 而言,这套“SOTA 精度 + 4× 更快 + 10× 更省内存”的组合意味着:在同样的嵌入式 GPU 上,点线联合特征可以真正实时跑起来,而无需为效率牺牲鲁棒性。
总结 & 未来工作
本工作中,我们提出 UPAL——一种统一架构,能够联合提取关键点、线段与特征描述子,同时保持高效率,并保留各独立组件的性能。我们的方法相比组合现有独立组件实现了 4× 加速,同时将内存占用降低至少一个数量级。
展望未来,我们计划将 UPAL 与一个轻量、联合学习的匹配器集成,以实现端到端的点-线图像匹配。我们相信,这种高效、联合的特征提取器,是迈向“让更先进的几何感知更易获取”的重要一步,最终促进点-线应用在嵌入式平台与低计算环境中的部署。
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。