点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
来源:3D视觉工坊
3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:
直接飞行时间(dToF)传感器凭借纳秒级光脉冲测量,正在成为下一代AR/VR头显、机器人导航和自动驾驶的核心深度感知方案。与传统的间接ToF(iToF)相比,dToF不受多径干扰影响,能在强 ambient light 下保持高精度度量深度,且功耗更低。苹果LiDAR、索尼dToF传感器阵列的量产,标志着这一技术已从实验室走向消费级市场。
然而,dToF传感器面临一个根本性矛盾:高精度与高分辨率不可兼得。由于SPAD(单光子雪崩二极管)像素尺寸大、制造工艺复杂,当前dToF阵列分辨率极低(通常仅数千到数万像素),产生的深度图极度稀疏且噪声严重。现有深度补全方法大多针对RGB-D相机或LiDAR设计,无法适应dToF特有的稀疏模式和噪声特性,且缺乏跨传感器泛化能力。
为解决这一难题,KAIST研究团队提出了一种从稀疏dToF测量进行稠密度量深度补全的泛化框架。该方法采用深度引导双分支Vision Transformer编码器,分别处理RGB图像和稀疏dToF测量,通过masked joint attention模块让深度token可靠引导图像特征。模型在完全合成数据上训练,却实现了跨6个数据集和3个真实dToF设备的强零样本泛化,被评为CVPR 2026。
该框架的核心创新在于将dToF稀疏深度作为"几何锚点"而非简单先验,通过masked joint attention让RGB特征在深度token引导下自适应聚焦于几何关键区域,既保留了RGB的语义理解能力,又注入了dToF的度量精度,最终实现了仅靠合成数据训练即可泛化到真实dToF传感器的突破。
论文信息
标题:Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors
作者:Hakyeong Kim, Ruicheng Wang, Chengtang Yao, Jiaolong Yang, Min H. Kim
机构:KAIST (Korea Advanced Institute of Science and Technology)
原文链接:https://arxiv.org/abs/2608.04737
代码链接:https://vclab.kaist.ac.kr/sparseDtoF
导读
直接飞行时间(dToF)传感器提供高精度度量深度,但制造昂贵且光电二极管阵列尺寸有限,产生极度稀疏、低分辨率和有噪声的深度图。本文提出一种从稀疏dToF测量进行稠密度量深度补全的泛化框架,能跨不同传感器类型、稀疏度和噪声条件工作。模型采用深度引导双分支Vision Transformer编码器分别处理RGB图像和稀疏dToF测量,masked joint attention模块使深度token可靠引导图像特征而不被覆盖。轻量解码器高效重建稠密度量深度。在完全合成数据上训练,实现跨6个数据集和3个真实dToF设备的强零样本泛化,为dToF传感器的大规模部署提供了实用解决方案。
效果展示
图 1:本文模型在不同 dToF 传感条件下的零样本泛化能力。上方:三种典型设置对应的稀疏深度输入 —— 自动驾驶激光雷达(旋转式 dToF)、轻量化移动端 dToF、极稀疏随机采样。下方:对应场景下本文方法预测得到的稠密公制深度,可见模型在多样稀疏程度、噪声水平与传感器模式下具备优异鲁棒性。右侧:精度与推理耗时对比(气泡大小代表模型参数量)。本文方法兼顾低误差与快速推理,实现最优平衡,性能超越当前主流深度补全与增强算法。定量指标详见表 1。
引言
深度感知是三维视觉的基础能力,广泛应用于机器人导航、增强现实、自动驾驶和工业检测等领域。在众多深度传感技术中,直接飞行时间(dToF)传感器因其高精度度量深度、抗多径干扰和低功耗特性,正成为下一代深度感知的核心方案。苹果iPhone Pro系列搭载的LiDAR扫描仪即是dToF技术的代表性消费级应用。
然而,dToF传感器的核心瓶颈在于分辨率。SPAD像素需要复杂的制造工艺和较大的像素面积,导致当前dToF阵列分辨率远低于传统CMOS图像传感器。例如,苹果LiDAR的dToF阵列仅约数千个有效像素,产生的深度图极度稀疏,无法直接用于密集场景理解任务。这一限制严重阻碍了dToF技术在需要高分辨率深度的场景中的应用。
现有深度补全方法主要针对RGB-D相机(如Kinect)或机械式LiDAR设计,其稀疏模式和噪声特性与dToF差异显著。RGB-D相机的深度图虽然也有空洞,但分辨率较高且噪声模式不同;LiDAR的深度点虽然稀疏,但呈线扫描分布且测距范围更远。直接将这些方法迁移到dToF场景往往效果不佳,且缺乏跨传感器泛化能力。
为解决上述问题,本文提出一种专门针对稀疏dToF深度补全的泛化框架。核心思路是利用RGB图像的密集语义信息补充dToF的稀疏几何测量,同时通过精心设计的masked joint attention机制确保深度token可靠引导图像特征而不被覆盖,从而在完全合成数据上训练即可实现跨真实设备的零样本泛化。
主要贡献
本文的主要贡献可以总结为以下几点:
• 提出了一种从稀疏dToF测量进行稠密度量深度补全的泛化框架,首次系统性地解决了dToF传感器跨设备、跨稀疏度、跨噪声条件的泛化问题。
• 设计了深度引导双分支Vision Transformer编码器,通过masked joint attention模块使稀疏深度token可靠引导RGB图像特征,避免了稀疏噪声对视觉特征的负面干扰。
• 在完全合成数据上训练,实现了跨6个数据集和3个真实dToF设备的强零样本泛化,验证了方法的实用价值。
方法
该框架采用双分支编码器-解码器架构。RGB分支处理标准RGB图像,提取密集的语义和外观特征;dToF分支处理极度稀疏的深度图,提取几何锚点特征。两个分支均基于Vision Transformer,分别对RGB patch和稀疏深度点进行token化。
核心创新在于masked joint attention模块。在Transformer的每一层中,RGB token和深度token进行联合注意力计算,但深度token的注意力被mask限制为仅从可靠的深度点采样,防止稀疏区域的噪声token覆盖RGB特征。同时,RGB token可以从深度token获取几何引导信息,实现"深度引导RGB、RGB不干扰深度"的单向引导机制。
解码器采用轻量设计,将融合后的双分支特征上采样为密集的度量深度图。整个模型在完全合成的场景数据上训练,通过随机模拟不同的dToF传感器参数(分辨率、稀疏度、噪声水平),使模型学习到与具体传感器无关的深度补全能力。



实验结果
在6个标准深度补全数据集(包括NYU Depth V2、KITTI、TartanAir等)上评估,该方法在零样本设置下的AbsRel和δ1指标均达到最优或接近最优性能。特别是在跨域设置下(训练集和测试集来自不同数据分布),该方法的泛化能力显著优于现有方法。
在真实dToF设备测试中,研究团队使用了3种不同的dToF传感器(包括苹果LiDAR)采集真实数据。尽管模型仅在合成数据上训练,在所有3种真实设备上均表现出强劲的深度补全性能,验证了跨设备泛化能力。消融实验表明,masked joint attention是跨设备泛化的关键,去除该模块后性能显著下降。





总结 & 未来工作
本文提出了一种从稀疏dToF测量进行稠密度量深度补全的泛化框架,通过深度引导双分支Vision Transformer和masked joint attention机制,实现了仅靠合成数据训练即可跨6个数据集和3个真实dToF设备的零样本泛化。该方法为dToF传感器的大规模实际部署提供了实用且高效的解决方案。
未来工作可以探索将该框架扩展到动态场景的时序深度补全,利用多帧dToF测量的时序一致性进一步提升深度精度。此外,结合dToF的多回波信号信息进行多径干扰建模,有望在更复杂的反射环境下提升深度恢复质量。
对更多实验结果和文章细节感兴趣的读者,可以阅读一下论文原文~
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。