KAIST开源dToF深度补全:跨6数据集零样本泛化!

3D视觉工坊 2026-08-18 07:00

点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达

来源:3D视觉工坊

3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:KAIST开源dToF深度补全:跨6数据集零样本泛化!图1

直接飞行时间(dToF)传感器凭借纳秒级光脉冲测量,正在成为下一代AR/VR头显、机器人导航和自动驾驶的核心深度感知方案。与传统的间接ToF(iToF)相比,dToF不受多径干扰影响,能在强 ambient light 下保持高精度度量深度,且功耗更低。苹果LiDAR、索尼dToF传感器阵列的量产,标志着这一技术已从实验室走向消费级市场。

然而,dToF传感器面临一个根本性矛盾:高精度与高分辨率不可兼得。由于SPAD(单光子雪崩二极管)像素尺寸大、制造工艺复杂,当前dToF阵列分辨率极低(通常仅数千到数万像素),产生的深度图极度稀疏且噪声严重。现有深度补全方法大多针对RGB-D相机或LiDAR设计,无法适应dToF特有的稀疏模式和噪声特性,且缺乏跨传感器泛化能力。

为解决这一难题,KAIST研究团队提出了一种从稀疏dToF测量进行稠密度量深度补全的泛化框架。该方法采用深度引导双分支Vision Transformer编码器,分别处理RGB图像和稀疏dToF测量,通过masked joint attention模块让深度token可靠引导图像特征。模型在完全合成数据上训练,却实现了跨6个数据集和3个真实dToF设备的强零样本泛化,被评为CVPR 2026。

该框架的核心创新在于将dToF稀疏深度作为"几何锚点"而非简单先验,通过masked joint attention让RGB特征在深度token引导下自适应聚焦于几何关键区域,既保留了RGB的语义理解能力,又注入了dToF的度量精度,最终实现了仅靠合成数据训练即可泛化到真实dToF传感器的突破。

论文信息

标题:Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors

作者:Hakyeong Kim, Ruicheng Wang, Chengtang Yao, Jiaolong Yang, Min H. Kim

机构:KAIST (Korea Advanced Institute of Science and Technology)

原文链接:https://arxiv.org/abs/2608.04737

代码链接:https://vclab.kaist.ac.kr/sparseDtoF

导读

直接飞行时间(dToF)传感器提供高精度度量深度,但制造昂贵且光电二极管阵列尺寸有限,产生极度稀疏、低分辨率和有噪声的深度图。本文提出一种从稀疏dToF测量进行稠密度量深度补全的泛化框架,能跨不同传感器类型、稀疏度和噪声条件工作。模型采用深度引导双分支Vision Transformer编码器分别处理RGB图像和稀疏dToF测量,masked joint attention模块使深度token可靠引导图像特征而不被覆盖。轻量解码器高效重建稠密度量深度。在完全合成数据上训练,实现跨6个数据集和3个真实dToF设备的强零样本泛化,为dToF传感器的大规模部署提供了实用解决方案。

效果展示

图 1:本文模型在不同 dToF 传感条件下的零样本泛化能力。上方:三种典型设置对应的稀疏深度输入 —— 自动驾驶激光雷达(旋转式 dToF)、轻量化移动端 dToF、极稀疏随机采样。下方:对应场景下本文方法预测得到的稠密公制深度,可见模型在多样稀疏程度、噪声水平与传感器模式下具备优异鲁棒性。右侧:精度与推理耗时对比(气泡大小代表模型参数量)。本文方法兼顾低误差与快速推理,实现最优平衡,性能超越当前主流深度补全与增强算法。定量指标详见表 1。KAIST开源dToF深度补全:跨6数据集零样本泛化!图2

引言

深度感知是三维视觉的基础能力,广泛应用于机器人导航、增强现实、自动驾驶和工业检测等领域。在众多深度传感技术中,直接飞行时间(dToF)传感器因其高精度度量深度、抗多径干扰和低功耗特性,正成为下一代深度感知的核心方案。苹果iPhone Pro系列搭载的LiDAR扫描仪即是dToF技术的代表性消费级应用。

然而,dToF传感器的核心瓶颈在于分辨率。SPAD像素需要复杂的制造工艺和较大的像素面积,导致当前dToF阵列分辨率远低于传统CMOS图像传感器。例如,苹果LiDAR的dToF阵列仅约数千个有效像素,产生的深度图极度稀疏,无法直接用于密集场景理解任务。这一限制严重阻碍了dToF技术在需要高分辨率深度的场景中的应用。

现有深度补全方法主要针对RGB-D相机(如Kinect)或机械式LiDAR设计,其稀疏模式和噪声特性与dToF差异显著。RGB-D相机的深度图虽然也有空洞,但分辨率较高且噪声模式不同;LiDAR的深度点虽然稀疏,但呈线扫描分布且测距范围更远。直接将这些方法迁移到dToF场景往往效果不佳,且缺乏跨传感器泛化能力。

为解决上述问题,本文提出一种专门针对稀疏dToF深度补全的泛化框架。核心思路是利用RGB图像的密集语义信息补充dToF的稀疏几何测量,同时通过精心设计的masked joint attention机制确保深度token可靠引导图像特征而不被覆盖,从而在完全合成数据上训练即可实现跨真实设备的零样本泛化。

主要贡献

本文的主要贡献可以总结为以下几点:

• 提出了一种从稀疏dToF测量进行稠密度量深度补全的泛化框架,首次系统性地解决了dToF传感器跨设备、跨稀疏度、跨噪声条件的泛化问题。

• 设计了深度引导双分支Vision Transformer编码器,通过masked joint attention模块使稀疏深度token可靠引导RGB图像特征,避免了稀疏噪声对视觉特征的负面干扰。

• 在完全合成数据上训练,实现了跨6个数据集和3个真实dToF设备的强零样本泛化,验证了方法的实用价值。

方法

该框架采用双分支编码器-解码器架构。RGB分支处理标准RGB图像,提取密集的语义和外观特征;dToF分支处理极度稀疏的深度图,提取几何锚点特征。两个分支均基于Vision Transformer,分别对RGB patch和稀疏深度点进行token化。

核心创新在于masked joint attention模块。在Transformer的每一层中,RGB token和深度token进行联合注意力计算,但深度token的注意力被mask限制为仅从可靠的深度点采样,防止稀疏区域的噪声token覆盖RGB特征。同时,RGB token可以从深度token获取几何引导信息,实现"深度引导RGB、RGB不干扰深度"的单向引导机制。

解码器采用轻量设计,将融合后的双分支特征上采样为密集的度量深度图。整个模型在完全合成的场景数据上训练,通过随机模拟不同的dToF传感器参数(分辨率、稀疏度、噪声水平),使模型学习到与具体传感器无关的深度补全能力。

KAIST开源dToF深度补全:跨6数据集零样本泛化!图3
KAIST开源dToF深度补全:跨6数据集零样本泛化!图4
KAIST开源dToF深度补全:跨6数据集零样本泛化!图5

实验结果

在6个标准深度补全数据集(包括NYU Depth V2、KITTI、TartanAir等)上评估,该方法在零样本设置下的AbsRel和δ1指标均达到最优或接近最优性能。特别是在跨域设置下(训练集和测试集来自不同数据分布),该方法的泛化能力显著优于现有方法。

在真实dToF设备测试中,研究团队使用了3种不同的dToF传感器(包括苹果LiDAR)采集真实数据。尽管模型仅在合成数据上训练,在所有3种真实设备上均表现出强劲的深度补全性能,验证了跨设备泛化能力。消融实验表明,masked joint attention是跨设备泛化的关键,去除该模块后性能显著下降。

KAIST开源dToF深度补全:跨6数据集零样本泛化!图6
KAIST开源dToF深度补全:跨6数据集零样本泛化!图7
KAIST开源dToF深度补全:跨6数据集零样本泛化!图8
KAIST开源dToF深度补全:跨6数据集零样本泛化!图9
KAIST开源dToF深度补全:跨6数据集零样本泛化!图10

总结 & 未来工作

本文提出了一种从稀疏dToF测量进行稠密度量深度补全的泛化框架,通过深度引导双分支Vision Transformer和masked joint attention机制,实现了仅靠合成数据训练即可跨6个数据集和3个真实dToF设备的零样本泛化。该方法为dToF传感器的大规模实际部署提供了实用且高效的解决方案。

未来工作可以探索将该框架扩展到动态场景的时序深度补全,利用多帧dToF测量的时序一致性进一步提升深度精度。此外,结合dToF的多回波信号信息进行多径干扰建模,有望在更复杂的反射环境下提升深度恢复质量。

对更多实验结果和文章细节感兴趣的读者,可以阅读一下论文原文~

本文仅做学术分享,如有侵权,请联系删文。

KAIST开源dToF深度补全:跨6数据集零样本泛化!图11KAIST开源dToF深度补全:跨6数据集零样本泛化!图12KAIST开源dToF深度补全:跨6数据集零样本泛化!图13KAIST开源dToF深度补全:跨6数据集零样本泛化!图14

添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 开源
more
小扎万字檄文炮轰硅谷,Meta重磅开源30B小钢炮!一台MacBook就能跑
曝苹果联合阿里自研中国专属大模型;追觅卖出首台超3万美元手机;微信称朋友圈坚守不可编辑原则;智谱发布GLM-5.3最强开源编程模型...
16个月后Meta杀回开源,小扎力挺蒸馏
开源、开放权重、闭源 大模型之争
英伟达发布Nemotron 3.5 Lightning,开源模型再提速
这个靠中国开源模型"撑"起的美国公司,要70亿美元卖身了
连续自回归的dots.tts:小红书开源语音合成模型「基座」
世界模型一口气输出小时级视频不跑偏,开源了
编程能力最强开源模型!智谱GLM-5.3登场,国产AI又一猛将
刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号