把Depth Anything砍到6M,深度估计终于能跑进Jetson

机器之心 2026-10-03 07:19
把Depth Anything砍到6M,深度估计终于能跑进Jetson图1


过去几年,单目深度估计快速 “Foundation Model 化”。从 Metric3D、Depth Anything 到 UniDepth,大规模数据、更强 backbone 和显式相机建模不断提高模型的跨场景泛化能力。


但与此同时,一个明显的断层也在扩大:基础深度估计能力越来越强,模型却越来越难部署。传统轻量深度估计模型虽然速度快,却往往针对单一数据集训练;Foundation Model 泛化更强,却通常需要数千万甚至数亿参数。于是我们想回答一个更直接的问题:如果模型只有约 6M 参数,还能不能保留基础深度估计的跨场景泛化能力?


这就是 DepthART(Depth Anything Rethought for Tiny Models)关注的问题。该工作已被 ACM Multimedia 2026 接收。


把Depth Anything砍到6M,深度估计终于能跑进Jetson图2



与其说它是在 “压缩 Depth Anything”,不如说是在研究:当模型真正进入轻量级范围后,哪些能力最容易丢失,训练方法又需要怎样改变。


把Depth Anything砍到6M,深度估计终于能跑进Jetson图3

图 1. 深度可视化对比与精度 - 效率表



小模型真正难在哪里?


我们发现,模型变小后首先暴露出的并不只是网络结构问题,而是数据问题。多源训练数据中,室内、车载、建筑、物体中心图像等分布并不均衡。大模型有足够容量同时吸收这些差异,但对 6M 级模型,高频数据更容易占据有限表示能力,最终让模型 “学偏”。


因此,DepthART 提出抗偏置数据采样(Bias-Resistant Data Sampling,BRDS)。我们从约 4400 万张多源候选图像出发,根据视觉特征空间中的样本密度降低高密度重复样本的采样概率,同时保留稀疏区域,最终得到约 170 万张更均衡的训练数据。随后利用 Depth Anything V2-L 生成的伪深度监督,将相对深度先验蒸馏到 TinyViM + DPT 构成的小模型中。


其核心是在固定训练预算下,把更多训练机会重新分配给不同场景、视角和成像条件。实验表明,对于轻量级基础模型,训练数据如何组织,可能和网络结构本身一样重要。


把Depth Anything砍到6M,深度估计终于能跑进Jetson图4

图 2. 抗偏置数据采样流程与蒸馏学习


第二个问题出现在度量深度。一个已经学会跨场景相对几何的小模型,如果直接在 NYUD 或 KITTI 上进行全量微调,虽然可以提高目标域的度量精度,却很容易覆盖原有的通用几何表示。小模型不仅更容易 “学偏”,也更容易 “忘掉”。


为此,我们设计了相机条件化微调(Camera-conditioned Fine-tuning,CamFT)。DepthART 冻结已经完成蒸馏的编码器,通过轻量相机适配模块引入相机内参,并利用多查询尺度估计头(Multi-query Scale Estimation Head)恢复真实尺度。它遵循一个简单原则:先保护已经学会的几何,再学习尺度。这样,相对深度和度量深度不再是两套割裂的目标,而是先学习可迁移几何,再低成本恢复真实尺度的连续过程。


把Depth Anything砍到6M,深度估计终于能跑进Jetson图5

图 3. 相机条件化微调的流程


6M 参数,真正能做到什么?


DepthART 最初提供 S、B、L 三个规模,参数量分别为 6.0M、11.4M 和 32.6M。仅 6.0M 参数的 DepthART-S 在 NYUD v2 的零样本相对深度评估中达到 δ1=0.964;DepthART-L 在 ETH3D 上达到 δ1=0.958。作为参考,Depth Anything V2-S 约为 24.8M 参数,而 DepthART-S 只有其约四分之一。


把Depth Anything砍到6M,深度估计终于能跑进Jetson图6

表 1. 深度估计性能对比


在论文的 strict FP32 测试中,DepthART-S 在 RTX A6000、224² 输入下约为 347 FPS;后续公开的 TensorRT FP16 版本进一步将 224 输入的 model-only latency 降至 0.918 ms。项目目前同时提供 PyTorch、ONNX、TensorRT 以及 Jetson Orin NX 部署路径。


但 DepthART 的重点并不是单纯追求 FPS,而是:当模型进入几百万参数后,能否仍然同时保留跨数据集泛化、度量适配和真实设备部署能力。大型基础模型仍然定义着性能上限,DepthART 试图推进的,是更靠近端侧区域的 accuracy-efficiency Pareto frontier。


把Depth Anything砍到6M,深度估计终于能跑进Jetson图7

表 2. 深度估计效率对比


轻量级深度估计正在成为独立方向


2026 年 7 月,多条 lightweight /zero-shot monocular depth 路线几乎同时出现。ZipDepth 于 7 月 9 日公开,DepthART 于 7 月 19 日公开;7 月 22 日,Ultralytics 又正式发布 YOLO26-Depth。需要说明的是,YOLO26 基础模型本身更早公开,这里的时间顺序指 YOLO26-Depth 作为官方单目深度任务的发布。


DepthART 与 ZipDepth 几乎同期,并早于 YOLO26-Depth 官方深度任务发布。这种集中出现并非偶然:单目深度的竞争正在从 “把 Foundation Model 做得更大”,逐渐转向 “如何把 Foundation 能力真正带到设备上”。


论文之后,我们为什么又做了一套

 MobileNetV4 DepthART?


把Depth Anything砍到6M,深度估计终于能跑进Jetson图8

图 4. DepthART 两条并行路线


DepthART 最初采用 TinyViM,是因为它在相近参数量下具有较强表示能力,并可通过 CUDA / TensorRT 的 Selective Scan plugin 获得很高效率。但研究模型在 GPU 上快,并不意味着它适合所有硬件。一些较早的移动平台、BPU 和 NPU 更偏好成熟卷积算子和标准计算图。


因此,2026 年 9 月的新版 DepthART 新增了 MobileNetV4-S 和 MobileNetV4-M,并进一步设计 MobileNetV4-M-slim-SPF:裁剪 MobileNetV4-M 编码器,同时额外设计了计算更轻的 Single-Path Pyramid Fusion(SPF)替代 DPT 解码器。标准 MobileNetV4-M DepthART 为 8.55M 参数、8.63 GMAC;slim-SPF 版本降低到约 6.05M 参数、3.78 GMAC。


与此同时,NYUD δ1 仅从 0.953 降至 0.952,KITTI 从 0.931 降至 0.928。也就是说,计算量减少超过一半,而主要深度性能基本保留。更重要的是,MobileNetV4 版本提供仅依赖标准 ONNX 算子的导出,不再依赖 Selective Scan 自定义算子,从而降低了在早期 BPU/NPU 等资源受限平台上的移植门槛。


把Depth Anything砍到6M,深度估计终于能跑进Jetson图9

图 5. DepthART 的方案在 NYUD v2 上的模型推理延时与 Delta1 精度对比


从一个模型走向不同硬件约束下的选择


目前 DepthART 已覆盖 TinyViM-S/B/L、MobileNetV4-S/M 和 MobileNetV4-M-slim-SPF,并提供相对深度、相机感知度量深度、ONNX 与 TensorRT 等不同推理路径。最新版仓库还加入了与 Depth Anything V2-S、ZipDepth、YOLO26-Depth 等近期轻量方法的统一横向比较和真实场景可视化。


把Depth Anything砍到6M,深度估计终于能跑进Jetson图10

图 6:横向可视化对比


我们越来越认为,真正的轻量级深度基础模型不会只有一个 “最佳模型”。服务器 GPU、Jetson、移动 GPU、NPU 和 BPU 对算子的偏好并不相同;一个模型在 NVIDIA GPU 上吞吐极高,也不意味着它就是另一类芯片上的最佳选择。


因此,我们并不试图证明一个 6M 模型可以全面替代大型 Foundation Model。我们更关心的是:当参数、算力和部署条件都受到严格限制时,Foundation Model 已经获得的泛化能力还能保留多少?从 BRDS、CamFT,到后续的 MobileNetV4 与 SPF,DepthART 想做的是重新思考它应该怎样成为真正可部署的轻量级模型。



作者介绍


薛峰,现为意大利特伦托大学计算机科学与工程系博士后,与 Nicu Sebe 教授合作。博士毕业于北京邮电大学,博士导师为明安龙教授。主要研究方向为计算机视觉与多模态学习,关注单目深度估计、高效视觉模型、视觉语言模型及视觉基础模型的轻量化与端侧部署。


把Depth Anything砍到6M,深度估计终于能跑进Jetson图11


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
跨越信任边界:大模型与小模型如何在医疗、金融等私域任务中协作?
8点1氪:耐克将被移出标普100指数;iPhone折叠版定价或14999元起;财政部将发行特别国债,支持8家中央金融企业补充资本
早报 | 杭州官方通报“酒局事件”;宇树科技今日科创板上市;杨国福就擅用他人姓名制作花篮道歉;阿联酋暂停与伊朗一切贸易金融往来
论坛报名丨“翼”启新程—低空经济金融论坛,东北证券主办
X平台打通“看盘即交易”闭环,社交舆论场变身金融交易厅
GPU开始金融化!黄仁勋拉上华尔街搞5000亿美元融资,回应“循环投资”
【“圈”聚四川 “链”动未来】全国首创!四川金融链长制落地,为重点产业链配专属金融“管家”
加速聚变产业!这场产融对接汇聚60余家企业 100余家金融机构
涉水新能源车险理赔新规落地,北京金融法院终审确立“实质定损”原则
深圳前海发布金融赋能低空经济“十二条措施”,设立共保体资金池,推出“入板即贷”融资服务,支持企业“绿色通道”审核挂牌新三板
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号