作者:Feng Xue, Wu Chen, Mingshuai Zhao, Guofeng Zhong, Anlong Ming, Haozhe Wang, Dianqiao Lei, Zhaowen Lin, Haiyang Zhang, Nicu Sebe

单位:University of Trento, Beijing University of Posts and Telecommunications, The Hong Kong University of Science and Technology, Tsinghua University

会议:2026 Arxiv

链接:论文项目页

研究动机

Depth Anything、Metric3D、UniDepth 等几何基础模型已经证明,大规模混合数据可以带来跨场景相对深度和度量尺度泛化。但把骨干缩小到几百万参数后,这些能力往往不能自动保留。

DepthART-0

DepthART 把问题归纳为两个与小容量直接相关的瓶颈:

  1. 数据分布偏置更容易被记住。 大数据集中占比高的常见场景会压过长尾几何,小模型没有足够容量同时吸收所有模式;
  2. 度量微调更容易破坏通用几何。 在 NYUD v2 或 KITTI 上全量微调虽然提高域内指标,却会覆盖蒸馏得到的跨域相对深度,造成灾难性遗忘。

因此论文没有简单地“换一个更小的 backbone”,而是分别从数据和优化两端解决容量问题:Bias-Resistant Data Sampling(BRDS)负责蒸馏前的数据选择,Camera-conditioned Fine-Tuning(CamFT)负责蒸馏后的度量适配。

核心方法

1. BRDS:先改变小模型看到的数据

DepthART-1

作者从 44M 多源图像库出发,先用 VAE 编码视觉特征,再以 Incremental PCA 降维并估计特征空间密度。采样时不按原数据频率随机抽取,而是进行 density-aware stratified sampling,让低密度、长尾模式得到更高曝光,最终形成 1.7M 的 bias-resistant 数据池。

学生网络采用 TinyViM-S/B/L + DPT 解码器,教师为 Depth Anything v2 Large。蒸馏损失由仿射不变深度误差和边缘梯度项组成:

$\mathcal L{\mathrm{MSE}}^{\mathrm{ssi}}$ 在每张图内先对齐预测与教师深度的 scale/shift;$\mathcal L{\mathrm{edge}}$ 约束空间梯度。论文还忽略每张图误差最高的 10% 像素,防止伪标签的少量异常点主导小模型更新。

BRDS 的关键不是“找最典型样本”,而是减少高频模式对固定训练预算的垄断。它与 K-Means core-set 的目标不同:后者更倾向覆盖聚类中心,BRDS 则刻意提高长尾密度层的比例。

2. CamFT:冻结几何主体,只适配相机与尺度

DepthART-2

论文先验证了全量微调的遗忘效应:在 NYUD v2 上,域内 affine-invariant RMSE 从 0.270 改善到 0.234,但在未见过的 iBims-1 上由 0.333 恶化到 0.421。CamFT 的域内结果为 0.237,同时 iBims-1 为 0.354,说明它用少量域内损失换取了更好的跨域几何保留。

DepthART-3

CamFT 包含三个要点:

  1. 冻结蒸馏后的 TinyViM 主干;
  2. Pyramid Camera Prompt:把内参 $K=(f_x,f_y,c_x,c_y)$ 转为逐像素相机射线,再做 Fourier 编码,并在 $1/4,1/8,1/16,1/32$ 四个尺度生成提示;
  3. Camera Adapter + Multi-Query Scale Head:在每个冻结 stage 中用轻量 cross-attention adapter 注入对应尺度的相机提示,最后由多查询尺度头预测度量缩放因子。

可以把最终预测理解为:

其中相对深度主体由蒸馏骨干保持,尺度 $\hat s$ 由相机条件和图像特征共同决定。这样比全量更新所有特征更不容易损伤跨数据集几何。

数据集

Stage 1:相对深度蒸馏

BRDS 从 44M 多源数据中选择 1.7M 样本。数据源覆盖 ImageNet、Objects365、Google Landmarks、BDD100K、Cityscapes、ApolloScape、HRWSI、Holopix50K 等多种室内外和互联网场景;教师为 Depth Anything v2 Large。

Stage 2:度量微调与评测

  • 度量微调:NYUD v2(室内)与 KITTI(室外);
  • 零样本仿射不变评测:NYUD v2、KITTI、ETH3D、DIODE-Full、DDAD;
  • 室内度量迁移:iBims-1、SUN RGB-D、DIODE-Indoor;
  • 室外度量迁移:DDAD、ETH3D-Outdoor、DIODE-Outdoor。

这种设计把“通用相对结构”与“带相机内参的度量尺度”分开评测,能够直接观察微调是否破坏跨域能力。

算力

DepthART 在单张 A800 上训练:

  • Stage 1 蒸馏 40 epochs,batch size 96,Adam,学习率 $10^{-4}$,weight decay 0.01;
  • CamFT 40 epochs,batch size 64,初始学习率 $5\times10^{-5}$;
  • 主精度实验分辨率为 $448\times448$。

桌面端延迟在 RTX A6000、batch size 1、严格 FP32 且关闭 TF32 的条件下测试。设备端还测试了 Jetson Orin NX 8GB 与 Jetson Nano 4GB;Orin NX 表中的 FP32 路径允许 TF32 加速,不能与 A6000 的 strict FP32 数字直接混用。

实验结果

小模型是否保住了零样本深度

DepthART-S 只有 6.0M 参数,在 $448^2$ 下达到:

  • NYUD v2:AbsRel 0.059,$\delta_1$ 0.964;
  • KITTI:AbsRel 0.082,$\delta_1$ 0.930;
  • ETH3D:AbsRel 0.084,$\delta_1$ 0.950;
  • DIODE-Full:AbsRel 0.214,$\delta_1$ 0.745。

DepthART-L 为 32.6M 参数,在 NYUD v2 和 ETH3D 上分别达到 $\delta_1=0.971$ 和 0.958。它仍不全面超过 Metric3D v2-L 等 400M 级模型,但在参数、延迟和跨域精度之间形成了更适合端侧部署的折中。

BRDS 是否比随机采样更有效

在相同 1.7M 蒸馏预算下,随机采样在 NYUD v2/KITTI 上得到 $\delta_1=0.957/0.905$;K-Means 为 0.958/0.923;BRDS 为 0.964/0.930。尤其 KITTI 上,BRDS 的 AbsRel 为 0.082,而随机采样为 0.104。

当预算只有 0.5M 时,BRDS 在部分指标上略落后于 K-Means,说明长尾数据更丰富并不代表极小训练预算下一定更容易拟合。数据达到 1.0M–1.7M 后,BRDS 的优势才更稳定。

CamFT 是否真正缓解遗忘

NYUD v2 微调后,在 iBims-1 上:

  • 全量微调:$\delta_1=0.572$,RMSE 0.844;
  • 不冻结但加入 CamAdapter + MQSH:$\delta_1=0.613$,RMSE 0.779;
  • 冻结主干并使用完整 CamFT:$\delta_1=0.713$,RMSE 0.693。

去掉 Camera Adapter 或 Multi-Query Scale Head 都会明显降低跨域结果;把 adapter 放在编码器侧、使用 cross-attention 融合,是消融中最好的组合。

DepthART-4

定性结果显示,DepthART 在细杆、窗框、家具边界和房间整体布局上比早期轻量模型更完整。度量微调后直接投影的点云没有做后处理 scale/shift 对齐,因此这些三维差异确实反映了尺度与结构预测,而不是可视化时重新配准。

效率与端侧部署

DepthART-5

RTX A6000 上,DepthART-S/B/L 在 $224^2$ 下分别达到 347/298/191 FPS,在 $448^2$ 下达到 245/204/124 FPS。DepthART-S 在 Orin NX 上以 FP32(启用 TF32)达到 $224^2$ 102 FPS、$448^2$ 34 FPS;在 Jetson Nano 4GB 上,$224^2$ strict FP32 仍超过 15 FPS。

这些数字证明模型具备端侧可用性,但不同硬件、分辨率、TF32/TensorRT 设置差异很大,比较时必须保留协议。

优势与不足

优势

  1. 把小模型问题拆成数据偏置和微调遗忘。 两个模块分别有独立消融,不是笼统地归因于“模型容量不足”。
  2. BRDS 不增加训练样本预算。 收益来自重新分配 1.7M 样本,而不是单纯扩大数据量。
  3. CamFT 的目标明确。 冻结相对几何,只让相机条件和尺度头适应度量任务。
  4. 部署证据充分。 A6000、Orin NX 和 Nano 覆盖了桌面到低功耗设备,并区分了模型延迟与端到端延迟。

不足

  1. CamFT 仍沿用 Depth Anything 式的小规模 NYUD v2/KITTI 微调;尚未进行 Metric3D/UniDepth 级别的大规模度量训练。
  2. 模型假设相机内参已知。缺失或错误内参会直接影响 camera prompt 和尺度预测。
  3. BRDS 依赖 VAE 特征和密度估计;采样空间是否真正对应几何长尾,仍受所选表征限制。
  4. 教师伪标签的系统性偏差会被学生继承,忽略最高误差 10% 只能抑制局部异常,不能消除教师偏差。

记忆点

  1. 小模型不是只需要更少的数据,而是需要偏置更小的数据。
  2. 先蒸馏通用相对几何,再冻结主体做相机条件尺度适配。
  3. 多尺度 backbone 应匹配多尺度 camera prompt。 浅层处理局部结构,深层处理全局尺度。
  4. 端侧论文必须保留精度、分辨率、数值精度和硬件协议,单独写 FPS 很容易误导。