作者: Muxin Liu, Xiaoyang Lyu, Tianhe Ren, Peng Dai, Xiaoshan Wu, Zhiyue Zhang, Jiaqi Zhang, Jiehong Lin, Shaoshuai Shi, Xiaojuan Qi

单位: The University of Hong Kong, Voyager Research, DiDi Chuxing

会议: ECCV 2026

链接: arXivProjectCode

FoundationGeo-0

研究动机

FoundationGeo 关注的是 relative geometry foundation model 到 metric geometry 之间仍然存在的缺口。MoGe-2 已经说明:先学习高质量 affine-invariant geometry,再通过轻量 metric calibration 恢复绝对尺度,是一条比直接训练 metric model 更稳健的路线。但作者进一步发现,一个全局 scale 并不足以解释真实的 metric error

论文给出两个关键观察:

  1. 当 scale alignment 从整图逐渐缩小到局部 patch 时,AbsRel 持续下降,直到 per-pixel alignment 最好。这说明误差具有明显的 spatially varying scale drift,而不是单一全局尺度偏差。
  2. 即使 scale 已经很好地对齐,point map 仍可能存在 ray-direction bias,即预测点不仅沿 camera ray 前后偏移,还可能在方向上偏离真实射线。

因此 relative-to-metric gap 至少包含两个正交因素:空间变化的尺度误差 + 射线方向误差。FoundationGeo 的核心问题就是:

能否保留强 relative geometry backbone,只学习轻量、可解释的 pixel-wise calibration field,把单目几何提升到更稳定的 metric 3D?

FoundationGeo-1

论文还指出另一类瓶颈来自数据分布。Metric geometry 与 camera intrinsics 强耦合,如果测试相机的 focal length 落在训练分布之外,模型会形成错误的隐式 focal prior,从而产生系统性 metric scale drift。因此作者不仅改模型,也专门研究 camera-model coverage

核心方法

1. 两阶段框架

FoundationGeo 分成两个阶段。

Stage I:Relative Base Model。 使用 DINOv3 初始化的 ViT-Large encoder 和轻量上采样 CNN decoder,预测 affine-invariant point map $\hat{\mathbf P}$ 与 reliability mask。训练采用 10.2M 多域样本,并通过 global alignment、multi-scale local patch、surface normal、edge/detail 等损失强化全局结构与局部细节。

这一阶段刻意不承担绝对 metric scale,而是先把“形状、边界、相对结构”学稳定。

Stage II:Spatial Pixel-Wise Fields。 在 Stage I 的 geometry 上增加两个 calibration field:

  • pixel-wise scale field:修正图像内部不同位置的尺度漂移;
  • ray-direction correction field:修正无法被 scale 吸收的方向偏差。

同时继续保留 relative geometry loss,避免 metric fine-tuning 破坏原有结构先验。

FoundationGeo-2

2. Ray-direction correction field

将每个预测点拆成 range 和 unit ray:

然后在 $\hat{\mathbf r}i$ 的局部 tangent plane 上构造两个正交方向 $\mathbf b{1,i},\mathbf b_{2,i}$。网络只预测两个有界角度扰动:

校正后的方向为:

随后恢复原始 range:

这个设计很重要:ray field 只改变方向,不改变 range,因此不会顺便把 metric scale 吸收进去,职责与 scale field 更容易解耦。

FoundationGeo-12

3. Pixel-wise scale field

在方向校正之后,每个像素预测独立尺度 $\hat s_i$:

metric point regression 使用近处权重更大的 $L_1$:

作者还直接构造 scale-field target。对于方向修正后的 relative point,最小二乘意义下最优的 scalar scale 为:

再在 log-scale 空间进行监督。相比只依赖最终 metric point loss,这种 closed-form target 能更明确地告诉 scale field“你只负责尺度”。

最终目标可写为:

其中论文设置 $\gammas=0.2$、$\gamma_r=0.1$、$\gamma{\Delta}=0.05$。

4. Focal-Length Coverage

作者统计训练集与测试集 focal distribution,发现 NYUv2、KITTI、iBims-1 与训练分布重叠较多,而 DDAD、ETH3D、HAMMER、DIODE 中存在明显欠覆盖的焦段,对应的 metric performance 也更差。

因此他们构建 Blender-based FoundationGeo Dataset,在 7 个室内/室外场景中人工设计 camera trajectories,额外渲染约 23.7K images,专门覆盖训练集中不足的 focal regimes。

这里值得借鉴的是:synthetic data 不是无差别扩数据,而是针对已诊断出的 camera-distribution failure mode 做定向补充。

FoundationGeo-3

数据集

训练:19 个数据集,总计约 10.2M frames,覆盖 indoor、outdoor、driving、synthetic、in-the-wild,GT 来源包括 synthetic rendering、LiDAR、RGB-D sensors 与 SfM reconstruction。

训练数据的构成见 Table 1:它同时记录了数据域、帧数、是否合成以及是否有 metric supervision,说明作者是在控制 supervision 来源的前提下扩大分布覆盖,而不是简单混合所有数据。

FoundationGeo-4

作者还进行数据过滤,移除存在严重 domain mismatch、几何线索弱或标注不可靠的样本。

补充材料中的数据集总览和过滤案例进一步说明了这个数据设计:七个 Blender 场景主要用于补焦距与视角覆盖,过滤阶段则主动移除视角分布或 RGB-depth 对应关系明显不可靠的样本。

FoundationGeo-13

FoundationGeo-14

评测遵循统一的 MoGe protocol:

  • Relative depth:NYUv2、KITTI、ETH3D、iBims-1、Sintel、DDAD、DIODE、HAMMER;
  • Metric depth:除没有可靠 metric scale 的 Sintel 外,其余 7 个 benchmark。

额外的 FoundationGeo Dataset 共约 23.7K rendered images,主要用于补 focal-length distribution,而不是作为大规模通用场景集。

算力

完整训练使用 32 张 NVIDIA H20 GPU

  • Stage I:55K iterations;ViT encoder 初始学习率 $1\times10^{-5}$,decoder 为 $1\times10^{-4}$;
  • Stage II:20K iterations;ViT backbone 学习率 $1\times10^{-6}$,decoder/field heads 为 $1\times10^{-5}$。

Controlled ablation 使用 8× NVIDIA H20 和约 5% stratified training subsets。

因此“轻量”的是 metric calibration module,而不是整个 foundation model 的训练成本。

实验结果

在 7 个 metric benchmark 上,完整 FoundationGeo 的平均结果为:

  • Average AbsRel:14.8
  • Average $\delta_1$:80.8
  • Average Rank:2.32

主结果 Table 2 的重要细节是:metric depth 的平均值来自 7 个 benchmark,而 relative depth 的平均值来自 8 个 benchmark;Sintel 没有可靠 metric scale,所以不参与前者。

FoundationGeo-5

相比论文重点比较的 MoGe-2(15.7 AbsRel / 76.8 $\delta_1$),FoundationGeo 的主要优势不是所有数据集都绝对第一,而是 跨域与跨 camera model 的稳定性更好

Boundary sharpness 也被单独评估。Table 3 显示,Base Model 从 3600 tokens 增加到 6000 tokens 后,三个数据集的边界 F1 与平均排名进一步改善;这部分不是 metric scale 对齐,而是相对几何细节质量的证据。

FoundationGeo-6

Fig. 5 则把这种几何质量放到米级 outdoor driving 与厘米级 indoor 场景中观察:模型不仅要给出数值,还要在不同深度量级下保持 point-map 结构和边界细节。

FoundationGeo-7

几个消融结果更能说明论文观点:

  1. two-stage training 优于直接从头训练 metric geometry:完整数据下从 15.2 / 78.2 改善到 14.8 / 80.8;
  2. spatial fields 优于单一 global calibration,说明局部尺度误差确实存在;
  3. 加入 field-specific supervision 后继续提升,说明 ray 与 scale 的职责解耦有效;
  4. diverse-focal rendered data 优于 fixed-focal augmentation,尤其能改善 intrinsic distribution mismatch 较明显的数据集。

四张消融表分别对应组件、full-data/focal 数据、ray-direction correction 和补充材料中的 Stage-II supervision 配置。Table 4 的完整组合将平均 AbsRel 从 22.4 降到 18.8,平均 $\delta_1$ 从 57.7 提高到 69.7;Table 5 中加入 FoundationGeo rendered data 后,完整配置达到 14.8 / 80.8。

FoundationGeo-8

FoundationGeo-9

FoundationGeo-10

补充 Table 7 还明确区分 synthetic、SfM 与 LiDAR supervision:不同来源并不是都启用同一组 global、patch、normal、metric 和 mask loss,这与作者强调的“按 supervision 可靠性设计训练目标”一致。

FoundationGeo-11

这些实验共同支持一个结论:relative-to-metric gap 不能只靠更大的 backbone 或一个全局 scale 解决,模型参数化与相机数据分布都很关键。

优势与不足

优势

  1. 把 metric error 从“global scale ambiguity”进一步拆成 spatial scale drift 和 ray-direction bias,几何解释更细。
  2. 两个 field 都有明确职责:ray field 保持 range 不变,scale field 使用 closed-form target,避免自由度完全纠缠。
  3. 对 camera distribution 的分析很有价值,证明 focal coverage 是 zero-shot metric generalization 的实际瓶颈之一。
  4. 两阶段方案保留强 relative geometry,再做轻量 metric calibration,方法逻辑清晰。

不足

  1. pixel-wise scale field 自由度很高,单帧 metric accuracy 提升并不自动等价于 multi-view consistency 提升。不同视角独立预测的 field 仍可能产生 3D layer splitting。
  2. camera-model study 目前主要围绕 focal length,principal point、distortion、aspect ratio、sensor size 等因素还没有系统覆盖。
  3. 32× H20 和 10.2M frames 的训练配置成本较高,完整 recipe 不易复现。
  4. targeted synthetic data 能证明 focal intervention 有效,但 7 个 Blender 场景仍不能代表真实相机模型的完整分布。

记忆点

  1. Relative-to-metric 的误差不是一个 global scale,而可能是 spatially varying scale field。
  2. Point-map error 不只沿 ray:scale 对齐后仍可能存在 ray-direction bias。
  3. ray field 保 range、scale field 用 closed-form target,是一种很干净的误差解耦思路。
  4. metric depth 的 zero-shot 泛化和 camera-intrinsic coverage 强相关,数据设计不能只按“场景类别”考虑。
  5. 对下游 3D reconstruction 来说,下一步更值得研究的是:这些单帧 spatial fields 如何在多个视角的共同世界坐标中保持一致,而不只是继续提高单帧 AbsRel。