作者: Wenhao Yuan, Yiyuan Ge, Deli Cai

单位: South China University of Technology

会议: ECCV 2026

链接: arXivProjectCode

StereoGS-0

研究动机

Sparse-view 3DGS 的根本困难不是 renderer 不够强,而是 几何约束太弱。只有少量训练视角时,很多错误的 Gaussian geometry 仍然可以很好地拟合训练 RGB,因此优化很容易出现 overfitting、floaters、错误表面和 novel-view artifacts。

已有方法常用 monocular depth prior 缓解这个问题,但 StereoGS 认为 MDE 在这里有两个天然缺陷:

  1. scale ambiguity:单目 depth 的尺度与 3DGS 世界坐标不天然一致;
  2. cross-view inconsistency:每个视角独立推理,同一真实 3D point 在不同图像中的 depth 可能不一致。

即使先用 MVS 获得一个更好的 initialization,也不意味着后续 3DGS optimization 会一直保持正确几何。只靠 RGB loss,初始好结构仍可能逐渐漂移。

StereoGS 因此采取了一个很直接的策略:

不再用单目 depth 做主要几何监督,而是在 3DGS 训练过程中主动构造 virtual stereo pair,调用 foundation stereo model 得到带 absolute-scale triangulation 约束的 stereo depth,持续监督当前 Gaussian geometry。

此外,作者认为 sparse-view 3DGS 的另一个问题是冗余 Gaussian 很容易“钻空子”拟合有限训练视角,因此又设计了 gradient-aware opacity decay,根据 Gaussian 在优化中的实际重要性动态清理 primitives。

核心方法

StereoGS 由三个部分组成:

  1. Consistency-Aware Dense Initialization:用 zero-shot MVS 获得更可靠的初始点云;
  2. Stereo Depth Regularization:训练过程中构造 virtual binocular pair,持续提供 metric/cross-view geometry constraint;
  3. Gradient-Aware Opacity Decay:根据 opacity gradient 自适应清理冗余 Gaussian。

1. Consistency-Aware Dense Initialization

Vanilla 3DGS 通常使用 SfM sparse points 初始化。在 sparse-view 设置下,这些 points 往往过稀,弱纹理区域甚至没有足够初始化点。

StereoGS 使用预训练 MVSAnywhere:对每一个 training view,将其作为 target、其余图像作为 source,预测 multi-view depth;随后通过 cross-view reprojection error 做 geometric filtering,过滤不一致 depth,再把各视角 depth back-project 并融合成 dense point cloud。

这里作者并没有发明新的 MVS,而是强调两个原则:

  • initialization 应尽可能 dense;
  • depth 必须先通过 multi-view geometric consistency filtering,再进入 3DGS。

补充实验显示,MVSAnywhere initialization 优于 SfM、PDCNet+ 和 MVSFormer variants,说明在 sparse-view 3DGS 中,initial point distribution 本身就是非常强的性能因素

补充 Table 6 将不同初始化方案的结果放在一起比较,结论不是单纯“点越多越好”,而是经过 multi-view consistency filtering 后,点云的空间分布更适合后续 Gaussian optimization。

StereoGS-12

Fig. 8 的 RGB、depth 和 point-cloud 可视化进一步说明:MVSAnywhere 在弱纹理和遮挡附近保留了更多可用结构,而未经筛选的初始化更容易把错误深度带进 3DGS。

StereoGS-13

补充 Fig. 14 还展示了不同初始化点云的定性差异;它强化了一个实践判断:初始化阶段的几何覆盖会决定后续优化能否“有东西可修”。

StereoGS-24

2. Stereo Camera Pair Construction

对一个真实 training view,StereoGS 把它作为 left camera,并沿水平方向平移得到一个 virtual right camera。

  • Left image:真实 GT image $I_l$;
  • Right image:当前 3D Gaussians 从虚拟右相机渲染出的 $\hat I_r$。

然后将 $(I_l,\hat I_r)$ 输入 FoundationStereo,预测 left disparity:

这里特意让 left image 使用真实图,而不是 renderer 输出。因为 stereo prediction 将作为 pseudo-GT,如果左右两张图都来自当前不稳定的 3DGS,geometry error 和 rendering artifacts 会一起污染外部 prior。

3. Validity Mask:不是所有 stereo prediction 都能监督

Foundation stereo model 仍然会在 occlusion、textureless region、异常 disparity 和背景区域失败。因此 StereoGS 不会全图无条件使用 stereo depth,而是构造:

其中:

  • $M_{occ}$:left-right disparity consistency 检查得到的遮挡/错误匹配区域;
  • $M_{bg}$:背景区域;
  • $M_{anomaly}$:非正 disparity、Inf、NaN 等异常值。

补充材料的消融很关键:去掉 validity mask 后,LLFF 3-view 从 21.91 PSNR 降到 21.30,DTU 从 21.46 降到 20.82,同时复杂边界区域会出现明显 floaters。

因此这篇论文真正可复用的不是“用了 FoundationStereo”,而是:foundation prior 必须带 reliability gating,不能直接把所有输出当 GT。

StereoGS-17

Fig. 10 给出了 validity mask 的具体作用:遮挡、背景和异常 disparity 被排除后,stereo depth 才进入几何监督;否则边界附近的错误匹配会直接变成错误的 Gaussian 更新方向。

4. Stereo Depth Regularization

由标准 stereo triangulation:

其中 $f$ 是 focal length,$d$ 是虚拟双目 baseline。

当前 3DGS 也可以渲染 left-view depth $\hat Z$。作者在 inverse-depth space 中监督:

Inverse depth 会强化 near-field geometry,同时数值上更稳定。

与 monocular depth regularization 最大的差别是:这个 pseudo depth 的尺度来自明确的 focal length + virtual baseline + disparity,不是对每帧 MDE 再做一次 scale-shift alignment;同时 stereo matching 本身建立了 binocular correspondence。

5. Gradient-Aware Opacity Decay

标准 3DGS 会周期性 reset opacity,Sparse-view 场景中这种统一处理可能把有效 surface Gaussian 和浮点一起打压。StereoGS 改成依据每个 Gaussian 的 opacity gradient 决定衰减强弱。

定义:

但绝对 gradient 很小,通常在 $10^{-6}$ 量级,所以进一步做 relative normalization:

动态 decay factor 为:

并更新:

直觉是:

  • gradient 小:当前 Gaussian 对降低 loss 不重要,更像冗余 primitive,衰减更强;
  • gradient 大:优化仍需要它,保留更多 opacity。

默认 $\gamma_{base}=0.99,s=0.5$。论文对 constant、step、linear、raw-gradient exponential 等策略做了消融,relative-gradient exponential 最好。

补充 Table 9 与 Fig. 11 量化并可视化了 opacity decay 策略:relative-gradient exponential 在保持重要 surface Gaussians 的同时,能更有效压低冗余 primitives。

StereoGS-18

StereoGS-19

Fig. 12、Fig. 13 和 Table 10 分别比较了不同 opacity function 与 gradient 归一化策略;这说明方法的收益来自“按相对重要性衰减”,而不是任意加入一个 opacity reset。

StereoGS-20

StereoGS-21

StereoGS-22

Table 11 对 virtual-camera 设定做了补充分析,默认 virtual baseline $d=4.0$ 是效果与稳定性之间的折中;baseline 过小会削弱视差,过大则更容易放大遮挡与匹配错误。

StereoGS-23

6. 总体优化

最终仍保持 3DGS 的 photometric objective,并加入 stereo depth:

所有额外模块都只发生在 training/optimization 阶段,最终部署仍是普通 3DGS representation,因此 inference 没有额外 network overhead。

数据集

论文在四类 sparse-view benchmark 上评测:

  • LLFF:3 / 6 / 9 views;
  • DTU:3 / 6 / 9 views;
  • Mip-NeRF360:12 / 24 views;
  • Blender:8 views。

评价主要使用 PSNR、SSIM、LPIPS,并同时可视化 RGB 与 rendered depth,检查 novel-view appearance 与 geometry 是否一致改善。

算力

所有实验使用 单张 NVIDIA RTX 4090

训练设置:

  • LLFF / DTU / Mip-NeRF360:30K iterations,在 20K iteration 开启 Stereo Depth Regularization;
  • Blender:7K iterations,在 4K 开启 stereo regularization;
  • Gaussian densification 从 1K iteration 开始,每 100 iterations 执行一次。

补充材料给出平均训练开销:

  • Vanilla 3DGS:LLFF 3-view 约 4.3 min;DTU 约 3.9 min;
  • StereoGS:LLFF 约 43.2 min;DTU 约 34.6 min

Peak VRAM 分别约 3.6 GB 和 2.5 GB,但额外 FoundationStereo inference 让训练时间显著增加。

补充 Table 12 同时报告了训练开销与 Gaussian 数量变化,说明减少冗余 primitives 能部分抵消 stereo inference 带来的表示与优化负担,但无法消除额外的训练时间。

StereoGS-25

因此“无额外 inference overhead”是成立的,但不能理解为“训练没有额外成本”。

实验结果

1. 主结果

LLFF:

  • 3 views:21.91 PSNR / 0.773 SSIM / 0.157 LPIPS
  • 6 views:24.92 / 0.853 / 0.104;
  • 9 views:26.25 / 0.879 / 0.087。

Table 1 展示了 LLFF 的完整 3/6/9-view 对比:StereoGS 的优势在 3-view 最明显,且随着输入视角增加仍保持稳定领先。

StereoGS-1

Fig. 2 把这一结果拆到 fern 与 trex 的 RGB/depth 可视化中:只用 3 个输入视角时,普通 3DGS 的纹理和深度都更容易出现空洞与漂浮点,而 StereoGS 的几何更完整。

StereoGS-2

DTU:

  • 3 views:21.46 / 0.879 / 0.099
  • 6 views:24.86 / 0.926 / 0.064;
  • 9 views:26.83 / 0.955 / 0.049。

Table 2 与 Fig. 3 表明,DTU 的结论与 LLFF 一致:StereoGS 在 3-view 的困难设置下仍能同时改善 PSNR、SSIM 和 LPIPS,并减少无纹理区域的结构破碎。

StereoGS-3

StereoGS-4

Mip-NeRF360 的 12/24-view PSNR 为 20.25 / 24.18;Blender 8-view 标准 variant 为 24.83 PSNR,带论文所用 dropout variant 可到 25.04。

Table 3 和 Fig. 4 进一步覆盖 Mip-NeRF360 的 12/24-view 设置;在 bicycle、stump 等大范围场景中,stereo regularization 对纹理稀疏区域和细小结构都更有帮助。

StereoGS-5

StereoGS-6

Table 4 与 Fig. 5 则给出 Blender 的 8-view 数值和 drums/materials 可视化,说明该方法并不只对真实户外数据有效。

StereoGS-7

StereoGS-8

整体结果说明 stereo prior 对 view 极稀疏时尤其有效。

2. 三个模块分别贡献什么?

LLFF 3-view 的 component ablation:

  • Baseline:16.02 PSNR;
    • Dense Init:19.75;
    • Dense Init + Opacity Decay:21.18;
  • Full:21.91

DTU 3-view:

  • Baseline:10.99;
    • Dense Init:14.10;
    • Dense Init + Opacity Decay:19.76;
  • Full:21.46

一个值得注意的结论是:最强的单项收益并不一定来自 stereo depth loss,而是来自更可靠的 dense initialization 和更合适的 Gaussian pruning。 Stereo regularization 是在好的 optimization state 上进一步修 geometry。

补充 Table 5 和 Fig. 6 将 LLFF、DTU 的模块组合与几何/渲染结果并列展示:dense initialization 先补足表示,opacity decay 再减少冗余,stereo regularization 最后继续校正跨视角 geometry。

StereoGS-9

StereoGS-10

3. Stereo model 是否必须是 FoundationStereo?

作者替换 LiteAnyStereo、S2M2 后仍然比不使用 stereo depth regularization 更好,说明机制不是完全绑定某一个模型;FoundationStereo 的效果最好。

补充 Table 7、Table 8 和 Fig. 9 比较了不同 stereo foundation models 及其 valid-pixel 情况:模型替换不会破坏 virtual-stereo 机制,但 stereo 预测的可用覆盖率和匹配质量会直接影响最终上限。

StereoGS-14

StereoGS-15

StereoGS-16

这支持“virtual stereo supervision”本身具有通用性,但也说明最终性能上限仍依赖外部 stereo model 的 zero-shot robustness。

优势与不足

优势

  1. 相比对 monocular depth 做逐帧 scale alignment,stereo prior 从几何上直接提供 absolute-scale binocular constraint。
  2. 不是只在初始化阶段用 MVS,而是在 optimization 中持续进行 geometry regularization,避免初始好结构被 RGB loss 逐渐拉坏。
  3. validity mask 明确承认 foundation stereo 并非处处可信,先过滤再监督,工程逻辑合理。
  4. Gradient-Aware Opacity Decay 从 optimization signal 而非固定规则判断 Gaussian 重要性,且最终减少 Gaussian 数量。

不足

  1. Stereo Depth Regularization 依赖当前 3DGS 渲染出的 virtual right image,因此是一个 prior 与当前 reconstruction 相互耦合 的闭环。训练早期右图较差时,stereo prior 也可能受影响。
  2. Stereo model 在 large textureless region、reflective surface、occlusion 等场景仍会失败,论文也将这些作为 failure cases。

StereoGS-11

Fig. 7 的失败案例提醒我们:即使有 validity mask,foundation stereo 也不是几何真值生成器,反光、低纹理和遮挡区域仍需要更谨慎的置信度建模。

  1. 训练时间从几分钟增加到几十分钟,虽然 inference 不变,但 optimization cost 并不轻。
  2. 方法依赖已知 camera calibration,并通过人为 virtual baseline 构造 stereo pair;当 pose/intrinsic 本身有误差时,几何监督质量会直接下降。

记忆点

  1. Sparse-view 3DGS 中,单目 depth 的核心问题不只是单帧精度,而是 scale + cross-view inconsistency。
  2. “好初始化”不够,RGB optimization 仍会破坏 geometry,因此需要持续的 cross-view geometric regularization。
  3. Foundation prior 进入 3DGS 时不能全图强监督,必须显式设计 validity/confidence mask。
  4. 虚拟相机可以把单视角 training image 转成可用的 stereo geometry constraint,这是很简单但有效的思路。
  5. 对 MDE 下游研究的启发是:StereoGS 某种程度上选择了绕开 MDE 的多视角不一致,而不是修正它;如果希望继续从 MDE 角度做工作,关键问题反而是 如何让单目先验自己获得类似 stereo 的 cross-view geometric identifiability