StereoGS: Sparse-View 3D Gaussian Splatting via Stereo Priors
作者: Wenhao Yuan, Yiyuan Ge, Deli Cai
单位: South China University of Technology
会议: ECCV 2026

研究动机
Sparse-view 3DGS 的根本困难不是 renderer 不够强,而是 几何约束太弱。只有少量训练视角时,很多错误的 Gaussian geometry 仍然可以很好地拟合训练 RGB,因此优化很容易出现 overfitting、floaters、错误表面和 novel-view artifacts。
已有方法常用 monocular depth prior 缓解这个问题,但 StereoGS 认为 MDE 在这里有两个天然缺陷:
- scale ambiguity:单目 depth 的尺度与 3DGS 世界坐标不天然一致;
- cross-view inconsistency:每个视角独立推理,同一真实 3D point 在不同图像中的 depth 可能不一致。
即使先用 MVS 获得一个更好的 initialization,也不意味着后续 3DGS optimization 会一直保持正确几何。只靠 RGB loss,初始好结构仍可能逐渐漂移。
StereoGS 因此采取了一个很直接的策略:
不再用单目 depth 做主要几何监督,而是在 3DGS 训练过程中主动构造 virtual stereo pair,调用 foundation stereo model 得到带 absolute-scale triangulation 约束的 stereo depth,持续监督当前 Gaussian geometry。
此外,作者认为 sparse-view 3DGS 的另一个问题是冗余 Gaussian 很容易“钻空子”拟合有限训练视角,因此又设计了 gradient-aware opacity decay,根据 Gaussian 在优化中的实际重要性动态清理 primitives。
核心方法
StereoGS 由三个部分组成:
- Consistency-Aware Dense Initialization:用 zero-shot MVS 获得更可靠的初始点云;
- Stereo Depth Regularization:训练过程中构造 virtual binocular pair,持续提供 metric/cross-view geometry constraint;
- Gradient-Aware Opacity Decay:根据 opacity gradient 自适应清理冗余 Gaussian。
1. Consistency-Aware Dense Initialization
Vanilla 3DGS 通常使用 SfM sparse points 初始化。在 sparse-view 设置下,这些 points 往往过稀,弱纹理区域甚至没有足够初始化点。
StereoGS 使用预训练 MVSAnywhere:对每一个 training view,将其作为 target、其余图像作为 source,预测 multi-view depth;随后通过 cross-view reprojection error 做 geometric filtering,过滤不一致 depth,再把各视角 depth back-project 并融合成 dense point cloud。
这里作者并没有发明新的 MVS,而是强调两个原则:
- initialization 应尽可能 dense;
- depth 必须先通过 multi-view geometric consistency filtering,再进入 3DGS。
补充实验显示,MVSAnywhere initialization 优于 SfM、PDCNet+ 和 MVSFormer variants,说明在 sparse-view 3DGS 中,initial point distribution 本身就是非常强的性能因素。
补充 Table 6 将不同初始化方案的结果放在一起比较,结论不是单纯“点越多越好”,而是经过 multi-view consistency filtering 后,点云的空间分布更适合后续 Gaussian optimization。

Fig. 8 的 RGB、depth 和 point-cloud 可视化进一步说明:MVSAnywhere 在弱纹理和遮挡附近保留了更多可用结构,而未经筛选的初始化更容易把错误深度带进 3DGS。

补充 Fig. 14 还展示了不同初始化点云的定性差异;它强化了一个实践判断:初始化阶段的几何覆盖会决定后续优化能否“有东西可修”。

2. Stereo Camera Pair Construction
对一个真实 training view,StereoGS 把它作为 left camera,并沿水平方向平移得到一个 virtual right camera。
- Left image:真实 GT image $I_l$;
- Right image:当前 3D Gaussians 从虚拟右相机渲染出的 $\hat I_r$。
然后将 $(I_l,\hat I_r)$ 输入 FoundationStereo,预测 left disparity:
这里特意让 left image 使用真实图,而不是 renderer 输出。因为 stereo prediction 将作为 pseudo-GT,如果左右两张图都来自当前不稳定的 3DGS,geometry error 和 rendering artifacts 会一起污染外部 prior。
3. Validity Mask:不是所有 stereo prediction 都能监督
Foundation stereo model 仍然会在 occlusion、textureless region、异常 disparity 和背景区域失败。因此 StereoGS 不会全图无条件使用 stereo depth,而是构造:
其中:
- $M_{occ}$:left-right disparity consistency 检查得到的遮挡/错误匹配区域;
- $M_{bg}$:背景区域;
- $M_{anomaly}$:非正 disparity、Inf、NaN 等异常值。
补充材料的消融很关键:去掉 validity mask 后,LLFF 3-view 从 21.91 PSNR 降到 21.30,DTU 从 21.46 降到 20.82,同时复杂边界区域会出现明显 floaters。
因此这篇论文真正可复用的不是“用了 FoundationStereo”,而是:foundation prior 必须带 reliability gating,不能直接把所有输出当 GT。

Fig. 10 给出了 validity mask 的具体作用:遮挡、背景和异常 disparity 被排除后,stereo depth 才进入几何监督;否则边界附近的错误匹配会直接变成错误的 Gaussian 更新方向。
4. Stereo Depth Regularization
由标准 stereo triangulation:
其中 $f$ 是 focal length,$d$ 是虚拟双目 baseline。
当前 3DGS 也可以渲染 left-view depth $\hat Z$。作者在 inverse-depth space 中监督:
Inverse depth 会强化 near-field geometry,同时数值上更稳定。
与 monocular depth regularization 最大的差别是:这个 pseudo depth 的尺度来自明确的 focal length + virtual baseline + disparity,不是对每帧 MDE 再做一次 scale-shift alignment;同时 stereo matching 本身建立了 binocular correspondence。
5. Gradient-Aware Opacity Decay
标准 3DGS 会周期性 reset opacity,Sparse-view 场景中这种统一处理可能把有效 surface Gaussian 和浮点一起打压。StereoGS 改成依据每个 Gaussian 的 opacity gradient 决定衰减强弱。
定义:
但绝对 gradient 很小,通常在 $10^{-6}$ 量级,所以进一步做 relative normalization:
动态 decay factor 为:
并更新:
直觉是:
- gradient 小:当前 Gaussian 对降低 loss 不重要,更像冗余 primitive,衰减更强;
- gradient 大:优化仍需要它,保留更多 opacity。
默认 $\gamma_{base}=0.99,s=0.5$。论文对 constant、step、linear、raw-gradient exponential 等策略做了消融,relative-gradient exponential 最好。
补充 Table 9 与 Fig. 11 量化并可视化了 opacity decay 策略:relative-gradient exponential 在保持重要 surface Gaussians 的同时,能更有效压低冗余 primitives。


Fig. 12、Fig. 13 和 Table 10 分别比较了不同 opacity function 与 gradient 归一化策略;这说明方法的收益来自“按相对重要性衰减”,而不是任意加入一个 opacity reset。



Table 11 对 virtual-camera 设定做了补充分析,默认 virtual baseline $d=4.0$ 是效果与稳定性之间的折中;baseline 过小会削弱视差,过大则更容易放大遮挡与匹配错误。

6. 总体优化
最终仍保持 3DGS 的 photometric objective,并加入 stereo depth:
所有额外模块都只发生在 training/optimization 阶段,最终部署仍是普通 3DGS representation,因此 inference 没有额外 network overhead。
数据集
论文在四类 sparse-view benchmark 上评测:
- LLFF:3 / 6 / 9 views;
- DTU:3 / 6 / 9 views;
- Mip-NeRF360:12 / 24 views;
- Blender:8 views。
评价主要使用 PSNR、SSIM、LPIPS,并同时可视化 RGB 与 rendered depth,检查 novel-view appearance 与 geometry 是否一致改善。
算力
所有实验使用 单张 NVIDIA RTX 4090。
训练设置:
- LLFF / DTU / Mip-NeRF360:30K iterations,在 20K iteration 开启 Stereo Depth Regularization;
- Blender:7K iterations,在 4K 开启 stereo regularization;
- Gaussian densification 从 1K iteration 开始,每 100 iterations 执行一次。
补充材料给出平均训练开销:
- Vanilla 3DGS:LLFF 3-view 约 4.3 min;DTU 约 3.9 min;
- StereoGS:LLFF 约 43.2 min;DTU 约 34.6 min。
Peak VRAM 分别约 3.6 GB 和 2.5 GB,但额外 FoundationStereo inference 让训练时间显著增加。
补充 Table 12 同时报告了训练开销与 Gaussian 数量变化,说明减少冗余 primitives 能部分抵消 stereo inference 带来的表示与优化负担,但无法消除额外的训练时间。

因此“无额外 inference overhead”是成立的,但不能理解为“训练没有额外成本”。
实验结果
1. 主结果
LLFF:
- 3 views:21.91 PSNR / 0.773 SSIM / 0.157 LPIPS;
- 6 views:24.92 / 0.853 / 0.104;
- 9 views:26.25 / 0.879 / 0.087。
Table 1 展示了 LLFF 的完整 3/6/9-view 对比:StereoGS 的优势在 3-view 最明显,且随着输入视角增加仍保持稳定领先。

Fig. 2 把这一结果拆到 fern 与 trex 的 RGB/depth 可视化中:只用 3 个输入视角时,普通 3DGS 的纹理和深度都更容易出现空洞与漂浮点,而 StereoGS 的几何更完整。

DTU:
- 3 views:21.46 / 0.879 / 0.099;
- 6 views:24.86 / 0.926 / 0.064;
- 9 views:26.83 / 0.955 / 0.049。
Table 2 与 Fig. 3 表明,DTU 的结论与 LLFF 一致:StereoGS 在 3-view 的困难设置下仍能同时改善 PSNR、SSIM 和 LPIPS,并减少无纹理区域的结构破碎。


Mip-NeRF360 的 12/24-view PSNR 为 20.25 / 24.18;Blender 8-view 标准 variant 为 24.83 PSNR,带论文所用 dropout variant 可到 25.04。
Table 3 和 Fig. 4 进一步覆盖 Mip-NeRF360 的 12/24-view 设置;在 bicycle、stump 等大范围场景中,stereo regularization 对纹理稀疏区域和细小结构都更有帮助。


Table 4 与 Fig. 5 则给出 Blender 的 8-view 数值和 drums/materials 可视化,说明该方法并不只对真实户外数据有效。


整体结果说明 stereo prior 对 view 极稀疏时尤其有效。
2. 三个模块分别贡献什么?
LLFF 3-view 的 component ablation:
- Baseline:16.02 PSNR;
- Dense Init:19.75;
- Dense Init + Opacity Decay:21.18;
- Full:21.91。
DTU 3-view:
- Baseline:10.99;
- Dense Init:14.10;
- Dense Init + Opacity Decay:19.76;
- Full:21.46。
一个值得注意的结论是:最强的单项收益并不一定来自 stereo depth loss,而是来自更可靠的 dense initialization 和更合适的 Gaussian pruning。 Stereo regularization 是在好的 optimization state 上进一步修 geometry。
补充 Table 5 和 Fig. 6 将 LLFF、DTU 的模块组合与几何/渲染结果并列展示:dense initialization 先补足表示,opacity decay 再减少冗余,stereo regularization 最后继续校正跨视角 geometry。


3. Stereo model 是否必须是 FoundationStereo?
作者替换 LiteAnyStereo、S2M2 后仍然比不使用 stereo depth regularization 更好,说明机制不是完全绑定某一个模型;FoundationStereo 的效果最好。
补充 Table 7、Table 8 和 Fig. 9 比较了不同 stereo foundation models 及其 valid-pixel 情况:模型替换不会破坏 virtual-stereo 机制,但 stereo 预测的可用覆盖率和匹配质量会直接影响最终上限。



这支持“virtual stereo supervision”本身具有通用性,但也说明最终性能上限仍依赖外部 stereo model 的 zero-shot robustness。
优势与不足
优势
- 相比对 monocular depth 做逐帧 scale alignment,stereo prior 从几何上直接提供 absolute-scale binocular constraint。
- 不是只在初始化阶段用 MVS,而是在 optimization 中持续进行 geometry regularization,避免初始好结构被 RGB loss 逐渐拉坏。
- validity mask 明确承认 foundation stereo 并非处处可信,先过滤再监督,工程逻辑合理。
- Gradient-Aware Opacity Decay 从 optimization signal 而非固定规则判断 Gaussian 重要性,且最终减少 Gaussian 数量。
不足
- Stereo Depth Regularization 依赖当前 3DGS 渲染出的 virtual right image,因此是一个 prior 与当前 reconstruction 相互耦合 的闭环。训练早期右图较差时,stereo prior 也可能受影响。
- Stereo model 在 large textureless region、reflective surface、occlusion 等场景仍会失败,论文也将这些作为 failure cases。

Fig. 7 的失败案例提醒我们:即使有 validity mask,foundation stereo 也不是几何真值生成器,反光、低纹理和遮挡区域仍需要更谨慎的置信度建模。
- 训练时间从几分钟增加到几十分钟,虽然 inference 不变,但 optimization cost 并不轻。
- 方法依赖已知 camera calibration,并通过人为 virtual baseline 构造 stereo pair;当 pose/intrinsic 本身有误差时,几何监督质量会直接下降。
记忆点
- Sparse-view 3DGS 中,单目 depth 的核心问题不只是单帧精度,而是 scale + cross-view inconsistency。
- “好初始化”不够,RGB optimization 仍会破坏 geometry,因此需要持续的 cross-view geometric regularization。
- Foundation prior 进入 3DGS 时不能全图强监督,必须显式设计 validity/confidence mask。
- 虚拟相机可以把单视角 training image 转成可用的 stereo geometry constraint,这是很简单但有效的思路。
- 对 MDE 下游研究的启发是:StereoGS 某种程度上选择了绕开 MDE 的多视角不一致,而不是修正它;如果希望继续从 MDE 角度做工作,关键问题反而是 如何让单目先验自己获得类似 stereo 的 cross-view geometric identifiability。











