MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors
作者:Yufei Cai, Xuesong Niu, Hao Lu, Kun Gai, Kai Wu, Guosheng Lin
单位:Nanyang Technological University, Kolors Team at Kuaishou Technology, The Hong Kong University of Science and Technology (Guangzhou)
会议:ECCV 2026
研究动机
单张图像的新视角合成同时面对两个互相牵制的目标:一方面,输出必须遵守相机运动和场景几何;另一方面,当视角变化很大、目标视图出现源图不可见区域时,模型又必须依靠生成先验补全内容。

已有扩散式方法大致分为两类。显式几何路线先重建点云或网格,再把重投影结果交给扩散模型补洞;它的局部对应关系较可靠,但错误深度、稀疏重建和遮挡会被直接传入生成阶段。纯隐式路线只给生成模型相机位姿,保留了强大的开放域生成能力,却容易出现“相机走了、场景尺度也跟着漂移”的问题。

MetaView 的问题意识可以概括为:
能否不构建一条刚性的显式重建流水线,只向预训练扩散模型注入最少但必要的三维线索,同时获得大视角变化下的几何一致性、尺度稳定性和开放域泛化?
论文的答案是“隐式几何为主、度量尺度为锚”:用前馈几何网络提供可学习的几何特征,用度量深度约束空间尺度,但不执行深度提升、点云重投影或显式遮挡填充。
核心方法

1. 在冻结的 MM-DiT 中增加几何流
MetaView 以 Qwen-Image-Edit 的 MM-DiT 为生成骨干。源图像 token、待生成图像 token 和文本 token 仍沿用预训练模型的主路径;DepthAnything3-Giant 提取的几何特征则进入新增的 geometry stream。
新增的 Image–Geometry Attention 为图像和几何 token 使用各自的 $Q/K/V/O$ 投影,而 FFN 与原模型共享。训练时冻结预训练骨干,只优化新增投影与几何映射层。这样做的目的不是让几何网络直接“画出”目标视图,而是让生成 token 在每层注意力中都能查询相对结构信息,同时尽量保留大规模图像预训练获得的语义和纹理先验。
2. 用度量深度补上空间尺度
仅把相机内外参写入二维位置编码,仍无法消除单目场景的尺度歧义。MetaView 使用 DepthAnything3-Metric 估计源图的度量深度 $z$,并在空间感知 RoPE 中为深度增加独立的 $z$ 轴子空间。源图 token 和几何 token 使用源相机位姿及下采样深度 $z’$;目标生成 token 使用相对目标位姿,但把未知的目标深度分量设为 0。
可以把这个机制理解为:相机位姿规定“从哪里看”,源图度量深度规定“场景大约有多大”,几何 token 则补充“哪些结构应当彼此对应”。它没有把深度硬变换成目标图,因此比重投影管线更灵活;但尺度锚又限制了纯隐式生成常见的几何漂移。
3. 用流匹配目标训练新增参数
模型沿用基座的 flow-matching 训练目标。对噪声插值状态 $X_t$,新增模块学习预测目标速度场:
其中 $X^{\mathrm{src}}$ 是源图 token,$G$ 是几何 token,$K,T,z$ 分别表示相机内参、相对位姿和尺度深度。论文固定文本提示为 “Turn to the target view”,推理使用 40 个采样步和 CFG 4。
4. 用 DMD 衡量大视角下的空间对齐
PSNR、SSIM 和 LPIPS 会强烈惩罚颜色或纹理差异,却不一定能正确反映大视角变化下的空间对应。论文提出 Dense Matching Distance(DMD):先用稠密匹配网络分别建立源图/生成图到真值目标图的对应,再累计对应位置的距离;未匹配点给予固定惩罚 $\sigma$。

图中随着视角变化增大,PSNR、SSIM 和 LPIPS 并不单调,而 DMD 与空间错位呈更稳定的单调关系。这说明 DMD 对论文关心的“相机控制是否准确”更敏感,但它仍依赖所选稠密匹配器,并不能取代人工感知评估。
数据集
训练和评测使用 DL3DV、RealEstate10K 与 Sekai-Real-Walk-HQ。论文只取 RGB 数据,再通过 VIPE 估计相机轨迹;VIPE 内部使用 DepthAnything3-Metric 提供尺度先验。低质量场景和明显错误的位姿估计会被过滤。
为了让难度更接近“目标视图还能从源图获得多少有效参考”,作者按视图重叠率采样,而不是只看帧间隔:
- 训练样本要求重叠率至少为 30%,最大帧间隔为 40;
- DL3DV-Easy 的重叠率大于 80%;
- DL3DV-Medium 为 50%–80%;
- DL3DV-Hard 为 30%–50%;
- RealEstate10K 与 Sekai 测试对覆盖 30%–80% 的变化范围。
这套协议很重要:当源图与目标图几乎没有共视区域时,单目 NVS 本身就接近不可辨识,单纯用“帧距”比较模型并不公平。
算力
论文给出了总 batch size 32、AdamW、学习率 $5\times10^{-5}$,但没有明确报告 GPU 型号、GPU 数量、训练时长或总训练步数。推理使用 40 步采样,因此 MetaView 的重点是高质量、强控制的新视角生成,而不是实时渲染。
实验结果

大视角变化下的总体表现
在 DL3DV 的 Easy/Medium/Hard 三档上,MetaView 的 DMD 分别为 2.56、7.57、20.74,均显著低于表中对比方法。Hard 子集上,MetaView 达到 12.54 PSNR、0.3802 SSIM、0.2881 LPIPS;低级指标仍会随共视区域减少而下降,但空间匹配指标保持了明显优势。
跨数据集评测中,MetaView 在 DL3DV、RealEstate10K、Sekai-Real-Walk-HQ 上的 DMD 分别为 10.29、6.44、6.69;对应最强对比结果仍明显更高。这组结果支持论文的核心主张:少量显式尺度线索并没有把模型锁死在某一种重建表示上。
组件是否真的有效

DL3DV-Medium 消融中,完整模型为 14.21 PSNR、0.3765 SSIM、0.2353 LPIPS、9.33 DMD。去掉几何流后 DMD 退化到 11.61;去掉 RoPE 的 $z$ 轴尺度线索后进一步退化到 14.45。二者说明:
- 几何 token 主要改善局部相对结构和细节对应;
- 度量深度的 $z$ 轴主要抑制全局尺度及相机运动漂移;
- 两种先验作用不同,不能简单互相替代。
开放域泛化

人物、动物、卡通和绘画等开放域样例表明,冻结生成骨干确实保留了较强的语义先验。不过这些结果主要是定性展示,不能单独证明所有域外场景都具有同样的几何精度。
优势与不足
优势
- 显式约束足够少。 不做点云重建和重投影,减少了错误深度被刚性传播到目标视图的风险。
- 几何与尺度职责清楚。 geometry stream 负责相对结构,度量深度负责绝对尺度,两项消融都给出了独立证据。
- 预训练先验保存较好。 冻结 MM-DiT 主干,让模型在开放域内容上仍有生成能力。
- 评测更贴近相机控制。 DMD 与按共视率划分的难度协议,补充了低级重建指标的盲点。
不足
- 整条链路依赖 VIPE、DepthAnything3-Giant 与 DepthAnything3-Metric;上游位姿或深度偏差仍会成为隐性瓶颈。
- 40 步扩散推理和大型生成骨干限制了实时性,论文也未给出完整训练算力与端到端延迟。
- 单图不可见区域最终仍由生成先验决定。视觉上合理并不等价于真实场景中确有该几何或纹理。
- DMD 依赖稠密匹配网络与未匹配惩罚设定;它更适合补充 PSNR/SSIM/LPIPS,而不是作为唯一标准。
记忆点
- 隐式几何为主,度量深度为锚。 不必把深度直接变成目标视图,尺度也可以通过位置编码进入生成模型。
- 把几何 token 当作注意力中的“可查询先验”。 这比在输入端一次性拼接深度更能持续影响多层生成过程。
- 大视角 NVS 应按共视率分难度。 帧距并不能准确描述可用参考信息。
- 指标要对应任务主张。 如果论文强调相机控制,空间匹配指标比纯像素相似度更有解释力。













