VGGT-Ω
作者:Jianyuan Wang, Minghao Chen, Shangzhan Zhang, Nikita Karaev, Johannes Schönberger, Patrick Labatut, Piotr Bojanowski, David Novotny, Andrea Vedaldi, Christian Rupprecht 单位:Visual Geometry Group, University of Oxford; Meta AI 会议:CVPR 2026 Oral / 2026 Arxiv 链接:https://arxiv.org/abs/2605.15195, Project Page 研究动机VGGT-Ω 这篇文章关心的不是“能不能再把 VGGT 做强一点”,而是一个更底层的问题:前馈式三维重建模型是否也像语言模型、2D 视觉基础模型一样,具有可预期的 scaling law。原始 VGGT 已经证明了 feed-forward reconstruction 可以在很多场景中接近甚至超过传统 SfM/优化式方法,但它仍然有几个限制: 全局...
D^2-4DGS: Dual-Depth Guided Sparse-Camera 4D Gaussian Splatting
作者: Jijian Zhao 单位: Huazhong University of Science and Technology 会议: 2026 Arxiv 链接: arXiv 研究动机Dynamic 4DGS 通常依赖密集、同步的多相机视频。相机数量减少以后,RGB supervision 很难唯一确定动态场景的 3D geometry:错误位置的 Gaussians 仍然可能解释有限 training views,最终产生 missing structures、foreground/background blending 和 floating primitives。 引入 depth prior 是自然选择,但 D²-4DGS 认为 单一 depth source 都不够: Monocular depth:coverage 稠密,但 scale ambiguous,而且存在局部 bias; Multi-view geometric depth:与 reconstruction coordinate system 一致、几何可靠性更高,但在...
StereoGS: Sparse-View 3D Gaussian Splatting via Stereo Priors
作者: Wenhao Yuan, Yiyuan Ge, Deli Cai 单位: South China University of Technology 会议: ECCV 2026 链接: arXiv | Project | Code 研究动机Sparse-view 3DGS 的根本困难不是 renderer 不够强,而是 几何约束太弱。只有少量训练视角时,很多错误的 Gaussian geometry 仍然可以很好地拟合训练 RGB,因此优化很容易出现 overfitting、floaters、错误表面和 novel-view artifacts。 已有方法常用 monocular depth prior 缓解这个问题,但 StereoGS 认为 MDE 在这里有两个天然缺陷: scale ambiguity:单目 depth 的尺度与 3DGS 世界坐标不天然一致; cross-view inconsistency:每个视角独立推理,同一真实 3D point 在不同图像中的 depth 可能不一致。 即使先用 MVS 获得一个更好的...
MoRe: Monocular Geometry Refinement via Graph Optimization for Cross-View Consistency
作者: Dongki Jung, Jaehoon Choi, Yonghan Lee, Sungmin Eum, Heesung Kwon, Dinesh Manocha 单位: University of Maryland, College Park;DEVCOM Army Research Laboratory 会议: WACV 2026 链接: arXiv | CVF Paper 研究动机MoRe 讨论的是一个非常直接的下游问题:单目 3D foundation model 单帧预测很好,但把多个视角的 point map 放到同一个世界坐标系后,为什么仍然对不齐? 以 MoGe 为代表的 monocular geometry model 可以预测细节丰富的 point map 和 normal,但每一帧都是独立推理。即使 camera pose 已知,把各视角 point map 变换到共同坐标系后,仍然会受到 monocular affine...
FoundationGeo: Learning Spatial Pixel-Wise Fields for Monocular Metric Geometry
作者: Muxin Liu, Xiaoyang Lyu, Tianhe Ren, Peng Dai, Xiaoshan Wu, Zhiyue Zhang, Jiaqi Zhang, Jiehong Lin, Shaoshuai Shi, Xiaojuan Qi 单位: The University of Hong Kong, Voyager Research, DiDi Chuxing 会议: ECCV 2026 链接: arXiv | Project | Code 研究动机FoundationGeo 关注的是 relative geometry foundation model 到 metric geometry 之间仍然存在的缺口。MoGe-2 已经说明:先学习高质量 affine-invariant geometry,再通过轻量 metric calibration 恢复绝对尺度,是一条比直接训练 metric model 更稳健的路线。但作者进一步发现,一个全局 scale 并不足以解释真实的 metric error。 论文给出两个关键观察: 当 scale...
MoGe-3: Fine-Detail Monocular Geometry Estimation with Self-Guided Sparse Volumetric Refinement
作者: Lingyu Kong、Ruicheng Li、Ruicheng Wang、Sicheng Xu、Chengtang Yao、Jianfeng Xiang、Jiaolong Yang单位: Tsinghua University、University of Science and Technology of China、Microsoft Research会议: arXiv 2026 预印本(截至 2026-07-24 未核实正式会议录用)链接: arXiv | Project Page | Code(论文页面标注为即将公开) 研究动机1. 深度图看起来清晰,不代表三维几何正确近年来的单目深度与单目几何基础模型已经能给出相当可靠的全局布局,但在真正把预测反投影成点图并改变视角后,细杆、栏杆、电线、树枝、小物体边缘等区域仍会出现明显扭曲: 细结构被加粗、折弯或粘连; 前景轮廓与背景表面发生几何串扰; 二维 disparity 边缘看起来锐利,三维点图却不在正确表面上; 全局深度指标较好,但局部结构无法用于高保真重建。 MoGe-3...
Modeling Depth Ambiguity: A Mixture-Density Representation for Flying-Point-Free Depth Estimation
作者: Siyuan Bian、Congrong Xu、Jun Gao单位: University of Michigan、NVIDIA会议: arXiv 2026 预印本(截至 2026-07-24 未核实正式会议录用)链接: arXiv | Project Page | Code 研究动机1. 飞点并不只是“边缘不够锐利”深度图在二维平面上看起来可能相当平滑,但一旦反投影到三维空间,物体轮廓附近常会出现一圈悬浮在前景和背景之间的离群点,即 flying points。这类错误会直接破坏点云、网格和新视角渲染,也会影响机器人抓取、碰撞检测等依赖真实表面的任务。 以往常见解释是网络分辨率不足、解码器过度平滑或输入模糊。因此,Pixel-Perfect Depth 等方法尝试使用生成式细化,Depth Anything 3、VGGT...
DepthART: Scaling Foundation Monocular Depth to Tiny Models
作者:Feng Xue, Wu Chen, Mingshuai Zhao, Guofeng Zhong, Anlong Ming, Haozhe Wang, Dianqiao Lei, Zhaowen Lin, Haiyang Zhang, Nicu Sebe 单位:University of Trento, Beijing University of Posts and Telecommunications, The Hong Kong University of Science and Technology, Tsinghua University 会议:2026 Arxiv 链接:论文 | 项目页 研究动机Depth Anything、Metric3D、UniDepth 等几何基础模型已经证明,大规模混合数据可以带来跨场景相对深度和度量尺度泛化。但把骨干缩小到几百万参数后,这些能力往往不能自动保留。 DepthART 把问题归纳为两个与小容量直接相关的瓶颈: 数据分布偏置更容易被记住。...
VAR: Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction
作者:Keyu Tian, Yi Jiang, Zehuan Yuan, Bingyue Peng, Liwei Wang 单位:Peking University, ByteDance Inc. 会议:NeurIPS 2024 链接:论文 | 会议页面 | 代码 | 演示 研究动机把图像离散成 token 后,最直接的做法是照搬语言模型:把二维 token 网格按光栅顺序拉平成一维,再从左到右、从上到下逐 token 生成。但图像并不是天然的一维序列,这种做法带来四个问题: 单向顺序与图像的二维联合分布并不自然匹配; 当前 token 只能使用“之前”的区域,难以执行需要双向上下文的任务; 拉平破坏了近邻像素或 patch 的空间局部性; $n\times n$ token 需要 $n^2$ 次串行解码,分辨率上升后速度迅速恶化。 VAR 的核心变化非常简单:不再预测“下一个 token”,而是预测“下一个尺度”。模型先生成低分辨率语义布局,再逐级补充更高分辨率的结构和纹理;同一尺度内的所有 token...
X-Lens: Real-Time Metric Depth Estimation with Heterogeneous Cameras
作者:Heng Zhou, Shuhong Liu, Yonghao He, Bohao Zhang, Fa Fu, Chenhui Hou, Xianbao Hou, Lijun Han, Cong Yang, Wei Sui 单位:D-Robotics, The University of Tokyo, Soochow University 会议:2026 Arxiv 技术报告 链接:论文 | 项目页 | 代码 研究动机机器人、自动驾驶和多相机空间感知系统很少只使用一种镜头:针孔相机适合保留远处细节,鱼眼相机适合覆盖近场和周边区域。真正的设备往往把它们组合在同一刚性相机架上,但这会带来两个问题: 针孔与鱼眼的投影规律不同,相同大小的图像 patch 对应的视线分布和局部尺度并不一致; 通用三维基础模型通常同时预测相机、点图、位姿和深度,模型很大,也不一定能在边缘设备上实时运行。 全景拼接可以把输入统一到球面或 ERP 表示,但重采样会改变原始成像几何,也可能损失相机之间本来可利用的共视信息。X-Lens...










