VGGT-Ω
作者:Jianyuan Wang, Minghao Chen, Shangzhan Zhang, Nikita Karaev, Johannes Schönberger, Patrick Labatut, Piotr Bojanowski, David Novotny, Andrea Vedaldi, Christian Rupprecht 单位:Visual Geometry Group, University of Oxford; Meta AI 会议:CVPR 2026 Oral / 2026 Arxiv 链接:https://arxiv.org/abs/2605.15195, Project Page 研究动机VGGT-Ω 这篇文章关心的不是“能不能再把 VGGT 做强一点”,而是一个更底层的问题:前馈式三维重建模型是否也像语言模型、2D 视觉基础模型一样,具有可预期的 scaling law。原始 VGGT 已经证明了 feed-forward reconstruction 可以在很多场景中接近甚至超过传统 SfM/优化式方法,但它仍然有几个限制: 全局...
ARDepth: Auto-regressive Monocular Depth Estimation with Progressive Visual Conditioning
作者:Zijie Wang, Wei Zhang, Weiming Zhang, Xiao Tan, Weikai Chen, Xiaoxu Li, Guanbin Li 单位:Sun Yat-sen University, Shenzhen Loop Area Institute, Baidu Inc., LightSpeed Studios (Tencent America), Lanzhou University of Technology 会议:2026 Arxiv(Under review) 链接:https://arxiv.org/abs/2607.12433 文中图表均引自原论文;该 arXiv 版本标注为 CC BY 4.0。 研究动机当前零样本单目深度估计常借助扩散模型:把深度视为一张全局连续的场,经由多轮去噪逐步恢复。但真实几何并不总是平滑的——遮挡边界、细杆、表面相交处恰恰是离散且有层级的高频结构。作者认为,统一的全局去噪并没有显式表达“先有整体布局、再有表面与边界”的构造过程。 另一条路是视觉自回归(AR),但把完整深度图拉平成单一长序列的 Flat...
ZipDepth: Bringing Lightweight Zero-Shot Monocular Depth Anywhere, on Any Device
作者:Fabio Tosi, Luca Bartolomei, Matteo Poggi, Stefano Mattoccia 单位:University of Bologna, Bologna, Italy 会议:ECCV 2026(论文与作者项目页标注;本文未独立核验 ECCV 会务目录) 链接:arXiv | PDF | 项目页 | 官方代码 研究动机单目深度估计的难点不只是“从一张 RGB 图预测深度”,而是同一张二维图像可能对应许多不同的三维结构。近年的基础模型借助大规模数据和重型视觉主干,已经能在室内、道路、合成场景之间取得很强的零样本泛化;代价是数亿参数、数百到数千 GMAC,以及难以放进嵌入式设备的延迟和能耗。另一端的轻量模型虽然跑得快,却大多在 KITTI 或 NYUv2 等单一域的自监督设置中训练,换域后容易失效。 ZipDepth 要解决的正是这条断层:能否把基础模型的跨域知识迁移到一张真正可部署的小网络中,而不是在精度和实时性之间二选一?作者用 Depth Anything v2-Large 生成伪深度监督,以 17 个异构域、约 14.1M...
3DShape2VecSet: A 3D Shape Representation for Neural Fields and Generative Diffusion Models
作者:Biao Zhang, Jiapeng Tang, Matthias Nießner, Peter Wonka 单位:KAUST, Technical University of Munich 会议:ACM Transactions on Graphics 42(4), SIGGRAPH 2023 链接:arXiv / Project / Code / DOI 研究动机3DShape2VecSet 讨论的是一个很基础但容易被低估的问题:如果要把扩散模型真正搬到 3D 形状生成里,应该在什么表示空间里扩散? 2D 图像扩散模型可以直接在像素或压缩 latent 上工作,因为图像天然是规则网格。但 3D 形状没有这么统一的表示:voxel 规则但立方级开销太大,point cloud 轻量但缺少连续表面,mesh 结构复杂,neural field 连续且能表达完整表面,却本身像一个无限维函数,不能直接作为扩散模型的固定长度输入。 论文选择的路线是 latent diffusion:先训练一个 shape autoencoder,把 3D 形状压成固定大小...
PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation
作者:Haofei Xu, Rundi Wu, Philipp Henzler, Nikolai Kalischek, Michael Oechsle, Fabian Manhardt, Marc Pollefeys, Andreas Geiger, Federico Tombari, Michael Niemeyer 单位:Google, ETH Zurich, University of Tübingen / Tübingen AI Center, Microsoft, KE:SAI, Technical University of Munich 会议:ICML 2026 / arXiv 2026 链接:https://arxiv.org/abs/2607.02515 研究动机PointDiT 讨论的是单目几何估计中的一个具体表征选择:给定一张 RGB 图像,直接预测每个像素在相机坐标系下的三维点图 Point Map,而不是只预测标量深度图。深度图只给出每个像素的距离,需要相机内参才能反投影为三维结构;Point Map 则把每个像素表示为...
MTD: 图优化视角下的 Metric Depth 公式推导笔记
作者:Yu Ma, Zizhan Guo, Zuyi Xiong, Haoran Zhang, Yi Feng, Hongbo Zhao, Hanli Wang, Rui Fan 单位:College of Electronic and Information Engineering, Tongji University; Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University; National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University 会议:CVPR...
2DGS: 2D Gaussian Splatting for Geometrically Accurate Radiance Fields
作者:Binbin Huang, Zehao Yu, Anpei Chen, Andreas Geiger, Shenghua Gao 单位:ShanghaiTech University, University of Tübingen, Tübingen AI Center 会议:SIGGRAPH 2024 Conference Papers 链接:arXiv, Project, Code 研究动机 3D Gaussian Splatting 的吸引力在于它把新视角合成做到了高质量、快速训练和实时渲染,但它的几何表达并不天然适合表面重建。3DGS 的基本单元是三维体素状 Gaussian blob,它可以很好地拟合视图相关外观,却会在几何上产生一个矛盾:真实世界的许多物体表面是薄的二维流形,而 3D Gaussian 表示的是有体积的密度分布。颜色可以通过体渲染被拟合出来,但表面在哪里、法向是否一致、不同视角看到的交点是否稳定,并没有被表示方式直接约束。 这篇文章要解决的问题不是单纯提升 PSNR,而是把 Gaussian Splatting...
DreamFusion: Text-to-3D using 2D Diffusion
作者:Ben Poole, Ajay Jain, Jonathan T. Barron, Ben Mildenhall 单位:Google Research, UC Berkeley 会议:ICLR 2023 notable top 5%,2022 Arxiv 链接:arXiv, Project, OpenReview 研究动机 DreamFusion 解决的是一个很直接但当时非常困难的问题:能不能只输入一句自然语言,就生成一个可以从任意角度观察、重新打光、导出到 3D 环境中的物体或场景? 这个问题的核心矛盾在于,2D 文本到图像扩散模型已经能从海量图文数据中学到强大的视觉先验,但 3D 生成没有同等规模的文本-3D 标注数据。直接训练 3D 扩散模型需要大量 3D asset、多视角数据和高效的 3D 去噪结构,这些条件在论文写作时都不成熟。 因此论文换了一个角度:不重新训练一个 3D 生成模型,而是把已经训练好的 2D 文生图扩散模型当作一个可微的“审美与语义先验”,反复渲染一个随机初始化的 3D 表示,再用扩散模型告诉这个渲染图应该往哪个方向改。这样,3D 结构本身由...
LoRA: Low-Rank Adaptation of Large Language Models
作者:Edward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, Weizhu Chen 单位:Microsoft Corporation 会议:ICLR 2022 Poster 链接:https://arxiv.org/abs/2106.09685, OpenReview, Code 研究动机1.大模型微调真正贵的地方,不只是一次训练的算力,而是每个下游任务都要保存和部署一整份模型权重。 以 GPT-3 175B 为例,论文把全量微调后的单任务模型存储开销估计为约 350GB。如果一个服务要支持很多任务,每个任务都保存一份完整模型,部署、切换、I/O 和显存都会变成系统瓶颈。 2.已有参数高效方法解决了“训练参数少”的一部分问题,但留下了新的部署代价。 Adapter 在 Transformer 层里串联额外模块,会增加推理深度,因此在线小 batch 场景下可能带来明显延迟;Prefix Tuning / Prompt Tuning 把可训练...
VLM3: Vision Language Models Are Native 3D Learners
作者:Zhipeng Cai, Zhuang Liu, Yunyang Xiong, Zechun Liu, Vikas Chandra, Yangyang Shi 单位:Meta, Princeton University 会议:2026 Arxiv 链接:https://arxiv.org/abs/2605.30561 代码:https://github.com/facebookresearch/VLM3 研究动机 这篇文章的核心问题不是再做一个 3D 专家模型,而是反过来追问: 标准 VLM 在不改架构、不加专门 3D head、不使用复杂回归损失的情况下,能否通过文本监督学会细粒度 3D 任务? 这个问题成立的背景有三层。 现有 VLM 在语义理解上很强,但 3D 理解仍然经常依赖专门模型。例如深度估计、像素对应、相机位姿估计通常需要 DPT/FPN/匹配网络/位姿回归头等任务结构。 近期 DepthLM 已经说明,标准 VLM 可以通过文本输出单点 metric depth,但它仍然依赖视觉 marker...










