点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
来源:3D视觉工坊
星球内有20多门3D视觉系统课程、3DGS独家系列视频教程、顶会论文最新解读、海量3D视觉行业源码、项目承接、求职招聘等。想要入门3D视觉、做项目、搞科研,欢迎加入!
论文信息
论文标题:SeeSE3: Emergence of 3D Space in Vision Features
作者:Caroline Chen, Sayna Ebrahimi, Fedor Kitashov, Ming-Hsuan Yang, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov
机构:Google DeepMind
论文链接:https://arxiv.org/abs/2607.14228
假如存在一个从出生起就一动不动,只能被动地接收来自外界的视觉信号——它能否"发现"三维空间的结构?
这并非科幻设定,而是法国数学家、物理学家亨利·庞加莱(Henri Poincaré)在一个多世纪前提出的一个著名思想实验。今天,一群来自 Google DeepMind 的研究者用现代视觉基础模型重新检验了这个假说,并给出了一个令人惊讶的答案。
研究者探究视觉特征是否与欧几里得变换的几何结构对齐,即静态场景中相机运动(轨迹)所捕捉的空间变换。原始特征混沌纠缠(中左),而"庞加莱适配器"可从特征空间中识别出与空间运动相关的子空间,并将其"展开"为紧密跟随真实相机轨迹的同质坐标系(中右和右)。

一、引言:庞加莱的百年之问
感知世界的三维结构是人类发展过程中不可或缺的一环。相比之下,在现有的大多数视觉、机器人学或世界模型中,三维空间的几何是先验强加的——要么通过显式选择某个坐标系,要么通过从人类知识中蒸馏而来。这自然引出一个问题:视觉模型是否可能在最小干预下,仅仅从视觉数据的统计规律中"发现"世界的三维结构?
在认知科学和哲学中,一个占据主流地位的观点是:要发现欧几里得空间的几何,必须具备能动性。庞加莱就曾假设:"一个不动的存在永远不可能获得空间的概念,因为他没有理由区分【位置的变化】和【状态的变化】。如果他的运动不是自主的,他同样无法获得这一概念。"(《科学与假设》,第4章)
现代视觉基础模型提供了一个检验这一假说的绝佳机会。这些模型,从严格意义上说,正是"不动的存在"——即使它们在视频数据上训练,也只是旁观者,被动地看着别人的运动。受庞加莱启发,研究者们提出了以下问题:
庞加莱任务(The Poincaré Task):一个不动的观察者,仅凭被动视觉输入,能否"发现"三维空间的结构?具体而言,一个视觉模型是否会自然地将其潜在空间组织成反映欧几里得变换群 SE(3) 的方式?
值得注意的是,视觉模型的潜在空间将特征与场景内容关联,而场景内容天然存在于三维空间中,但三维空间本身并非直接可观测。与先前工作不同——此前的方法要么通过回归深度和法线等局部表面中心量来探测视觉特征的三维意识,要么用高容量解码器来提取位姿——本研究测试的是:特征空间本身是否被组织为反映欧几里得三维结构的形式。
欧几里得空间的两个关键特征是其低维度(位置和相机朝向共6个自由度)以及同质性——相对位移无论在空间中何处,含义相同。这似乎与视觉特征的高维度及其与视觉内容的基本耦合形成鲜明对比。因此,即使在最强大的模型中,是否存在这样一个低维、同质的坐标系,在事前看来绝非显然。
为了回答这一问题,研究者定义了一套评估协议,在来自多种数据集的静态场景上测试了多个视觉基础模型。实验结果表明,多个纯自监督图像模型中所包含的信息,在正确探测时,与 SE(3) 的空间结构呈现出令人瞩目的强对齐——也就是说,这些模型能够"看见"SE(3)。基于这一洞察,研究者进一步提出了高效回归相机运动的方法,并实现了闭式潜在视觉导航。
二、核心贡献
本工作的四个关键贡献如下:
1. 正式提出了从视觉特征推断三维空间结构的问题,方法是将特征空间的结构与欧几里得变换群 SE(3) 进行比较,并引入了一套探测指标来评估各类编码器在此任务上的表现。
2. 证明了虽然没有任何特征的原始形态直接同构于 SE(3)(即使在局部意义下),但这一结构可以通过一个轻量级的孪生解码器提取出来;研究者将其命名为"庞加莱适配器"(Poincaré Adapter),它能产生一个同质的坐标系。
3. 提供了自监督方法在何种条件下可恢复几何结构的理论分析,并研究了恢复 SE(3) 不同分量的难度差异——例如,证明了旋转比平移更容易编码。同时,通过对同一数据集上训练的不同变体视觉特征进行大规模消融实验,建立了几何结构涌现的必要条件。
4. 基于以上洞察,提出了一种新颖的闭式视觉导航方法,充分利用了庞加莱适配器实现的线性化。
综上,本工作探索了在基于视觉的架构中三维空间结构涌现的条件。这些洞察也与视觉导航模型(Visual Navigation Models)和导航世界模型(Navigation World Models)紧密相关——它识别了潜空间中支撑空间推理与导航的底层几何。
三、方法概要:四种度量与庞加莱适配器
研究者设计了四种由浅入深、复杂度递增的度量指标,系统性地探测视觉模型的"空间感知力":
度量 M1 — 拓扑对齐(Topological Alignment):使用互 k-近邻对齐分数(mutual k-nn alignment),比较视觉特征空间中邻域结构与相机位姿空间中邻域结构的相似度。这是完全免训练的,直接评估特征空间与位姿空间在拓扑层面的匹配程度。高分意味着:视觉上相似的图像在物理空间中也临近。
度量 M2 — 本征维度(Intrinsic Dimensionality):使用 MLE 和 Two-NN 两种估计器,计算局部本征维度。如果一个特征空间完美地对齐了三维运动空间,其维度应接近6(SE(3)的自由度)。
度量 M3 — 线性等变性(Linear Equivariance):直接训练一个线性回归器 W,尝试从原始特征差分预测相对位姿变化:ΔP ≈ W(z_{t+s} - z_t)。如果特征空间是天然平坦的欧几里得空间,这个简单的线性映射就足够。
度量 M4 — 庞加莱适配器(Poincaré Adapter):既然线性约束过于严苛,研究者引入了一个轻量级的孪生 MLP 适配器 φ_θ,形式为:ΔP ≈ W(φ_θ(z_{t+s}) - φ_θ(z_t))。其核心思想是:通过一个非线性投影 φ 将弯曲的特征流形"展开"为平坦同质坐标空间,使得位姿变化在其中变为线性可解码。
之所以命名为"庞加莱适配器",正是对其使命的致敬——在特征空间中展开出同质的三维坐标系,让"不动之眼"也能看见空间。
两组示例帧对,帧间间隔 s=40,展示了庞加莱适配器需要解码的典型视角变化。帧间差异包括相机平移和旋转带来的显著场景变化。

潜空间导航(Latent Space Navigation)
作为本研究的应用验证,研究者提出了潜空间导航方案。核心思路是:如果视觉潜空间可以被构造成反映 SE(3) 的局部拓扑,那么智能体应当可以在不进行显式三维重建的情况下,"想象"物理运动带来的视觉后果。
给定起始帧的适配特征 g_t = φ_θ(z_t) 和期望的位移 ΔP,目标帧特征通过简单的向量运算预测:
ĝ_{t+s} = g_t + W† ΔP
其中 W† 是线性投影权重的伪逆。这意味着——在潜空间中导航像做一道加法一样简单。
四、实验与效果展示
4.1 拓扑对齐:DINO 系列令人惊讶
在 ScanNet 数据集上,研究者首先评估了多种视觉模型的特征邻域结构与物理世界邻域结构的一致性。短期步长(短距离帧间)捕捉像素级的图像依赖,而长期步长(大视角变化)则更能体现真正的空间感知。
短步长(x轴)与长步长(y轴)下相机位姿与视觉特征之间的对齐。前者捕捉像素级依赖,后者更能体现空间感知能力。

此图揭示了几个关键发现:
接受显式几何目标训练的模型(DUSt3R, MoGe, MASt3R)在长步长下获得最高对齐分数(≈0.35–0.40),说明它们的编码器本身就将潜空间结构化以对齐位姿空间。 最令人惊讶的是:在纯自监督视觉模型中,DINOv2 和 DINOv3 表现出极强的拓扑对齐(≈0.38),显著优于其他基线模型和原始像素。这种结构纯粹从被动的图像级自监督中涌现,无需任何显式深度或位姿信号。 视频模型(VideoMAE, RVM, 4DS)在此度量上表现较差(≈0.15–0.25)。研究者推测:虽然这些模型可以捕获时序运动,但其潜状态高度依赖上下文(与生成轨迹纠缠),未能形成稳定的、全局一致的空间映射。
4.2 原始特征的本征维度与线性等变性
代表性模型的本征维度(TwoNN / MLE)与原始线性读出 R²(M3)对比。数值对应最大化 M3 性能的编码器层。

Table 1 展示了代表性模型的本征维度和线性解码性能。大多数编码器的特征本征维度在6附近(与理论预测一致),但 M3 线性等变性的 R² 全部为负或接近零——没有一个模型的原始特征能直接通过线性向量运算对应物理运动。"视觉的流形"天然是弯曲的,标准的向量算术与物理运动并不对应。
4.3 庞加莱适配器:解锁线性结构
通过应用轻量级孪生 MLP 适配器 φ,研究者恢复了非常强的线性等变性。DINOv2 在 ScanNet 三个场景上的平均测试 R² 达到约 0.65——这意味着潜在空间中存在一个局部欧几里得子流形,同构于 SE(3),即一个"视觉网格编码"(Visual Grid Code),可以通过非线性投影被访问。
各类编码器在 ScanNet 上不同帧步长 s 下的适配器 R² 定量评估。测试的是:跨 s 帧观测到的潜在特征变化能否被线性映射到相机位姿变化。DINOv2 表现最强(R²≈0.65),而原始像素即使使用适配器也保持负 R²,证实可解码结构源自学习到的特征内部。

值得注意的是,尽管 CroCo 经受了显式 3D 跨视图补全的预训练,其表现(R² ≈ 0.38)反而不及 DINOv2。这暗示:大规模被动观察(DINOv2 的规模)可能比小规模显式 3D 预训练更有效地发现空间规律。
4.4 跨数据集泛化与缩放
5个数据集、3个代表性骨干模型上的聚合解码指标(Max R² / R²>0 比例 / R²>0.3 比例)。数据集质量(位姿精度、捕获密度)显著影响可解码性。*

在5个数据集、913个独立场景上的大规模测试中,研究者发现场景难度主要由三个因素驱动:(1)数据充足性——帧对数>1000的场景成功率达81%;(2)视觉丰富度——高纹理房间提供必要的语义锚点;(3)工作空间几何——有界房间天然支持密集视角重叠和环闭性。
31 个留出测试房间上的零样本位姿恢复随训练房间数 N 的变化。左:成功恢复房间比例(Top-R²>0)单调增长。右:总可恢复信号(Clipped Mean R²)大幅增长且未见平台期。

Figure 5 展示了泛化与缩放特性。Poincaré 适配器在越来越多的 ScanNet 房间上训练后,在31个留出测试房间上评估零样本位姿恢复能力。适配器成功恢复正 R² 信号的房间比例从 N=5 时的约 18% 增长到 N=200 时的 50%,而总可恢复信号大幅增长且未见平台期。这确认了几何感知是视觉 Transformer 的可缩放、通用涌现特性,可迁移至未见环境。
4.5 潜空间导航:在特征空间里"走路"
Identity 基线(无导航)校准任务难度。零样本 Inv. Poincaré 在拓扑检索(Hit@ϵ)上占优,尽管 Attention 校正器回归指标(R²)更高。

基于庞加莱适配器揭示的线性结构,研究者测试了潜空间导航方案。零样本的 Inverse Poincaré 方法(仅用伪逆 W† 缩放位姿位移加到当前特征上)在拓扑检索上具有高度竞争力,远超不做导航的 Identity 基线。Attention 校正器尽管在回归指标(R²)上更优,但在物理区域检索上反而不及简单的向量运算——说明正确的空间邻域移动,只需向量算术即可实现。
4步开环导航轨迹(ΔP = 0.85m, 36°)。路径因开环积分略有漂移,但检索帧视觉连贯,成功逼近目标视角。

Figure 6 展示了一个4步开环导航轨迹(ΔP = 0.85m, 36°):路径因开环积分略有漂移,但检索到的帧视觉上保持连贯,成功逼近目标视角。对于中等位移(0.68m, 19°),检索轨迹精确抵达目标帧;即使对于极端位移(2.45m, 37°),旋转恢复仍极其精确(<5°误差),验证了开环潜空间规划在长路径上的可行性。
跨房间泛化:在31个留出测试房间上的实验中,零样本导航在约 60% 的房间中优于基线;通过 Ridge-Refit(仅适配线性映射部分)可将导航成功率推至 90-94%,横跨 DINOv2、DUSt3R 和 V-JEPA 三种骨干网络。
五、结论与展望
在本文中,研究者探究了视觉特征是否能够捕捉欧几里得空间的结构,通过研究这些特征与刚体运动群 SE(3) 之间的对齐来实现。研究表明,虽然没有任何编码器直接反映这一结构,但在某些情况下,通过一个相对简单的适配器网络来"展开"特征流形是可能的。
令人瞩目的是,视觉特征的变化可以通过一个同质的、独立于位置的、低维适配器映射到位姿变化。 有趣的是,自监督模型虽然仅通过被动观察来训练,却能形成三维空间的表征,且在正确探测时可被解码。
本研究的一个局限在于:仅考虑了静态场景,其中特征变化仅与相机运动相关,因此尚未检验庞加莱关于"位置变化"与"状态变化"的区分。一个有趣的扩展方向是将本工作的形式化方法和研究路径推广到动态场景——其中既有相机运动,也有来自底层物理过程的场景运动——以探索更深层的时空对称性或守恒定律。
总结:SeeSE3 为视觉基础模型的"空间直觉"提供了系统性的实证和理论框架。它揭示了一个重要事实:三维空间的几何结构,可以从纯粹的、被动的视觉观察中涌现——不需要能动性,不需要先验的三维知识,只需要足够大的数据规模和正确的探测方式。庞加莱的"不动之眼",在今天的大型视觉模型中,似乎真的看见了空间。
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。