点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
来源:3D视觉工坊
3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:
1. 导读
我们提出TokenSplat,一个从无位姿多视图图像联合进行 3D 高斯重建和相机位姿估计的前馈框架。TokenSplat 的核心是引入了一个 Token 对齐的高斯预测模块,该模块直接在特征空间中对齐跨视图的语义对应信息。在粗略 token 位置和融合置信度的引导下,它聚合多尺度上下文特征以实现长程跨视图推理,并减少重叠高斯带来的冗余。为进一步增强位姿鲁棒性并将视点线索与场景语义解耦,TokenSplat 采用了可学习的相机 token 和非对称双流解码器,该解码器在相机 token 与图像 token 之间实施方向约束的通信。这在前馈架构中保持了干净的分解,使得无需迭代精修即可实现连贯的重建和稳定的位姿估计。大量实验表明,TokenSplat 在无位姿设置下实现了更高的重建保真度和新视图合成质量,并且与先前的无位姿方法相比显著提升了位姿估计精度。项目页面:https://kidleyh.github.io/tokensplat/。
2. 主要贡献
我们提出 TokenSplat,一个前馈无位姿重建框架,从无位姿多视图图像联合估计相机位姿和 3D 高斯场景,展现出强泛化能力。 我们引入了 Token 对齐的高斯预测模块,实现相对长程的多视图特征聚合和高质量高斯生成,同时减少冗余和碎片化。 我们设计了一个非对称双流解码器,将位姿推理与场景编码解耦,同时实现相互增强,从而获得更准确的位姿估计和改进的重建保真度。
3. 方法
3.1. 问题表述
我们的目标是学习一个前馈网络,从 张无位姿图像序列 联合重建 3D 高斯并预测相机位姿,其中 。对于 3D 重建,我们在规范 3D 空间中预测一组 3D 高斯:
其中每个高斯由其中心 、不透明度 、旋转四元数 、尺度 和球谐系数 参数化, 为阶数。对于相机位姿估计,网络预测每视图位姿 ,将每个输入图像 变换到规范参考视图 。形式上,模型学习一个映射:
训练期间,3D 高斯属性和相机位姿被联合优化。
3.2. 架构

如图1所示,我们的方法是一个基于 Transformer 的架构,用于从无位姿图像进行前馈 3D 重建。每个输入视图首先通过共享 ViT 编码器编码为图像token。参考视图 由规范场景解码器处理,该解码器使用交叉注意力从其他视图集成信息并建立规范场景表示。其余视图由非对称双流解码器处理,通过方向约束的通信精修图像和可学习相机 token,有效将相机参数与图像特征解耦。这些解码器的输出随后用于两个并行分支:相机位姿估计头预测每视图相机变换,而 Token 对齐高斯预测模块在特征空间中聚合多视图 token 并通过其预测头生成密集、连贯的 3D 高斯。这种统一的前馈设计实现了连贯的多视图重建和鲁棒的位姿估计,无需任何迭代精修。
ViT 编码器:对于每个输入视图,RGB 图像被划分为 patch 并嵌入为图像 token 序列。可选地,遵循文献[44],相机内参通过线性层编码为额外 token,并沿空间维度与图像 token 拼接以缓解尺度模糊性。每个视图的 token 由权重共享的 ViT 编码器独立处理,无跨视图交互。
规范场景解码器:为建立规范场景表示,参考视图 使用具有到其他视图交叉注意力的 ViT 解码器进行解码。这确保了多视图上下文被高效捕获用于参考视图,并为重建 3D 场景提供一致的基础。规范表示便于后续对剩余视图的相机和场景特征的精修。
3.3. 非对称双流解码器
ADF-Decoder旨在联合精修图像和相机表示,同时显式地将场景内容与相机参数解耦。为防止将视点特定线索与场景语义纠缠,它采用非对称更新方案,其中图像 token 主要聚合场景上下文,而相机 token 从图像 token 提取几何线索并仅传播稳定的位姿信号回去。这种设计在单次前向传递中实现了准确的位姿估计和高保真 3D 重建。
Token 初始化:图像 token 由共享 ViT 编码器生成。相机 token 从可学习嵌入初始化,并为 个非参考视图复制以提供每视图位姿表示。在每个解码器层,相机 token 与对应的图像 token 通过方向约束的注意力交互,使其能够提取视图特定的几何线索,同时防止不必要的特征混合。
自注意力:ADF-Decoder 由 12 个解码器块组成。在每个块内,自注意力分别应用于图像和相机 token。图像 token 集成视图内上下文以捕获局部场景结构并增强重建。相机 token 关注其对应的图像 token 以提取用于位姿估计的几何线索。形式上,对于视图 ,设 表示图像 token, 表示相机 token。它们被投影为查询、键和值 ()、 和 。更新计算为:
其中 是查询和键的相应维度。通过在与同一视图的图像 token 交互中更新相机 token,解码器提取鲁棒的几何特征以支持位姿预测。
图像 Token 跨视图注意力:为捕获全局多视图上下文并强制视图间一致性,每个视图对其他视图的 token 执行交叉注意力,同时明确避免与其自身 token 的交互。这防止了跨视图的信息泄漏,并确保从场景的其余部分集成互补线索。对于视图 的图像 token,来自其他视图的键和值沿空间维度拼接:
图像 token 随后通过交叉注意力更新:
为减少多视图时的计算量,超参数 将每个视图的注意力限制为其 个邻居,平衡上下文和效率。
相机 Token 交叉注意力:仅通过其他相机 token 或仅通过图像 token 更新相机 token 不足以捕获全局几何。因此,每个相机 token 与其他视图的图像和相机 token 交互,使其能够聚合多视图几何线索以实现更准确的相机位姿估计。
对于视图 ,设 为其相机 token。所有相机 token 被投影以获得 和 。每个 对 被复制以匹配其他视图图像 token 的数量,然后与图像 token 的键和值相加以形成交叉注意力输入:
相机 token 更新为:
前后调制:由于图像和相机 token 之间的 token 数量和信息内容差异,图像 token 在注意力前后都用对应的相机 token 进行调制。这稳定了更新,加强了位姿和场景特征之间的解耦,并确保位姿线索在不污染场景语义的情况下引导重建。
3.4. 用于场景重建的 Token 融合
Token 对齐的高斯预测模块聚合多视图特征并预测密集 3D 高斯用于场景重建。它由 Token 融合操作和高斯预测头组成。与传统的像素对齐高斯方法不同,后者直接为每个像素预测密集高斯并在密集多视图设置中遭受冗余和几何模糊,我们的方法跨 token 融合特征以产生更一致和高效的 3D 高斯。
Token 融合:Token 融合操作首先预测每个 token 的粗略位置和融合置信度。然后基于空间邻近性(空间分组大小 )对 token 进行分组,并使用 softmax 归一化的置信度分数进行融合。这产生一组具有合并特征和粗略位置的融合 token。融合网络采用基于 DPT 的架构,与文献[44]类似,预测参数数量已调整。
高斯预测头:对于每个融合 token,高斯预测头生成更密集的高斯,包括相对于 token 的位置偏移和高斯属性。来自 Transformer 解码器不同层对应于融合 token 的多尺度特征 首先被上采样和线性投影:
通道维度被统一,特征根据层尺度上采样(较低层上采样较大,较高层上采样较小)。特征随后使用残差融合模块 从深层到浅层逐步融合,该模块由残差块和上采样组成:
残差块增强特征表达力,而上采样在空间上对齐语义和细节信息。所得的融合特征结合了细粒度细节和丰富语义上下文。
最后,融合的高分辨率特征通过由上下采样和线性层组成的预测块,产生表示最终高斯预测的连续张量。Token 对齐高斯预测头的完整架构细节请参见附录。
3.5. 相机位姿估计头
相机位姿估计头预测每个输入视图(不包括参考视图 )的外参。它接收解码器产生的每视图相机 token 作为输入,并应用线性投影来回归每个视图的相机变换 。将相机位姿与 Token 对齐的高斯重建联合优化,鼓励网络学习几何一致的 3D 特征,这同时提高了位姿估计和场景重建的精度。
3.6. 损失函数
图像渲染损失:我们使用真实目标 RGB 图像监督模型。渲染损失结合了 L2 损失和感知 LPIPS 损失:
其中 和 表示真实图像和渲染图像, 平衡感知项。
相机位姿损失:相机位姿头预测每个视图相对于参考视图 的外参。我们使用 MSE 和单位对偶四元数对齐损失的组合来监督预测,该损失联合表示旋转和平移以避免单独预测的不一致性。对齐损失定义为:
其中 和 是预测和真实的单位 DQ, 表示共轭。总相机位姿损失为:
总损失:模型以端到端方式训练,总损失为:
其中 平衡相机位姿监督的贡献。
4. 实验
我们在稀疏和长序列真实世界数据集上评估了新视图合成和相机位姿估计。
4.1. 实验设置
数据集:我们在 ScanNet 和 RealEstate10K 上进行实验。对于 ScanNet,我们采用文献[38]的训练/测试划分,对于 RE10K,我们遵循文献[44]。两种设置都确保与先前工作的直接和一致比较。
基线与指标:我们使用 PSNR、SSIM 和 LPIPS 评估 NVS 性能。对于相机位姿估计,我们报告绝对平移误差、相对平移误差和相对旋转误差。我们比较了可泛化 NVS 方法,包括(1)需要位姿的:MVSp1at 和 FreeSplat;(2)无位姿的:NoPoSplat、VicaSplat、SPFSplat 和 AnySplat。位姿估计比较仅与无位姿方法进行。
实现细节:我们的方法在 PyTorch 中实现。编码器遵循文献[44]并采用 ViT-Large 骨干,patch 大小为 16。我们用 MAST3R 权重初始化编码器-解码器和高斯中心头,而 ADF-Decoder 和其余头随机初始化。
遵循文献[23],我们在 RE10K 上以 4 视图和 8 视图参考设置进行训练和评估,并进一步在 ScanNet 上进行跨数据集泛化测试。对于 ScanNet,我们采用文献[38]的 3 视图和 10 视图设置,其中 10 视图配置通过向 3 视图设置添加额外参考视图获得。为在更长序列上测试多视图可扩展性,我们还设计了 ScanNet 上的 28 视图评估。
为公平比较,我们遵循文献[5,14,23]并以 的固定分辨率报告所有定量结果。额外细节在附录中提供。
4.2. 实验结果
多视图NVS性能:结果如表1:RE10K上不同参考视图的NVS定量结果(左)和ScanNet跨数据集泛化(右)——最佳和第二佳值已高亮)和 表2:ScanNet上不同视图数量的NVS定量结果——最佳和第二佳值已高亮 左侧所示。这里,AnySplat 指在其他数据集上训练的零样本结果,而 AnySplat 指在相应数据集上微调后得到的结果。可以看出,TokenSplat 始终优于最先进的无位姿方法,包括那些专门为多视图输入设计的方法如 VicaSplat 和 AnySplat,它们分别利用跨邻域注意力和像素对齐高斯融合。在密集视图场景中,TokenSplat 甚至超越了依赖位姿的方法如 FreeSplat,在 8 视图 RE10K 上 PSNR 高出 0.95 dB。
对于28视图评估,我们使用以10视图训练的模型。尽管视图数量不同,TokenSplat 保持稳定的重建质量,而竞争方法包括通过预测融合置信度融合像素对齐高斯的 AnySplat 和 FreeSplat 都出现退化。我们将此归因于这些方法中使用的高斯级融合策略,该策略在更多视图融入时累积不一致性和冗余。相比之下,TokenSplat 在特征空间中进行融合,增强了跨视图推理并减少了长序列、高密度场景中的冗余。此外,随着输入图像数量增加,我们的模型相比 FreeSplat 实现了更高的 SSIM(高出 0.061),同时新视图合成质量也有所提升。这些结果证明了我们的方法对更多视图的可扩展性。
在图2:RE10K和ScanNet上不同参考视图数量的定性比较中,我们的方法在挑战性案例中一致产生更清晰、更真实的新视图渲染。我们的方法更好地保留了精细结构细节并减少了伪影和模糊。更多可视化见附录。


位姿估计:结果如表3:RE10K上不同视图的位姿预测定量结果(左)和ScanNet跨数据集泛化(右)和 表4:ScanNet上不同视图的位姿预测定量结果——最佳和第二佳值已高亮左侧所示。对于 NoPoSplat,位姿通过从预测高斯中心经 PnP 和 RANSAC 估计,而其他方法直接输出相机位姿。TokenSplat 在 RE10K 上始终优于无位姿基线,在 8 视图设置下相比 VicaSplat 和 AnySplat,RPE-r(越低越好)分别降低了 0.335 和 0.147。这一收益源于我们方向约束的 ADF-Decoder,它强制相机与图像 token 之间的解耦交互,导致更稳定的位姿学习。在 ScanNet 上,模型在 28 视图设置下保持准确的位姿估计,相比 AnySplat 将 ATE 降低了 0.018,证实了 TokenSplat 在多视图场景中的鲁棒性和可扩展性。


跨数据集泛化。 为评估零样本泛化能力,我们在 RE10K 上训练 TokenSplat 并直接在 ScanNet 上评估。如表1:RE10K上不同参考视图的NVS定量结果 和 表3:RE10K上不同视图的位姿预测定量结果的右半部分所示,我们的方法在新视图合成和位姿估计上都超越了所有 SOTA 方法。相比 FreeSplat,TokenSplat PSNR 最高提升 0.92/0.51 dB,相比 SPFSplat 将 ATE 降低了 0.013/0.033。在 图3:跨数据集泛化定性比较 中,TokenSplat 保持了连贯的几何和清晰重建的场景结构。值得注意的是,家具边界等精细细节比竞争方法保持得更好,证明了我们的方法在未见场景上的有效性。相机位姿头进一步确保了在新相机配置下的可靠位姿估计,共同促进了优越的跨数据集性能。

场景级可视化:为进一步说明重建质量,图4:场景级可视化和多个新视点渲染展示了场景级可视化,其中相机被拉远以显示全局 3D 高斯结构,以及几个渲染的新视图。AnySplat 直接融合 3D 高斯,显示出明显的未对齐伪影和跨视图可见的融合裂缝。FreeSplat 生成大量分散的高斯,而 NoPoSplat 和 SPFSplat 可扩展性差,未能泛化到未见远处视点。相比之下,我们的方法即使在远超出训练范围的视点渲染时,也保持连贯和几何一致的重建。

4.3. 消融分析
我们在 RE10K(8 视图)上进行消融研究,总结于表5:RE10K上的组件消融——(a)完整模型;(b)像素头;(c)AnySplat风格融合;(d)无ADF-Decoder;(e)无内参嵌入的PSNR、SSIM、LPIPS、ATE、RPE-t、RPE-r指标。相比完整模型(a),(b)将 Token 对齐高斯预测替换为像素对齐高斯头,重建和位姿估计均退化,SSIM 下降 0.026,RPE-r 上升 0.038;(c)AnySplat 风格高斯融合相比像素对齐基线有所改进,但仍不及我们的基于 token 的融合,PSNR 低 0.38 dB;(d)标准 ViT 解码器增加位姿纠缠,导致 RPE-r 高出 0.046,LPIPS 高出 0.011(越低越好),突显了方向约束通信对解耦位姿和图像特征的好处;(e)移除已知相机内参嵌入损害了尺度捕获,尽管位姿估计仍有竞争力。总体而言,这些结果证明了我们的模型设计对准确的多视图重建和相机位姿估计的有效性。

5. 结论
TokenSplat 将基于 token 的多视图融合与 ADF-Decoder 集成,用于从无位姿视图联合进行 3D 重建和位姿估计。该架构实现了连贯的特征解耦和稳定聚合,无需迭代精修。它在不同数据集上产生一致的精度改进和鲁棒的零样本泛化。
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。