点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
来源:3D视觉工坊
3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:
太长不看版: iPhone 三镜头全开,动态 4D 重建 PSNR 从 24.51 跃至 31.71,提升超 7dB;静态场景 mPSNR 从 26.24 升至 30.50。
导读
许多消费级智能手机、立体相机和光场相机在一次曝光事件中记录多个同步视角。然而,新视角合成流水线通常只使用单目流,并依赖相机运动或学习到的先验来获得角度覆盖。在本文中,我们发问:为什么只用单个视角?我们分析了传感器受限的多视角(一个传感器在空间和角度分辨率之间做权衡)以及曝光受限的多视角(一个设备上多个传感器同时观测每个事件)。我们提出了一个包含三类消费级多视角相机的新数据集,并对稀疏视角 3DGS 与 4DGS 基线进行评估,衡量重建质量随曝光次数与极端视角间夹角的变化。我们的结果表明,即便基线很低,使用多台相机也能显著提升单次拍摄、少样本以及随手拍摄视频场景下的重建质量。此外,在固定传感器预算下,尽管空间分辨率更低,角度采样在曝光稀缺时仍能改善重建。这些增益在单次拍摄场景与动态场景中最为显著——静止的单目相机缺乏恢复场景几何与运动所需的角度多样性。

效果展示

▲ 图1:稀疏光场采样示意。静态场景(左):多视角设备每次曝光记录同一场景状态的多个视角,恢复出更好的几何;动态场景(右):固定单目相机每个时刻只有一个视角,无法区分运动与几何,而同步相机阵列能从多个角度观察每个场景状态,打破这一歧义。

▲ 图7:复用光场相机实拍结果。用原型分别以单目、光场和复用配置拍摄同一场景(中),并从单次曝光重建中渲染留出视角(右)。复用光场相机的 PSNR 高达 25.78,既恢复了单目完全无法重建的几何,又保留了非重叠光场因分辨率下降而丢失的细节。
引言
当下的照片与视频大多由配备多颗摄像头的设备拍摄。例如,iPhone 的三颗后置摄像头会同时从相隔约 5° 的视角对场景成像;Apple Vision Pro 的立体主摄像头提供更宽、约 15° 的基线;即便是老牌光场相机 Lytro Illum,也能在单次曝光中记录 13×13 网格的微透镜子视角。这类相机能捕捉单目传感器所无法提供的角度多样性。
然而,新视角合成社区几乎一边倒地假设单目输入。基于 NeRF、3DGS 及其动态对应方法的工作,都假设每个相机位姿对应一张图像。为了积累角度多样性,现有方法要么搭建昂贵的多相机阵列,要么绕场景移动相机,从而在角度分辨率与时间分辨率之间引入固有的取舍。此外,只有当相机移动远快于场景运动时,移动相机才能提供有效的多视角线索,而这对动态场景并不现实。当视角受限时,近期工作通常依赖学习到的先验或正则项,而非更好的硬件。这一点在那些用多相机手机与平板采集的数据集上同样成立:这些设备明明拥有两颗以上摄像头,训练时却只用了其中一颗。
为什么会丢弃这些角度信息?也许最自然的解释是:消费级相机的基线太小,无法提供有意义的视差线索,因而相对单目采集并无实质提升。我们的工作检验并推翻了这一假设。我们借助光场采样的视角框架来审视这个问题,并分析了两种情形:传感器受限的多视角,即一个有限的传感器在空间分辨率与角度分辨率之间做权衡;曝光受限的多视角,即一个消费级设备上的多个同步传感器同时观测每一次曝光事件。一台移动的单目相机若想匹配图像数量,只能付出更多拍摄时间,而对于动态场景,它观察到的还是不同的场景状态。
我们对高斯泼溅与基于先验的稀疏视角方法,在三类消费级多视角相机——智能手机多摄像头阵列、立体相机与光场相机——上做了全面评测,并在静态与动态场景的单次拍摄、少样本以及随手拍摄视频采集下把它们与单目基线对比。我们还提出了一种复用式光场相机,它延展了光场相机空间-角度权衡的思路:让更高分辨率的子镜头图像在传感器上刻意重叠。
我们证明,使用所有可用的相机能显著提升少样本下的静态与动态重建。在固定传感器预算下,即便单视图空间分辨率更低,角度采样仍能在曝光稀缺时改善重建,而复用式设计在仿真与我们的物理样机上同时改善了这一权衡。这些增益在单次拍摄与动态场景中最为显著——静止的单目相机缺乏恢复场景几何与运动所需的角度多样性。此外,这些源自硬件的增益与数据驱动的先验互补:每次曝光中编码的额外场景专属角度信息,并不会被学习先验所编码的统计信息所覆盖。
主要贡献
多相机数据集:16 个真实场景(8 静态 + 8 动态),每个场景均由 iPhone 15 Pro(每次曝光 3 视角)、Apple Vision Pro(立体双目)和 Lytro Illum 光场相机(每次曝光 81 视角)拍摄——首次在同一批场景上横向对比多类消费级相机。 跨相机基准测试:系统评测 3DGS、4DGS 及稀疏视角基线(SparseGS、FSGS),把重建质量刻画为相机类型、曝光次数和角度基线三者的函数。 实用结论:消费级光场采样相机在视角受限场景下全面优于单目相机;收益在动态场景最为显著,因为每个时间步的角度多样性对恢复几何与运动至关重要。 软硬件协同设计:搭建复用光场相机原型,让子镜头图像在传感器上刻意重叠,单次曝光下同时超越单目和传统光场采集,示范了"为重建算法设计相机硬件"的思路。
方法
一句话核心思路:把每次曝光看作一次"稀疏光场采样"事件,将同一设备上的所有子视角(sub-view)作为一组同步测量,共同监督同一套 3D/4D 高斯——用真实的角度信息取代(或补充)学习先验。

(a) 两种多视角采样模式。 作者首先厘清问题的坐标系。传感器受限多视角:一块传感器被切成 M×M 网格的子孔径视角,每个视角只保留 1/M² 的像素,但曝光同时从 M² 个方向观察场景——像素换角度。曝光受限多视角:多个独立传感器(手机三摄、双目)硬件同步,每次曝光免费获得 2–3 张全分辨率视角。关键洞察是:移动的单目相机想匹配 M 相机设备的图像数量,必须花 M 倍拍摄时间;而动态场景下根本无解——顺序曝光看到的是不同场景状态,任何单一时刻都没有视差可言。同步子视角是随手拍设备在每个时间步唯一可得的视差来源。
(b) 相机建模与角度基线。 每台相机 C 被建模为一组子视角,每个子视角有已知的内外参;单次曝光同步采集所有子视角。为了量化"视差有多大",作者定义了尺度不变的角度基线 θ:从场景质心 g 出发,看任意两个子视角之间的最大夹角。直觉上,θ 就是"站在物体中心左右张望能转过多大角度"——单目 θ=0,基线越宽或物体越近,θ 越大。真实数据集上的中位角度基线为:iPhone 约 5.06°、立体相机约 15.1°、Lytro 仅 0.74°。这些数字小得可怜(全光采样理论要求的密度远高于此),但后文实验证明它们依然真香。
(c) 复用光场相机:让子图像故意叠在一起。 传统基于微透镜阵列的全光相机把传感器切成互不重叠的子区域,空间分辨率大打折扣。本文的硬件创新是在主镜头后方放置透镜阵列 + 光阑阵列,让子镜头的成像足迹在传感器上刻意重叠——相当于每个子视角分到更大的像素份额,代价是测量变成多视角的线性叠加。重建时对每个子视角按标定位姿做光栅化,线性叠加模拟出合成传感器图像,直接与单次实测监督——这是一个"从一次测量中训练"的压缩感知式逆问题。为了解开重叠视角,训练目标加入总变分(TV)正则:在去噪的同时保留图像边缘,实验发现这个无监督正则对光场与复用输入尤其有用。
(d) 与高斯泼溅的结合。 流水线相当"朴素":给定一次或多次曝光的子视角,直接优化 3D 或 4D 高斯,通过模拟每台相机的前向模型对实测做监督。每个子视角独立光栅化、独立算光度损失;静态场景用 3DGS,动态场景用 4DGS(一组规范 3D 高斯 + 基于 HexPlane 的变形网络)。位姿估计用 VGGT 加光束法平差,iPhone 与 Vision Pro 的多路流通过 iOS 的 AVMultiCamSession API 锁定到同一硬件时钟,实现亚帧级时间对齐。由于消费级光场相机不能录视频,动态实验只在手机与立体相机上进行。

实验结果

▲ 表1:合成场景(NeRF Synthetic,角度基线 10°)结果。传感器受限(左)与曝光受限(右)两种机制下,单次曝光时光场/复用设计 PSNR 达 24.78/26.39,iPhone 与立体相机达 19.35,均大幅超过单目的 16.25;曝光增加到 3 次时各类相机收敛,但多视角仍保持优势。

▲ 表3:真实单曝光静态场景结果。光场采集(左)中 81 个子视角相对单视角让 mPSNR 从 26.24 升至 30.50(3DGS);iPhone(右上)与立体相机(右下)的同步视角也在所有重建方法下全面超越各自的单目基线,且与稀疏视角方法的学习正则互补。

▲ 表5:真实动态场景结果(4DGS)。iPhone 三镜头全开使 PSNR 从 24.51 提升到 31.71,立体相机从 29.17 提升到 34.48——动态场景收益最大,因为顺序单目曝光观察到的是不同场景状态,同步多相机是每个时间步唯一的视差来源。
几个关键数字值得划重点:单次曝光、同等传感器预算下,复用光场设计把 PSNR 从单目的 16.25 拉到 26.39(+10.14 dB),深度绝对相对误差从 0.0939 降到 0.0181,几何质量提升近一个量级;真实动态场景上多相机带来 +5~7 dB 的涨幅。深度实验(Table 2,本文未展开)同样显示四种光场采样相机的几何误差全面低于单目。而随手拍视频实验(Table 4)中,多视角与 Difix3D+ 扩散先验叠加时收益趋于饱和——印证了"硬件角度信息与学习先验互补、但当视角充足时边际收益递减"的结论。
总结 & 未来工作
这篇论文用扎实的跨相机基准证明:消费级多相机设备是一座被严重低估的金矿。哪怕只有几度的基线、两三个同步视角,也足以在单张、少视角和动态重建中大幅提升 3DGS / 4DGS 的质量;传感器预算固定时,角度采样在曝光稀缺场景下比空间分辨率更值钱,而复用设计能追回部分丢失的分辨率。
局限同样清晰:收益依赖角度覆盖与场景深度——基线越宽、物体越近、采样越密,视差越强;对于视差微小的远景大场景,提升会明显缩水。更远的想象空间在于软硬件协同:既然重建算法知道要什么,相机硬件是否可以为之重新设计?复用光场原型只是这一方向的第一步。对从业者而言,最直接的行动建议是:下次用手机采集 NVS 数据时,别忘了那两颗一直在旁边陪跑的镜头。
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。