港大&字节重磅StereoWorld:无需深度估计,直接生成几何一致双目视频,破解单目几何幻觉,3倍加速5%一致性提升!

3D视觉工坊 2026-08-10 07:00

点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达

编译:3D视觉工坊

3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:港大&字节重磅StereoWorld:无需深度估计,直接生成几何一致双目视频,破解单目几何幻觉,3倍加速5%一致性提升!图1

1. 摘要

本文提出 StereoWorld,一种相机条件的立体世界模型,能够联合学习外观和双目几何,实现端到端的立体视频生成。与单目 RGB 或 RGBD 方法不同,StereoWorld 仅在 RGB 模态内运行,同时直接从视差中显式地建立几何基础。为了实现高效的立体一致生成,我们的方法引入了两个关键设计:(1)统一的相机帧 RoPE,通过相机感知的旋转位置编码增强潜在 token,在保持预训练视频先验的同时实现相对的、视角和时间一致的调节;(2)立体感知注意力分解,将完整的 4D 注意力分解为 3D 视图内注意力加水平行注意力,利用对极先验捕获视差对齐的对应关系,同时大幅降低计算量。在基准测试中,StereoWorld 在立体一致性、视差精度和相机运动保真度方面优于强大的“单目生成+后处理立体转换”流水线,生成速度提升超过 3 倍,视角一致性额外提升约 5%。除基准测试外,StereoWorld 无需深度估计或图像修补即可实现端到端的双目 VR 渲染,通过公制尺度深度基础增强具身策略学习,并兼容长视频蒸馏以支持扩展的交互式立体合成。

港大&字节重磅StereoWorld:无需深度估计,直接生成几何一致双目视频,破解单目几何幻觉,3倍加速5%一致性提升!图2图1:StereoWorld介绍——一种能够基于给定双目图像进行探索的立体世界模型,生成具有内在几何理解的视角一致立体视频,可应用于VR/AR可视化和具身智能中的动作规划*

2. 引言

学习生成式世界模型——即根据动作和相机运动预测未来观测——在交互式感知和具身智能中变得越来越重要。现代世界模型主要使用单目视频表示,在可控视频合成方面取得了强劲成果。然而,单目观测存在根本性的几何局限:深度是隐式的,尺度是模糊的,几何一致性必须被推断而非观测到,这在长时域相机轨迹下会累积 3D 误差,并限制了需要精确几何的应用(如具身智能和导航)。RGB-D 世界模型引入了辅助深度通道,但预测的深度依赖于场景且尺度仍然模糊,通常需要临时归一化,跨域不稳定。

相比之下,立体视觉——许多生物系统中的主导感知机制——提供了对 3D 场景结构的直接、鲁棒的几何线索。这促使我们研究一种立体世界模型,它在双目观测中建立几何基础,而非从单目运动中推断深度或依赖不完美的深度预测器。与单目世界模型相比,立体条件系统联合学习在外观和几何在相机运动和动作下的耦合演化;与 RGB-D 系统相比,它避免了生成和稳定显式公制深度图,同时保留了强大的几何信号。结果是具有一致性、公制尺度感知能力,非常适合 VR/AR 渲染和具身导航,如图 2 所示。

构建立体世界模型仍然具有挑战性。首先,预测必须在双目视图和时间上保持一致,同时泛化到不同的内参、外参和基线——这需要一个统一的、视角和时间感知的相机嵌入。光线图拼接编码了绑定到特定帧的绝对坐标,这可能纠缠视点和场景布局,使相对跨视图泛化(跨变化的基线或位姿)更加困难;相对相机公式更可取。其次,单目 Transformer 的朴素立体扩展带来难以承受的计算量:自注意力随 token 数量呈二次方增长,完整的 4D 时空跨视图注意力很快变得不可行。第三,预训练的视频扩散骨干对位置编码变化高度敏感,因此注入视点信号有破坏已学习先验的风险。

港大&字节重磅StereoWorld:无需深度估计,直接生成几何一致双目视频,破解单目几何幻觉,3倍加速5%一致性提升!图3图2:世界模型对比——StereoWorld整合了公制尺度几何,产生的输出模态与预训练模型更兼容,且可端到端应用于VR可视化,确保左右视图间细粒度细节的一致性更好

为解决这些挑战,我们引入 StereoWorld,第一个相机条件的立体世界模型。我们的方法围绕两个关键设计构建。首先,我们提出一种统一的相机帧 RoPE 策略,扩展潜在 token 空间并用相机感知的旋转位置编码增强它,实现跨时间和双目视图的联合推理,同时最小程度地修改预训练骨干的 RoPE 空间。这种公式有效地编码了相对相机关系,自然地支持具有变化内参和基线的场景,同时保留预训练视频先验,促进稳定高效地适应立体视频建模。其次,我们设计了一种立体感知注意力机制,将完整的 4D 注意力分解为 3D 视图内注意力加水平行注意力,利用立体对应关系集中在扫描线上的对极先验。这实现了强立体一致性,同时大幅降低计算量。这些组件共同使 StereoWorld 能够联合学习外观和几何,提供具有精确相机控制和视差对齐 3D 结构的端到端双目视频生成。

实验表明,StereoWorld 在立体一致性(图4)、视差精度(图6)和相机运动保真度(图5)方面相比单目世界模型有显著提升。例如,与增强后立体转换的最先进方法相比,我们的方法生成速度提升 3 倍,同时视角一致性额外提升约 5%(见表2)。除基准测试外,StereoWorld 开启了实际应用:(i)无需深度估计或修补流水线的直接双目 VR 渲染;(ii)通过公制尺度几何基础增强具身代理的空间感知;(iii)通过蒸馏与长时域单目视频生成方法兼容,支持扩展的交互式立体场景合成。据我们所知,这是第一个实现端到端、相机条件立体世界建模的系统,为几何感知的生成式世界表示开辟了道路。我们的贡献总结如下:

  • 我们引入第一个相机条件的立体世界模型,联合学习外观和双目几何,在显式相机轨迹或动作控制下生成视角一致的立体视频。
  • 我们用相机感知的旋转位置编码扩展潜在 token(不改变骨干的原始 RoPE),实现跨时间和双目视图的相对、统一调节,同时通过稳定的注意力初始化保留预训练视频先验。
  • 我们将完整的 4D 时空注意力分解为 3D 视图内注意力加水平行注意力进行跨视图融合,利用对极先验大幅削减计算量,同时保持视差对齐的对应关系。
  • 我们的方法在定量和定性结果上均表现优越。它实现了端到端的 VR 渲染,具有改进的视角一致性,为具身策略学习提供了潜在的几何基础收益,并自然地扩展到长视频生成。

3. 立体世界模型

给定一对校正后的立体图像  及其基线  和场景提示 ,我们的目标是合成一个以相机轨迹  指定的动作为条件的立体视频,其中  和  分别为内参和外参, 表示动作数量。生成的序列应(i)在遵循指定相机运动的同时保持时间平滑,且(ii)在每个时间步保持左右一致。为此,在预训练视频扩散模型(3.1节)的基础上,我们提出具有两个关键组件的 StereoWorld(图3):(a)一种统一的相机帧位置嵌入策略,扩展骨干的潜在 token 空间并用相机感知的 RoPE 增强,最小程度地扰动预训练先验(3.2节);以及(b)一种立体感知注意力机制(3.3节),将跨视图融合分解为 3D 视图内注意力加水平行注意力,在计算效率与精确的对极(视差对齐)对应关系之间取得平衡。

港大&字节重磅StereoWorld:无需深度估计,直接生成几何一致双目视频,破解单目几何幻觉,3倍加速5%一致性提升!图4图3:StereoWorld图示——给定一对立体图像和条件相机轨迹,StereoWorld首先使用统一的相机帧RoPE表示编码来自不同视点和时间步的条件和噪声视频潜在表示,然后通过配备立体注意力的DiT进行去噪,最终产生立体视频

3.1. 预训练视频扩散模型

我们的工作构建在预训练视频扩散模型之上,并将其改造用于立体世界建模,使我们能够利用大规模视频预训练提供的强时空先验和视觉保真度。具体而言,我们采用由 3D VAE 和基于 Transformer 的扩散模型组成的潜在扩散模型。VAE 编码器  将视频  压缩为紧凑的时空潜在表示:

DiT 随后在此潜在空间中训练,按照整流流公式逐步将带噪潜在变量去噪为视频潜在表示。训练完成后,模型可通过迭代去噪从纯噪声生成样本。去噪后,VAE 解码器  将潜在表示重建回像素域。在我们的立体设置中,立体视频  使用式(1)以视点无关的方式编码,产生潜在表示 

旋转位置编码与注意力。 原始 RoPE 通过在点积注意力之前旋转查询和键向量来编码相对位置。对于 1D 序列,注意力矩阵定义为:

其中  是位置  和  的查询和键嵌入, 是作用于  维嵌入的每个 2D 子空间的相对旋转矩阵。相对旋转矩阵 ,其中  是虚数单位, 是应用于特定第  对  维度的旋转频率 ,使模型能够直接在注意力中捕获相对位置关系。

对于视频,最近的 RoPE 变体(如 Qwen2-VL 中的 M-RoPE)通过沿时间和空间分解旋转来保留固有的 3D 结构。设位置为 ,注意力项变为:

其中 ,且 。旋转  和  作用于  维特征的不相交 2D 子空间,因此可交换并以乘法方式组合。在实践中,特征维度  在  和  上均匀划分,每轴应用独立的 1D RoPE,然后按上述方式组合。

3.2. 统一的相机帧 RoPE

将预训练的 DiT 视频扩散模型微调为立体世界模型需要注入相机条件——包括具有变化基线的立体相机和动态相机运动——同时最小程度地干扰预训练先验。

一种常见方法是将 Plücker 光线编码拼接到输入特征通道上。然而,类似于早期的位置编码方法,这种方法依赖绝对坐标,使其对参考帧的选择敏感。为缓解这一局限,近期方法如 GTA 和 ProPE 建模相对相机位置,实现了更好的泛化。具体而言,ProPE 将式(3)中的  替换为 ,其中:

其中  是 Kronecker 积, 是单位矩阵。然而,在微调预训练模型时,直接用式(5)修改原始位置编码会显著破坏模型已学习的先验,因为 DiT 的注意力权重、归一化统计量和 token 基是与原始 RoPE 频率和轴划分协同适应的。

为解决此问题,我们提出通过扩展 token 维度而非改变原始编码方案来注入相机位置编码。具体而言,我们通过增加特征维度来扩展原始自注意力层:

其中  是相机 RoPE 的扩展维度。相同的扩展也应用于 。因此,式(5)中的旋转矩阵可扩展为 

从而得到我们统一的相机帧 RoPE:

其中 。在此设置中,矩阵的第一个  块保持与式(3)相同,与预训练先验对齐。对于新添加的  块,我们实验了两种不同的初始化策略。

我们对新子空间  和  实验了两种初始化方案:

  • 零初始化确保模型初始输出与预训练模型相同。然而,这种初始化使训练更具挑战性,因为相机条件信号难以有效激活。
  • 复制初始化用时间注意力权重初始化新子空间。由于相机和时间嵌入在帧级别操作,这提供了强起点,同时对预训练行为影响最小。

与 PRoPE 相比,我们统一的相机帧 RoPE 扩展了 token 维度而非重新参数化 RoPE,保留了预训练位置子空间并添加了一个正交的、相机条件通道。经验上(图7),这产生了更稳定的训练和更快的收敛。

3.3. 立体感知注意力

通过统一的相机帧表示,每个视点的相机位置编码被注入立体视频潜在表示  中,建模任意 token 对之间的关系为 。这种统一公式使我们的方法能够无缝适应具有变化基线和内参的多立体视频数据集,如表1所示。

使用这种表示,朴素的立体生成器沿序列维度拼接左右 token,并对特征  应用完整的联合注意力,产生耦合空间、时间和视点依赖的 4D 注意力 。然而,由于注意力成本随 token 数量呈二次方增长,这种方法对视频合成在计算上难以承受。

观察到在校正后的立体对中,对极线水平对齐,我们利用这种几何设计更高效的立体感知注意力。4D 注意力被分解为:(a)捕获时空动态的视图内 3D 注意力 ,以及(b)仅在相同时间步的水平对齐 token 之间计算的跨视图注意力 。如图3所示,最终输出聚合了两个分量:

通过这种设计,总体计算复杂度从  降低到 。我们在表5中报告了这两种注意力机制之间性能差异的比较,证明了所提出的解耦注意力方案的高效性和有效性。

4. 实验

表1:训练数据信息——包含Stereo4D、TartanAir、TartanAirGround、DynamicReplica、VKitti数据集的样本数、基线/毫米、运动类型、域类型港大&字节重磅StereoWorld:无需深度估计,直接生成几何一致双目视频,破解单目几何幻觉,3倍加速5%一致性提升!图5

4.1. 实现细节

我们基于视频生成模型 Wan2.2-T12V-5B 实现 StereoWorld。模型在表1列出的混合数据集上训练。每个视频片段包含 49 帧,输入网络前裁剪并缩放到 。我们使用 AdamW 优化器训练 StereoWorld 20k 步,批量大小为 24,在 24 块 NVIDIA H20 GPU 上。学习率设为 1e-4。

4.2. 基准数据集与指标

评估数据集。 我们从 FoundationStereo(合成)、UnrealStereo4K(合成)、TartanAir 测试集(合成)和 Middlebury(真实)中采样 435 张立体图像构建评估集,覆盖室内和室外场景、多样化纹理和不同基线。

对每张立体图像,我们使用 Qwen2.5-VL 生成场景描述并采样随机相机轨迹。

评估指标。 StereoWorld 在相机精度、左右视图同步、视觉质量和 FPS 上评估。对于相机精度,我们从生成视频中提取相机位姿,计算旋转和平移误差。视图同步使用图像匹配技术 GIM 测量超过置信度阈值的匹配像素数量。我们进一步使用 SV4D 的 FVD-V 分数和每时间步对应源帧与目标帧之间的平均 CLIP 相似度(记为 CLIP-V)测量跨域对齐。对于视觉质量,我们分别使用 Fréchet Image Distance、Fréchet Video Distance、CLIP-T 和 CLIP-F 评估保真度、文本一致性和时间一致性。我们还使用标准 VBench 指标对我们的方法进行基准测试。

4.3. 立体视频对比

港大&字节重磅StereoWorld:无需深度估计,直接生成几何一致双目视频,破解单目几何幻觉,3倍加速5%一致性提升!图6图4:立体视频生成与增强后立体转换的SOTA方法对比——我们的方法以端到端方式直接生成立体视频,更好地保持了视图间细节一致性和色调连贯性

基线。 StereoWorld 是第一个立体视频生成模型。为展示同步立体视图生成的优势,我们首先使用一系列最先进的相机控制视频生成方法获得单目视频,然后使用 StereoCrafter 将其扩展为立体视频。StereoCrafter 是一种扭曲-修补视频生成模型。因此,对于 RGBD 生成模型,我们直接使用生成的深度将视频扭曲到另一个视图;对于 RGB 生成模型,我们首先使用 DepthCrafter 进行视频深度估计,然后执行扭曲。与这些多阶段流水线相比,StereoWorld 作为端到端模型实现了更高效的生成,如表2的"FPS"列所示。

此外,由于不同模型使用的训练数据不完全对齐,我们还在相同设置下训练了方法的单目版本进行比较,以更好地展示立体生成带来的优势。

4.3.1. 立体视图一致性

表2:立体视频与SOTA方法在视觉质量、相机精度、视图同步和FPS上的对比——包含Voyager、DeepVerse、Aether、SEVA、ViewCrafter、Ours Monocular、Ours Stereo的模态、FID、FVD、CLIP-T↑、CLIP-F↑、RotErr、TransErr、Mat. Pix.、FVD-V、CLIP-V、FPS指标港大&字节重磅StereoWorld:无需深度估计,直接生成几何一致双目视频,破解单目几何幻觉,3倍加速5%一致性提升!图7

图4展示了我们的方法与基线方法在立体视频生成任务上的视觉对比。依赖于额外深度估计和视图修补模型的对比方法,常常在左右视图之间出现细节错位(如第三列的植物)或轻微颜色不一致(如第二列的天空)。相比之下,我们的方法端到端地生成立体视频,有效避免了这些伪影,确保了更好的视图一致性。表2的"View Synchronization"列进一步验证了这一观察。

4.3.2. 相机轨迹

我们的方法在生成结果与条件相机参数之间的对齐方面也表现优越。相比之下,基于扭曲的世界模型在视点变化较大时往往因深度估计不准确或几何线索不足而导致相机一致性偏差。同时,基于离散动作的世界模型缺乏细粒度相机控制。受益于统一的相机帧 RoPE,我们的方法有效建模了相机之间的相对关系,实现了更精确和连续的相机控制。我们使用 VGGT 估计生成视频的相机位姿,并与条件相机输入进行比较以量化精度。如表2的"Camera Accuracy"列所示,我们的方法达到了最高精度。此外,图5:不同相机条件类型方法的相机轨迹对比可视化 可视化显示了相机轨迹对比,清楚表明我们的模型更好地保持了预期的相机运动。

港大&字节重磅StereoWorld:无需深度估计,直接生成几何一致双目视频,破解单目几何幻觉,3倍加速5%一致性提升!图8图5:相机轨迹对比可视化

4.3.3. 视差

港大&字节重磅StereoWorld:无需深度估计,直接生成几何一致双目视频,破解单目几何幻觉,3倍加速5%一致性提升!图9图6:立体视差对比——值得注意的是,我们的方法在训练期间不依赖任何深度监督

表3:立体视频在Vbench指标上的对比——包含Aesthetic Quality、Imaging Quality、Temporal Flickering、Background Consistency港大&字节重磅StereoWorld:无需深度估计,直接生成几何一致双目视频,破解单目几何幻觉,3倍加速5%一致性提升!图10

图6比较了我们的方法与其他 RGB-D 世界模型生成的视差图。如图所示,现有的 RGB-D 方法常常出现伪影,其中 RGB 输出的纹理模式被无意地转移到预测的视差中——例如 Voyager 第三列和 Aether 第一列。相比之下,我们的方法通过首先生成立体图像对然后从它们估计视差,有效缓解了此问题,产生更清晰和几何一致的结果。此外,在我们的设置中,视差可直接转换为公制深度。还值得注意,与这些对比方法不同,我们的模型在训练时不使用任何深度监督,仅依赖双目图像信号。

4.4. 应用

4.4.1. 虚拟现实显示

我们的方法可直接应用于 VR/AR,配合专业头戴显示设备。我们在图1中可视化了几个红蓝立体图作为生成立体输出的示例。此外,我们在 VR 头显上进行了测试并进行了用户研究,结果见补充材料。

4.4.2. 具身场景

为展示我们方法的潜力,我们进一步在具身场景中进行了评估。具体而言,我们在 DROID 的双目机械臂数据集上微调了我们的模型。训练后的模型可以基于给定文本提示生成相应的立体操作视频,同时从生成结果中准确恢复公制尺度深度。我们在图1和补充材料中展示了结果。

4.4.3. 长视频蒸馏

我们的方法还可作为交互式因果方式立体视频生成的双向注意力基础模型,类似于 Self-Forcing。具体而言,我们将扩散采样过程蒸馏为四步,并将模型转换为因果注意力机制,同时保持 KV 缓存。蒸馏后的模型能够生成 10 秒的立体视频,生成速度从 0.49 FPS 提升到 5.6 FPS。长视频蒸馏的更多技术细节见补充材料。

4.5. 消融实验

相机注入。 我们在 TartanAir 数据集上比较了不同的相机条件策略,报告于表4:相机注入策略消融——包含Plucker Ray、PRoPE、Ours Zero Init、Ours Copy Init的FID、FVD、CLIP-T、CLIP-F、RotErr、TransErr指标) 和图7:不同相机条件策略的可视化对比。其中,Ours(Zero Init)保留了预训练模型的先验并取得了相对较高的视觉质量。然而,由于权重初始化为零,相机条件的学习变得更加困难,导致相机精度较低。Plucker Ray 方法依赖绝对坐标,泛化能力有限且性能下降。与 PRoPE 相比,我们的方法更好地保留了预训练模型先验,在视觉保真度和相机一致性方面都取得了优越结果。

表4:相机注入策略消融港大&字节重磅StereoWorld:无需深度估计,直接生成几何一致双目视频,破解单目几何幻觉,3倍加速5%一致性提升!图11

港大&字节重磅StereoWorld:无需深度估计,直接生成几何一致双目视频,破解单目几何幻觉,3倍加速5%一致性提升!图12图7位置:不同相机条件策略对比

注意力机制。 我们也比较了不同注意力机制对结果的影响。如表5:注意力机制消融——包含4D Attn和Stereo Attn的CLIP-T、CLIP-V、Mat. Pix.、CLIP-V、FLOPs、FPS指标 所示,虽然 4D Attention 在视觉质量上略优,但 Stereo Attention 的性能大致相当——甚至在视图一致性方面超越。同时,FLOPs 和 FPS 提升了约 ,证明了我们设计的高效性。详细的 FLOPs 计算见补充材料。

表5:注意力机制消融港大&字节重磅StereoWorld:无需深度估计,直接生成几何一致双目视频,破解单目几何幻觉,3倍加速5%一致性提升!图13

5. 结论与讨论

本文提出了 StereoWorld,一种相机条件的立体视觉模型,联合建模双目视觉外观,同时支持显式几何基础。通过采用统一的相机帧旋转位置嵌入,模型有效编码了相对相机参数,对预训练先验的干扰最小。此外,我们引入了一种立体感知注意力机制,利用立体视频中固有的水平对极约束来降低计算复杂度。实验表明,StereoWorld 在立体视频生成中实现了更高效和视图一致的结果,在虚拟现实、具身 AI 和长时域视频合成等下游应用中具有强潜力。

尽管取得了这些进展,立体视频生成在计算上仍然比单目对应方法更昂贵,且大规模立体数据集的稀缺进一步限制了模型的可扩展性。我们在补充材料中详细讨论了这些局限性和潜在的未来研究方向。

本文仅做学术分享,如有侵权,请联系删文。

港大&字节重磅StereoWorld:无需深度估计,直接生成几何一致双目视频,破解单目几何幻觉,3倍加速5%一致性提升!图14港大&字节重磅StereoWorld:无需深度估计,直接生成几何一致双目视频,破解单目几何幻觉,3倍加速5%一致性提升!图15港大&字节重磅StereoWorld:无需深度估计,直接生成几何一致双目视频,破解单目几何幻觉,3倍加速5%一致性提升!图16港大&字节重磅StereoWorld:无需深度估计,直接生成几何一致双目视频,破解单目几何幻觉,3倍加速5%一致性提升!图17

添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
字节
more
早报|宇树科技今日申购,中一签或赚20万;于东来回应关闭许昌生活广场店;原字节跳动机器人一号位加入小米
150.8元/股!宇树科技超百名员工参与IPO「盛宴」,一批90后千万富豪或将诞生;DeepSeek拟上调API服务定价;字节拟训练超5万亿参数大模型
雷军挖走字节一员大将
字节发布SeedRealtime大模型,原生音视频全双工交互上线豆包
腾讯亮剑、字节缺席,AI共识变了
港大&字节重磅StereoWorld:无需深度估计,直接生成几何一致双目视频,破解单目几何幻觉,3倍加速5%一致性提升!
汽车早餐 | 雷军称小米汽车计划2027年进入欧洲市场;字节跳动称没有做智能驾驶业务的计划;一汽解放预计上半年净利润同比增长1274%-1528%
字节跳动突发重大调整
OpenAI挖到最新菲尔兹奖得主,字节刚出炉的科学家计划在瞄准谁?
字节Seed为什么不蒸馏别的模型?
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号