点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
来源:3D视觉工坊
3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:
给模型一张图,再按下 W、A、S、D:向前推进、侧向平移、后退,甚至连续执行一段组合路线。腾讯 ARC Lab 联合香港大学、香港科技大学提出并开源 SCoPE(Sightline-Coordinate Positional Encoding)。它关注的不是再加一个相机控制模块,而是一个更基础的问题:视频模型究竟应该用什么坐标来理解相机运动?
它没有先把场景重建成显式 3D,也不需要额外维护一套几何地图。做法是为每个视频 token 绑定一条由相机参数确定的三维射线,并把射线特征写进 query / key。这样,attention 在比较“内容像不像”的同时,也能看到“这两束视线在几何上合不合理”。
这套设计的代价很小:SCoPE 在 Wan2.2 5B / 14B 上新增参数均不到 0.1%。在 14B 模型上,相机旋转误差降低29%,FVD 降低43%。几乎不改变模型规模,却同时改善了相机控制与视频质量。
作者:Minghao Yin、Jiahao Lu、Wenbo Hu、Wang Zhao、Ying Shan、Kai Han
机构:香港大学、香港科技大学、腾讯 ARC Lab

视频1:单张图像响应连续 WASD 指令;画面同步显示按键与目标相机轨迹。

论文:https://arxiv.org/abs/2606.27345
项目主页:https://visual-ai.github.io/scope/
代码:https://github.com/TencentARC/SCoPE
模型:https://huggingface.co/TencentARC/SCoPE
图1:SCoPE 为每个时空 token 构造相机射线,并将射线特征注入 query / key;外观相似但视线不相容的候选可以因此被区分。
视频模型为什么会在三维世界里“迷路”?
当前主流视频扩散 Transformer 往往用 (u, v, t) 描述 token 的位置,再通过 三维 RoPE 编码“第几行、第几列、第几帧”。它描述得很好的是视频张量中的位置,却没有直接告诉模型:这个 token 对应的是哪一条三维视线。
问题在镜头运动后变得明显。同一面墙、同一扇窗,甚至同一个人物,都会落到新的像素位置。两个 token 即使对应同一个三维点,它们的 (u, v, t) 也可能相距很远。
换到三维视角来看,模型知道 token 在视频张量里的“座位号”,却不知道这次观察从哪个相机位置出发、朝哪个方向看。跨帧匹配因此更依赖外观相似性,而不是显式的观察几何。
在重复纹理、长轨迹或复杂运镜中,这个缺口会直接变成匹配歧义:相机可能逐渐偏离目标轨迹;当镜头绕一圈重新回到原位,场景本身也可能已经发生漂移。
世界还没生成,射线先确定了
一种直接做法,是告诉模型每个 token 对应哪个三维世界点。但世界点依附于场景表面,而在视频真正生成之前,这个表面还不存在;对于纯文本生成的新场景,也没有现成画面可以先做三维重建。
但在画面真正生成之前,有一类几何量已经确定:相机射线。只要目标相机轨迹给定,每个未来 token 从哪个相机中心出发、沿什么方向观察,都能由相机内外参直接算出。
射线不提供物体深度,却给出一个稳定的几何关系:如果两个 token 对应同一个三维点,那么它们的观察射线应该在该点相交,或在噪声下近似相交。
SCoPE 正是利用这一点,把 token 的位置从“第几行、第几列”扩展到“从哪里看、朝哪里看”——也就是一套与相机运动直接相关的三维观察坐标。
图2:同一个世界点在不同帧中的像素位置会变化,但目标相机轨迹一旦确定,对应的观察射线即可提前计算。
从线几何到 Attention:两套公式刚好对得上
SCoPE 的关键不是再堆一个几何模块,而是让射线关系直接参与 attention score 的计算。这里恰好出现了一个很漂亮的对应:经典线几何与 query-key 点积,在代数形式上是兼容的。
SCoPE 用 Plücker 坐标表示三维射线,由方向 d 和矩 m = o × d 组成,其中 o 是相机中心。d 描述射线方向,m 则把相机中心的位置也编码进来。
在线几何中,reciprocal product 可以描述两条射线的相对关系。它对两条射线分别都是线性的,而 Transformer 的 query-key 点积同样是双线性形式。换句话说,射线之间的几何关系天然适合写进 attention,而不必另起一套计算。
当两条射线在同一个三维点相交时,reciprocal product 为零;其他共面情形也可能为零,所以这个量并不是“是否相交”的唯一判据,更准确地说,它衡量的是两条视线之间的 几何相容性。
只改 Q/K:让内容匹配自带几何判断
SCoPE 在预训练 Wan2.2 上微调,原有的内容投影、QK Norm 和三维 RoPE 都保留,只把投影后的射线特征加到 query 和 key。key 侧对 Plücker 坐标中的方向与矩进行交换,使 ray-ray 点积能够对应到具有明确几何意义的 reciprocal-product 形式。
于是,一次 query-key 点积可以拆成四类交互:
content · content:保留原模型已有的视觉内容匹配; content · ray 与 ray · content:让视觉内容与观察几何相互校准; ray · ray:绕开外观,直接判断两条视线是否具有几何相容性。
这意味着无需额外跑一套几何匹配:内容相似性和视线几何在同一次 attention 中共同决定 token 之间的关联。
图3:content-content 保留外观匹配;两个交叉项负责内容与几何交互;ray-ray 项直接编码视线之间的几何关系。
消融结果与这个解释一致。完整模型的 RotErr 为 0.085;去掉两个交叉项后升至 0.135,去掉纯 ray-ray 项后进一步升至 0.159。这说明 content-ray 交互和独立的 ray-ray 几何项都不是装饰,它们都直接影响相机控制效果。
为了尽量不扰动预训练模型,射线分支采用 零初始化。训练第 0 步与原始 DiT 保持一致,之后再逐步学会使用相机几何。
在当前 Wan2.2 版本里,(u, v, t) 仍负责描述 token 在视频张量中的排列,相机射线则描述“从哪里、朝哪里看”。两套坐标各司其职,也便于直接复用预训练权重。团队还在进一步探索让 SCoPE 完全替代 RoPE,由射线坐标独立承担位置编码。
尺度不统一怎么办?NGI 把方向和幅度拆开
实际训练还会遇到另一个麻烦:不同数据源的相机位姿并不共享同一尺度。真实标定数据可以直接用米表示,而单目 SfM / SLAM 往往只能恢复 up-to-scale 的轨迹;同样的数值,在不同视频里可能对应完全不同的真实运动幅度。
为了解决这一点,SCoPE 引入 Normalize-Gate-Inject(NGI),把射线方向、尺度信息和最终注入强度分开处理:
Normalize:把射线矩 m分解为单位矩向量和单独的对数模长s;Gate:根据每个 token 的 s生成逐通道门控,自适应调节几何注入强度;Inject:投影射线特征并使用与内容分支匹配的 RMSNorm,再经门控和零初始化系数加入 query/key。
这样处理后,方向与尺度不再混在同一个数值范围里。模型可以适配不同来源的位姿尺度,同时保留相机运动幅度这一有用信号。
图4:SCoPE 在 Wan2.2 上的注入流程。原有内容路径保持不变,射线经分解、投影、RMSNorm 与尺度门控后加入 query / key。
不仅走得准,还要走得远、再走回来
在 Wan2.2 5B 和 14B 上,研究团队分别评估了旋转、平移和整体相机轨迹误差。SCoPE 在表中的四项相机控制指标上均取得最佳结果;从 5B 扩展到 14B 后,这一优势仍然保持。视频质量方面,14B SCoPE 的 FVD 为 280.17,相比最强基线降低43%。
表1:Wan2.2 5B 与 14B 上的相机控制结果。RotErr、TransErr、CamMC 和 ATE 均为越低越好。
定性结果覆盖了大范围环绕、拉升、S 形巡游和组合 WASD 路线。无论是真实拍摄画面还是风格化插画,模型都能沿给定轨迹继续生成,并在较长相机运动中保持场景结构。

视频 2:单张空中山海图像沿 Grand Tour 轨迹连续生成,右下角显示目标相机路径。

视频 3:真实水下场景沿给定相机轨迹继续生成。

视频4:风格化输入在保持画风的同时执行目标运镜。
除了“走得准”,论文还测试了模型能不能“走出去,再回来”。closed-loop revisit 让镜头沿闭环轨迹离开初始视角,最后重新回望起点。SCoPE 的 Return Translation Ratio 为 0.090,Return LPIPS 为 0.230,两项均优于对比方法;生成结果中,相机位置与场景内容也能回到接近起点的状态。

视频5:镜头离开苏州园林的初始视角后重新回望,场景结构与起始画面保持一致。
从“生成一段视频”,走向“进入一个世界”
视频生成首先解决的是“把一个世界画出来”。但如果目标进一步走向世界模型,问题就会变成:能不能在这个世界里移动,并在长轨迹之后仍然认得回去的路?
SCoPE 的出发点很直接:如果模型要理解三维运动,位置编码就不该只描述像素网格,还应该包含三维观察坐标。这样,相机控制不再只是网络外部附加的一条条件,而是进入模型自身用于组织 token 关系的坐标系统。
射线并不等于完整几何:它确定相机位置与观察方向,场景深度仍要由模型从内容中学习。SCoPE 需要相机内外参,但训练位姿可以来自标定、SfM、SLAM 等多种来源;生成时,目标相机轨迹由用户给定。当前实验主要基于 Wan2.2。再往前一步,如果射线坐标从预训练阶段就进入模型,它有可能成为世界模型的一种基础坐标接口——模型生成的不再只是“看起来连续”的画面,而是一个可以进入、移动、离开并再次回访的空间。
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。