

视频生成模型为了合成连贯画面,需要学习场景几何、物体持续性、运动规律和语言语义。这些在生成任务中形成的知识,能否直接服务于视觉感知?
Google DeepMind 等机构的最新论文 Video Generation Models are General-Purpose Vision Learners[1] 给出了一项系统验证。研究团队提出通用视觉模型 GenCeption,以预训练视频扩散模型为基础,通过一次前向计算完成深度估计、表面法线估计、相机位姿估计、前景分割、文本指代分割和 3D 关键点预测等任务。
论文作者包括 Letian Wang、Chuhan Zhang、Kaiming He、Andrew Zisserman、Joao Carreira 等研究者,来自 Google DeepMind、多伦多大学、伦敦大学学院、牛津大学、MIT 与隆德大学。论文将发表于 ECCV 2026,演示结果可在 GenCeption 项目主页[2] 查看。



研究目标:用视频生成建立通用视觉预训练
计算机视觉已经拥有 SAM、Depth Anything 等基础模型,但多数模型仍围绕单一任务设计。分割、深度、相机位姿和人体关键点通常依赖各自的网络结构、预测头与损失函数。任务数量增加后,模型和训练流程也随之扩张。
GenCeption 关注一个更基础的问题,视觉领域能否找到类似语言模型“下一词预测”的通用预训练目标?
研究团队将大规模文本到视频生成视为当前最有潜力的方案,理由包含三个方面:
视频生成要求模型理解连续时间中的空间变化,能够形成 3D 几何、物体持续性和运动关系等时空先验; 文本条件提供原生的视觉语言对齐; 视频生成模型已经具备较成熟的数据与算力扩展路径。
基于这一判断,GenCeption 采用预训练 WAN 2.1 视频扩散模型,将生成阶段积累的视觉表征迁移到下游感知任务。论文的核心贡献可概括为,验证视频生成预训练的通用性,并用统一架构将这种通用表征转化为可量化的感知能力。
模型设计,一次前向计算完成多类视觉任务
WAN 2.1 原本通过约 50 步迭代去噪生成视频。感知任务通常要求确定、快速的输出,多步采样会增加延迟,也可能引入额外幻觉。GenCeption 因此将扩散模型改造成单次前向预测器。
模型直接接收输入视频的无噪声潜变量,将扩散时间步固定为 t=0,只运行一次 DiT。由于 WAN 2.1 采用 Rectified Flow 目标,团队对 DiT 输出的速度项取负,使结果更接近目标视频潜变量。这项改动保留了预训练网络的大部分结构,同时显著降低推理成本。
实际测试中,在单张 v6e TPU 上处理 81 帧、480×832 分辨率的视频,1.3B 模型总耗时 5.92 秒,速度约为 13.6 FPS,显存占用 15.3GB;14B 模型总耗时 10.03 秒,速度约为 8 FPS,显存占用 42.8GB。文本编码器与 VAE 还可卸载到系统内存。该速度尚未达到高频机器人控制所需的实时水平,但已经避免传统扩散模型反复采样的主要开销。
另一个关键设计是统一任务表示。深度、分割、表面法线、DensePose 和相机射线图等稠密输出都被编码到三通道 RGB 空间,共用原模型的 VAE 解码器。相机位姿对应的六通道射线信息通过空间分区压缩到三通道图像。2D、3D 关键点等稀疏坐标任务则使用附加的可学习 token,再由轻量 MLP 解码。
任务类型由文本指令指定。模型可以在同一骨干网络、同一预测头和同一组权重下切换输出形式。新增任务的主要工作由数据表示承担,无需重新设计完整模型。

论文中的后训练属于监督式多任务微调,没有奖励模型、强化学习或 RLHF。所有任务统一采用 L2 损失,稠密任务在潜空间计算,稀疏任务在坐标输出空间计算。深度估计的尺度模糊等问题通过数据归一化处理,任务间权重则由数据混合比例控制。
训练数据:7500 段合成视频提供精确标注
真实视频很难同时提供逐像素深度、表面法线、相机轨迹和三维关节位置。GenCeption 因此以合成数据作为感知后训练的主体。
团队使用 800 个 RenderPeople 人体资产和 CMU 动作捕捉数据集中的 200 组动作,配合不同三维场景、HDRI 背景、焦距和相机轨迹,在 Blender 中生成 7500 段人类视频。渲染管线同步输出 RGB、深度、法线、前景掩码、2D 与 3D 关键点以及相机位姿,从而获得规模化且精确的监督信号。
深度和相机位姿训练还加入 TartanAir、Virtual KITTI 与 MVS Synth。文本指代分割使用 MeViS、Ref-COCO 和 YouTube-VOS 等真实数据。除文本指代分割外,论文的主要感知任务基本依赖合成数据后训练。
训练样本分辨率为 480×832,每段包含 81 帧,帧率为 24 FPS。模型使用 Adam 优化器,学习率为 5×10⁻⁵,共训练 15000 步,batch size 为 64,使用 256 张 v6e TPU。梯度裁剪与梯度丢弃用于维持多任务训练稳定性。
实验结果:统一模型达到专用模型的竞争水平
论文在多个图像和视频 benchmark 上评估 GenCeption。表面法线估计使用 Hi4D 与 SINTEL;深度估计使用 KITTI、SINTEL、ETH3D 与 Goliath;软前景分割使用 VideoMatte、PhotoMatte 85 与 PPM-100;相机位姿、3D 人体关键点和文本指代分割分别在 SINTEL、EMDB、RefVOS-DAVIS 与 MeViS 上测试。
评估指标随任务设置,包括法线角度误差、深度相对误差 AbsRel、分割 MSE、文本指代分割 J&F、关键点 MPJPE,以及相机位姿的 ATE 与 RPE。这套实验同时覆盖二维外观、三维几何、语言指代和时序感知。

在文本指代视频分割中,14B 通用模型在 RefVOS-DAVIS 和 MeViS 上取得 75.8 和 69.0 J&F,高于论文列出的 SAM 3 以及 SAM 3 与 Gemini 3.5 Flash 组合结果,并接近单任务版本的 76.4 和 70.0。3D 人体关键点的单任务版本取得 71.8 MPJPE,优于论文对比的 GVHMR、TRAM 与 Genmo。

视频生成预训练的优势在深度实验中更明显。使用相同的 7500 段、约 90 万帧后训练数据时,V-JEPA-H、VideoMAE V2-G、WAN 2.1 1.3B 和 WAN 2.1 14B 的平均 AbsRel 分别为 0.281、0.154、0.122 和 0.093,数值越低越好。
加入额外合成数据后,14B GenCeption 使用约 123 万帧,在三个深度数据集上的平均 AbsRel 达到 0.071。D4RT 与 VGGT-Ω 的对应结果为 0.082 和 0.067,但论文估算二者分别使用约 8600 万帧与 6 亿帧。GenCeption 因而以少 7 倍到 500 倍的数据达到接近的表现。
消融实验进一步区分了模型规模与预训练本身的作用。随机初始化的 DiT 在后训练中学习曲线接近平坦;从 WAN 2.1 转移的预训练层越多,深度预测性能越好。在相同数据和相近设置下,视频生成骨干也持续领先 V-JEPA 与 VideoMAE V2。结果说明,增益不能只归因于参数量或合成数据,生成目标形成的时空表征是模型快速适配感知任务的重要来源。论文同时观察到初步的扩展趋势,模型从 1.3B 增长到 14B、训练数据增加后,多组指标继续改善,但现有实验规模还不足以推导稳定的视觉 scaling law。

联合训练也暴露出当前限制。前景分割通常受益于多任务训练,文本指代分割基本稳定,深度与部分几何任务则出现轻微下降。3D 关键点退化更明显,原因可能是新增坐标 token 偏离了视频生成模型原生的连续像素表示,并扰动了预训练注意力结构。
研究价值与边界:面向具身智能的通用视觉底座
GenCeption 的后训练数据主要包含单个人类对象,但模型可以零样本迁移到真实视频、多对象场景,以及动物和机器人等未见类别。团队据此认为,视频生成骨干内部已经形成较通用的时空表征。

这项结果对具身智能具有直接价值。深度、表面方向、相机运动、对象分割和 3D 关键点共同构成机器人理解物理环境的基础信息。统一模型还能通过文本指令选择目标任务,为机器人导航、操作、AR/VR 和 4D 场景重建提供更一致的视觉接口。

论文将这种表征称为生成模型内部的通用“世界模型”。目前的证据主要集中在视觉感知与跨类别迁移。GenCeption 尚未接收机器人动作,没有预测行动后的环境变化,也没有完成规划或闭环控制验证。因此,它更接近具身系统的通用视觉底座,完整世界模型仍需进一步整合动作、因果预测和策略学习。
GenCeption 的重要性在于,它把视频生成模型的潜在世界知识转化成了可测量的感知结果。生成模型由此获得了一条新的技术路径,从合成视觉内容,进一步走向理解和表征物理世界。
一作 Letian Wang 在项目复盘博客[3]中将当前阶段比作视觉基础模型的 GPT-1 或 GPT-1.5 时刻。这个判断仍需更多任务、更大规模和真实机器人实验验证,但 GenCeption 已经证明,视频生成预训练值得被视为通用视觉学习的重要候选方案。
Video Generation Models are General-Purpose Vision Learners: https://arxiv.org/pdf/2607.09024
[2]GenCeption 项目主页: https://genception.github.io/
[3]项目复盘博客: https://letian-wang.github.io/blog/thoughts-after-building-a-general-purpose-vision-model.html
> 本文由 Intern-S2 等 AI 生成,机智流编辑部校对
-- 完 --
机智流推荐阅读:
1.
2.
3.
4.
cc | 大模型技术交流群 hf | HuggingFace 高赞论文分享群 lc|LangChain 技术交流群 code | AI Coding 交流群 具身 | 具身智能交流群 硬件 | AI 硬件交流群 推理 | AI 推理框架交流群 智能体 | Agent 技术交流群