只搭“骨架”,就能长出一个世界:腾讯 Proxy2World 让粗糙 3D 场景生成可控视频

3D视觉工坊 2026-10-01 00:00

点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达

作者供稿直发 | 来源:3D视觉工坊

3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:只搭“骨架”,就能长出一个世界:腾讯 Proxy2World 让粗糙 3D 场景生成可控视频图1

城门要在指定位置,角色要按设计路线前进,镜头还得照着轨迹走。要做到这些,是否必须先把整座城的模型、材质和灯光全部做完?

腾讯团队提出的 Proxy2World 给出了另一种做法:先用简化的 3D 场景代理(scene proxy)指定必须可控的结构和运动,再让生成模型补全真实的形体、外观与氛围。

论文:Proxy2World: Learning to Generate Worlds from Lightweight Proxies without Seeing Them
研究机构:Tencent
项目主页:https://dumdumgura.github.io/proxy2world/
作者:Hongli Xu、Weilong Yan、Anbang Wang、Chunyu Zou、Siyu Hong、Jingwei Huang
arxiv链接:https://arxiv.org/pdf/2609.35023v1

只搭“骨架”,就能长出一个世界:腾讯 Proxy2World 让粗糙 3D 场景生成可控视频图2图 1|灰色代理规定城门、通道与交互结构;生成结果补上建筑细节、材质和光照。图片裁自论文主视觉。

难题:既要“听指挥”,也要有想象力

只给文字或相机轨迹,视频模型可以生成丰富画面,却未必能保证人物站在指定位置、桥按脚本升起,或建筑始终保持预定布局。把完整 3D 场景当作硬约束,又可能让低模人物的圆柱形身体、粗糙边缘直接出现在成片里。

Proxy2World 的出发点是:用户只需构建必须受控的部分,不必预先制作最终世界的全部细节。 代理可以由低多边形网格或简单几何体组成,也可以故意留白;它表达的是空间与行为意图,而非最终画面的逐像素答案。

这里有一道数据难关:真实视频通常没有与之成对的“设计师版低模代理”。为每段视频重新拆解场景、搭建代理,成本很高。Proxy2World 因而没有依赖成对的代理—真实视频训练样本,而是从 120,624 段带相机位姿的 RGBD 视频片段学习。

核心方法:先定结构,再长细节

同一模型在训练时学习两种互补能力:

  1. 深度条件下生成 RGB:把几何当作固定条件,学会遵循空间结构。
  2. 联合生成 RGB 与深度:让外观和几何一起变化,学会补全与细化场景。

推理时,两种能力接力工作。以论文采用的 40 步采样设置为例,前 3 步用代理深度锚定布局、物体范围与运动;后 37 步不再把代理深度锁死,而是联合细化 RGB 和深度。相机引导始终保留,深度与相机平移也被校准到一致的度量尺度,避免几何和镜头运动“各说各话”。输入还可包含文字描述和可选的首帧参考图。

只搭“骨架”,就能长出一个世界:腾讯 Proxy2World 让粗糙 3D 场景生成可控视频图3图 2|上半部分是同一模型学习两种生成模式;下半部分展示推理时由“代理定结构”过渡到“RGBD 联合细化”。图源:论文方法图。

“没有见过代理”并不是推理时不使用代理。 它指训练阶段无需成对的代理—RGB 视频;真正生成时,模型仍接收代理渲染的深度,遵循用户给出的结构。

怎么评测一个“听话又好看”的世界?

团队同时提出 ProxyBench:包含 25 个场景、300 段五秒序列;论文的统一定量比较选取其中 78 段,覆盖不同场景、相机轨迹、主体运动和代理抽象程度。评测既看相机轨迹、几何与时间对齐,也用视觉语言模型比较“是否遵循代理”以及“是否合理地丰富细节”,并辅以人工偏好实验。

只搭“骨架”,就能长出一个世界:腾讯 Proxy2World 让粗糙 3D 场景生成可控视频图4图 3|ProxyBench 的部分场景代理。不同主题与几何复杂度用于检验模型对抽象结构的适应能力。图源:论文基准图。

在同一权重、同样提供文字、首帧和相机轨迹的对照中,加入代理混合控制后,几何对齐分数从 0.5340 提升到 0.6795(相对提升 27.2%);VLM 评估的代理遵循胜率从 53.55% 提升到 64.18% ,细节精修胜率从 71.44% 提升到 77.96% 。这些胜率来自与其他配置的两两比较,平局按半胜计算,并非单条视频的成功概率。

在同为“文字+相机+代理”、不使用首帧的配置中,相比 Coarse2Real,Proxy2World 的归一化位移和旋转误差分别降低 47.3% 和 77.2% ,几何对齐提升 28.3% 。在论文的小规模人工偏好实验中,混合控制版本排名第一;该实验由 10 位参与者评估 10 段序列。

只搭“骨架”,就能长出一个世界:腾讯 Proxy2World 让粗糙 3D 场景生成可控视频图5图 4|为便于手机阅读,从论文原始对比图中保留 Input、Proxy Video、VACE-Depth、Cosmos-Depth 和 Ours 五列;其他方法请见原论文。红框标示代理指定的主体位置。

结果也不是“所有指标都第一”。例如,Cosmos-Depth 的 VLM 代理遵循胜率高于混合版本;Proxy2World 的重点是在保留可控结构的同时,让粗糙几何有机会变成更自然的形体和外观。下面的消融图直观呈现了这种取舍:只依赖代理容易保留僵硬形状,只依赖相机可能偏离预设位置,混合推理则试图兼顾两者。

只搭“骨架”,就能长出一个世界:腾讯 Proxy2World 让粗糙 3D 场景生成可控视频图6图 5|同一模型在不同控制强度下的生成结果。中列为代理—相机混合推理。图源:论文消融图。

同一副“骨架”,不止一种世界

轻量代理保留的是可编辑的世界结构,而不是锁死的最终外观。在论文展示的同一场景中,风格、角色与光照都可以变化:城门仍在那里,但世界可以呈现不同气质。

只搭“骨架”,就能长出一个世界:腾讯 Proxy2World 让粗糙 3D 场景生成可控视频图7图 6|同一世界结构的不同视觉呈现。图片裁自论文主视觉。

Proxy2World 展示了一条有意思的路径:让创作者明确指定“什么必须保持”,让模型负责“其余可以如何生长”。 它目前聚焦短视频生成;更长时序的持续交互,仍是论文指出的后续方向。

本文仅做学术分享,如有侵权,请联系删文。

。

只搭“骨架”,就能长出一个世界:腾讯 Proxy2World 让粗糙 3D 场景生成可控视频图8只搭“骨架”,就能长出一个世界:腾讯 Proxy2World 让粗糙 3D 场景生成可控视频图9只搭“骨架”,就能长出一个世界:腾讯 Proxy2World 让粗糙 3D 场景生成可控视频图10只搭“骨架”,就能长出一个世界:腾讯 Proxy2World 让粗糙 3D 场景生成可控视频图11

扫码添加微信,备注:姓名+方向+单位,邀请入群。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
个人AI大发布时代来了,我们真的需要Muse吗?
直播回顾:工业AI的下一个机会在哪?
白宫AI承诺书签署现场现低级拼写错误,特朗普强推“超级智能”新叙事
AI自己榨干算力!让Kimi K3自己写「超级算子」,推理快了3倍
苹果押注智能家居中枢,J490设备或成AI落地关键载体
Meta被指将AI数据中心包装为实验项目以避税,去年节省近40亿美元
实录 OpenAI 年度发布会:25 项发布,逐一详解
赛豆科技首款量产车AIVA!ME7全球首秀
Muse“越权”风波:当AI助手开始替你做主,Meta的信任危机再升级
GPT-6 Astra也会「看错」流程图? Einsia AI发布PPTBench,视觉编程还有多远?
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号