港科大(广州)联合腾讯AI平台部开源VibeWorlding,3D世界构建迎来Vibe Coding时刻?

机器之心 2026-08-26 19:01
港科大(广州)联合腾讯AI平台部开源VibeWorlding,3D世界构建迎来Vibe Coding时刻?图1


如果说 Vibe Coding 让「写代码」这件事从「敲键盘」变成了「和 AI 对话」,那么今天要介绍的这项工作,可能正在把同样的故事在 3D 世界构建 领域重演一遍。


香港科技大学(广州)联合腾讯 AI 平台部团队,提出了 VibeWorlding:一个可以像 Agent 写代码一样,通过多轮对话、调用工具、观察渲染反馈来自主构建和编辑交互式 3D 世界的多模态智能体框架。只需要说一句「给我造一个阴森的荒漠神殿」,或者「把桌子旁边的那把椅子往前挪两米」,剩下的检索 3D 资产、摆放物体、避免碰撞、渲染确认,统统交给 Agent 完成。


港科大(广州)联合腾讯AI平台部开源VibeWorlding,3D世界构建迎来Vibe Coding时刻?图2



这套系统的核心不是又一个「文本转 3D」的生成模型,而是一整套可训练、可验证、可复现的基准与强化学习框架 —— 团队同时开源了 6828 条多模态用户 query、2616 个高质量 3D 资产、323 个人工标注的种子 3D 世界,以及一整套沙盒环境和双重约束验证器。


实验结果显示,经过强化学习后训练的开源模型 VibeWorlder-30B-A3B,在综合 Pass@1 指标上反超了 GPT-5.5 和 Qwen3.8-Max,成为目前该任务上表现最好的模型。


港科大(广州)联合腾讯AI平台部开源VibeWorlding,3D世界构建迎来Vibe Coding时刻?图3

图 1:VWE-Bench 与 VibeWorlding-Gym 总览


为什么造 3D 世界需要一次范式转移?


游戏关卡、数字孪生、具身智能仿真环境…… 这些场景都依赖大量可交互、可编辑的 3D 世界,但传统的人工搭建方式效率极低。近年来,随着多模态大模型(MLLM)的兴起,学界开始探索用 AI 智能体自动化完成这一过程,大致分为两条路线:



但这些工作普遍存在两个尴尬的现实:一是评测用的查询过于理想化和简单,难以反映真实用户天马行空、模糊不清、甚至互相矛盾的表达;二是几乎所有框架都不开源,学界既无法公平对比,也无法系统研究「训练是否真的能提升这些底层能力」这个更根本的问题。


一个可行的 3D 世界,既要「物理上站得住」(不悬空、不穿模),也要「语义上说得通」(符合用户意图、风格协调)。这种多维度的正确性,仅靠人工规则或者一个通用的 LLM 裁判都很难兼顾 —— 这正是 VibeWorlding 团队要解决的核心难题。


VibeWorlding 到底是什么?


团队把整个「3D 世界构建」任务,形式化为一个多轮、多模态、工具集成的推理过程:给定一个多模态请求(纯文本描述,或者「现有世界 + 编辑指令」),智能体需要自主推断用户意图、规划场景布局、调用 3D 工具(检索 / 添加 / 旋转 / 平移 / 删除 3D 资产),并在每一轮结束后观察沙盒返回的多模态反馈(3D 地图文本 + 五视角渲染图),如此循环,直到最终产出一个完整的交互式 3D 世界。


这套框架包含两大组件:



6828 条查询是怎么「反向」造出来的?


VWE-Bench 的构建走的是「人机协作」路线,分三步走:



港科大(广州)联合腾讯AI平台部开源VibeWorlding,3D世界构建迎来Vibe Coding时刻?图4

图 2:VWE-Bench 数据样例。(a) 按物理尺寸从小到大排列的 3D 资产样例;(b) 按复杂度从低到高排列的种子世界样例


最终,团队沉淀出六大类查询,其中「精确资产级编辑」类查询因为有明确的扰动过程可以直接对比 Ground-truth 地图,被归为 Verified(可验证);剩下五类模糊表达、场景批判、引导、重申和复杂场景描述等更贴近真实用户口吻的查询,则归为 Unverified(不可验证),交给精心设计的 Rubric 由 MLLM 裁判打分。


既要「立得住」又要「听得懂」:双重约束验证器


一个 3D 世界能不能算「过关」,VibeWorlding 团队给出了两条硬性标准:



对于 Unverified 查询,只有物理可行性和四个意图维度全部通过才算成功;对于 Verified 查询,则直接和 Ground-truth 地图比对,按正确编辑的 3D 资产比例打分。


在此基础上,团队搭建了 VibeWorlding-Gym 训练管线:先用 Gemini 3.1-pro 反向合成冷启动 SFT 轨迹,再用 GRPO 算法在双重约束验证器提供的奖励信号下做多模态强化学习 —— 让智能体同时从「纯文本从零构建」和「多模态图文编辑」两类任务中联合学习,而不是像以往工作那样只训练单一模态。


实验结果:开源模型如何反超 GPT-5.5?


团队在 VWE-Bench 上系统评测了 8 个前沿闭源模型(GPT-5.5、Gemini 3.1-Pro/3.5-Flash、Kimi-K3、Qwen3.8-Max 等)、3 套 3D-Scene 智能体框架(SceneWeaver、SAGE、SceneAssistant),以及经过冷启动 SFT 和强化学习后训练的开源模型 VibeWorlder 系列。核心结论可以概括为三句话:



瓶颈到底在哪?六维能力拆解揭晓答案


团队进一步把「过关」拆解成六个能力维度:碰撞无冲突、高度合理性、生态合理性、3D 理解、3D 推理、检索合理性,逐一打分对比。


港科大(广州)联合腾讯AI平台部开源VibeWorlding,3D世界构建迎来Vibe Coding时刻?图5

图 3:各模型在六个能力维度上的通过率对比


结果非常有意思:碰撞无冲突是所有模型(包括强化学习后的旗舰模型)共同的瓶颈,即便经过 RL 训练,通过率也只有 59%~68%。相比之下,强化学习对 3D 推理能力的提升最为显著 —— 从基座模型的 6%~20% 一跃提升到 56%~85%,VibeWorlder-30B-A3B 更是达到 85%,超过 Gemini 3.1-pro(62%);同时检索能力被提升到 91%~99%,甚至超过前沿闭源模型。团队的结论是:


强化学习让模型「看懂」场景、「找对」3D 资产的能力大幅跃升,但要把 3D 资产精确地摆到不产生碰撞的位置 —— 这种精细的空间操控能力,仍然是当前所有模型(无论开源闭源)共同的天花板。


翻车现场:两种最典型的失败模式


为了搞清楚「精确编辑」到底难在哪,团队人工审查了大量失败案例,归纳出两种最常见、最顽固的错误:



这两个案例共同指向一个结论:多模态智能体在语义理解上已经相当成熟,但在精确空间执行跨轮状态保持上仍有明显短板 —— 这也是团队认为未来最值得投入的方向之一。


像 Vibe Coding 一样,

Vibe Worlding:一个真实可用的 CLI 原型


为了验证这套系统不只是「刷榜工具」,团队还提供了一个真正能用的命令行交互原型,配上浏览器端的实时 3D 渲染视图 —— 你敲一句自然语言指令,Agent 立刻思考、调用工具、执行编辑,浏览器里的 3D 世界同步刷新。


场景一:从零造一个农场。用户输入「Create a simple farm with a barn, crop fields, fences, and a few trees」。Agent 从一张空地图开始,检索谷仓、树木、栅栏、作物等资产,规划出「农舍 + 围栏菜地 + 树丛」的三区布局,中途还根据渲染图自我修正 —— 发现栅栏太高像一堵墙,就调低高度;发现树冠过大盖住了农舍,就把树整体缩小。


从零构建场景 —— 左侧终端展示 Agent 的完整推理与自我修正过程,右侧为实时渲染出的农场


场景二:编辑一个已有的城市。面对一个繁忙的城市街区,用户说「Remove the car in the middle of the road and delete the two green buildings」。Agent 先从 3D 地图中枚举出场景里的摩天楼、军事建筑、汽车、路灯、绿化树,精确定位到目标对象,连发三次删除调用,再重新渲染多视角画面确认「只删掉了该删的,其余元素原封不动」,最后用自然语言总结改动与修改。


多轮编辑场景 ——Agent 定位并删除指定车辆与建筑,同时严格保持其余元素不变。


整个「思考 - 执行 - 渲染确认 - 回复」的闭环,与训练时使用的多模态反馈机制完全一致。目前,团队已经开源了这个 CLI 原型,希望社区能在此基础上开发出更强的智能体框架、更专业的技能插件。


离真正的「Vibe Worlding」还有多远?


论文在讨论部分列出了几条尚待跨越的门槛:



更深层的挑战在于:即便有了完整的多模态反馈闭环,精确的空间推理能力(距离、角度等量化空间关系)仍是当前所有 MLLM(无论是否经过强化学习)的共性短板。


团队认为,这可能最终需要从预训练 / 中训练阶段就注入更多 3D 空间数据,才能让基础模型真正具备扎实的空间世界理解能力。


写在最后


VibeWorlding 给出的答案并不是「3D 世界构建已经被解决」,恰恰相反 —— 论文用实验证明,即便是 GPT-5.5、Qwen3.8-Max 这样的顶级闭源模型,在这项任务上的整体成功率也不到 60%。但它同时证明了一件更重要的事:只要有可靠的验证器和奖励信号,开源的中小规模模型完全可以通过强化学习后训练反超闭源前沿模型,这与「Vibe Coding」在编程领域走过的路径高度相似 —— 先有工具化的沙盒环境,再有可验证的奖励,最后是开源模型的规模化追赶。


或许,3D 世界构建领域的「Vibe Coding 时刻」,才刚刚拉开序幕。


港科大(广州)联合腾讯AI平台部开源VibeWorlding,3D世界构建迎来Vibe Coding时刻?图6


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 开源
more
浙大开源PhyEdit:单图编辑+精准3D物体操作 | ACM MM'26
千问办公开源上下文基础设施,Agent的下一个战场打响
匿名牛来大模型被扒出智谱血缘,也有人怀疑Cursor拿开源GLM训的
8B参数!国产轻量级多模态开源,实测超长指令、4K生图
英伟达400亿押注开源,边卖铲子边挖矿
千问办公首个开源项目:从飞书和钉钉里蒸馏出“第二个你”
全球首个!10万小时人类数据全开源,Hugging Face罕见站台
活动预告|开源 RISC-V 汽车电子生态创新峰会暨RISC-V汽车控制芯片技术规范标准研讨会即将举办
X平台向Nitter发出“封杀令”:开源阅读工具面临法律终局
RA-L 2026开源|一个公式通吃旋转LiDAR所有装法,自适应定位不惧白墙走廊,精度<1.5mm、1104米闭环误差<0.01m
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号