让AI Agent「试玩」世界模型,长程目标评测有了新基准PlayWorld

机器之心 2026-08-23 17:32
让AI Agent「试玩」世界模型,长程目标评测有了新基准PlayWorld图1


本文第一作者为香港大学博士生丁凯欣。团队成员包括香港大学博士生陈汐、徐致远、汪逸阳、陆宇翔、李俊奕,香港中文大学蔡明宏,浙江大学陈书扬,以及快手可灵团队的高远、陶鑫和万鹏飞。通讯作者为香港大学助理教授赵恒爽。


世界模型应该如何评测?答案是:像真实用户一样去 “玩” 它。


例如,在虚拟世界中绕房子一周,回到原点后检查场景是否一致;走入水中,观察是否激起水花;或在不同房间之间来回穿梭,看看每次返回时,客厅里画画的人是否取得了新的进展。然而,要完成这些 “长程操控目标”,不同模型所需的操作序列并不相同。


为此,来自香港大学、香港中文大学、浙江大学和快手可灵团队的研究者使用 Agent Player 操作世界模型:只给定 “场景” 和 “长程目标”,由 Agent Player 在交互过程中观察生成视频的几何一致性、交互正确性和事物演化的合理性。他们对多个 SOTA 模型进行了系统评测与分析,并已开源评测集和代码。


让AI Agent「试玩」世界模型,长程目标评测有了新基准PlayWorld图2



为什么固定动作轨迹不够公平?


人类试玩世界模型时,通常不会关心 “是否严格执行了三次右转”,而会关心 “是否完成了绕场一周并回到原来的地标”。这两种评测思路看似接近,实则回答的是不同问题。以 “围绕中心雕塑转一圈” 为例,固定轨迹只能保证所有模型收到相同的按键,却不能保证它们都到达相同的视角。如果模型并未真正到达目标视角,后续的几何一致性评分就失去了可比性。


PlayWorld 因此把评测单位从 “固定动作序列” 升级为 “场景相关的长期目标”:所有模型面对同一个初始世界、同一个目标,但允许 Agent Player 根据实时观察作出必要调整。


图为围绕中心雕塑转一圈,再观测雕塑形状有无改变:



核心创新:

会观察、会调整、会喊停的 Agent Player


Agent Player 由多模态模型与接口转换器组成。每一步,它都会查看生成帧、已执行的动作、场景描述和长期目标,再从五种决策中选择一种:



接口转换器则将 WASD 代表的当前 action 序列转换为各个模型自适应的输入形式。考虑到 Agent 的决策需要一定时间,研究者不要求 Agent 从零规划整条轨迹,而是让它基于共享先验进行针对性修正。这套设计既保留了基础动作序列带来的可比性,又能适应不同模型的动作粒度。


四大维度:

从 “看起来不错” 走向 “世界真的成立”


PlayWorld 为每个场景设计了任务相关的 VQA 问题,并从四个核心维度评估世界模型:


1. 几何一致性(Geometry Consistency)


模型在移动镜头、绕行和重访之后,能否保持物体身份、数量、纹理、材质、颜色以及相对位置?例如,完成 360° 旋转后,原来的建筑、文字或雕塑是否仍然位于正确位置,还是被重新 “生成” 成另一个版本?


2. 交互保真度(Interaction Fidelity)


用户的动作是否产生符合物理规律的反馈?例如,人物走入水中时是否会激起水花和涟漪;从水塘岸边走向深处时,水位是否会逐渐升高;撞向障碍物时是否会合理停下,而不是直接穿模或悬浮。


3. 视野外演化(Out-of-sight Evolution)


目标离开画面后,世界是否仍在继续演化?当镜头再次转回,目标是否保持身份与位置,并呈现符合因果关系的状态变化,而不是恢复原状、突然消失或被另一个物体替代?例如,正在写字的人书写的内容是否会增多,火箭腾空后是否会持续上升,倒出的液体是否会持续增多。


4. 视野内演化(Insight Evolution)


在长达 60 秒的持续观察中,人物或过程是否真正向前发展?例如,远处爆竹响起时,周围的人是否会四散离开;夜市上的行人是否会突然静止;收银台前的顾客结账后是否会离开,而不是重复动作或长时间停留在原地?


让AI Agent「试玩」世界模型,长程目标评测有了新基准PlayWorld图3


PlayWorld 测试集针对每个评测维度人工筛选共 171 个样本并且设计 820 余个问题。其中几何一致性样本强调可重访的视觉锚点,例如文字、壁画和标志性建筑;交互样本则覆盖人物与水、火、悬崖、草地和障碍物等的交互;视野外演化关注削苹果、制作甜品、绘画等在遮挡期间仍应继续进行的过程;视野内演化则关注排队结账、摆盘等持续可见的长时过程。


实验结果:

世界模型仍待进步


让AI Agent「试玩」世界模型,长程目标评测有了新基准PlayWorld图4


发现一:持续世界演化仍是最明显的瓶颈


几乎所有模型在视野内与视野外持续状态演化维度上的得分都较低。一个正在进行的过程可能长时间静止、反复循环或突然重置,也可能在目标离开视野后不再继续。这表明当前模型更擅长维持短时间的局部外观连续性,却仍无法稳定维护跨时间、跨遮挡的语义状态。


发现二:长时重访暴露全局空间不一致


单帧看起来合理,并不代表整个世界在三维空间中成立。实验中,当视角环绕泰姬陵等地标旋转 360° 时,模型可能在不同视角反复生成多个 “新地标”。每一帧都足够逼真,但从完整轨迹来看,空间唯一性已遭到破坏。


发现三:能到达目标,不等于理解世界


轨迹验证通过率与世界模型的综合能力并不总是一致。例如,SANA-WM 的总体轨迹验证通过率达到 80.4%,说明它通常能够到达目标区域;但其四项 rubric 的总体得分仅为 1.48。这意味着模型即使能够 “走到那里”,仍可能无法维持记忆、空间关系或物理交互的一致性。


总结


PlayWorld 将世界模型评测从 “执行相同按键” 推进到 “完成同一长期目标”。通过 Agent Player 的闭环观察与在线修正,让不同控制粒度、不同交互接口的模型得以在更贴近真实用户体验的条件下进行公平比较。


更重要的是,PlayWorld 揭示了当前世界模型最关键的能力边界:生成清晰、流畅且可控的画面只是第一步;一个真正可靠的世界模型,还必须在经历长时间交互、视角变化与遮挡后,持续维持空间结构、物体身份、物理反馈与因果状态的一致性。


让AI Agent「试玩」世界模型,长程目标评测有了新基准PlayWorld图5


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
哈佛商学院引入AI数字人助教,杰夫·巴斯冈的“数字分身”略显惊悚却受学生追捧
美法律科技巨头Harvey弃用闭源模型,转投中国Kimi K3构建内部AI
AI眼镜、指环、吊坠争抢智能穿戴万亿风口,谁能笑到最后?
600 亿、5000 亿:美国 AI 开始疯狂借钱
亚马逊、谷歌、微软新季度财报B面:一切让位给AgenticAI,一边失血一边靠芯片赚钱
高校AI作弊泛滥成灾!线上考试形同虚设,学位含金量大跳水
我军截击无人机亮相:AI双模制导,连光纤自杀无人机也能打!
从爱犬离世到400万融资:AI定制mRNA疫苗的商业化突围
Lady Gaga背后的“隐形极客”:如何用AI与活体组织重塑美妆研发
Anthropic:AI没有导致失业率的增加
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号