世界模型一口气输出小时级视频不跑偏,开源了

量子位 2026-08-17 18:00
Alaya Lab 团队 投稿 
量子位 | 公众号 QbitAI

视频世界模型跑久了,往往面临三个问题:

画面发灰发糊或者过曝过饱和、场景悄悄换了地方、显存先撑不住。

Alaya Lab、中国科学技术大学与上海创智学院联合推出的Alaya-EVOKE把这条线拉到了小时级:示例展示了连续生成120分钟,4800个片段、172800帧一镜到底的视频结果。亮度、饱和度、对比度一路稳住,上下文有固定上界,单步成本不随会话变长。

而它只用3步去噪,连CFG都不开。单卡H200生成1.5秒的384×640视频,扩散部分只要2.11秒。

世界模型一口气输出小时级视频不跑偏,开源了图1
世界模型一口气输出小时级视频不跑偏,开源了图2
七条不间断长会话,每行同一会话均匀采样六帧

持久记忆、实时响应、无限时长,为何难以兼得

三者彼此打架:历史留在去噪器上下文或KV cache里,每步开销就随会话变长;开窗口、逐出缓存能按住成本,代价却是丢信息——“能跑多久”和“能记多少”被迫互换。另一边,低延迟只能做几步去噪,得从慢老师蒸馏,学生天花板由老师的监督时长和条件方式决定。

EVOKE的判断是,这两件事不必压在同一个去噪器上:空间状态挪到模型外,长时程与动态条件交给重做过的老师。

技术方案

世界模型一口气输出小时级视频不跑偏,开源了图3
递归循环:位姿把世界状态银行读进当前视角,新片段再写回银行

把记忆搬到模型外面

学生只留最近19个latent帧、约3.2秒。走出这3.2秒的内容不再进上下文,而是写进一个以相机位姿为索引的外部“世界状态银行”,只有三个操作:

掩码也决定记忆能被信任到什么程度:低于0.5的像素直接赋σ=1,等于什么都不给;有几何支撑处只加很轻的噪声。至于“三步”,是12×20、24×40、48×80的latent金字塔,几何条件只在最粗一级注入。

世界模型一口气输出小时级视频不跑偏,开源了图4
转身离开再转回来,银行把街景放回原处(黑色带状需补全)

教师模型不该只是个“高质量打分器”

多数工作中,蒸馏只是加速手段,teacher本身并不为长时序监督而设计:双向注意力带来随序列长度平方增长的计算开销,训练通常局限于短片段,同时整段序列共享单一提示词,难以支持生成过程中的条件切换。EVOKE则进一步改造teacher,通过线性注意力与分chunk计算将其转化为一个计算开销可控、支持中途切换prompt、能够提供长时序监督与条件调度的教师模型。这点尤其重要,因为student的长rollout退化——例如色彩漂移与内容漂移——往往只有在时间跨度足够长后才会真正暴露,而EVOKE的long-horizon teacher正是针对这些短窗口监督难以捕捉的问题提供训练信号。

具体而言Evoke Teacher建在14B的Wan2.2 A14B上,保留高噪、低噪双专家;序列切成9个latent帧一块,每块只看固定几样:首帧sink、本地片段、压缩过的近邻帧、按重要性挑的远帧,加上线性注意力的全局状态——访问量有上界,注意力从二次降到近似线性。分块也让每个片段能挂独立文本条件。

世界模型一口气输出小时级视频不跑偏,开源了图5
上:分块稀疏注意力;下:三阶段训练流程

30秒长程分布匹配

最后把能力搬进三步学生:自强制rollout下做30秒全窗口分布匹配(DMD),从1个真值前缀起步生成20个片段、共189个latent帧,老师与critic对整条轨迹联合打分。

在只换老师的对照里,短时程老师带出的学生亮度掉到开场74%,长时程老师带出的停在101%,8段里7段改善。

世界模型一口气输出小时级视频不跑偏,开源了图6
两个三步学生,唯一差别是老师的时间跨度

让世界学会如何回应

逐片段文本条件让提示词能在生成中途换掉,论文称之为evocation。下面几条都在第3个片段切换指令:场景不会推倒重来,而是在原有世界里自然唤出新内容。

世界模型一口气输出小时级视频不跑偏,开源了图7
切换前后:相机轨迹与场景结构保留,新元素按提示词出现
世界模型一口气输出小时级视频不跑偏,开源了图8
左图:极光;右图:星门

世界模型一口气输出小时级视频不跑偏,开源了图9
物体在第2个片段引入、第4个片段撤回,城堡、丛林与巨龙不变

中途指令若指向尚未锚定的区域(比如天空),67%会被兑现;若要覆盖已被世界状态渲染的几何,就只剩4%——因此作者指出切换时应对几何参考进行mask来保证画面能够有效响应用户指令。

世界模型一口气输出小时级视频不跑偏,开源了图10
分数0-100,越高越好;组行为组内各项无加权平均

WBench导航子集158例同题,EVOKE在画质、场景、物理三组均分领先,一致性持平;弱项没藏:导航与视角偏低,作者归因于相机控制路径。截至8月16日总分80.8列于首位。

在通用画质上,VBench-2.0拿到66.77居公开榜前十之首,其后是Veo 3的66.72;VBench-Long 85.11列第七。两处都不是等步数比较:EVOKE用3步、无CFG,对手跑默认多步采样器。

世界模型一口气输出小时级视频不跑偏,开源了图11
一条连续65.5分钟的生成,属8条同规格长会话之一

在小时级会话里,光度统计短暂波动后趋于平稳;场景身份余弦相似度稳定在0.523,正好是真实素材相隔60秒时的自相似水平,证明长时生成色彩分布稳定性。

几何召回上,21组受控对比有20组符合预期:保留窗口不短于离开时长,回访质量就高出2.3–3.2dB;但15.4–17.8dB的平台期也说明,这是“认得出来”而非像素级还原。

项目价值与边界

EVOKE给出的是一条完整清晰的交互式世界模型训练方案:即世界模型不必把“记忆”和“实时”压在同一个去噪器上。空间状态外置成显式存储,时间一致性和指令切换能力由长时程重做过的老师监督训练得到,会话时长就不再被上下文预算封顶。

世界模型一口气输出小时级视频不跑偏,开源了图12
三种条件输入,每条各4个片段、约5.9秒

论文边界作者也写得清楚:几何世界状态只保住粗结构,物体身份与局部细节一致性仍有限;只有静态几何,还没有动态状态这些都值得进一步探索。

项目主页:https://evoke-world.github.io/Evoke/
代码仓库:https://github.com/SII-YuanyangYin/Evoke
模型权重:https://huggingface.co/SII-YuanyangYin/Evoke

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目/主页链接,以及联系方式

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
开源
more
3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26
ECCV'26 开源 | UniPR-3D:首个基于3D基座模型的视觉识别框架,不用标定、不看纹理,单帧序列全面碾压SOTA!
一个开源项目,如何走到异构算力的关键接口?
Meta推轻量级开源模型,扎克伯格吁美放宽监管以抗衡中国AI势力
刚刚,蚂蚁站在Kimi肩膀上开源了一款新模型
Meta重押开源赛道,扎克伯格喊话华盛顿:松绑政策以抗衡中国AI崛起
GLM-5.3 来了:编程能力开源第一,还顺手揪出潜伏 40 年的世界级漏洞
实时视频版「Nano Banana」来了!160亿参数重磅开源
编程能力最强开源模型!智谱GLM-5.3登场,国产AI又一猛将
英伟达开源cuFile API,SSD或成显存新“备胎”
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号