Alaya Lab 团队 投稿
量子位 | 公众号 QbitAI
视频世界模型跑久了,往往面临三个问题:
画面发灰发糊或者过曝过饱和、场景悄悄换了地方、显存先撑不住。
Alaya Lab、中国科学技术大学与上海创智学院联合推出的Alaya-EVOKE把这条线拉到了小时级:示例展示了连续生成120分钟,4800个片段、172800帧一镜到底的视频结果。亮度、饱和度、对比度一路稳住,上下文有固定上界,单步成本不随会话变长。
而它只用3步去噪,连CFG都不开。单卡H200生成1.5秒的384×640视频,扩散部分只要2.11秒。


△七条不间断长会话,每行同一会话均匀采样六帧
持久记忆、实时响应、无限时长,为何难以兼得
三者彼此打架:历史留在去噪器上下文或KV cache里,每步开销就随会话变长;开窗口、逐出缓存能按住成本,代价却是丢信息——“能跑多久”和“能记多少”被迫互换。另一边,低延迟只能做几步去噪,得从慢老师蒸馏,学生天花板由老师的监督时长和条件方式决定。
EVOKE的判断是,这两件事不必压在同一个去噪器上:空间状态挪到模型外,长时程与动态条件交给重做过的老师。
技术方案

△递归循环:位姿把世界状态银行读进当前视角,新片段再写回银行
把记忆搬到模型外面
学生只留最近19个latent帧、约3.2秒。走出这3.2秒的内容不再进上下文,而是写进一个以相机位姿为索引的外部“世界状态银行”,只有三个操作:
写入。单目深度模型给新片段估12帧深度,按相机内外参反投影追加进持久点云;各片段几何独立插入,避开长序列深度融合的尺度漂移。 读取。当前位姿即地址,候选源视角按共视度排序,最多取8个做批量z-buffer投影,返回对齐当前视角的warp图与逐像素可见性掩码。 逐出。全部在CPU内存侧完成,不占GPU资源、不受显存约束。
掩码也决定记忆能被信任到什么程度:低于0.5的像素直接赋σ=1,等于什么都不给;有几何支撑处只加很轻的噪声。至于“三步”,是12×20、24×40、48×80的latent金字塔,几何条件只在最粗一级注入。

△转身离开再转回来,银行把街景放回原处(黑色带状需补全)
教师模型不该只是个“高质量打分器”
多数工作中,蒸馏只是加速手段,teacher本身并不为长时序监督而设计:双向注意力带来随序列长度平方增长的计算开销,训练通常局限于短片段,同时整段序列共享单一提示词,难以支持生成过程中的条件切换。EVOKE则进一步改造teacher,通过线性注意力与分chunk计算将其转化为一个计算开销可控、支持中途切换prompt、能够提供长时序监督与条件调度的教师模型。这点尤其重要,因为student的长rollout退化——例如色彩漂移与内容漂移——往往只有在时间跨度足够长后才会真正暴露,而EVOKE的long-horizon teacher正是针对这些短窗口监督难以捕捉的问题提供训练信号。
具体而言Evoke Teacher建在14B的Wan2.2 A14B上,保留高噪、低噪双专家;序列切成9个latent帧一块,每块只看固定几样:首帧sink、本地片段、压缩过的近邻帧、按重要性挑的远帧,加上线性注意力的全局状态——访问量有上界,注意力从二次降到近似线性。分块也让每个片段能挂独立文本条件。

△上:分块稀疏注意力;下:三阶段训练流程
30秒长程分布匹配
最后把能力搬进三步学生:自强制rollout下做30秒全窗口分布匹配(DMD),从1个真值前缀起步生成20个片段、共189个latent帧,老师与critic对整条轨迹联合打分。
在只换老师的对照里,短时程老师带出的学生亮度掉到开场74%,长时程老师带出的停在101%,8段里7段改善。

△两个三步学生,唯一差别是老师的时间跨度
让世界学会如何回应
逐片段文本条件让提示词能在生成中途换掉,论文称之为evocation。下面几条都在第3个片段切换指令:场景不会推倒重来,而是在原有世界里自然唤出新内容。

△切换前后:相机轨迹与场景结构保留,新元素按提示词出现

△左图:极光;右图:星门

△物体在第2个片段引入、第4个片段撤回,城堡、丛林与巨龙不变
中途指令若指向尚未锚定的区域(比如天空),67%会被兑现;若要覆盖已被世界状态渲染的几何,就只剩4%——因此作者指出切换时应对几何参考进行mask来保证画面能够有效响应用户指令。

△分数0-100,越高越好;组行为组内各项无加权平均
WBench导航子集158例同题,EVOKE在画质、场景、物理三组均分领先,一致性持平;弱项没藏:导航与视角偏低,作者归因于相机控制路径。截至8月16日总分80.8列于首位。
在通用画质上,VBench-2.0拿到66.77居公开榜前十之首,其后是Veo 3的66.72;VBench-Long 85.11列第七。两处都不是等步数比较:EVOKE用3步、无CFG,对手跑默认多步采样器。

△一条连续65.5分钟的生成,属8条同规格长会话之一
在小时级会话里,光度统计短暂波动后趋于平稳;场景身份余弦相似度稳定在0.523,正好是真实素材相隔60秒时的自相似水平,证明长时生成色彩分布稳定性。
几何召回上,21组受控对比有20组符合预期:保留窗口不短于离开时长,回访质量就高出2.3–3.2dB;但15.4–17.8dB的平台期也说明,这是“认得出来”而非像素级还原。
项目价值与边界
EVOKE给出的是一条完整清晰的交互式世界模型训练方案:即世界模型不必把“记忆”和“实时”压在同一个去噪器上。空间状态外置成显式存储,时间一致性和指令切换能力由长时程重做过的老师监督训练得到,会话时长就不再被上下文预算封顶。

△三种条件输入,每条各4个片段、约5.9秒
论文边界作者也写得清楚:几何世界状态只保住粗结构,物体身份与局部细节一致性仍有限;只有静态几何,还没有动态状态这些都值得进一步探索。
项目主页:https://evoke-world.github.io/Evoke/
代码仓库:https://github.com/SII-YuanyangYin/Evoke
模型权重:https://huggingface.co/SII-YuanyangYin/Evoke
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。
🌟 点亮星标 🌟