ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事

机器之心 2026-08-28 07:31
ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事图1

刘恺骐,北京大学博士生,主要研究方向为可控视频生成、音视频联合生成、世界模型、理解生成统一模型及多模态大模型等,相关成果发表于 ECCV、ICCV、CVPR 等国际会议。


过去几年,视频生成模型在清晰度、运动表现和画面质感上不断进步。输入一句文字,模型已经能够生成颇具电影感的视频。


但当任务从「生成一个漂亮片段」,变成「完整拍完一场戏」,问题就不一样了。


前一个镜头里,女主说完一句话;画面随即切到男主,他停顿片刻后作出回应;接着镜头切回女主,而男主在画外继续说话。要完成这段内容,模型不仅需要知道画面中有什么,还要准确执行一系列叙事约束:何时切镜?谁在什么时候开口?对白能否与口型和动作对应?切镜之后,人物的脸和声音还能否保持一致?


即使这些要求已经写进脚本,现有模型仍可能出现切镜错位、对白提前或延后,以及多人场景中的串脸、串音。问题不只在于故事有没有说清楚,更在于模型内部是否具备沿着复杂时间线组织音视频内容的能力。


为此,北京大学、可灵团队、中国科学院自动化研究所和中山大学联合提出 MAVIN,一种支持定制化叙事控制的多镜头音视频联合生成模型



目前,该论文已被 ECCV 2026 以 Oral 形式接收。刘恺骐为第一作者,翁书晨、施柏鑫为通讯作者。



一、会生成电影感画面,

为什么还「拍不完一场戏」?


多镜头音视频叙事至少面临三类挑战。


首先是时间错位。模型可能知道脚本中有哪些人物和事件,却无法判断它们应该出现在哪个时间段:镜头已经切换,上一名角色的声音仍在继续;人物尚未出现,对白却提前响起。


其次是身份混淆。同一名角色跨镜头出现时,不仅要保持面部、发型和服装一致,也要维持稳定的音色;多名人物交替对话时,还要避免串脸、串音和说话人绑定错误。


此外,用户通常只会输入一段故事梗概,很少完整标注镜头边界、对白区间、角色外貌和声音事件。系统既需要补全一份可执行的剧本,也需要真正按照这份剧本完成生成。


因此,MAVIN 要解决的并不是简单的「多生成几个镜头」,而是让模型学会在一条统一的叙事时间线上,调度画面、对白、动作和角色身份。


ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事图2


二、核心思路:

把「叙事时间线」真正写进生成模型


MAVIN 采用全局、镜头和角色三个层级的结构化脚本,统一描述整体情节与背景音乐,各镜头的起止时间、画面内容与人物动作,对白内容及其时间区间,以及角色的视觉外貌与声音身份。


模型建立在双塔音视频联合生成架构之上,视频和音频分别在各自分支中建模,并通过跨模态注意力交换信息。围绕「何时发生」与「由谁发生」,MAVIN 提出了两项核心机制。


ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事图3


1. 边界感知注意力:让镜头与对白在叙事时间线上精准落位


视频生成模型通常让整段文本影响所有音视频位置。这意味着,模型在生成第一个镜头时,也能读取后续镜头的描述,容易造成后一个人物提前出现、上一段对白串入下一镜等「语义串场」。


MAVIN 根据镜头边界划分视频特征,根据对白区间划分音频特征,再通过动态 token 路由,为不同信息限定明确的作用范围:镜头描述只影响对应片段,角色外貌只在其出场镜头中生效,声音条件也只作用于相应的对白区间。


由此,镜头切换、人物动作和说话时间不再只是提示词中的「软要求」,而成为模型内部能够执行的时间约束。


2. 身份感知传播:镜头可以换,演员不能「掉线」


MAVIN 可以同时接收角色参考图像和参考音频,并通过专门的音色编码器,从参考语音中提取「是谁在说」,而不是复制参考语音「说了什么」。


在此基础上,身份感知掩码进一步限制不同人物之间的信息传播。每个镜头只读取实际出场角色的视觉参考,每段对白只读取当前说话人的声音特征;同一角色的文字、画面和音色相互绑定,不同角色之间则保持隔离。


这相当于为每名角色设置独立的视觉与声音锚点,从而减少多次切镜后的身份漂移,以及多人对话中的串脸、串音。


3. 多智能体脚本流水线:先把故事补成一份「可拍」的剧本


面对自由形式的用户输入,MAVIN 还设计了一套轻量级多智能体流水线。


结构解析智能体负责识别场景、角色和对白,并划分镜头与对白区间;身份对齐智能体匹配人物与参考图像、参考声音;叙事细化智能体则补充动作、镜头语言和环境声音,最终形成全局、镜头和角色三个层级的脚本。


它负责「把拍摄计划写清楚」,边界感知注意力和身份感知传播则负责「按计划真正拍出来」。


三、MAVINSet:

让模型从数据中学会「一场戏该怎么拍」


要让模型学会执行镜头、对白与角色约束,训练数据也必须包含完整的叙事结构。然而,现有音视频数据通常只提供整段内容描述,缺少镜头边界、对白时间以及跨镜头的角色信息。


ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事图4


为此,团队构建了多镜头音视频数据集 MAVINSet,收录数十万条时长 3 至 15 秒、包含 1 至 6 个镜头的样本。不同于普通视频字幕,MAVINSet 为每段内容提供全局、镜头和角色三级标注,覆盖故事进展、镜头内容、人物动作、对白文本与时间,以及角色的外貌和声音特征。


对于跨越切镜点的对白,数据还会记录其在不同镜头间的延续关系。这样,模型看到的不再只是一段音视频,而是一份包含画面、声音、人物与时间信息的完整「分镜表」。


四、实验结果:

不仅时间更准,角色也不再「串线」


研究团队将 MAVIN 与两类代表性方法进行了比较:一类先生成多镜头视频,再通过视频到音频模型补充声音;另一类则是端到端音视频联合生成模型。

视觉对比


ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事图5

在同一段三镜头雪地对话中,现有方法容易出现角色外貌漂移、镜头顺序错乱或对白与人物对应不准等问题。相比之下,MAVIN 能够更完整地执行镜头切换,并在不同镜头间保持人物身份与场景风格,同时让对白与角色之间的对应更加准确。


定量指标


ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事图6

在涵盖音视频质量、语义一致性、音画同步与多镜头控制的 13 项指标上,MAVIN 取得最佳结果。其中,镜头切换准确率 STA 达到 0.9897,对白时间对齐指标 TAMS 达到 0.8104,表明模型不仅能够生成连贯的音视频内容,也能更准确地执行脚本中的时间和身份约束。


五、从模型能力到创作接口:

MAVIN 拓展多镜头叙事的应用边界


当镜头边界、对白区间和角色身份被统一建模后,MAVIN 不再只是按照脚本一次性生成成片。创作者可以直接修改时间安排、角色设定和局部叙事条件,由此衍生出多种面向实际创作的应用。下面介绍其中两个具有代表性的应用场景:


叙事节奏控制(Speed Control)


通过调整镜头边界和对白区间,用户可以改变整段内容的叙事节奏。压缩镜头时长和对白区间,可以让画面推进与人物表达更加紧凑;延长相应区间,则能形成更舒缓的节奏。模型会按照新的时间安排重新组织动作、口型和声音,而不是简单地对已有视频进行机械变速。


角色身份定制(Identity Customization)


MAVIN 将角色的视觉外貌与声音身份作为可独立编辑的条件。用户可以分别替换参考图像或参考音频,实现同一人物使用不同音色说话,或让不同人物共享同一种音色。在保持故事、分镜和对白内容不变的情况下,创作者可以自由组合角色的外貌与声音,并在多次切镜和交替对白中维持正确的视听身份对应。


六、从「生成画面」到「组织叙事」


MAVIN 关注的不只是如何生成更清晰、更自然的单个镜头,而是让模型开始处理镜头、对白与角色视听身份之间的时空关系。视频生成的控制粒度,也由「画面中生成什么」进一步走向「内容在何时发生、由谁完成,以及如何跨越多个镜头展开」。


这种结构化的叙事控制,为多角色短剧、数字人表演、影视预演和交互式内容创作等场景提供了新的技术路径,也让音视频模型开始从单个片段生成,迈向更完整的叙事组织。


当模型不再只是完成一个画面,而能够沿着时间线组织并拍完一场戏,AI 视频才真正开始走向可控的叙事创作。


更多方法与实验细节,请参阅原论文及项目主页。


ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事图7


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
AI Agent伪造身份渗透开源社区,AISI测试揭示具身智能新风险
2026CDIE科创型制造业AI创新峰会——半导体行业专场圆满落幕!数智赋能芯产业,AI 驱动新质生产力
被开除的Thinking Machines CTO,又离开OpenAI回谷歌了
拼增长也拼交付,AI办公双雄接下来往哪儿走
倒计时1天!感知觉醒:2026 AI传感器产业前瞻与应用论坛即将举办
【化合物及功率半导体要闻简报】SiC进入“大尺寸+高压化”竞争,GaN加速切入AI供电,传统功率器件价格周期同步回暖
AI“越狱”成常态?半年17起黑客事件,安全测试反成最大隐患
猿编程李翊:教育底层逻辑需重写,发布“AI素养新编程”理念
首次把时间纳入模型!小鹏第二代VLA全新版本来了,成为物理AI公司?
NVIDIA发布Groq 3 LPX,开启Agentic AI新时代
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号