智源&北大用一句话完成音视频联合编辑 | SIGGRAPH Asia'26

量子位 2026-08-04 17:00
InstructAV2AV 团队 投稿 
量子位 | 公众号 QbitAI

真实世界中的视觉与声音,并不是两条彼此独立的信息流。

人物口型对应语音,汽车运动对应引擎声,动物动作对应叫声。一次完整的视频编辑,不仅要改变画面中的目标,还要同步处理它在音轨中的声学痕迹,同时尽量保持环境声不变。

文本驱动的视频编辑已经能够替换人物、修改物体属性、插入或删除对象,但真实媒体天然是多模态的。视觉对象、运动状态、语音、环境声之间存在紧密对应关系。

模型不仅要准确执行编辑指令,还要保留无关背景与环境声,并维持声音事件和视觉运动的时间同步

针对这一问题,北京智源人工智能研究院与北京大学联合团队提出了InstructAV2AV。给定一段带声音的视频和一句自然语言指令,它可以同时编辑指定视觉对象及其对应声音。整个过程不需要用户手工绘制掩码或边界框,也不是先改视频、再单独生成音频,而是让画面与声音在同一个端到端生成过程中共同响应指令

智源&北大用一句话完成音视频联合编辑 | SIGGRAPH Asia'26图1

相关工作已被SIGGRAPH Asia 2026接收,推理代码、模型权重、训练脚本、数据处理代码和InsAVE-80K数据集均已公开。

InstructAV2AV:先补数据,再改模型

InstructAV2AV的技术路线分为两步:首先构建可规模化的数据生成pipeline,解决成对训练数据不足的问题;随后基于这些数据,将预训练音视频生成模型改造成文本驱动的联合编辑模型。

音视频联合编辑需要“源视频—编辑指令—目标视频”的成对样本。但与图像和纯视频编辑相比,这类数据不仅要包含编辑后的画面,还要包含与其同步变化的目标音轨,公开数据极其稀缺。由于人工逐条制作成本高昂,团队搭建了一条包含素材筛选、目标合成和质量验证三个阶段的自动化数据流水线。

InsAVE-80K数据集构建

智源&北大用一句话完成音视频联合编辑 | SIGGRAPH Asia'26图2
InsAVE-80K数据构建流程。先筛选高质量开放世界音视频,再自动生成编辑指令、目标声音和同步画面,最后通过五维自动评估与人工复核完成质量控制。

阶段一:筛选声画对应明确的开放世界素材

原始素材来自YouTube、MovieBench、Condensed Movies、Short-Films-20K和VGGSound等开放来源。在视频侧,系统先使用PySceneDetect切分单镜头片段,再通过CoTracker3估计画面运动,过滤静止或低运动视频,并使用LAION Aesthetics Predictor删除视觉质量较低的样本。

在音频侧,系统使用PyDub删除低于-45 dBFS的静音片段,并通过Audiobox-Aesthetics过滤低质量声音。随后用Qwen3-Omni随后对素材进行分类。这一步的目标不是单纯寻找画质好的视频,而是保证画面中的声源清晰可见,声音与视觉事件具有可靠对应关系。

阶段二:自动合成编辑指令与目标音视频

对于每段源视频,先使用Grounded-SAM-2定位视觉实体并获得实例掩码,再利用Qwen3-Omni结合音视频上下文,生成多样化的编辑指令。音频处理遵循“分离—生成—混合”的路径:

视频目标则由一个基于Wan2.2-5B的掩码引导编辑模型生成。这个数据引擎包含三类条件:实例掩码提供空间定位,逐帧音频交叉注意力提供时间同步,参考token用于保留目标外观。模型采用源条件Flow Matching训练,因此不需要人工制作编辑后视频作为监督。

阶段三:自动过滤与人工复核

对于训练集,生成结果需要同时通过指令忠实度、非目标内容保留、感知质量、音视频同步和内容安全五项检查。而针对评测集还增加了人工复核。最终得到的InsAVE-80K包含7.9万组自动验证训练样本和1000组人工精筛评测样本。每段视频时长为5秒,规格为720p、24 FPS,并带有16 kHz音频。

从生成模型到联合编辑模型

数据准备好后,下一步是把生成模型真正变成编辑模型。InstructAV2AV以预训练音视频生成模型Ovi的对称双流扩散Transformer为基础,不从零学习音视频生成能力,而是将已有生成先验迁移到编辑任务中。

智源&北大用一句话完成音视频联合编辑 | SIGGRAPH Asia'26图3
InstructAV2AV整体框架。源音频与源视频分别编码后与噪声潜变量拼接;视频、音频分支各自进行自注意力建模,通过SIGA注入源内容与编辑指令,最后利用双向跨模态注意力完成声画同步。

给定源视频x^v、源音频x^a和编辑指令I,模型需要联合生成编辑结果y^v与y^a。视频和音频分别通过时空VAE与一维VAE编码到潜空间,指令则由T5编码。

要完成这种迁移,核心不在于继续堆叠模块,而在于解决源内容锚定、编辑区域定位和跨模态同步三个问题。对应到结构上,主要包含以下三项设计。

源潜变量拼接:告诉模型“哪些不能乱动”

在普通生成任务中,模型可以从噪声出发自由创造内容;编辑任务则不能推倒重来,它必须持续参考源视频。

InstructAV2AV将源视频和源音频的潜变量,分别与对应模态的高斯噪声沿通道维度拼接。源内容由此成为整个去噪过程的结构条件,约束模型保留背景、无关对象和环境声。

简单说,这个设计要避免模型“为了修改一个目标,顺手重绘整个世界”。消融实验显示,去掉源潜变量拼接后,InsAVE-80K上的SSIM从93.84降至49.97,FVD从180.38上升到467.20,非目标背景会出现大幅变化。

SIGA:逐token决定“改多少、留多少”

仅依赖文本指令意味着模型没有显式时空掩码告诉它哪里需要变化。Source-Instruction Gated Attention(SIGA)正是为这一矛盾设计的。在每个DiT block中,当前噪声特征会同时与两路条件交互:(1)源特征负责提供原始人物、背景、运动和声音信息;(2)指令特征负责提供目标编辑方向。

SIGA随后通过一个可学习的逐token软门控融合两路结果。当门值接近0时,模型更依赖源内容;当门值接近1时,模型更重视编辑指令。

这样一来,“内容保留”和“指令执行”不再共享一个固定的全局比例,而是可以随空间位置、时间步和语义动态变化。去掉SIGA、改用普通文本交叉注意力后,模型更容易出现指令执行不足、额外发音和语音卡顿等问题。

双流交互与两阶段训练:先学编辑,再学声画同步

视频和音频首先在各自分支中通过自注意力建模模态内部依赖,随后通过双向跨模态注意力交换特征。这使视觉运动可以影响声音生成,音频事件也可以反向约束画面变化。例如,汽车出现的时刻和运动轨迹需要与引擎声对应,人物的语音节奏需要与唇形变化一致。

InstructAV2AV具体采用两阶段训练方案,先完成单模态能力迁移,再学习联合同步:

实验效果

从改台词到删除声源,InstructAV2AV覆盖了四类主要编辑能力;在此基础上,人物外观、说话内容和音色还可以进行更细粒度的组合控制。

智源&北大用一句话完成音视频联合编辑 | SIGGRAPH Asia'26图4
InstructAV2AV支持四类代表性任务,包括身份保持的语音修改、音视频实例替换、实例插入和实例移除。蓝绿色波形表示源音频,粉色波形表示编辑后的音频。

身份保持的语音修改

编辑指令:保留人物身份,将台词改为“This is more than just art, it’s a statement.”

原视频
编辑后视频

人物、声音与台词联合替换

编辑指令:将男人换成一个棕色头发的年轻女人,穿着灰色西装外套,将台词改为“I really think we should give it another chance.

原视频
编辑后视频

插入新对象并同步声音

编辑指令:添加一辆从右向左行驶的深色复古轿车。

原视频
编辑后视频

删除对象及其声音

编辑指令:删除站在石头表面、位于花生之间的花栗鼠。

原视频
编辑后视频

更多开放世界应用场景

智源&北大用一句话完成音视频联合编辑 | SIGGRAPH Asia'26图5
人物外观、说话内容和音色也可以作为相对独立的属性进行组合编辑

未来展望

InstructAV2AV把“先改画面、再补声音”的级联流程,改写成一个统一的多模态条件生成问题。它为影视后期、短视频制作、虚拟人、广告创意和交互式内容生产提供了一条新的研究路线,但距离复杂生产环境中的稳定应用仍有提升空间。

当前效果仍受底层音视频生成骨干限制。在复杂物体交互、多光源、大幅相机运动等场景中,结果可能出现物理真实性不足、光照不一致、三维空间漂移或物体恒常性下降。后续工作还需要进一步提升长视频稳定性、分辨率和推理效率。

论文标题:InstructAV2AV: Instruction-Guided Audio-Video Joint Editing
作者:Haojie Zheng、Yixin Yang、Siqi Yang、Shuchen Weng、Boxin Shi
作者单位:北京智源人工智能研究院、北京大学
论文链接:https://arxiv.org/abs/2605.18467
项目主页:https://hjzheng.net/projects/InstructAV2AV/
代码链接:https://github.com/suimuc/InstructAV2AV
模型权重:https://huggingface.co/suimu/InstructAV2AV
数据集:https://huggingface.co/datasets/suimu/InsAVE-80K

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目/主页链接,以及联系方式

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
全电多旋翼eVTOL飞行器推进系统概念设计研究
不同旋转配置的有翼eVTOL旋翼失效对比分析
论坛报名丨先进低空飞行器(eVTOL)设计研发、测试与核心零部件技术论坛将于7月23日举行
新兴航空技术相关岗位推荐(发动机、高速飞行器、eVTOL、自主飞行、无人机和工程技术服务等)
低空出行的“终局之战”:eVTOL最后都在卷“全倾转旋翼”!
打破瓶颈!沃飞长空自研移动充电站,破解eVTOL商业化补能痛点
eVTOL飞行器在公共服务领域的应用前景研究
国家队飞控正式入局!国产eVTOL核心系统迎来关键合作
峰飞、亿航双双入选香港“监管沙盒X”,eVTOL合规试飞迈出关键一步
四证是入场券,如何商业化?eVTOL真正的考验才刚开始
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号