18秒出片、视频生成提速265倍!北大清华阿里提出SparkDiffusion

机器之心 2026-09-28 16:00
18秒出片、视频生成提速265倍!北大清华阿里提出SparkDiffusion图1


随着 Sora、Runway 等视频生成模型的快速迭代,AI 视频生成正在变得越来越普及。但生成速度慢、算力门槛高的问题,让大多数开发者和创作者难以将其落地。一段 5 秒 720P 视频,传统方法需要超过 1 小时才能完成扩散生成——这给实时创作、批量生成与消费级硬件部署带来了巨大挑战。


更令人困惑的是,当研究者试图通过极致稀疏化(97%稀疏率)来突破性能瓶颈时,却发现了一个反常现象:训练损失持续下降,生成视频质量却急剧恶化——人物破碎、背景扭曲、时序混乱。


针对这一问题,北京大学、清华大学、阿里巴巴等机构的研究者提出了 SparkDiffusion:首个将稀疏注意力、少步蒸馏与低精度量化整合到统一框架(含开源权重及完整训练代码)的视频生成加速系统,推动 DiT 视频生成从「分散优化单个组件」转向「端到端系统化加速」的新范式。




核心发现

"高稀疏陷阱"——当训练越久,质量越差


极致稀疏的反常现象


研究团队发现,当稀疏率从 90%推到 97%时(计算量从 10%降至 3%),训练损失持续下降,生成视频却开始破碎、扭曲、失去时序连贯性。更诡异的是,延长训练、增大数据集、扩大补偿分支容量,都无法修复这个问题。


18秒出片、视频生成提速265倍!北大清华阿里提出SparkDiffusion图2


团队将这种现象命名为"高稀疏陷阱"(High-Sparsity Trap):


在极高稀疏率下,逐步监督架构的稀疏视频 DiT 会陷入一种失效模式——尽管单步验证损失持续优化,但终端生成质量却停滞不前甚至退化,而且延长逐步训练也无法实质性恢复终端质量。


问题出在哪?误差累积在高噪声阶段


扩散模型沿着去噪轨迹逐步生成视频。传统的 Flow Matching 等逐步监督方法,只要求模型在某个噪声时刻预测正确的速度,却不直接约束"这一步与后续轨迹组合后,最终会生成什么"。


关键实验:Oracle 干预


研究者做了一项 Oracle 干预实验:在 97%稀疏率下,用稠密教师的预测替换稀疏学生在不同采样区间的预测。


18秒出片、视频生成提速265倍!北大清华阿里提出SparkDiffusion图3


发现:



结论: 高噪声阶段的结构误差会被后续步骤放大,最终导致终端质量崩溃。


解法

从诊断到分阶段治疗


核心洞察:终端对齐监督


传统方法的问题: 只监督"当前这一步预测是否准确",却不管后续累积误差会把结果带偏到哪里。


SparkDiffusion 的解法: 终端对齐监督(Terminal-Aligned Supervision),在训练时就约束"这一步最终会生成什么",从根源上避免误差累积。


理论验证:二维序列分布实验


18秒出片、视频生成提速265倍!北大清华阿里提出SparkDiffusion图4


在六种二维序列分布上:



方法设计

RoLA + CrossDistill + FP8


分阶段策略:先适应,再修正


基于上述诊断,SparkDiffusion 提出三阶段流程:


18秒出片、视频生成提速265倍!北大清华阿里提出SparkDiffusion图5


RoLA:为极高稀疏率保留全局信息


SparkDiffusion 默认采用团队提出的 RoLA:Rotary-Positioned Low-Rank Linear Attention for Efficient Diffusion Transformers 作为稀疏注意力模块。RoLA 一边通过块稀疏分支保留高能量 query-key 交互,一边用带旋转位置信息的低秩线性分支补回被稀疏化舍弃的全局上下文。


CrossDistill:3 步兼顾质量与多样性


SparkDiffusion 的少步蒸馏采用团队提出的 CrossDistill:Balancing Quality and Diversity via Trajectory-Level Hybrid Few-Step Distillation。CrossDistill 在噪声轨迹上设置交叉点。PCM 一致性目标和 DMD 分布匹配目标都不是只拟合孤立时刻,而是利用后续轨迹或最终输出构造监督,因此都属于终端对齐监督:



最终得到一个 3 步、无 CFG 的学生模型。它一方面用终端对齐信号跨过高稀疏陷阱,另一方面通过高低噪声分工平衡生成质量与多样性。


再结合 FP8 量化策略以及团队开发的高性能融合算子,将理论计算收益转化为实际延迟缩减。


实验结果

单卡 RTX 5090 实现 265 倍加速


主要性能数据


18秒出片、视频生成提速265倍!北大清华阿里提出SparkDiffusion图6


SparkDiffusion 在以下配置下均保持高质量快速生成:


  1. 在 90%稀疏率下: SparkDiffusion 在所有指标上全面超越 FastWan 和 TurboDiffusion

  2. 推到 97%稀疏: 质量略有下降但仍接近稠密基线,加速比从 201×提升到 265×

  3. H100 上: 同样配置下加速 220×,绝对延迟降至 8 秒


为什么高分辨率加速更明显?


分辨率越高,稀疏收益越大:



这解释了为什么 720P-14B 的 265×加速比 480P-1.3B 的 140×更高。


18秒出片、视频生成提速265倍!北大清华阿里提出SparkDiffusion图7


立即体验


SparkDiffusion 已完整开源:


✅ 权重 

✅ 稀疏微调+蒸馏训练代码

✅ RTX 5090/H100 推理脚本

✅ 统一加速框架 (稀疏+蒸馏+量化一体化)

✅ 跨模型支持 (Wan2.1/Wan2.2, T2V/I2V, 480P/720P)


18秒出片、视频生成提速265倍!北大清华阿里提出SparkDiffusion图8



总结与展望


SparkDiffusion 将 DiT 视频生成加速从"分散优化单个组件"推进到"端到端系统化加速":


核心贡献:


  1. 首次识别并命名"高稀疏陷阱" — 极致稀疏率下逐步训练失效的现象

  2. 诊断根因 — 高噪声阶段的结构误差会沿轨迹累积

  3. 分阶段解法 — 先稀疏预热建立粗略先验,再轨迹混合蒸馏修正终端分布

  4. 统一框架 — 首个整合稀疏+蒸馏+量化的完整开源系统


实测成果:



研究团队希望这项工作能够为视频生成落地提供新的思路,在高稀疏度下激发消费级显卡视频生成的速度上限,让消费级显卡也能高质量生成视频。


下一步计划


团队正在将该框架扩展至:



AR 扩展、全模态生成的后续进展,敬请期待。


18秒出片、视频生成提速265倍!北大清华阿里提出SparkDiffusion图9


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AR 阿里
more
桌面Agent现在只是过渡态?腾讯Marvis负责人:基模能力上涨,会吞噬边界
Sharpa机器人一举发布三款旗舰新品
Spark Talk灵感闪聊参与教程 | 虹桥国际科技周
【Informa TechTarget 招聘】 Research Director,China Semiconductor research practice
卫星地球观测雷达:FPGA从SAR雷达到智能感知
腾讯新版Marvis实测!把电脑里琐碎脏活交给它,真靠谱吗?
同期活动 | 120+企业已申报!2026深圳国际AI+AR智能眼镜展「灵眸·金瞳奖」报名火热进行中,十大年度大奖等你角逐 |
AI重塑保险经纪“后台”:Outmarket获3450万美元B轮融资,估值达3.35亿美元
拆解报告:Smartoools五号/七号可充锂电池
独家消息|西门子新一代SMART PLC即将新增UL认证,本土研发产品打通出海关键关卡
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号