PAPER DEEP DIVE
SparkDiffusion:破解高稀疏陷阱,阿里北大清华把视频生成在单卡上加速 265 倍
北大、清华与阿里(Melon Group/Alibaba Research)提出 SparkDiffusion(arXiv:2609.23153):先诊断出「高稀疏陷阱」——注意力稀疏到 97% 时逐步训练损失照降而终端生成质量停滞倒退,根因是流匹配类逐步监督无法约束终端误差(Oracle 干预实验证明高噪声 5 步修正即可消除大部分终端误差)。三段配方:短促稀疏预热(补偿式稀疏注意力,RoLA)→ 少步轨迹混合蒸馏(CrossDistill:高噪声 PCM 一致性 + 低噪声 DMD 分布匹配,3 步 CFG-free 学生)→ FP8 W8A8 量化与融合核。720P 长序列维持 97% 稀疏度,Wan2.1-T2V-14B-720P 单张 RTX 5090 端到端加速 265×(H100 220×),1.3B-480P 视频仅 1.3s;多样性最接近稠密参照,VBench 83.15 对稠密 83.69。代码开源。
一句话读懂
北京大学(Melon Group)、清华大学、阿里巴巴集团等联合提出 SparkDiffusion(arXiv:2609.23153):文章先诊断出视频扩散 Transformer 在极限稀疏度下的「高稀疏陷阱」——注意力稀疏到 97% 时,逐步(step-local)训练损失还在降,终端生成质量却停滞甚至倒退;根因不在表示能力而在监督方式:主导终端误差的是高噪声段的「结构生成」阶段,而流匹配这类逐步损失根本管不到终端样本。由此得到一条分阶段原则:先把稀疏架构适配成粗糙先验,再校正终端分布。落到工程上是三段流水线——短促稀疏预热 + 少步轨迹混合蒸馏 + FP8 量化与融合核。结果:720P 长序列维持 97% 注意力稀疏度,Wan2.1-T2V-14B-720P 在单张 RTX 5090 上端到端加速 265 倍(H100 220 倍),1.3B-480P 视频端到端仅 1.3 秒(H100 0.6 秒)。
一、问题:为什么稀疏到 97% 反而更慢地「变差」
视频扩散 Transformer 的推理成本几乎全部压在长时空 token 序列的注意力上,复杂度 $O(L^2)$。稀疏注意力靠跳过冗余 query–key 交互降本,但常规设计一旦推到极高稀疏度就丢失全局上下文、结构崩坏;补偿式稀疏注意力(高能稀疏分支 + 轻量低秩/线性补偿分支)把这一上限推到约 90%。
再往上走的收益是实打实的:块稀疏只计算 $1-s$ 比例的 query–key 块,稀疏度从 90% 提到 97% 意味着保留块从 10% 降到 3%,块级稀疏注意力计算量降到 90% 时的约 30%。在 Wan2.1-T2V-14B-720P、3 步推理下,仅这一档拉伸就把延迟从 10.5s 降到 8.0s(H100)、从 23.7s 降到 18.0s(RTX 5090),额外拿到 1.31–1.32× 加速——前提是质量撑得住。而现实中极端稀疏暴露出第二重障碍:稀疏模型推理很快、逐步训练损失也收敛,但终端视频出现结构破碎、语义漂移、马赛克纹理与时序闪烁。作者把这一失效区命名为高稀疏陷阱。
1.1 机制诊断:Oracle 探针指向高噪声段
论文用一个干净的干预实验定位根因:从同一初始噪声出发,在采样轨迹的一个短窗口内把稀疏学生的速度场替换为稠密教师的速度(「fix」),比较不同窗口位置的修正效果(Wan2.1-T2V-14B-480P、50 步采样、32 提示词 × 4 种子)。结果是决定性的:
在 97% 稀疏度下,修正「最高噪声的 5 步」消掉了大部分终端误差,而修正「最低噪声的 5 步」几乎毫无改善;把高噪声窗口扩到 28 步则几乎完全恢复。这直接把责任从「表示能力」转移到「监督」。论文对此的形式化解释是:逐步损失度量的是单步误差幅度,而终端样本取决于这些误差如何沿采样轨迹被搬运并累加——流匹配监督的是 $(x_t, t)$ 处与闭式、逐点目标对齐的速度,对误差的复合与累积天然不敏感。
由此引出关键定义:终端对齐(terminal-aligned)信号的监督目标是在噪声水平 $t$ 处由「$t$ 之后的采样轨迹」构造的——模型在更晚轨迹状态的预测、教师合成的轨迹片段、或终端输出本身——因此损失约束的是 $t$ 处预测与后续轨迹如何复合成终端状态。一致性目标相对其噪声区间的终端对齐,分布匹配目标相对全局终端输出对齐,两者都属终端对齐;而逐步损失只是建立粗糙先验,在极端稀疏下无法锚定终端分布。
二、方法:三段流水线
SparkDiffusion 把一个预训练稠密视频 DiT 转成快速高稀疏生成器,不需要从头训练。三段依次消费前一段的 checkpoint,且对稀疏选择器、补偿分支、蒸馏目标都保持无关——默认实例化用 RoLA 作稀疏模块、CrossDistill 调度作蒸馏目标。
2.1 补偿式稀疏注意力
稠密自注意力为:
$$A(Q,K,V) = \mathrm{softmax}\!\left(\frac{QK^\top}{\sqrt{d}}\right)V$$
补偿式稀疏注意力把它替换为两条分支的加权和:
$$\tilde{A}(Q,K,V) = A_M(Q,K,V) + g_\gamma \odot C_\psi(Q,K,V)$$
其中 $A_M$ 是只保留 $1-s$ 比例 query–key 块的稀疏分支(top-k 选择、块级打分或固定时空模式),$C_\psi$ 是轻量补偿分支(线性/低秩注意力或池化摘要),$g_\gamma$ 是融合门。论文采用 RoLA 的补偿设计:复用骨干注意力前的归一化 query/key,施加低秩投影、逐点非线性与秩截断的 3D RoPE 旋转:
$$\tilde{q}_i = R_r(p_i)\,\phi\!\left(P_q\, q^{\text{norm}}_i\right), \qquad \tilde{k}_j = R_r(p_j)\,\phi\!\left(P_k\, k^{\text{norm}}_j\right)$$
$$C = \sum_j \tilde{k}_j v_j^\top, \qquad O_{lr,i} = \mathrm{RMSNorm}\!\left(\tilde{q}_i^\top C\right)$$
该分支对序列长度线性、且保留相对时空位置。最后用逐 token 门融合,门初始化接近零:
$$O_i = O_{s,i} + g_i\, r_i\, O_{lr,i}$$
其中 $r_i$ 是稀疏输出 $O_{s,i}$ 的 RMS。模块因此从接近纯稀疏分支起步,只在需要处打开补偿通路——这也解释了为何小幅预热就足以为后续蒸馏提供可用先验。
2.2 轨迹混合蒸馏:为什么必须「混」
极端稀疏下的蒸馏要同时满足两个要求。第一,跳出高稀疏陷阱需要终端对齐信号——一致性目标与分布匹配目标在原理上都够用(消融证实)。第二,二选一被「保真度–多样性」权衡支配:纯分布匹配是 mode-seeking 的,会丢失种子级多样性;纯一致性匹配保留教师轨迹,却从不校正终端分布。因此采用 CrossDistill 的轨迹混合调度:在噪声交叉点 $t_{\text{cross}}$ 处分割采样轨迹,高噪声段用 PCM 风格一致性训练以保住结构、运动与多样性,低噪声段用 DMD 风格分布匹配以锐化细节、修正终端可见误差。学生为 3 步——一个高噪声 PCM 步 + 低噪声两个 DMD 步。这一分工恰好对应第 1 节的诊断:终端可见误差源于高噪声结构生成,故高噪声步锚定教师的粗糙轨迹,低噪声步供给终端对齐的校正。
流匹配的基础形式在此仍是 Stage 1 的监督目标:
$$x_t = (1-t)x_0 + t\epsilon, \qquad \mathcal{L}_{FM}(\theta) = \mathbb{E}_{x_0,\epsilon,t}\left[w(t)\left\|F_\theta(x_t,t) - (\epsilon - x_0)\right\|_2^2\right]$$
2.3 FP8 量化与融合核
稀疏省下的 FLOPs 要兑现成墙钟加速,必须靠部署侧量化。论文把注意力线性投影与前馈层量化为 W8A8 FP8(E4M3):权重用离线校准的静态逐通道缩放,激活在运行时逐 token 动态缩放;归一化层、门控操作与稀疏掩码选择保持 BF16。逐 token 激活量化路径被融进单个自定义核,让缩放与类型转换在一次内存遍历中完成。这一变换纯在部署时施加、训练全部完成后进行,且少步采样下量化误差没有累积空间——BF16→FP8 的质量差在消融中控制在 0.1 个 VBench 分以内。

2.4 训练与部署配方细节
三段的调度设计都刻意「省」。Stage 1 的预热之所以能短,是因为补偿门 $g_\gamma$ 初始化在零附近——模块起点即接近原稠密行为,骨干只需少量更新即可适应稀疏掩码的选择性丢弃;论文用 Wan2.1-T2V-14B-480P 做了预热消融,显示是否预热(而非预热多久)才是决定蒸馏成败的变量:跳过预热直接蒸馏的模型终端质量明显塌陷,而短预热后蒸馏即可恢复。Stage 2 的教师是冻结的多步稠密模型,学生 3 步的分配(1 PCM + 2 DMD)与 CrossDistill 的默认交叉点、损失权重和优化调度保持一致,未做额外调参——这暗示配方对超参不敏感,工程复现门槛低。Stage 3 对 MoE 骨干(Wan2.2)有一个专门处理:高噪声与低噪声专家组分别在自己的噪声范围内完成预热与蒸馏再量化;部署时 RTX 5090 的延迟里包含显存中交换两组专家的开销,而 H100 内存足够同时驻留两组——同一模型在两卡上的延迟差有一部分来自这个工程细节而非算法。
基准协议也值得注意公平性设计:稠密基线不是「随便跑跑的 Full Attention」,而是各卡最强实现(RTX 5090 用 FlashAttention-2、H100 用 FlashAttention-3,BF16);基线加速方法(FastWan/VSA、TurboDiffusion)用官方发布权重与推理脚本、含其自身的量化设置;所有 SparkDiffusion 的质量数字都在 FP8 + 融合核全开度的部署形态下测得——质量与延迟数字来自同一个部署形态,不存在「论文质量、产品延迟」的错位。NFE 口径也全程标注:稠密基线 50 步 × CFG 双前向 = NFE 100,加速模型 3 步 CFG-free = NFE 3,265× 由此可分解(约 33× 来自步数与 CFG 消除,其余来自稀疏与量化)。
三、实验结果
3.1 主对比:质量与延迟同时守住
| 模型 / 方法 | 稀疏度 | VBench↑ | VBench-2.0↑ | 5090 延迟(s)↓ | H100 延迟(s)↓ |
|---|---|---|---|---|---|
| Wan2.1-T2V-1.3B-480P 稠密 | 0% | 83.21 | 56.02 | 182 | 92 |
| FastWan (VSA) | 90% | 82.37 | 54.63 | 2.8 | 1.2 |
| TurboDiffusion | 90% | 82.52 | 54.61 | 2.0 | 1.0 |
| SparkDiffusion | 90% | 82.64 | 55.85 | 1.3 | 0.6 |
| Wan2.1-T2V-14B-720P 稠密 | 0% | 83.69 | 60.20 | 4769 | 1757 |
| FastWan (VSA) | 90% | 82.72 | 58.04 | 54.1 | 20.5 |
| TurboDiffusion | 90% | 82.88 | 57.98 | 25.3 | 16.0 |
| SparkDiffusion | 90% | 83.42 | 59.36 | 23.7 | 10.5 |
| SparkDiffusion | 97% | 83.15 | 58.05 | 18.0 | 8.0 |
| Wan2.2-T2V-A14B-720P 稠密 | 0% | 84.21 | 60.36 | 4545 | 1508 |
| SparkDiffusion(MoE) | 97% | 83.36 | 58.46 | 25.1 | 8 |
匹配 90% 稀疏度时,SparkDiffusion 在 Wan2.1-T2V-14B-720P 上每项指标都超过全部基线;在 1.3B-480P 上则以最低延迟拿到最佳 VBench-2.0(1.3s / 0.6s,比基线快 1.5–2.2×)。推到 97% 稀疏度时,聚合质量仍略优于最强的 90% 基线(相对 TurboDiffusion),而延迟显著更低——注意基线被评估在其最强官方配置(90%),因为质量随稀疏度单调退化,把基线也训到 97% 只会扩大质量差距。
端到端加速是三项乘法因子(少步蒸馏 × 稀疏注意力 × FP8)的合成结果:Wan2.1-T2V-14B-720P 上 4769s → 18.0s 即 265×(RTX 5090),1757s → 8.0s 即 220×(H100)。稠密基线用各卡最强实现(5090 上 FlashAttention-2、H100 上 FlashAttention-3,BF16),加速结果则是 3 步 CFG-free(NFE=3)对稠密 50 步 CFG(NFE=100)。
3.2 多样性:少步蒸馏不牺牲种子级变化
| 方法 | 稀疏度 | V-JEPA 2 余弦↑ | V-JEPA 2 L2↑ | VideoMAE V2 余弦↑ | VideoMAE V2 L2↑ |
|---|---|---|---|---|---|
| 全注意力(稠密参照) | 0% | 0.125 | 27.15 | 0.0252 | 2.83 |
| FastWan (VSA) | 90% | 0.075 | 21.31 | 0.0117 | 2.05 |
| TurboDiffusion | 90% | 0.078 | 21.67 | 0.0125 | 2.21 |
| SparkDiffusion | 97% | 0.087 | 23.04 | 0.0142 | 2.47 |
用两个冻结视频编码器(V-JEPA 2、VideoMAE V2)对同提示词、不同噪声种子的 5 条视频测平均成对距离(1000 个提示词,协议跟随 Shaul 等)。即便在 97% 稀疏度下,SparkDiffusion 仍最接近稠密参照,而少步基线明显丢掉了一部分种子级变化——这正是分布匹配 mode-seeking 倾向的体现,也反证了轨迹混合设计的必要性:高噪声一致性匹配保住粗糙结构与多样性,低噪声分布匹配提升终端保真。
3.3 玩具流形上的轨迹级验证
在真实视频基准之外,论文还在六个二维序列流形的玩具设定里测量了去噪轨迹上到数据分布的 sliced-W2 距离:把稀疏模型训到验证损失平台期,与轨迹混合蒸馏得到的学生对比。结果与「陷阱是监督问题」的论断一致——验证损失平台期并不意味着轨迹上处处贴近数据分布,蒸馏学生的轨迹距离显著更低。这组小实验的价值在于把机制与基准解耦:即便不看 VBench,终端对齐信号在受控设定下也确实移动了整条轨迹的分布,而非只在评测指标上讨巧。
定性跨模型验证覆盖了五个设定:Wan2.1-T2V-1.3B 480P(90% 稀疏)、Wan2.1-T2V-14B 480P(90%)、Wan2.1-T2V-14B 720P(97%)、Wan2.1-I2V-14B 720P(97%)与 Wan2.2-T2V-A14B 720P(97%,MoE),全部 3 步推理,与官方权重的 TurboDiffusion/FastWan 并排比较。97% 档位下蒸馏后模型在结构连贯性、语义对齐与时序细节上肉眼可见地贴近稠密教师,而未做终端对齐的多步稀疏模型在同等稀疏度下出现马赛克纹理与漂移——图 8 的三列对比(稠密教师 / 多步稀疏 / 蒸馏后)是全文最直观的一张图。
Wan2.1 / Wan2.2"] --> B["Stage 1 稀疏预热
插入补偿式稀疏注意力
逐步目标短训 → 粗糙先验"] B --> C["Stage 2 轨迹混合蒸馏
高噪声 PCM 一致性
低噪声 DMD 分布匹配
3 步学生"] C --> D["Stage 3 FP8 W8A8 量化
逐通道权重 / 逐 token 激活
融合核单遍执行"] D --> E["部署:3 步 CFG-free 推理
97% 注意力稀疏度"] E --> F["Wan2.1-14B-720P
265x @RTX 5090 / 220x @H100"] E --> G["Wan2.1-1.3B-480P
端到端 1.3s / 0.6s"] E --> H["Wan2.2 MoE A14B
97% 稀疏仍 83.36 VBench"]
四、消融:陷阱的根在监督
| Stage-2 目标(97% 稀疏、3 步) | VBench↑ | VBench-2.0↑ |
|---|---|---|
| 全注意力(稠密,50 步) | 83.69 | 60.20 |
| 仅 PCM(3 步) | 81.94 | 56.41 |
| 仅 DMD(3 步) | 82.56 | 57.38 |
| CrossDistill 轨迹混合(3 步) | 83.15 | 58.05 |
所有 3 步学生都从同一个 Stage-1 预热 checkpoint 出发。两个单一目标都已恢复 97% 稀疏度下的大部分质量损失,佐证陷阱确实是监督问题——任何终端对齐目标都能缓解它。但两个纯目标沿保真度–多样性轴朝相反方向失败:仅 PCM 追随教师轨迹却从不校正终端分布,得分最低;仅 DMD 校正了终端分布但 mode-seeking,丢掉粗糙结构与种子级多样性。轨迹混合目标兼得两段之长,配合预热消融(短预热足以建立可用先验),共同支撑了分阶段原则。
论文还给出了扩展到自回归视频扩散的路径:补偿式稀疏注意力可限制在因果窗口内;轨迹混合蒸馏作用于噪声轴而非时间轴,因此可与 self-forced AR 训练结合。由于高噪声结构误差会跨 chunk 传播,终端对齐在 AR 生成中「只会更重要」。
五、边界与启示
这篇工作的价值有两层。工程层很直接:它把「高稀疏真的能跑快」这件事从口号变成可测的数字——97% 稀疏在 720P 长序列上守住质量,265× 的端到端加速不是估算而是单卡实测,而且整条路线是后训练 + 部署优化,不需要重训基础模型。方法层更值得记住的是那个诊断范式:作者没有堆更多稀疏结构,而是先用一个「替换教师速度」的干预实验把误差归因到采样轨迹的特定噪声段,再据此设计训练信号的形状。当指标停滞时,先做归因实验再改方法——这条经验对任何「训练损失好看但输出不行」的系统都通用。
边界同样清楚:论文的稀疏度上限(97%)是在 RoLA 这类补偿式稀疏架构上取得的,换成无补偿分支的纯稀疏设计未必可达;FP8 的省时依赖融合核的工程实现,非 NVIDIA 平台的可移植性未评估;AR 扩展只是提出路径,没有实验数据;多样性评估用两个冻结编码器的成对距离,指标本身对编码器选择敏感。此外这一整套是加速框架而非质量改进框架——它在 97% 稀疏下仍比稠密版低约 0.5 个 VBench 分、2.1 个 VBench-2.0 分,选择它意味着接受这点质量换取一个数量级的延迟。项目页 sparkdiffusion.github.io,代码与权重在 github.com/AlibabaResearch/SparkDiffusion 开源。
六、技术定位:与站内既有工作的关系
放在 agientry 已收录的生成类工作里看,SparkDiffusion 补的是推理侧成本这一维度。SoL-Refiner(NVIDIA)走「一步精修把低分辨率变 4K」,用帧级 RL 后训练 + 一步蒸馏把 MiniMax H3 管线从 152.3s 压到 5.64s;LTX 走「原生分辨率编辑 + 重叠分块」;Kling 4.0 走「模型能力升级(4K/HDR、15 个多模态参考、原生 30 秒)」。SparkDiffusion 则不动模型能力、不动分辨率与时长,纯粹把每个 token 的注意力计算量砍掉 97%,再叠上步数蒸馏与 8 位量化。三者的可组合性值得想象:稀疏注意力 + 少步蒸馏 + 一步精修,理论上可以在同一条生成管线上叠加出更高量级的端到端加速。
对机器人应用侧的意义同样直接:视频世界模型(world model)与机器人策略里的生成式视频分支正在快速膨胀——GE-Act 2.0 用生成式视频预训练、WB-WAM 用生成视频专家辅助动作生成——这些系统的瓶颈往往不在训练而在部署时的推理延迟。97% 注意力稀疏度与 3 步 CFG-free 推理的组合,为人形机器人上「跑一个视频世界模型当预测器」提供了可行的算力预算:14B 参数、720P、单张消费级 GPU 上 18 秒生成 81 帧视频,且可分离成小块按需推理。作者也在结论里明确下一步是把高稀疏加速推向全模态生成模型与自回归世界模型——这正是机器人世界模型最需要的方向。
最后补一句对部署者的实操提醒:这套框架的三个因子(蒸馏、稀疏、量化)各自独立开关,站点侧可按算力预算取用——只做 3 步蒸馏就有约 30× 的收益,不必非要吃满 265×;反之若下游对延迟不敏感(如离线数据合成),保留更多推理步数可获得更接近稠密版的质量。论文开源的实现里,FP8 融合核对内核版本的依赖较深,在非 Hopper/Blackwell 架构上部署前建议先跑一遍官方基准脚本核对延迟收益是否成立。



