Skip to content
←返回开源项目

OPEN SOURCE DEEP DIVE

Image GenerationText-to-Image扩散Transformer

SANA:把 4K 文生图压进笔记本显存

SANA 是 NVIDIA 实验室开源的高分辨率图像与视频生成代码库(9 千+ star,Apache-2.0,PyTorch)。效率来自两处结构改动:变换器用线性注意力替代标准注意力,自编码器做 32 倍深度压缩(传统为 8 倍)。官方数据:6 亿参数版单张 1024 图 0.9 秒,是 FLUX-dev 的 23 秒的近四十分之一,而 FID 同时从 10.15 降到 5.61。系列已扩展到一步生成、视频、世界模型与流式编辑,4 位量化下 8GB 显存可跑 4K。未做基准复现,记为待复现。

NVlabs/Sana9.2kPythonApache-2.02 min read

一句话定位

SANA 是 NVIDIA 实验室开源的一套高效扩散模型代码库,做的是高分辨率图像与视频生成,训练与推理管线都完整开放。仓库在 2024 年 10 月公开,星标九千余,Apache 2.0 协议,Python 与 PyTorch。它最初的口号是「用线性扩散变换器高效合成高分辨率图像」,两年下来已经长成一个系列:图像、视频、世界模型、后训练四条线都在同一个仓库里。

论文成绩是 ICLR 2025 口头报告、ICML 2025、ICCV 2025 亮点、ICLR 2026 口头报告。它最值得被记住的一句话在介绍里:相比 Flux 的 120 亿参数版本,它小 20 倍、快 100 倍,还能生成到 4K。

效率从哪来:两处同时变小

把扩散变换器做快,通常的做法是减步数或减参数。SANA 在结构上动了两刀,而且这两刀相互加强。

第一刀是把变换器里的标准注意力换成线性注意力。标准注意力的代价随序列长度平方增长,分辨率越高,这张账单越难看;线性注意力把这个关系拉回近似线性,高分辨率下省下的正是最贵那部分。

第二刀是自编码器。它用的是深度压缩自编码器 DC-AE,把图像压到 32 倍,而传统扩散模型常用的压缩倍数是 8 倍。压缩倍数直接决定潜空间令牌的数量——令牌少了,前面那刀省下的算力又被放大一次。

配套还有两处:文本编码器换成现代的纯解码器大语言模型,用上下文学习改善图文对齐;采样器用 Flow-DPM-Solver 减少步数。这些加在一起,才撑得起「小 20 倍、快 100 倍」这个说法。

官方数字:快不是靠牺牲质量换的

下面这组是 1024×1024 图像生成的官方对比,我们没有复现,这一档记为待复现。看的时候请注意一个反直觉的点:不只是变快,几项质量指标同时变好了。

模型吞吐(张/秒)延迟(秒)参数(十亿)加速比FID ↓CLIP ↑GenEval ↑
FLUX-dev0.0423.012.01.0×10.1527.470.67
Sana 0.6B1.70.90.639.5×5.6128.800.68
Sana 1.6B1.01.21.623.3×5.9228.940.69
Sana 1.5 1.6B1.01.21.623.3×5.7029.120.82
Sana 1.5 4.8B0.264.24.86.5×5.9929.230.81

6 亿参数的 Sana 单张 1024 图 0.9 秒,是 FLUX-dev 的 23 秒的近四十分之一;同时 FID 从 10.15 降到 5.61(越低越好),图文匹配分与 GenEval 也都在 FLUX 之上。这说明它的效率收益主要来自结构而不是「砍质量换速度」——后者常见得多。

再往上堆算力仍然有效:1.5 系列 4.8B 版本的 CLIP 分最高(29.23),GenEval 却被同系列 1.6B 反超(0.81 对 0.82)。官方把 1.5 定位成「训练时与推理时的算力扩展」,也就是说这一档卖的是可扩展,不是单一最优。

从图像长出来的一整个系列

这个仓库现在覆盖的远不止文生图:

SANA-Sprint 用连续时间一致性蒸馏(sCM)把生成压到一步或少步,官方称在 H100 上一张 1024 图 0.1 秒、在消费级 4090 上 0.3 秒。SANA-Video 与 LongSANA 走块线性注意力与因果混合前馈网络,做长视频;SANA-Video 2.0 是 50 亿与 140 亿两档,混合线性与 softmax 注意力并引入注意力残差。SANA-WM 是 26 亿参数的可控世界模型,生成 720p、一分钟的连续场景并支持六自由度相机控制。SANA-Streaming 是 20 亿参数的实时流式视频到视频编辑。Sol-RL 是后训练方法:用 NVFP4 低精度做采样、BF16 高精度做优化,官方称收敛快 4.64 倍。

工程侧也有一笔值得单独提:Sol Engine 在 MiniMax-H3 这个 330 亿参数的全模态音视频变换器上做到 3.95 倍加速(GB200),在台式硬件上更高(DGX Spark 3.92 倍、RTX 5090 4.52 倍),官方称 4.5 小时完成优化,且没有用蒸馏、没有用低秩适配、没有标定步骤。

部署边界:4K 与 8GB 显存

官方给出的部署口径很具体:16 亿参数的 4K 模型可以在 20 秒内出 4096×4096 的图;靠 DC-AE 分块,4K 推理压进 22GB 显存;再叠加 8 位或 4 位量化与模型卸载,4K 可以在 8GB 显存里跑。整体结论写的是「通过 4 位量化可部署在 8GB 显存以下的笔记本显卡上」。

生态接入也齐:已被合并进 Hugging Face 的 diffusers(0.32.0 起可用 SanaPipeline),有 ComfyUI 节点、SGLang 接入、ControlNet、LoRA 与 DreamBooth 训练,量化有 4 位与 8 位两档,后训练可对接 NVIDIA 自家的 Cosmos-RL。

读数字时要注意的口径

官方视频表里 SANA-Video 2.0 5B 的 13.2 秒对应的是 480×832×81 帧、40 步、单张 H100 的 VBench 协议;同一模型在 736×1280×81 下的端到端延迟是 30.9 秒。4 步版本是 DMD 预览,不是最终版。14B 的配置与权重官方明确说尚未包含。这些都是仓库自己写清的,读表格时别把不同口径的数字直接横着比。

另外,视频表里 SANA-Video-2B 用 2B 参数、36 秒拿到 84.05 的 VBench 总分,高于 Wan-2.1-14B 的 83.73(1897 秒、14B)。这一组同样出自官方,我们没有复现。

待复现

我们未对 SANA 做过任何基准或复现测试,上述全部数据引自仓库与官方文档站。星标、更新活跃度(公开两年、仍在持续发布新版本)与它在 diffusers 里的官方支持,说明它是图像生成这条线上必须收录的一层,但能力水位记为待复现。

作为亚马逊联盟会员,我们可能从符合条件的购买中获得佣金。