FLUX:把图像生成从「出图」推进到「可控编辑 + 开放权重」的那条主线
flux
Black Forest Labs 的 FLUX 家族用整流流(rectified flow)Transformer 做图像生成,并放出 Apache-2.0 的 dev 档权重,是开源侧最重要的图像基线;Kontext 一档把「按指令改这张图的局部而不动其余」做成了可用能力。我们的采集库里另有 FLUX 3 的发布记录,厂商把它定位成统一图像/视频/音频的世界模型,这一主张我们记为待核验。
- 置信度
- 厂商宣称
- 只有官方模型卡/发布会,无独立复测
- 关键指标
- 开放权重档位(dev)
- 厂商宣称 · 2024-08
- 成熟度
- 产品
- 研究 → 演示 → 产品 → 生产
我们的判断<p>FLUX 在这条阶梯上的位置很特别:它既是<strong>产品</strong>(API 与 pro 档),又是<strong>公共基线</strong>(Apache-2.0 的 dev/schnell 权重可以在自己机器上跑、可以微调)。对 AIGC 情报站来说,第二种身份更值钱——整个开源图像生态的 LoRA、ControlNet、加速与量化工作大量围绕它展开,所以「图像生成现在能做到什么」这个问题,拿它当参照系比拿任何一个闭源服务当参照系都更稳。</p><p>需要如实标注的是:我们这一轮<strong>没有重新核验第三方竞技场的最新排名</strong>,卡片上的置信度是 C(厂商宣称)而不是 A。真正属于 A 级事实的只有一条:dev 档权重确实是 Apache-2.0 且仓库公开可查(我们已核验)。</p><p>至于 FLUX 3 被定位成「真实世界模型」而不只是生成模型,这是当前最值得盯的一条主张:如果图像、视频、音频共享同一个流匹配底座并且能预测动作后果,那它就不只是内容工具,而是通往具身智能的感知-预测通道。但我们采集到的只有发布材料,没有独立评测,所以在本页里它按厂商宣称处理,不当结论用。</p>
这条家族线的三件事
一、架构是整流流 Transformer,不是 U-Net。FLUX 用的是 flow matching 目标 + Transformer 主干,配合旋转位置编码与双流/单流混合的 block 结构。这带来的直接结果是分辨率与长宽比的适配比传统 U-Net 扩散更自然,也更适合往视频与多模态延伸。
二、分档发布:pro / dev / schnell。pro 只走 API,dev 是 Apache-2.0 的开放权重档,schnell 是步数极少的加速档。这种「闭源最强 + 开放可用」的双轨是它成为生态底座的原因:研究者和独立开发者用 dev,生产系统按需要选 pro 或自托管 dev。
三、Kontext 把「编辑」变成一等能力。此前的图像生成主要是「从提示词出一张新图」,Kontext 一档做的是在保留其余像素语义的前提下按指令修改局部——换服装、改材质、调姿态、加物体。这是图像生成进入真实设计流程的分水岭:设计师要的不是重新抽卡,而是「把这里改掉,别的地方别动」。
它在设计流水线里的真实位置
可用姿势是可控的迭代器:概念阶段用文生图铺量,选定方向后用 Kontext 类编辑能力做定向修改,最后由人完成版式、字体与品牌规范。收益最大的一段是「同一个主体出多个变体而保持身份一致」——角色、产品、包装的视觉一致性,是纯文生图长期做不好、编辑式生成才勉强做到的事。
| 任务 | 当前可用度 | 主要风险 |
|---|---|---|
| 概念图 / 情绪板 | 高 | 版权与风格来源不清 |
| 产品图变体(换背景/材质) | 中高 | 细节漂移,logo 与文字易坏 |
| 角色一致性(多角度/多场景) | 中 | 身份漂移,需要参考图与人工筛选 |
| 含文字的版面(海报/UI) | 低 | 字形错误率高,应交给排版工具 |
| 像素级精修(修瑕/局部重绘) | 中高 | 蒙版边界融合需要手工 |
边界与失败模式
- 文字与字形:长文本、小字号、非拉丁文字仍是高失败区。
- 手部与机械结构:明显改善但没有消除,精密结构(齿轮、接口、乐器)仍会给出「像但不对」的结果。
- 编辑的影响半径:局部编辑会悄悄改动相邻区域的色调与纹理,批量生产时必须做前后对比质检。
- 自托管成本:dev 档的显存与单图耗时都不可忽略,批量场景需要量化或加速档,而加速会换来质量损失。
- 许可边界:dev/schnell 的 Apache-2.0 与 pro 的商用条款是两套东西,混用会在合规上出问题。
待核验清单(我们下一步做什么)
要把这条从 C 升到 A:在自己的环境下用同一批提示词测 dev 档的出图质量与耗时;对 Kontext 类编辑做「影响半径」量化(编辑区外的像素变化率);把 FLUX 3 的世界模型主张与我们已采集的具身动作预测证据放在一起对读。这些跑完之前,本页的排名与读数按厂商口径理解。