GPT Image 2.5:把「多轮改图不走样」写成 API 契约的图像旗舰
gpt-image-2-5
OpenAI 2026-09-08 发布的图像生成与编辑模型,分 Flare(默认档:画质高于 GPT Image 2、延迟低 50%)与 Sunburst(精度档:用更长生成时间换复杂细节保真)两个变体,共 4 个端点(各一个文生图 + 一个编辑),API 面与价格完全一致。能力面:长边 3840px、6 档质量(auto/low/medium/high/xhigh/max,比上代多两档天花板)、单次最多 16 张参考图编辑、可选 mask、PNG/WebP 真 alpha 透明输出。发布重点是「多次编辑之间细节保持一致」与「基于批注只改一处」,即多轮改图不漂移。第三方水位:本站同步的 Artificial Analysis 竞技场(2026-09-22)上,sunburst 同时是文生图第 1(Elo 1423)与图像编辑第 1(1526),flare 双榜第 2(1401/1482),是唯一双榜登顶的系列;但两行都还标 preliminary、票数(8791/8014)远少于被超越的 gpt-image-2(82862)。闭源、只走 ChatGPT 与 API,不能自托管或微调。我们未做基准复现,置信度记 C(厂商宣称)。
- 置信度
- 厂商宣称
- 只有官方模型卡/发布会,无独立复测
- 关键指标
- Arena 文生图 / 图像编辑 Elo 双榜第 1
- 厂商宣称 · 2026-09
- 成熟度
- 产品
- 研究 → 演示 → 产品 → 生产
我们的判断<p>我们给它 C 档(厂商宣称),但要把这个梯顶位置的理由说清楚:它不是因为「OpenAI 出品」而排在图像 SOTA 第 1,而是因为<strong>它同时拿到了两个第三方竞技场榜首,且发布日期最新</strong>。这两条都是可核对的,不是形容词。</p> <p>能力面里真正有生产意义的是三条。第一是<strong>多轮编辑不漂移</strong>:官方演示的是三轮连续改动,每一轮都要求「其它东西都不要动」,判据是前一轮的改动活到后一轮。对 agent 工作流这是关键一环——改图工具被 agent 反复调用时,累积漂移会让第 5 轮的结果和第 1 轮的意图彻底脱钩,这条能力直接决定「能不能把它交给 agent 自动跑」。第二是<strong>16 张参考图</strong>,把「多主体合成一张」从多趟 img2img 变成一次调用。第三是<strong>质量档从 3 档扩到 6 档</strong>(多出 xhigh、max),配合 Flare/Sunburst 分工,让「快」和「细」变成同一个价格表上的两个选择,而不是两个模型的选型决策。</p> <p>但两条边界必须写在脸上。第一是<strong>榜首票数未沉淀</strong>:sunburst/flare 两行在抓取时都还是 preliminary,文生图票数 8791/8014,而它们超越的 gpt-image-2 (medium) 是 82862 票、nano-banana-pro 是 157906 票。置信区间 ±9。所以准确表述是「早期票数下的双榜第 1」,本站榜单行会随复抓刷新,这个判断需要跟着复核。第二是<strong>闭源、数据必须出域</strong>:不能自托管、不能微调。对私有部署团队,图像这一档的候选集仍然是 Qwen-Image-2.1 / FLUX / Wan 那批开放权重,而不是它。两条路线不是竞品,是两个不同的约束下的最优解。</p>
它解决的问题:把「多轮改图不走样」写进 API 契约
图像生成到 2026 年已经不缺「一张好看的图」。真正卡住生产线的是连续性:改第二轮的时候,第一轮改对的地方会不会被顺手改掉;换了风格之后,参考照片里那个人还是不是同一个人;一张排满小字的交通图,放大之后站名还能不能读。GPT-Image-2.5 的发布重点几乎全部压在这三件事上——OpenAI 在 2026-09-08 的官方公告里把改进列成四条:生成更快、保真度更自然、多次编辑之间细节保持一致、以及「基于批注的编辑,只改你圈出来的那一处」。
同一代模型分两个变体,是这一版最实用的结构决定。Flare 是默认档:官方口径是画质高于 GPT Image 2、延迟低 50%,面向高并发与交互式出图。Sunburst 是精度档:同样只从文本生成或编辑现有图像,但用更长的生成时间换复杂细节的保真度,面向要放大看、要裁进去用的成品图。两者的 API 面完全一致、价格完全一致,所以选档只是「等多久」的取舍,不是成本取舍。
能力面:哪些数字是真的能拿来排产的
| 能力 | 具体读数 | 生产含义 |
|---|---|---|
| 最大分辨率 | 长边 3840px;两边须为 16 的倍数,宽高比 ≤3:1,总像素 655,360–8,294,400 | 4K(3840x2160)直出,不需要超分兜底;但像素下限意味着不能生成很小的图 |
| 质量档位 | auto / low / medium / high(默认)/ xhigh / max | 比 GPT Image 2 多出两档天花板;xhigh、max 是 Sunburst 存在意义的落点 |
| 编辑参考图 | 单次最多 16 张;每次请求最多 4 张输出;可选 mask 限定改动区域 | 「六张人像合成一张合影」这类任务一次成型;mask 可选而非必填 |
| 透明背景 | PNG / WebP 输出真 alpha 通道 | 商品图、图标直接落版,省掉一次抠图工序;JPEG 无 alpha,不要配错格式 |
| 端点数 | Flare / Sunburst 各一个文生图 + 一个编辑,共 4 个 | 同一套参数、同一份价格表,迁移成本只在模型名 |
「多轮编辑不串味」这件事值得单独说,因为它是可验证的工程行为而不是形容词。官方展示的用法是:第一轮把沙发换成深绿丝绒并声明「房间里其它任何东西都不要动」,第二轮在沙发上方挂一幅抽象风景画并声明「其余部分保持原样」,第三轮把时间改到傍晚、要求家具/画作/构图完全不变。三轮下来的判据是前一轮的改动活到了后一轮。这正好是 agent 工作流里最难的那一环:改图工具一旦被 agent 反复调用,累积漂移会让第 5 轮的结果和第 1 轮的意图彻底脱钩。
第三方水位:双榜第 1,但要把票数和 preliminary 说清楚
本站同步的 Artificial Analysis 竞技场(抓取于 2026-09-22)上,GPT-Image-2.5 是唯一同时占据文生图与图像编辑两个榜首的模型系列:
- 文生图(arena-t2i):sunburst 第 1,Elo 1423;flare 第 2,1401;上一代 gpt-image-2 (medium) 第 3,1381。
- 图像编辑(arena-image-edit):sunburst 第 1,Elo 1526;flare 第 2,1482;gpt-image-2 (medium) 第 3,1461。
- 紧跟其后的不是同一家:文生图第 4 是 Microsoft 的 mai-image-2.6(1334),第 5 xAI grok-imagine-image-2.0(1302),第 7 Meta muse-image(1276),第 9 Google nano-banana-2(1260),第 10 字节 seedream-5.0-pro(1256),第 11 阿里 qwen-image-3.0-pro(1254);图像编辑第 4 是 grok-imagine-image-2.0(1430)、第 5 mai-image-2.6(1429)。
诚实的那一半:sunburst 与 flare 这两行在抓取时都还标着 preliminary=true,文生图票数分别只有 8791 / 8014 票,而它们要超越的 gpt-image-2 (medium) 是 82862 票。图像编辑榜好一些(29252 / 27048 票),但仍然少于 gpt-image-2 的 259008 票与 nano-banana-pro 的 582162 票。所以这个第 1 是「早期票数下的第 1」,置信区间 ±9,不是终局判定。本站把它列为图像 SOTA 阶梯梯顶,依据是它同时拿到两个榜首 + 官方发布日期最新(2026-09-08),而不是因为它的票数已经沉淀。
成本:质量档是唯一的杠杆
fal 在 2026-09-08 对整个尺寸×质量矩阵做了实测计费(短提示词),Flare 与 Sunburst 同价。文生图 high 档:1024x768 约 $0.0362、1024x1024 约 $0.0528、1920x1080 约 $0.0395、3840x2160(4K,上限)约 $0.1002;降到 medium 是 $0.0091–$0.0260,low 从 $0.0041 起。编辑同尺寸略贵一点,因为参考图按图像输入计费:high 档 $0.0445–$0.1084,单张 1024x1024 参考图本身约 $0.008,4K 参考图约 $0.012,多张继续叠加。底层按 token 计:文本输入 $5/M、图像输入 $8/M、图像输出 $30/M,缓存输入 $1.25/$2.00,总额向上取整到 $0.0001。排产结论:先定尺寸再定质量档,质量档决定成本量级(high 比 medium 贵 4 倍上下),xhigh/max 再往上走。
边界
- 闭源、只走接口:ChatGPT(含 ChatGPT Work、Codex 用户)与 API 两条路,不能自托管、不能微调、数据必须出域。对私有部署团队,候选集仍然是 Qwen-Image-2.1 / FLUX / Wan 那一档开放权重。
- Sunburst 的延迟是显式代价:官方没有给秒数,只说「更长的生成时间」;交互式场景默认应该留在 Flare。
- 文字渲染仍要目检:密集版式(交通图、仪表盘、包装标签)是官方重点展示的能力,但中英混排的招牌/包装小字在生产里仍需人工核对一遍。
- 票数未沉淀:两个榜首都是 preliminary 行,过几周复抓可能变动;本站榜单行会跟着刷新,本页的水位判断需要随之复核。
- 像素下限 655,360:缩略图、favicon 这类小尺寸不是它的目标场景。
我们的核验状态
本页事实来自三处实读:OpenAI 开发者社区官方公告 Introducing GPT Images 2.5 in the API and ChatGPT(发帖时间 2026-09-08T19:12:35Z,含 Flare/Sunburst 分工与四条改进)、fal 的模型页(四个端点、分辨率与质量档约束、透明背景、16 张参考图、整份实测价格矩阵)、以及本站已入库的 arena-t2i / arena-image-edit 榜单行(含票数与 preliminary 标记)。我们未做基准复现:没有跑同一批提示词的横向对照,没有量化多轮编辑的漂移率,也没有测 Flare 与 Sunburst 的真实延迟差。因此模型能力部分置信度记为厂商宣称(C),竞技场排位部分为第三方读数(A/B 之间,取决于竞技场协议与票数沉淀程度)。要把这条升到 A,需要:固定提示词集的 Flare/Sunburst 同图对照、三轮编辑后的结构相似度量化、与 mai-image-2.6 / seedream-5.0-pro / nano-banana-pro 的同批出图对比,以及一次票数沉淀后的榜单复核。