Nano Banana Pro:把「聊天式改图」做成产品形态的图像编辑模型
nano-banana-pro
Gemini 的原生图像生成与编辑一档,社区叫它 Nano Banana。它的关键不是画质峰值,而是交互形态:多轮对话里持续改同一张图、能读图里的文字再改、能把多张参考图合成一张。这让图像生成第一次像「和设计师对话」而不是「抽卡」。它的排名多来自偏好竞技场,那是投票不是测量,我们记为待复现。
- 置信度
- 待复现
- 单一来源,本站尚未验证
- 成熟度
- 产品
- 研究 → 演示 → 产品 → 生产
我们的判断<p>我们给它 D 档(待复现),这不是贬低,而是把话说清楚:它的名声主要来自<strong>偏好竞技场</strong>——大量用户对两张图投票。竞技场能很好地回答「哪张更讨人喜欢」,不能回答「哪张在你要的规格上更准」。而设计生产要的恰恰是后者:文字对不对、产品比例准不准、改一处有没有动别处。</p><p>就交互形态而言,它是这一档里最有影响力的一个:多轮连续编辑、读图内文字、多图融合这三件事,把图像生成从「一次性出图」变成了「可迭代的工作对象」。这个变化比任何一次画质提升都更贴近 AGI 的方向——它意味着模型开始持有对一个工件的<strong>持续状态</strong>,而不是每次重新抽卡。</p><p>它同时是闭源、只走厂商接口的一档,所以无法自托管、无法微调、无法离线复现。对需要数据不出域的团队,这是硬边界。</p>
为什么「对话式编辑」是一个能力台阶
文生图的原始形态是无状态的:提示词进、图出,不满意就重来。要在同一张图上做第二次修改,你得把上一张当参考图重新喂进去,并且祈祷其余部分别变。这条路很快撞到两个墙——身份漂移(改一次脸就变一次)与全局扰动(改一处,整张图的色调与细节都被重算)。
对话式编辑把这两件事变成了产品要求:模型需要在一个会话里维持对同一工件的理解,并且把修改限制在被要求的范围内。这不是提示词技巧能解决的,它要求生成端与理解端在同一个模型里闭环——这也是它挂在 image 与 multimodal 两个能力域下的原因。
真正拉开差距的三件事
- 读图内文字再改:海报、包装、界面上的文字先被理解、再被重排,而不是当成纹理去猜。这让「改文案」第一次成为一个可靠操作。
- 多参考图融合:把产品图、场景图、风格图分别给进去,输出一张同时满足三者的合成图。这是电商与广告的真实工作流形态。
- 多轮连续修改:第 5 轮的修改仍然记得第 1 轮定下的东西。会话越长,工件越接近可交付。
边界与失败模式
- 精确尺寸与比例:它不持有工程语义,「按 1:1 还原这个包装尺寸」这类要求仍会给出视觉合理但尺寸错误的结果。
- 长文本排版:短标题与标签可靠,整段正文的排版仍应交给专业排版工具。
- 会话越长越漂:多轮之后累积的微小改动会偏离最初意图,需要阶段性地「回到干净版本」。
- 不可自托管:数据必须出域;合规敏感的场景直接排除。
- 评测证据的性质:现有排名以偏好投票为主,缺少按规格判定的第三方测量。这正是我们记 D 档的原因,也是我们要补的复现工作。
我们的复现口径(将要发布的测量)
计划用三组固定任务测它,而不是继续引用竞技场名次:其一,文字保真——给一张含中英文混排的海报,只改一行文案,测其余文字的字形错误率;其二,影响半径——只改指定区域,测区域外像素的变化率;其三,身份保持——同一主体连续五轮编辑后,测与首图的可识别一致性。这三项跑完,这条记录才会升档。