社区讨论 · 赛道

生图卷到改图,谁在定标准

晴姐晴姐9月9日2026/09/09 46 浏览

我注意到一个有意思的细节,这次 GPT Image 2.5 把改图能力端了出来。官方说法里,精确编辑与多轮一致性被放在很前面。凌晨发布,节奏很像抢入口。

这俩月我在 AI Lab 帮组里做 demo,经常遇到一个破事。让模型生成一张图不难,难的是改第三版时,logo 位置偏了,人物衣服变了,文字又开始乱跳。上周三我拿一组内部活动海报做测试,第一版颜色还行,第二版把标题挪到右上角,人脸就开始漂移。以前我习惯用 Gemini 那边试,这一个月下来,感觉 Google 的 Nano Banana 更像能看懂图的模型,OpenAI 这次像是把改图做成产品卖点。

先说背景。Google 的 Nano Banana 官方名称是 Gemini 2.5 Flash Image,在 2025 年 10 月 2 日已经进入 GA,也就是通用可用阶段,可以当成生产环境里的候选。它还有一个常被忽略的点,AI Studio 模型页提到,创建或编辑的图片会带 SynthID,一种人眼看不出的水印。OpenAI 这边,GPT Image 1.5 曾主打生成速度比之前版本快 4 倍,GPT-Image-2 又能在 Codex 里调用,面向网页 UI、背景素材、图标、游戏素材。到 GPT Image 2.5,改图成了核心叙事。

所以两条路线开始分叉。OpenAI 这条线更像把图片变成可反复修改的素材,核心卖点是精确编辑、多轮一致性和速度,适合资产流。Google Nano Banana 这条线更像把图片变成可理解、可生成的多模态输出,核心卖点是 GA 状态、Gemini 图像理解和 SynthID 水印,适合信息图。选谁取决于你要不要合规和复杂语义。中文密集文字方面,社区反馈里大字较稳,小字和表格容易乱码,Google 这条线需要按自己素材测,别拿一张 demo 下结论。人物一致性方面,社区反馈里多角色合成时可能丢人、改五官,Google 素材未给明确对比,真实业务要固定参考图。工作流位置上,ChatGPT、API、Codex 入口更顺,Gemini、AI Studio 文档和 GA 更成熟,团队已经在哪,就先在哪测。

我最想强调的是改图这个词。落到团队里,生图模型的竞争是返工成本。一张图生成得再漂亮,如果改不动、记不住上一版,它就只能当灵感图,不能当素材。GPT Image 2.5 把精确编辑和多轮一致性拿出来,说明 OpenAI 也意识到,图像模型要进生产,不能只靠抽卡。

但我也不太同意标题里那句抄 Banana 的作业。抄作业至少意味着对方先交了卷。Nano Banana 先跑通了通用可用,还把水印放进产品页,这是工程化和信任层的动作。OpenAI 的优势一直是入口和工作流,ChatGPT 里有人,API 里有开发者,Codex 里又有工程流程。它现在补改图,更像把图像模型从聊天里的附件推进到可编辑的工作对象。

不过,风险也没消失。社区对上一代中文生成能力有个很具体的反馈,比较大字体的恭喜发财能生成,月饼包装、配料表、营养标签这类密集小字还是容易乱码。这个坑我见过类似形态,做财报摘要图的时候,只要表格线一多、字号一小,模型就容易把字当成纹理。人物合成也一样,多角色同时出现时,一致性会下降。这些问题发布会解决不了,得靠用户拿自己的数据测。

还有一个判断,不一定对,但我现在倾向这么看。如果你要的是好看的一张图,两家都能给。如果你要的是能进设计稿的素材,先看 OpenAI 这条线。如果你要的是能解释、能引用、能带水印的图像资产,先看 Google 这条线。原因很实际,前者更像素材编辑器,后者更像带信任标记的多模态模型。

新手建议先看这个。别一上来问哪个模型最强。先把自己要干的活拆成三格,生成、修改、合规。生成看审美和速度,修改看参考图、局部重绘、多轮一致性,合规看水印、权限、数据边界。我这边测下来,最省时间的是换任务表。

行动建议很简单,拿你们组最麻烦的 10 张图做小样本测试。选三类,一张有中文密集文字,一张有多个人物,一张需要反复改局部。同一段 prompt 分别丢进两条线,记录第一次是否可用、第二次是否崩、第三次是否还能保持原意。最后再看团队栈,如果已经在用 ChatGPT/API,就从 OpenAI 试,如果已经吃 Gemini 的文档和 GA,就从 Nano Banana 试。核心就一句,先选工作流,再选模型。

模型卷到今天,后面就看谁能让用户少返工。

2 条回复

?
Ctrl + Enter 快速回复
路过
路过9月9日

改图比生图难多了,语义一致性根本没法量化,现在各家还在各自为战,标准得靠大厂落地场景倒逼出来。

Kevin
Kevin9月9日
回复 路过

改图标准怎么量化?没个 A/B test 数据支撑,这 ROI 我是不敢认。