分享
ChatGPT Images 2.5 技术解读:图像生成从能力展示转向工程体验
输入“/”快速插入内容
ChatGPT Images 2.5 技术解读:图像生成从能力展示转向工程体验
用户6099
用户6099
9月9日修改
封面:ChatGPT Images 2.5(图源:OpenAI 官方公告)
OpenAI 于美东时间 9 月 8 日发布新一代图像生成模型 ChatGPT Images 2.5。官方公告的关键词是更锐利的细节、更精准的编辑、更快的生成,单看卖点清单像一次常规迭代,但放进具体数字里,这次更新的分量不轻:图像模型每周承载超过 30 亿张的生成量,延迟较 Images 2.0 最多降低 50%,API 侧一次推出两款定位分明的新模型。
更值得注意的对照是四个月前的 Images 2.0:那一版的里程碑是「首个具备思考能力的图像模型」,可以在思考模式下搜索网络、一次生成多张图像并自我检查;这一版的主题则明显转向工程体验:延迟、保真度、编辑精度、多轮一致性。图像生成的竞争重心,正在从「能生成什么」移向「能不能稳定地产出」。
本文基于
官方公告
全文整理,重点回答三个问题:模型变了什么、产品功能怎么用、API 怎么选型。
模型层:四项改进指向同一个目标
官方对 Images 2.5 模型能力的描述可以归纳为四点,它们共同指向「生产环境可用性」。
延迟最多降低 50%。
图像生成很少一次出片,真实的创作过程是「生成、看、改、再生成」的循环,延迟决定的是每一轮试错的成本。延迟砍半意味着同样的预算里,迭代次数翻倍,这对概念探索阶段的效率提升是直接的。
参考图保真度增强。
基于上传照片生成或修改时,图中的人物、物体形象更不容易走样,光照与纹理更自然,独特特征更容易延续。对 API 侧的团队,官方特意强调这让「以参考图为导向的工作流」更可靠:批量生成的变体始终锚定在原始素材上,而不是越走越偏。
参考图编辑前:原始照片
50%
编辑后:主体特征与细节保持一致
50%
多轮编辑一致性。
这是个老痛点:反复修改几张之后,画质和细节逐渐退化,用户被迫「回到最早那版重来」。Images 2.5 让每次新编辑都建立在此前的工作之上,先前的改动保持一致,质量不随轮次衰减。生产工作流里开发者经常需要定点修改而不是重建整个素材,这项改进的直接受益者就是他们。
智能与风格。
模型对复杂视觉指令的理解更连贯,包含现实世界信息的图像内容更准确,支持透明背景等复杂版式,对指定视觉风格的还原也更到位。官方给出的场景是成套品牌素材、保持层级的 UI 概念图、契合固定结构的演示配图:都是「指令越具体越容易翻车」的场合。
复古未来主义风格示例
25%
中世纪现代风格海报示例
25%
印象派城市风光示例
25%
婚礼请柬设计示例
25%
产品功能:从生成工具走向精修工作台
Sketch 把「画」带进对话。
在聊天框输入 @Sketch 会弹出绘图窗口,先手绘草图,再用文字补充风格与细节要求,ChatGPT 依草图生成完整图像。这个交互解决的是「语言描述不清布局」的问题:想让某个元素落在某个位置、维持某种构图关系,画一笔比写一段提示词直接得多。官方的定位也很克制:不需要是专业画手,这只是让最终图像更接近所想的又一种输入方式。
评论式编辑只改想改的地方。
直接在图像特定位置标注留言写下修改意图,模型只改动指定区域,其余保持原样。
The Verge
记者 Jay Peters 实测:用鼠标画一只粗糙的猫生成逼真照片,再在眼睛部位留言,绿色眼睛就改成了蓝色。配套工具栏提供 Markup、Comment、Remove BG、Erase、Resize 操作,且每次编辑保存为可独立回滚的版本。定点修改加版本化回滚,这个组合把图像编辑往真正的生产力工具推进了一步。
模板降低起步门槛,提示词分享让创意可复用。
模板库覆盖海报、周边商品等常见创作格式,选模板后补充信息、设计元素与风格即可;分享图像时可选择附带促成该效果的提示词,接收方可以带入自己的图片和细节继续发挥。两个功能都不复杂,但都指向同一个方向:把「会用提示词的人的经验」沉淀成产品能力。