AGI时代的第一个生图模型,ChatGPT Images 2.5上线

量子位·2026年09月09日 20:31
别做数学题了,生图才是正经事

来来来,说多模态路边一条 ,不是AGI的都来排队道歉(doge)。

在喊出“AGI时代来了”之后,你奥特曼叔叔搬出来的第一个东西,就是多模态!

刚刚,OpenAI发布新一代生图模型,ChatGPT Images 2.5,主打生成更快,细节更好,改图也终于越来越像“真·修图”了。

按照OpenAI的说法,这次升级可以先划四个重点:

  • 生图更快,相比Images 2.0,生成延迟最多降低50%;
  • 画面更自然,参考照片里的人和物更容易保住原本的特征;
  • 连续修改多轮,前面改好的细节更容易保持一致;
  • 支持直接在图片上添加批注,告诉AI具体要改哪里。

除此之外,这次还有一个我觉得相当实用的新玩法——

直接拿草图当参考图。

这个东西非常适合一种情况:

脑子里大概知道自己想要什么构图,但一时半会儿又找不到合适的参考图。

现在可以直接在对话框里@Sketch,自己画。

只要用鼠标(或者随便什么)画一张草图,再补充你想要的风格和细节,GPT就会把它作为视觉参考,生成完整图片。

非常好用(就离谱)。

一如既往,对于懒人,OpenAI也准备了一套新的模板,直接套就完事了。

By the way,现在GPT终于支持看百分比的生成进度了,不用再问“在吗”看网断没断了!

重点补的是细节和“别乱动”

如果说上面这些是功能层面的变化,那么从这次技术博客来看,相比4个半月前发布的GPT Image 2,Images 2.5真正值得看的升级,还是生成质量和编辑稳定性本身

Images 2.5并没有单纯继续往上堆输出分辨率,最高依然是3840px,但新增了xhigh和max质量档位,进一步提升细节、材质纹理、光照,以及参考主体的保真度。

比如官方这张Demo。

给小孩哥换了一身衣服之后,脸部基本没怎么漂,尤其是原图里卷发那种稍微有点毛躁的质感,保留得相当完整。

但你要硬说,这张给小狗换的还是有点没那么……完美。

主体确实改对了,但仔细看影子,后背轮廓似乎还是保留了原来的形状。

按理说,穿上衣服后,影子的后背也应该变平滑。

但像下面这种,把原始照片重新还原、放大,同时重新处理打光,效果还是挺惊艳的。

而相比单纯“把图画得更漂亮”,Images 2.5这次更重要的一个方向就是让修图改图变得更加可控。

官方展示了一组很典型的电商场景:不断给人物换衣服、换背景。

虽然有些图看起来还是稍微有点“AI塑料感”,但人物本身、场景关系和整体构图已经能比较稳定地保留下来。

(尤其可以看看Image 2和2.5在人物与物体比例上的变化。)

更进一步,ChatGPT现在还支持直接在图片上批注修改。

思路很像平时给设计稿提意见:

不用再写一大段“请把画面左上角第二个人脸上的墨镜换成黑框眼镜”,直接圈那个地方,写一句要求就行。

比如我在表情包生成界面里,直接在墨镜的位置批注“换成黑框眼镜”,点发送。

GPT就知道我说的是哪一个。

如果一张图里有很多人物、很多物体,这个功能尤其好用。

与此同时,模型本身的局部编辑能力也在增强。

官方有一组旅行票券的演示,很适合说明这个变化。

放到实际工作里,就很像做一整套不同城市的活动物料:

版式已经定了,需要替换的只是城市信息,但每做一版,你都希望继续沿用前面的设计。

这就牵出了Images 2.5另外一个重点——多轮编辑的一致性。

很多时候,对于设计工作者来说,一张图不可能一遍生成就结束。第一轮把主体生成出来,第二轮改排版,第三轮换文字,第四轮再抠一些细节。

以前经常改着改着就变成:这次这里终于对了,结果刚才已经对的地方又坏了。

OpenAI表示,在更长的对话中,Images 2.5可以更稳定地接着上一轮结果继续修改,同时保住已经确认好的内容和画质。

比如下面这种旅行攻略海报,文字、照片、路线、排版全挤在一张图里,修改时需要同时照顾的元素比单主体图片多得多。

现在可以先换目的地,再继续改单独的文字和细节。

不多说,这完全是设计福音来的,懂得都懂~

生图才是正经事儿

当然,除了编辑之外,Images 2.5对复杂画面、材质和风格指令的理解也一起升级了。

官方放了一大堆Demo。比如碎玻璃:

日杂封面:

还有《银翼杀手》式的科幻画面:

其他的咱就不多放了……

当然了,生图这玩意,本质上还是创造力工具。就像奥特曼说的,它又不是拿来做数学题的。

玩就完事了。

我自己也上手试了一下。

输入就一张马喽的照片,让它给我生成一组“马喽在世界各地旅游打卡”的照片。

GPT直接给我整了4张。

效果怎么说呢——这个马喽是真出息了。

网友们也是直接开玩。

有哥们直接拿它做起了定格动画。

还有人感叹细节已经离谱了。

不过我自己看下来,部分区域还是能感觉到一点熟悉的AI“涂抹感”。

也有人测试了手绘草图。

大方向确实能跟,但一些比例关系还是会出问题。

但材质和体积感的提升还是很明显。

比如下面这双鞋,皮革、鞋底、褶皱和立体感,相比以前确实更扎实了。

当然,也已经有网友给出不同反馈:

细节确实好了不少,但人物肢体反而偶尔更容易翻车。

所以到底是史诗级升级,还是熟悉的“这边补好了,那边又冒出新Bug”,大家实测下来也可以说说。

生成延迟最多减半,API一次上了两个版本

最后再说速度和价格。

对于一天要生几十上百张图的人来说,这次一个很实际的变化是:

Images 2.5生成延迟相比Images 2.0最多降低50%。

听着没有“画质炸裂”那么性感,但真到了反复改图的时候,少等一半其实相当重要。

尤其Images 2.5明显开始强调多轮编辑。

既然要你第一轮改内容、第二轮改版式、第三轮继续抠细节,那生成速度自然也得跟上。

面向开发者,OpenAI这次还同时发布了两个API模型。

一个是GPT-Image-2.5 Flare

它更强调质量、编辑能力和速度之间的平衡,也是官方推荐的大多数应用默认使用的版本,适合社交内容、快速视觉原型和大批量生图等场景。

另一个是GPT-Image-2.5 Sunburst。

它瞄准的是更精细的创作和编辑需求,比如正式投放的广告素材、产品图片,以及对画质要求更高的视觉内容。

价格方面,Flare和Sunburst目前采用相同的token计费:

文本输入:5美元 / 百万tokens

图像输入:8美元 / 百万tokens

图像输出:30美元 / 百万tokens

所以整体看下来,Images 2.5这次跟2那种直接生成老照片质感的视觉冲击还差点意思?

(也可能是还没开发出来)

但它确实把生成模型开始真正进入生产流程之后,那些不多轮交互、定点修改的问题进一步清扫了一遍。

换句话说,过去大家用生图模型,多少还有点“抽卡”,现在直接定点p就完事了。

现在,x上的网友也已经玩疯了!

所以就说嘛,AI也不用都去做数学题。

参考链接

[1]https://openai.com/index/introducing-chatgpt-images-2-5/

[2]https://x.com/sama/status/2097410967978324010

本文来自微信公众号“量子位”,作者:henry ,36氪经授权发布。

+1
4

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

这个时代最硬的通货

42分钟前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业