GPT Image 2.5 改图提示词:只改一处,其余不动
2026/09/25

GPT Image 2.5 改图提示词:只改一处,其余不动

GPT Image 2.5 改图提示词实测:写不写保留清单,结果几乎一样;连改四轮人脸变化将近翻倍,四处改动合并成一条就减半。附提示词和前后对比图。

「把不许动的地方一条条写清楚,否则模型会连人一起换掉」——脸不许动、姿势不许动、光不许动,这种三十来条的保留清单我写了两年。上周我终于把同一处改动不带清单跑了一次,结果两张图我分不出来。

于是我去量了。同一张照片、同一处改动、两版提示词:一版五个英文单词,另一版 82 个词,把她的脸、雀斑、手、杯子、笔记本、街道、机位和色温全部点名。

在脸上一个固定方框里,只有 0.3% 的像素变化超过了 8/255。那份长清单几乎什么都没换来。

一位穿红色打蜡棉布外套的女性坐在鹅卵石街道边的咖啡馆桌前,桌上有一只白瓷杯和一本合着的笔记本

这是起点照片,同一个模型生成的,所以整篇文章里没有一张搬运来的图。下面每一张,都是对它的一次改动,或者对改完那张的再改。

A candid documentary photograph of a woman in her early thirties sitting at a
small outdoor cafe table on a quiet European city street. She wears a bright
red waxed-cotton jacket over a grey knit sweater. A plain white ceramic mug
sits on the table in front of her, next to a closed notebook. Late afternoon
natural light from the left, 35mm film look, eye-level camera, medium shot,
shallow depth of field, real skin texture with visible pores and a few
freckles, natural colour. No text, no logos, no watermarks.

这次所有提示词都用英文跑,所以下面给的是英文原文。中文提示词这次没做对照,不清楚差别有多大。

我以为必须写的那版 GPT Image 2.5 改图提示词

先看写得最仔细的一版,带完整保留清单:

Change one thing only: the red jacket becomes navy blue, same waxed-cotton
material and same cut. Keep everything else exactly as it is: her face,
facial features, skin tone, freckles, expression, hair, hands and pose; the
grey sweater; the white mug and the notebook; the table and the street behind
her; the camera angle, framing, depth of field, lighting direction and colour
temperature. Do not restyle the photograph, do not add or remove objects, and
do not add text, logos or watermarks.

同一张照片、同一个人,外套变成藏青色,棕色灯芯绒领子保持不变

活儿干得挺干净:脸还是那张脸,雀斑的位置没变,杯子没挪,棕色灯芯绒领子还是棕色,光仍然从左边来。

另一版只有五个词:Make the jacket navy blue.

出来的几乎是同一张图。

保留清单到底带来了多少差别:几乎没有

我没有靠肉眼判断。每一对图,我都算了两个数:每个像素 RGB 的平均绝对差,以及变化超过 8/255 的像素占比,统计范围是脸上一个 240×210 的固定方框,每张图取同样的坐标。

对比脸部平均变化脸部变化超过 8/255 的像素
82 词的保留清单版 vs 五词版1.370.3%
五词版 vs 原图4.7513.4%
82 词保留清单版 vs 原图4.5211.9%

选脸来量,是因为读者最先察觉到的走样就发生在脸上。这也意味着这组数字说不了背景的事。另外我比对前没有做对齐,所以一张图哪怕整体移了一两个像素,也会被算进这个数里。

两版提示词之间的差距,比它们各自跟原图的差距都小。拿原图当基准,长清单比五词版多保住了 1.5 个百分点的脸(11.9% 对 13.4%)。这点差距,不足以把一张能用的图和一张废掉的图分开。

这只是一个场景、一个人物、一个模型,所以它是一个方向,不是一份基准测试。但它和我这段时间的日常体感一致:在这一代模型上,你没提到的东西默认就会留着。

GPT Image 2.5 的每一次改图,都是整张重绘

再看上面那张表的第二行:五词版的改动,让她脸部 13.4% 的像素发生了可测量的变化——而我压根没提过脸。

模型不是在你的图上打补丁。它读你的图,照着重画一张,再把新画的这张交给你。看起来「没动」的意思是:新画的这张和旧的足够接近,你的眼睛分不出来。不等于那些像素被原样保留了。

所以:你不能把改图当成无损的局部修改;而且每多走一轮,那些细小的不一致就会叠加一次。

保留清单在什么时候还值得写

它没有失效。有三种情况仍然值得写,其中一种在这次测试里出现了,另外两种是我至今还留着这句话的原因。

你点名的东西边界模糊。 后面我会把四处改动合并成一条提示词,其中包括外套。那一次,棕色灯芯绒领子也跟着变成了藏青色,而两次单改都把领子留住了。也就是说:当模型一次重画四样东西时,领子算外套的一部分;只改一样时,它不算。解法是把例外写进同一句话:the jacket becomes navy, keep the brown corduroy collar brown。

画面里有容易丢的小东西。 小道具、倒影、某一处特定的文字。凡是丢了你会立刻发现的,都值得占一个分句。

指令本身有歧义。 「暖一点」可以是色温,也可以是给她加件毛呢外套。

真正管用的结构很短:改什么 → 哪些是例外不能动 → 一句兜底。不是我以前写的那种三十条清单。

GPT Image 2.5 有蒙版或者涂抹工具吗

没有。这套流程里没有蒙版,也没有画笔,你不能像修图软件里那样先涂出一块区域再描述它。限定改动范围的只有你用的那个名词短语——这也是为什么措辞的分量这么重。

所以真正要练的功夫,是用词把东西指准。两种办法通常就够了:位置,比如「桌子右边那只杯子」,而不是「那只杯子」;或者只有它有的属性,比如「那本暗红色的笔记本」。两样都没有的时候用关系:「她坐的那把椅子」。

只要画面里有两个东西都能对上你的说法,就当它迟早会挑错。换一个更具体的名词,比把句子写长管用。

用 GPT Image 2.5 改图提示词去掉一个东西

Remove the white ceramic mug from the table. Everything else in the photograph
stays exactly as it is: the woman, her face, hair, jacket, pose and hands, the
notebook, the table surface and its reflections, the chair, the street behind
her, the camera angle, framing, lighting and colour. Fill the space where the
mug was with the table surface that belongs there. Do not add text, logos or
watermarks.

同一张咖啡馆照片,白瓷杯已被移除,原来位置补上了石质桌面

杯子没了,原来的位置是像模像样的石面,笔记本和红外套看上去原样回来了——按上一节的说法,这不等于它们真没动。我会保留的是「补上本该在那儿的桌面」这一句:去掉一个东西其实是一次小型的生成,物体原来的位置必须凭空造出点什么,与其事后修一块糊掉的斑,不如提前告诉它那里应该是什么。这句话我没做去掉它的对照,所以它是个习惯,不是实测结论。

两张参考图怎么分工

一次请求最多可以放 16 张参考图。如果你不说每张图干什么,就只能赌哪张占上风——我遇到过产品图和街景被混成了两不像。开头两句就把活派清楚。

Image 1 is the scene. Image 2 is the product. Place the amber bottle from
image 2 onto the cafe table in image 1, standing upright to the right of the
mug, at a size that matches the mug. It must sit in image 1's world: same late
afternoon light from the left, a matching soft shadow on the marble table, a
subtle reflection in the polished surface, same colour temperature and same
grain. Keep everything from image 1 unchanged.

浅灰影棚背景上的无品牌琥珀色玻璃瓶,配哑光黑泵头

咖啡馆照片的桌上多了一只琥珀色泵头瓶,位于杯子右侧、笔记本前方

光是对的:瓶身的高光和画面里其他东西一样落在左侧。大小不对。「和杯子差不多大」回来的结果比杯子高了约 40%,位置也更靠后——是一只合理的瓶子放在一张合理的桌上,但不是我给的指令。

接触阴影更弱。杯子把右侧的石面压暗了约三分之一;瓶子旁边的桌面亮度,和更远处空桌面一样。瓶底正下方有一道暗线,侧面什么都没投出来。合成图第一个要检查的就是接触阴影,因为「物体悬浮」是那种其他地方都对、唯独它会出卖你的破绽。

让画面里的文字扛过一次改动

文字曾经是改图最容易崩的地方。管用的写法是:把那句话用引号括起来,说明它只出现一次,再交代字体。

Put the bottle from the input image on a large roadside billboard photographed
at sunset, seen from the road at a slight angle. The billboard carries exactly
one line of copy: "SLOW MORNINGS". Set it in a bold sans-serif, evenly spaced,
high contrast against the billboard background, easy to read, and appearing
once only. The bottle keeps its shape, colour and matte black cap. No other
text, no logos, no watermarks, no brand marks on the billboard, the frame or
the surroundings.

日落时分公路边的广告牌,上面是那只琥珀色瓶子和一行粗体无衬线的 SLOW MORNINGS

错两个字母就等于重拍,所以这种图交付前要逐字母读一遍。这次这行字是对的,只出现了一次,牌子上也没混进别的东西。另外注意:输入的瓶子图是 2:3,输出是 3:2——改图用的是你这次要的画面比例,不是输入图的,并会为此重新取景。

然后是第二轮,只有一句话:

Make it a winter evening with snow falling. Keep the billboard, the bottle,
the line of copy and its typography, the camera angle and the composition
exactly as they are.

同一块广告牌变成落雪的冬日黄昏,太阳仍在地平线上,瓶子和那行文案原样保留

季节换了,牌子没换。框架上积了雪,射灯在暗下来的天空里更扎眼(它们在日落那版就已经亮着),字距一点没动。这就是多轮改图该有的样子,也是「分轮改」的理由:那个雪的黄昏,我很难一次描述到这么准,但我可以指着日落那张说「把天气改掉」。这里还占了个便宜:画面里没有人脸。下一节讲的就是画面里有人脸时,多轮要付什么代价。

连改四轮,代价是多少

分轮是有代价的,我想要一个数字。从原图开始,我连着做了四次改动,每次一句短指令,没有一句提到她的脸:

  1. Make the jacket navy blue.
  2. Change the sweater to cream.
  3. Change the notebook on the table to a dark red one.
  4. Change the mug to a dark green one.

第一轮就是上面那次五词运行,直接当成链条的起点,所以两张表里的第一组数字是同一组。

改了几轮脸部平均变化脸部变化超过 8/255 的像素
14.7513.4%
29.0242.8%
311.4653.1%
412.4556.1%

经过四轮改动后的咖啡馆照片:藏青外套、米白毛衣、暗红笔记本、墨绿杯子

我要的四处改动全都实现了。但这已经不太是同一张照片了:雀斑变重,她身后的街道有几处细节重排过,放到原图尺寸看,皮肤上还浮起一层淡淡的网状纹理——那不是雀斑。一眼看还是同一个人,可它没法和原图放进同一组素材里了。

最值得记住的是第一轮到第二轮那一跳:第二次之后,脸部发生变化的像素直接是原来的三倍多。曲线最陡的一段在开头,而出图本身不会告诉你你走到哪儿了。

想清楚的改动合并成一条,别分四轮

于是我回到原图,把同样四处改动写成一条提示词重跑了一次。

同样四处改动脸部平均变化脸部变化超过 8/255 的像素
分四轮,每轮改一处12.4556.1%
一轮,四处一起改6.8631.2%

一次改完四处的咖啡馆照片:藏青外套、米白毛衣、暗红笔记本、墨绿杯子

结果一样,漂移只有一半多一点。这和人人都在重复的那条建议正好相反,包括我以前给过的:「一次只改一件事」是你还在摸索时的好习惯,等你已经知道要什么了,它就变成了成本。先想清楚,再写一条。

代价是单条指令的边界会变宽,也就是前面那个领子的例子:合并那一次,把灯芯绒领子一起算进了外套。所以合并改动时,把你在意的例外点名。

确实需要多轮时,尽早回到原图重来,把学到的东西带在措辞里,而不是带在图里。

用 GPT Image 2.5 改自己上传的照片

上面这些都不依赖图是模型生成的。同一套写法可以直接用在你上传到图生图生成器的照片上:说清改什么、点名例外、加一句兜底。

但有一件事,在你动手改一张不可替代的照片之前必须先说清楚。你拿回的是一张新图,不是在原图上打了补丁。每一个像素都过了一遍模型,包括你从没提过的那个角落。做产品图、做样机,这无所谓;如果那是某个人唯一的一张照片,请把原件留好,把改完的当成派生文件。

其他限制和普通出图一样:输出用的是你这次要的画面比例和分辨率,不是你文件本身的尺寸。所以一张 4000 像素宽的照片,在 1K 下改完回来就是 1K。裁剪和缩放的事,放到改完再定。

四轮之后没变的:取景

我原以为机位会一点点往前挪,特地去找了。它没有。取她头发暗区在三行上的宽度:原图是 457、458、498 像素,第四轮是 455、456、496——同样大小,在噪声范围内。整帧只向右移了两三个像素,没有任何缩放。

所以四轮真正花掉的是质感和颜色,不是构图。做成组素材时这件事值得知道,因为它告诉你要盯的是哪种错位:链条上的图和源图对得齐,却对不上,而这种错位靠裁剪修不好。

这也说明上面那组数字略偏保守:固定方框不做对齐就比对,那两三个像素的位移会被算进「变化」那一列,真实的质感变化比表里还小一点。

只换语言,不动版式

一种和摄影无关但很实用的改动:把做好的图表换个语言。

一张名为「热泵如何给房子供暖」的扁平矢量示意图,带五个英文标注

Translate every piece of text in this diagram into Spanish. Nothing else
changes: same layout, same icons, same arrows, same colours, same type sizes
and same positions. Only the words are replaced.

同一张示意图,所有标注换成西班牙语,图标、箭头和配色完全一致

Serpentín exterior、Compresor、Válvula de expansión、Serpentín interior,加上顶上的标题。重音符号都对,图标一模一样,箭头位置没动,蓝橙两色的循环回路也完整。

有一处确实变了。英文版的 Warm air to rooms 是两行同样字号;西语的 Aire cálido a las habitaciones 更长,模型把第二行缩小了才塞下。文字一长,版面就被挤乱,所以翻译版要检查的是换行和字号,而不只是拼写。德语的复合词更长,我估计它更难对付,但这次没测。

GPT Image 2.5 改图用的设置

设置我用什么实测结果
模型Flare够快,连改四轮也就几分钟。要抠细节就换 Sunburst,差别在 Flare 和 Sunburst 的同提示词实测 里
画面比例咖啡馆那组 2:3,广告牌和示意图 3:2输出跟着你这次的要求走,不跟输入图,并会重新取景
分辨率1K实际回来是 832×1248 和 1248×832
质量照片类改动用 medium,画面要出字的用 high这篇里所有带文字的图都是 high
参考图改图 1 张,合成 2 张单次最多 16 张,每张都要派活
积分medium + 1K 每张 8 分,high + 1K 每张 32 分照片类每张 8 分,广告牌和示意图那几张是 32 分。四轮链条花了四张的钱,合并版只花一张

GPT Image 2.5 改图翻车的四种样子

你看到的原因怎么修
目标旁边的东西也变了你用的那个名词涵盖范围比你以为的大,一次改多处时尤其明显把例外写进同一句话
改了几轮之后人有点不像了每一轮都整张重绘,细小的不一致会叠加回原图合并改,或者接受漂移、别再当它是同一张照片
合成进去的物体在飘接触阴影太淡,哪怕大小和颜色都对写进提示词也可能还是淡(这次就是),交付前放大看接触面,不够就单独再跑一轮只加深阴影
翻译后文字重新排了新语言更长,字号会自动适配检查换行和字号,不只是拼写

这次没测的部分

上面的数字来自一个场景、一个人物、Flare、medium、1K,而且只量了脸。有四件事在范围之外,我不会假设结论能照搬:

  • Sunburst。 这个更重精度的模型,也许在长链条里能把脸咬得更稳。我只测了 Flare。
  • 照片改动用 2K 和 high。 这篇里的照片改动全是 medium + 1K。像素更多是让漂移更大还是更小,我没有数据。
  • 不是我生成的人脸。 真人照片正是漂移最要命的场景,也正是我不会拿来做公开测试的场景。
  • 更长的链条。 我停在第四轮,曲线还在往上走,真正有意思的问题是它在哪里走平。

GPT Image 2.5 改图三步工作流

  1. 动手之前,把想改的地方全部列出来。如果清单已经定了,它就该写进同一条提示词。
  2. 提示词按这个结构写:改什么 → 不能动的例外 → 一句兜底。画面里要出现的文字用引号括起来,并说明只出现一次。
  3. 拿结果和原图按 100% 比对,顺序是:改动的地方 → 它周围的边缘 → 人脸和文字 → 其他。要再来一轮的话,先决定是从这张继续,还是回原图重来。

这些都可以直接在浏览器里跑:上传自己的图用图生图生成器,想自己调模型和参数就用 GPT Image 2.5 页面,不需要 ChatGPT 账号。默认档(medium、1K)每张 8 积分,high 质量和 2K、4K 更贵,生成前页面会显示价格。新账号送免费积分,够你把上面几条提示词都跑一遍;付款支持支付宝和银行卡。

写在最后

在这一代模型上,保留清单已经不是救命稻草:一条五个词的提示词和一条 82 个词的,跑出来的两张脸只差 0.3% 的像素。真正有代价的是轮次。四次单改比一次合并改让她的脸多走了将近一倍,而那四条指令里没有一句提过脸。先把要改的想全,写成一条,点名你在意的例外,然后回原图重来,而不是在改过的图上接着改。

延伸阅读

gpt-image2.art 是独立站点,与 OpenAI 无隶属关系。本文所有出图均由 GPT Image 2.5 Flare 于 2026 年 9 月 24 日生成和改动;文中数据来自单个场景、1K 分辨率、只测人脸的比对,请当作方向而非基准。

限时免费试用

现在就用 GPT Image 2 出一张图

中文文字稳定渲染、支持局部编辑、带 50+ 现成 Prompt 模板——无需下载,浏览器里即可上手。