网上找到了一些好看的图标,但是苦于自己没有办法提炼出来他的提示词?又或者需要垫图的方式实在是不太方便,也不方便分享来用?

经过我的探索,我找到了一种通过不断迭代的问题生图提示词模板的工作流,基本上任何一个人都可以操作,没有技术门槛,只要你有耐心。

可交付的提示词模板

我理解真正可交付的提示词模板,至少要满足三个条件:

  • 它的结构是稳定的。比如主体、构图、镜头、材质、光影、色彩和背景这些信息,各自放在比较明确的位置。

  • 它的变量是清楚的。哪些地方可以换,哪些地方不要乱动,最好用【】直接标出来。

  • 它经过测试。不是只在当前对话里跑出一张好图,而是换到新对话里再测,依然能保持大体方向。

这很显然,我们要有不断测试并反馈的循环过程,理论来说是可以让 AI 自己去迭代的,这很像一个 Agent loop(如果你对此感兴趣,可以查看我的 Harness 笔记:https://harness-learn.pages.dev/),但是这还是不太好,经过我的实践我发现:

  • AI 只擅长输出,但是在多模态输入上,远不如人精细,它往往认为就是一样的(因为主体和大概的配色是一致的);

  • 不经济,多模态模型更贵,相比人去做对比,也更花时间。

下面,我们来介绍整个操作流程

寻找参考并交付 AI

第一步很简单,先找到你想学习的参考图,你可以去花瓣、小红书或者 x 上去找你喜欢的、想要沉淀成模板的参考图。但这里要注意,参考图不能太含糊。你至少要知道自己想保留什么。比如你想要的是它的低饱和配色,还是中心构图,还是产品像素级的材质表现,还是那种柔和但有层次的光影。

我这里以 Codex 为例,当然你使用其他 AI 工具都是可以的,接下来,再把参考图直接交给 Codex,让它先做一件事:分析这张图为什么成立,然后基于分析生成一条可测试的提示词。

这一步不要只让它“帮我写提示词”,最好明确要求它拆解画面。因为我们要的不是一堆漂亮形容词,而是让模型知道哪些信息需要固定下来。

请分析这张参考图,拆出主体、构图、色彩、材质、光影、镜头语言、背景复杂度和整体风格,然后生成一条适合用于生图测试的完整提示词。提示词要具体、可执行,不要只写抽象风格词。

这样做的好处是,Codex 不会只给你“高级感、电影感、精致”这种泛词,而是会尽量把参考图里的具体特征转成提示词结构。

提示词测试

拿到提示词之后,我会把它放到 ChatGPT 的生图能力里测试,当然你也可以用即梦、可灵等等任何你想要用来生图的 AI,不过我个人的经验是不同的 AI 想要达到同一张图的效果提示词是不同的,因此提示词具有强依赖模型的特点。

不过有一个小细节要注意,每一次测试,都要新开一个对话。每一次测试都新开对话,目的是防止上下文污染。不要在同一个对话里连续测试很多版本,否则前面的参考、失败结果和修改要求,都可能影响你对提示词真实稳定性的判断。

如果测试结果不满意,不要说类似“这张不好,再改改”。这句话基本没有信息量,Codex 也只能猜。

我的做法是把测试出来的图复制回 Codex,然后明确告诉它:这张图和参考图到底差在哪里,为什么不一样,例如下面这些反馈维度:

反馈维度

不建议这样说

更建议这样说

构图

构图不对,再改改

参考图里主体占画面大约 70%,测试图主体太小,画面留白过多,需要拉近镜头并加强中心构图。

色彩

颜色不好看

参考图是低饱和冷灰调,测试图偏高饱和橙色,整体更像广告海报,需要压低饱和度并减少暖色面积。

光影

光感不高级

参考图是柔和侧光,有明显明暗层次;测试图光线太平,材质没有体积感,需要加入侧向柔光和更清楚的高光边缘。

风格

不像参考

参考图更偏真实产品摄影,测试图变成了插画质感,需要减少手绘感、增强真实材质和镜头景深。

你会发现,反馈越具体,下一轮提示词就越容易收敛。因为 Codex 需要的不是情绪判断,而是可操作的差异信息。

这次测试图和参考图主要有三个差异:
1. 参考图主体更大,几乎占据画面中心区域,测试图主体太小。
2. 参考图的色彩更克制,偏低饱和冷灰,测试图颜色太鲜艳。
3. 参考图是柔和侧光,测试图光线太平,材质没有层次。

请基于这些差异重写提示词,优先修正构图、色彩和光影,不要改变原来的主体方向。

稳定后抽离模板

当你觉得测试结果已经比较稳定,就可以进入最后一步:让 Codex 把这条提示词提炼成模板。

这里的重点是,把可以替换的部分用【】括起来。比如【主体】、【主色】、【背景】、【材质】、【画幅比例】、【使用场景】。而那些决定风格稳定性的内容,比如构图方式、光影结构、镜头语言和质感要求,就尽量保留下来。

请把这条已经测试稳定的提示词提炼成一个可复用模板。把可替换的内容用【】括起来,例如【主体】、【主色】、【背景】、【材质】、【画幅比例】。请保留影响风格稳定性的固定描述,例如构图、镜头、光影、材质质感和画面复杂度。

一个提炼后的模板,可能会长这样。

为【主体】生成一张【画幅比例】的视觉图。画面采用【构图方式】,主体占据画面中心主要区域,背景保持【背景复杂度】。整体色彩以【主色】为主,饱和度克制,避免过度鲜艳。材质表现为【材质】,需要真实、细腻、有清晰的高光和阴影层次。光线采用柔和侧光,保留自然景深和产品摄影感。整体风格接近高质量商业视觉,不要插画化,不要过度装饰。

注意,这只是一个示例。真正的模板一定要从你前面测试稳定的提示词里提炼,而不是凭空套一个万能格式。

不过要注意的是,我个人有一个习惯,那就是提炼成模板后最后再测一次。因为把完整提示词改成模板之后,变量位置可能会影响稳定性。

总结

这套方法看起来有点慢,但它解决的是一个很关键的问题:不要让生图变成每次都重新抽奖。参考图负责提供方向,Codex 负责把方向拆成语言,ChatGPT 负责测试效果,而你自己的反馈负责把提示词一步步收敛。整个流程里最重要的不是工具,而是你能不能把“哪里不对”说清楚。

主要的 2 个细节最后想再说明一下:

  • 每一次正式测试都新开对话,避免上下文污染;

  • 反馈一定要具体,不要只说“不好”“再改改”。你要说明具体差异,也要说明为什么它和参考图不一样。

当这两点做好之后,提示词就不再只是一次性的文字,而可以变成一个能交付、能复用、能继续迭代的生图模板。

如果你有兴趣,也可以看看我自己反推出来的以及收集到的不少提示词模板:

生图提示词汇总用 “我来” 搭建一站式协作平台,团队知识库、仪表台、工作流、内部应用、外部网站与个人云端笔记、待办……开箱即用!