AI图片生成入门:从提示词到工作流

本文用于AI知识学习与工作流理解,不构成对具体产品、付费服务或商业效果的推荐。AI工具能力、可用地区和规则会变化,重要结果请以发布时官方说明和人工核验为准。

生成一张好看的AI图,为什么还是不能用

你有没有类似遇到这样的场景:

负责一次社区读书会的线上招募,需要一张横版封面图,当晚交给运营发布。你打开一款文生图工具,输入"年轻人参加周末读书会,温暖、有活力",很快拿到一张画面:色调确实温暖,人物表情也自然,很符合你对图片的要求。

但放到实际排版里,问题立刻出现:

  • 画面是竖构图,横版裁切后人物只剩半张脸;

  • 主体人物正好站在画面上方三分之一处,标题放不进去;

  • 背景里出现了不属于读书会的运动器材;

  • 最关键的一点——画面中间有一行变形英文,无法当作活动标题使用。

这不是工具出了错,而是一句模糊描述能做的事本来就有限。

文生图工具收到的信息只有氛围和主题方向,它不知道这张图要横着用、标题放在哪里、画面里哪些东西必须出现而哪些绝对不能出现。生成按钮做的事情比你以为的少,而你需要做的事比想象的多。

这篇文章会沿着这张招募图从"不能用"变成"可以发"的过程,把AI图片生产中真正需要的步骤走一遍:明确需求、首次生成、筛选底图、局部修改、人工排版、导出交付,以及怎样让下一张图不用从头来过。

需要注意的是,我这里提供的示例场景是特定的用法,用来展示通用方法,不代表某一款工具的固定操作。

先把"想要一张图"变成可执行任务

你已经知道第一版为什么不能交付:不是因为画面不好看,而是因为你在按下生成之前没有确定验收标准。

在真正写提示词之前,需要先回答几个和AI工具无关的问题:

这张图给谁看、在哪里用?

招募图的读者是社区群成员和朋友圈浏览者,投放渠道决定了横版比例(通常 16:9 或公众号头图尺寸),也决定了图片要在手机屏幕上一眼看清主题。

画面必须传达什么信息?

活动名称、时间和报名方式会以文字排版覆盖在图上,所以画面需要留出足够的安全区域。核心视觉信息是"一群年轻人在室内参与读书相关活动",不需要出现具体书名或具体面孔。

哪些元素可以变化,哪些不能?

人物数量、服装配色、书架样式都可以交给AI发挥。但画面不能包含真实品牌logo、特定名人面孔,也不能出现与读书会无关的场景元素。如果你打算上传一张往期活动照片作为参考图,需要确认你对这张照片有使用权利。

把这些答案写下来,你会得到一份简短的图片任务单——它不是提示词,而是提示词的依据。任务单上至少包含:

  • 用途与渠道

  • 画幅比例

  • 核心视觉信息

  • 文字排版区域

  • 必须包含与必须排除的元素

  • 参考素材来源说明

有了这些任务单信息,接下来的每一步才有判断标准,而不是反复按生成按钮碰运气。

提示词只负责指令,不能替你做决定

任务单准备好了,现在该写提示词。提示词的作用是把你的任务单翻译成生成工具能理解的描述——它是一次沟通,不是一道咒语。

一条有效的提示通常包含几类信息:

  • 主体(画面里是谁或什么东西)

  • 动作或状态(他们在做什么)

  • 环境(室内还是室外、什么样的空间)

  • 构图方向(留出上方三分之一做标题区、主体偏左或居中)

  • 风格与色彩(插画风还是摄影风、暖色调)

以这张招募图为例,一条提示可能是:

一群年轻人围坐在明亮的室内空间里翻阅书籍和讨论,暖色自然光从左侧窗户照入,画面上方三分之一留白,摄影风格,16:9横版构图。

注意这里没有堆砌几十个风格关键词,也没有试图在一句话里规定每个人的衣服颜色。提示词写得越具体越好,但"具体"指的是你确实需要控制的维度,不是把能想到的修饰语全部罗列。堆砌过多互相矛盾的要求,反而会让结果变得不可预测。

除了文字提示,多数图片工具还提供其他控制入口:

  • 画幅比例

  • 内容类型(摄影 / 插画 / 平面设计)

  • 风格参考图、构图参考图等。

这些选项和提示词共同约束生成结果——它们不是高级功能,而是和文字提示平级的沟通渠道。如果你在提示词里写"暖色调",同时在风格参考里放了一张冷蓝色照片,工具收到的就是矛盾信号。

第一次生成建议只跑少量候选(比如四张),目的不是直接拿到完美成品,而是看生成方向是否正确。这一步更像拍一组样片确认取景方向,而不是期望每张都能直接印刷——当然,AI生成和摄影的相似也仅限于此:摄影记录真实场景,AI是从学习过的视觉模式中合成新画面。

选底图比追求一次完美更重要

四张候选图摆在面前,你需要做一次快速判断。不是选"最好看"的那张,而是选最接近任务单、同时后续修改成本最低的那张。

判断可以从三个层面进行。

第一,主题是否准确:画面里的人在做读书相关的事情吗?场景是否是室内?有没有出现任务单里要求排除的元素?

第二,构图是否服务于信息传达:上方是否留出了标题区域?主体人物是否被裁切到只剩边缘?横版比例下画面是否平衡?

第三,细节错误的严重程度:手指数量异常或书本文字变形是生成模型常见问题,但如果错误出现在画面焦点位置,修改成本就会很高;如果出现在可以被标题遮盖的区域,反而不影响最终交付。

这里需要理解一件事:文生图工具每次生成都包含随机因素。即使你用完全相同的提示词再点一次生成,出来的画面也会不同。这不是bug,而是生成过程的基本特性——模型从随机起点出发,沿提示方向逐步"去噪"形成画面。保留你选中的那张底图以及对应的生成参数(提示词、随机种子、画幅设置),是后续能继续修改而不是从零开始的前提。

假设第二张候选构图最接近要求,上方有足够留白,人物姿态自然,但右下角出现了一个不合理的物体,而且整体色调偏冷。这两个问题不需要重新生成——它们可以通过局部修改解决。

改一处时,不要每次推倒重来

选定底图之后,最常见的冲动是"右下角不对,重新生成一张"。但重新生成意味着随机性会改变整张画面——你好不容易选中的构图、留白和人物姿态全部作废,问题可能解决了一个却冒出三个新的。更合理的做法是只改需要改的地方。

AI图片工具普遍提供两种局部操作。

一种是局部重绘(inpaint):你用遮罩框选画面中的某个区域,工具只在这个区域内重新生成内容,其余部分保持不变。比如框选右下角那个不合理的物体,告诉工具"这里应该是木质地板",它就会在保留周围像素的前提下替换掉那块区域。随着AI技术发展,有些能力强的AI也能通过你的自然语言描述信息,进行局部重绘调整,但是有时候也会出现随机不可控。

另一种是扩图(outpaint):如果底图的比例不够宽,你可以向左右扩展画布,工具会根据现有画面的边缘信息补全新增区域的内容。

接下来你可能需要先用局部重绘处理右下角的物体,再对整体色调做一次调整让它偏暖。如果底图本身偏窄,扩图可以帮你补全到 16:9 的横版比例。每一步修改之后都值得保存一个版本——局部重绘的结果不一定一次满意,你可能需要调整遮罩范围或补充描述再试一次,但这比重新生成整张图的代价小得多。

需要注意的是,局部修改并非无限制。遮罩范围太大,修改后的区域与原图衔接可能不自然;连续多次修改同一区域,画面质量可能逐步下降。如果你发现底图需要大面积修改才能达到要求,说明应该回到上一步重新选一张更合适的候选,而不是在一张方向偏离的图上反复修补。

完成AI生成图片外,还有交付工作

经过局部修改,画面本身已经可以接受了——构图合理、色调温暖、主体清晰、没有明显错误。但这张图距离"可以发给运营"还差最后一段路,而这段路AI帮不了你。

活动标题、时间、地点和报名方式需要用真实字体排版到画面上。很多AI生成的文字几乎不可用:它不理解中文笔画结构,即使偶尔生成了看似正确的字,放大后往往存在变形和错误。正确做法是在你熟悉的设计或排版工具中将AI生成的画面作为背景图层导入,然后用真实字体手动排版所有文字信息。

排版时还需要处理几件事:

  • 确认品牌相关元素(社区logo、配色规范)是否正确使用;

  • 检查导出分辨率是否满足投放渠道要求;如果渠道同时需要不同尺寸(比如公众号封面和朋友圈配图),可能需要分别导出裁切版本。图片的alt文字也值得在这一步写好——它帮助视障读者和搜索引擎理解图片内容,一句描述画面主体和用途的话就够了,不需要把提示词复制过去。

如果你所在的平台要求对AI生成合成内容进行标识,导出前应按相关规则添加。中国现行规则对生成合成内容的标识有明确要求,不同平台的执行细节可能不同,发布前应查阅具体渠道的最新说明。

如何让下一张图不用从零开始?

招募图发出去了。现在回头看这次经历,从第一张"好看但不能用"到最终交付,你实际上走过了一条完整的路径:

明确用途和规格 → 写提示词生成候选 → 筛选底图 → 局部修改 → 人工排版 → 导出交付。

这条路径不是只能用一次。

把这次用过的材料整理成一个文件夹:

  • 图片任务单

  • 最终使用的提示词

  • 参考素材及其来源说明

  • 候选图和选中理由

  • 每次局部修改的版本

  • 最终交付文件和排版源文件。

下次社区有新活动需要类似的招募图时,你不需要从"年轻人参加周末读书会"重新开始——打开上次的任务单,修改活动信息和视觉方向,以上次的提示词为起点微调,甚至可以复用同一张底图的扩图版本换一种色调。

如果你使用支持节点工作流的工具(比如 ComfyUI),整个生成过程——从模型选择、提示输入、采样参数到解码和保存——可以被显式地记录为一张可视化流程图。下次加载这个工作流,修改提示词节点的内容,其他环节自动沿用上次的设置。即使你不用节点工具,养成"保存提示 + 参数 + 版本"的习惯也能达到类似效果,只是手动记录多一些。

工作流的核心不是工具形态,而是一个意识:每一次可以交付的图片都不只是一次生成的结果,而是一系列决策(需求、提示、筛选、修改、排版)的组合。把决策记录下来,你就拥有了可以复用和改进的流程,而不是每次都在碰运气。

更深入地学习

这篇文章带你走完了一张图从想法到交付的基本流程。沿着这条路继续往下,你会遇到一些当前方法还不能很好解决的问题。

  • 文字和精确信息。 AI生成模型目前对文字的控制仍然有限,尤其是中文。如果你的图片需要在画面内展示准确的文字、数字或图表,最可靠的做法仍然是人工排版叠加,而不是期望AI直接生成正确文字。

  • 角色和品牌一致性。 如果你需要同一个虚拟角色在多张图片中保持一致的外貌和服装,或者需要产品图片严格匹配品牌视觉规范,单靠文字提示词很难做到。参考图、风格参考和一致性控制技术可以帮助缓解这个问题,但目前没有哪种方案能保证每次生成完全一致。这是入门之后值得深入学习的方向。

  • 版权和使用边界。 AI生成的图片能否用于商业场景、是否需要标识为AI生成、上传的参考素材是否涉及他人权利——这些问题没有一句话的通用答案,需要根据具体场景、适用法规和平台规则逐一判断。如果你的图片用于公开发布或商业用途,建议在使用前专门了解相关规则。

如果你想系统了解提示词的编写方法,可以阅读一文学会Prompt编写技巧场景、上下文与Prompt之间的关系。关于AI如何理解和生成图像背后的技术基础,《计算机视觉》《生成式模型》提供了更深入的解释。

当你从静态图片走向动态内容时,AI视频生成入门会讲清镜头、运动和剪辑的工作流。后续AI图片栏目还会有局部重绘与扩图、参考图与一致性控制、商品图片工作流等专题文章。

扩展阅读

(资料核验日期:2026-07-23)

  1. OpenAI Image generation guide — 图像生成与编辑能力说明,包括文本生成、已有图片编辑、参考图和多轮迭代。

  2. Google Gemini API image generation — 文本生图、图文输入编辑和多轮图片修改能力说明,含素材权利提醒。

  3. Adobe Firefly 文本生图 — 画幅、内容类型、构图参考、风格参考和光线等控制项说明。

  4. ComfyUI 文生图工作流教程 — 节点工作流把模型、提示、采样、解码和保存连接成可复查流程。

  5. ComfyUI 局部重绘教程 — 遮罩与局部重绘在保留大部分原图时修改指定区域的方法。

  6. ComfyUI 扩图教程 — 向原画面边界外补全内容的操作说明。

  7. 人工智能生成合成内容标识办法 — 中国现行生成合成内容显式与隐式标识规则。

分享协议:  CC BY 4.0

©2026 AI全书. 保留部分权利

    备案号: 浙ICP备06043869号-8