它是怎么工作的,一段话讲完
你输入一段描述,图就出来了。在底层,工具先从一片随机的视觉噪点开始,然后一遍遍把它推向与你的文字相符的样子,而它是从海量带文字说明的图片里学会“这些词长什么样”的。
有一个后果解释了新手大部分的挫败感:模型是在把你的描述和它学到的规律做匹配,而不是像人那样执行指令。你写“不要狗”,“狗”这个词还是在里面,图里很可能真会出现一只狗。而你没写到的部分,它不会来问你,它会用它见过的那类东西里最平均的样子把空缺填上。
全部技巧就在这儿:把你想要的说具体,把你不想要的放到专门为它准备的位置。
六要素公式
几乎每一条好的图片提示词都包含同样这六样东西。缺掉的那些会被默认值填满,而默认值恰恰就是让一张图看起来平庸的原因。
| 要素 | 该怎么写 | 不写会怎样 |
|---|---|---|
| 主体 | 具体是什么,带上关键细节 | 这个名词最普通的版本 |
| 场景 | 在哪里,画面看到多少 | 空白或杂乱的背景 |
| 光线 | 什么时间、什么方向、什么质感 | 平淡、均匀、没有生气 |
| 构图 | 特写还是远景,从什么角度 | 每次都是居中的中景 |
| 风格 | 照片、油画、三维渲染、插画 | 那种油亮的数字绘画 |
| 情绪或色调 | 想要的感觉和配色 | 过饱和、高对比 |
一条弱提示词:一间温馨的客厅。
一条强提示词:一间小客厅,壁炉里生着火,一只虎斑猫睡在磨旧的扶手椅上,午后偏晚的阳光从朝西的窗户照进来,从门口拍的远景,写实照片,35mm,暖棕色和柔和的琥珀色,安静而有生活气息。
想出这两条花的力气差不多。第二条是一幅画面,第一条只是一个类别。
然后加上新手完全跳过的那一部分:反向清单。反向:文字、水印、多余的手指、杂乱的背景、图库照片式的假笑。让一张图看起来像AI生成的,多半来自一小撮反复出现的瑕疵,把它们点名说出来,它们就消失了。
让这件事变简单的窍门
这些提示词不用你自己写。让一个文字AI替你写。
帮我写一条文生图提示词,内容是:[你的粗略想法]。用途是[用途]。按主体、场景、光线、构图、风格、色彩与情绪的顺序组织,最后附一份反向清单。给我三个版本,差异体现在构图上,而不是换几个形容词。
在写图片提示词这件事上,语言模型比大多数人强得多,因为这个格式是固定的,而它们见过海量的例子。这也是为什么在聊天里直接生成图片,比一个孤立的图片输入框实用得多:写提示词的工具就坐在画图的工具旁边。
你的图为什么画歪了
一份简短的排查清单,几乎覆盖了新手遇到的所有问题。
平淡、没特点。 你没写光线和构图。这两项起的作用比任何其他组合都大。
东西都对,但摆错了位置。 把构图明确写出来:从低角度拍的远景、特写,主体位于画面左三分之一。你不说,模型就完全不知道你想把东西放哪儿。
你说了不要的东西还是出现了。 在正文提示词里点它的名,只会让它更容易出现,而不是更不容易。把它挪到反向清单里。
手、脸或重复的小细节不对劲。 这在所有工具里都仍是最弱的一块。试试更近的裁切、换个角度,或者干脆让手不入镜。有时候重新生成一次就好了。
图里的文字是乱码。 意料之中。看下一节。
看着像图库照片。 加上抓拍,描述一个动作而不是一个摆好的姿势,并把对着镜头的图库式微笑放进反向清单。
尺寸和你要用的地方对不上。 直接要你真正需要的画面比例。把方图裁成横幅,等于把你辛苦要来的构图扔掉。
怎么迭代才不会原地打转
新手会拿同一条提示词反复重生成,指望撞到更好的运气。随机性确实无法完全避免,但大部分被浪费的尝试,来自一次改了好几处。
- 每次只改一样。 光线,或者构图,或者风格。别三样一起改,否则你不会知道是哪一处起了作用。
- 先定构图,再抠细节。 先把画面和光线弄对,比在主体位置还不对的时候死磕细节高效得多。
- 把已经对的地方也说出来。 一张图接近满意时,在下一条提示词里用文字写清楚哪里对了,别指望工具自己记得。
- 把有效的提示词存下来。 六到八个靠得住的提示词模板,比任何一张单图都值钱,也正是它们让一组图片看起来是一家人。
它目前还做不到的事
文字。 图里的文字在所有工具上都仍不可靠。一个短词有时能成,一句标题或一个标志通常不行。先把图干干净净地生成出来,再到任何设计工具里加文字,这样字体也能用对。
精确的摆放。 “正好三个物体,红色的那个在左边”并不能被稳定执行。如果摆放很重要,就把各个元素分别生成,然后自己拼。
同一个角色出现两次。 让同一个人物或同一件产品贯穿一整组图很难。反复给出详细一致的描述会有帮助,但结果不保证完全一致。
精确修改一张真实照片。 调背景、调光线、调风格它做得不错。但让某个物体稳稳地往左移五厘米,它做不到。
还有关于结果的使用:任何生成的图片用到商业场合之前,先把规则看清楚。尤其要当心那些像某个真实人物、某个可辨认的地点,或某位在世艺术家标志性风格的图片。各家工具的条款不一样,责任落在发布这张图的人身上。
- 六个要素都写上:主体、场景、光线、构图、风格、情绪
- 把不想要的内容写进反向清单,绝不要写在正文描述里
- 让一个文字AI把你的粗略想法写成完整的图片提示词
- 一开始就按你真正需要的画面比例生成
- 每次尝试只改一个变量,这样你才知道是什么起了作用
- 文字到设计工具里加,别指望图片模型来写
- 把有效的提示词存下来,让你的图片风格保持统一
常见问题
生成AI图片需要有美术功底吗?
不需要,但确实需要描述能力,而这正是新手低估的部分。一张让人失望的图和一张好图之间的差距,几乎全在于你把光线、构图和风格描述得有多具体。如果细致描述一个场景对你来说不太顺手,就让一个文字AI把你的粗略想法扩写成结构化的提示词,这招很好用。
我能用AI帮我想图片创意吗?
能,而且比多数人以为的更有用。先让聊天机器人给你五个带画面感的概念,再让它把你最喜欢的那个写成一条完整的结构化图片提示词,附上反向清单。语言模型写图片提示词比大多数新手写得好,这也是为什么在聊天里直接生成图片胜过一个孤立的图片输入框。
为什么我图里的文字像乱码?
因为渲染文字确实是所有图片模型最弱的一块,没有哪条提示词能稳定解决它。短的单个词有时能出来,标题、标志和标签通常不行。先生成不带文字的图片,再到任何设计工具里加排版,这样你还能用上正确的字体、把位置摆好。
哪个图片生成模型最好?
这比人们以为的更取决于题材。Flux在写实照片,以及任何要看起来像相机拍出来的内容上最强。Stable Diffusion在插画方向给你更多风格控制和变化。最快的判断办法是把同一条提示词分别跑一遍,把结果并排看,因为在人像上赢的那个,往往在室内场景上不是赢家。
生成图片需要单独再订一份吗?
不一定。Whizi的Pro及以上方案里就包含图片生成,和文字模型放在一起,普通的创作和内容工作不用再付第二份账单。如果你是每天专业做这件事,并且想要非常精细的风格控制,那专门的图片工具仍然值得。