如何在Whizi聊天中生成图片

快速解答

要在Whizi聊天中生成图片,打开模型选择器,把开关从文字切换到图片和视频,选择Whizi Image、Nano Banana、Flux或Stable Diffusion,然后描述你想要的图片。图片生成功能包含在Pro套餐(每月100张)和Powerhouse套餐(500张)中。在同一段对话里反复迭代,然后下载结果。

简单来说

打开模型选择器,将顶部的开关从文字切换到图片和视频,选择一个图片模型,然后描述你想要的图片。输入框的提示文字会变成“描述你想生成的图片……”,生成结果会直接显示在同一段对话里。

模型用途
Whizi Image生成任意图片;创意选择器里的第一行
Nano Banana编辑你上传的照片
Flux锐利的写实风格作品
Stable DiffusionStability AI的图片模型

图片生成功能包含在Pro套餐(每个计费周期100张)和Powerhouse套餐(500张)中。免费版和入门版账户的图片额度为零。图片提示词可以是1到4,000个字符,生成的图片会保存30天,每张图片都有下载按钮。如果生成失败而不是正常渲染,提示文字会说明原因;参见图片生成失败

为什么在聊天里生成图片不一样

常见的图片生成流程是一个独立的产品、一个独立的订阅,以及一个完全不了解你正在做什么的空白输入框。在对话内部直接生成图片改变了两件实际的事情。

第一,模型已经掌握了上下文。如果你刚花了二十条消息来完善一个营销创意,那么“为这个生成主视觉图”这句话已经带上了全部背景。你不需要向另一个工具重新描述一遍需求。

第二,你可以用文字模型来撰写图片提示词。这是大多数人都会忽略的技巧:让ClaudeGPT把你粗略的想法转化为结构完整的图片提示词,再拿去运行。语言模型在撰写图片提示词方面通常比大多数人做得更好,因为这是一种已知的格式,而它们已经见过大量的范例。

提示词:让文字模型来写图片提示词

为以下内容写一段图片生成提示词:[粗略的想法]。它将用于[用途和展示位置]。按以下结构组织:主体、动作或状态、场景、光线、构图与取景、媒介或镜头、色彩处理、氛围。补充一份不希望出现内容的负面清单。给我三个在构图上(而不是形容词上)有差异的版本。

行之有效的提示词结构

几乎每一个好的图片提示词都遵循大致相同的七个部分,且顺序相近。缺失的部分会被模型用默认值填补,而正是这些默认值让泛泛的提示词生成千篇一律的图库风格图片。如果这是你第一次写提示词,如何创建AI图片从零开始讲解了同样的内容。

部分该写什么省略后的效果
主体具体的事物,加上关键细节得到这个名词最泛泛的版本
动作或状态它正在做什么,或处于什么姿态静止、摆拍、缺乏生气
场景在哪里,能看到多少环境空白或杂乱的默认背景
光线方向、质感、时间平淡、均匀打光、缺乏个性
构图角度、距离、主体在画面中的位置每次都是居中的中景
媒介或镜头摄影及焦距,或插画风格默认偏向光滑的数字艺术
色彩与氛围色调与情绪色彩过饱和、对比过强

一个实际的例子。弱:一个人在办公室工作。强:一位五十多岁的女性站在站立式办公桌前查看打印出来的图纸,傍晚的光线从她左侧的窗户照进来,从她肩膀稍后方、与视线齐平的角度拍摄,50毫米镜头,柔和的绿色与暖色中性调,平静从容。负面清单:对镜头微笑的商业图库风格、杂乱的桌面、可见的品牌标志、文字。

负面清单的作用比大多数人想象的更重要。让生成图片看起来“一眼假”的,往往就是一小组反复出现的瑕疵,把它们明确列出来就能去除它们:商业图库式微笑色彩过饱和文字水印多余的手指对称的公司风构图

如何选择模型

  • Whizi Image:用于生成任意图片。它是内置生成器,也是创意选择器里的第一行。
  • Nano Banana:用于编辑你已有的照片。上传图片并描述想要的修改;一旦附上图片,输入框的提示文字就会从“生成”切换为“编辑”。
  • Flux:适合锐利的写实风格作品,以及任何需要和真实照片放在一起使用的内容。
  • Stable Diffusion:Stability AI的模型,可以作为第二意见:它对具体的提示词反应更好,用同样的文字也能生成不同的风格。

你可以在同一段对话里切换模型,这是回答那个唯一重要问题的最快方式:把同一个提示词分别放进两个模型里运行,然后并排比较结果。不同模型的质量因主体而异,在人像上表现最好的模型,在室内场景或平面插画上未必是赢家。

不要在原地打转地迭代

最常见的失败是反复重新生成同一个提示词,指望能碰上更好的结果。这在一定程度上难以避免,但大多数被浪费掉的尝试,其实来自一次改动太多东西,结果忘了到底是哪一点起了作用。

  • 每次只改一个变量。 光线,或者取景,或者色调,而不是三样一起改。
  • 把有效的部分用文字记下来。 当一张图片已经接近理想效果时,在下一个提示词里描述清楚它哪里对了,不要指望模型会记得。
  • 先修构图,再修细节。 先把取景和光线调对,远比先完善一个位置不对的主体更高效。
  • 按最终需要的宽高比生成。 把方形图裁成宽幅横幅,会丢掉你原本要求的构图。提前说明你实际需要的比例。
  • 保存有效的提示词。 八个可靠的、可以直接粘贴复用的固定风格提示词,比任何一张单独的图片都更有价值,反复使用它们也正是让一组素材看起来像一整套的原因。

如果要编辑已有的图片,上传它并描述想要的修改。这种方式很适合调整背景、光线和色调,但不太适合精确的结构性修改,这类修改在真正的图片编辑工具里做起来仍然更快。

图片模型目前仍然做不好的事

文字。 渲染文字仍然是所有模型中最薄弱的环节。简短的单词有时能正确生成,但标题、标志或标签通常不行。先生成不带文字的干净图片,再在你的设计工具里加上文字。

手、数量和重复的小细节。 手指、牙齿、椅子腿,以及建筑物上的窗户,都是模型容易数错的地方。使用前请先放大检查。

精确的空间指令。 “正好三个物体,红色的那个在左边”这类指令并不可靠。如果排列方式确实重要,请在你的编辑工具里自己完成构图。

多张图片之间的一致性。 让同一个角色或产品在一系列图片中保持完全一致很难。详细且重复的描述会有帮助,但无法保证得到完全相同的结果。

关于使用权:在把任何生成内容用于付费投放之前,先确认你的权利,尤其要留意任何类似真实人物、可辨认地点,或与在世艺术家风格高度相似的内容。各家提供商的条款各不相同,商业风险由发布图片的一方承担。

操作清单
  • 让文字模型根据你的粗略想法写出图片提示词
  • 包含全部七个部分:主体、动作、场景、光线、构图、媒介、氛围
  • 加上一份负面清单,列出你绝不想出现的瑕疵
  • 按你实际会用到的宽高比生成
  • 每次迭代只改一个变量
  • 把同一个提示词放进两个模型里运行并比较
  • 在你的设计工具里加文字,而不是在图片模型里加
  • 把有效的提示词保存为可复用的模板

常见问题

我每个月可以生成多少张图片?

Pro套餐每个计费周期包含100次图片生成,Powerhouse套餐包含500次。免费版和入门版账户的图片额度为零,因此Pro是能生成图片的最低套餐。在按周计费的周期里,额度是月度数字除以四并向上取整。由于反复迭代正是消耗生成次数的地方,先写好一段结构完整的提示词(最好借助文字模型)能明显减少得到一张可用图片所需的尝试次数。

我可以编辑已有的图片吗?

可以。在图片和视频模式下,上传照片并描述想要的修改;一旦附上图片,输入框的提示文字就会从“生成”切换为“编辑”,而Nano Banana正是为照片编辑而设计的模型。这种方式很适合调整背景、光线、色调和风格。但不太适合精确的结构性修改,比如把某个物体移动特定距离或修改文字,这类操作在普通的图片编辑工具里依然更快。

我该用哪个图片模型?

Whizi Image用于生成任意图片,Nano Banana用于编辑你上传的照片,Flux适合需要和真实照片放在一起使用的锐利写实风格作品,Stable Diffusion则能用同样的提示词生成不同的风格。由于不同模型的质量因主体差异很大,最快的决定方式是把同一个提示词放进其中两个模型里,在同一段对话里运行并比较结果。

为什么我图片里的文字总是不对?

渲染文字仍然是所有图片模型中最薄弱的环节,没有哪种提示词能可靠地解决这个问题。简短的单个词有时能生成对,但标题、标志和标签通常不行。生成不带文字的图片,再在你的设计工具里加上排版,这样也能让你使用正确的字体,并更好地控制文字的位置。

除了Whizi之外,我还需要单独订阅一个图片生成工具吗?

对于大多数营销活动、内容创作和创意构思工作来说,不需要。图片生成功能已经包含在Pro套餐(每月100张)和Powerhouse套餐(500张)中,这足以覆盖典型营销和社交媒体产出所需要的范围,与独立订阅工具能做到的相当。如果团队有非常特定的风格要求,或者已经积累了不想重建的庞大提示词库,一款专门的工具仍然有意义。