新手怎麼用AI產生圖片(簡單指南)

快速解答

要用AI圖片產生,你打出描述,圖片就會出現。要拿到好圖片,需要指名六件事:主體、場景、光線、構圖、風格,和氛圍或色調。任何你沒說的部分,都會被填上籠統的預設值,而你不想要的東西,該放進另外一份負面清單裡。

它怎麼運作,一段話說完

你打出描述,圖片就會出現。在底層,這個工具是從大量附有說明文字的圖片裡,學到了文字看起來像什麼樣子。它從隨機的視覺雜訊開始,反覆把那些雜訊推向符合你描述的樣子。

有一個後果能解釋大多數新手的挫折感:模型是在拿你的描述去比對模式,而不是像人一樣遵循指示。如果你說「沒有狗」,「狗」這個詞依然存在於裡面,圖片裡很可能還是會出現一隻狗。如果你漏掉了什麼,它不會問,它會用它看過最平均的版本,來填補那個空缺。

這就是全部的技巧。具體說出你想要什麼,並把你不想要的東西,說在為此設計的地方。

六要素公式

幾乎每一則好的圖片提示詞,都包含同樣的六件事。漏掉的部分會被填上預設值,而正是這些預設值,讓圖片看起來很籠統。

要素該說什麼如果漏掉會怎樣
主體具體的東西,附上重要的細節那個名詞最籠統的版本
場景它在哪裡,你能看到多少空白或雜亂的背景
光線時段、方向、品質平淡、均勻打光、缺乏生氣
構圖特寫或遠景、從什麼角度每次都是置中的中景
風格照片、油畫、3D算圖、插畫光滑的數位藝術
氛圍或色調感覺和色盤過度飽和、高對比

一則弱的提示詞:一間舒適的客廳

一則強的提示詞:一間小客廳,壁爐點著火,一隻虎斑貓在一張用舊的扶手椅上睡覺,午後陽光穿過一扇朝西的窗戶,從門口拍攝的遠景,寫實照片,35mm,暖棕色和柔和的琥珀色,寧靜、有生活感。

兩者想出來要花的力氣差不多。第二則是一張畫面;第一則只是一個分類。

接著加上新手完全會跳過的部分:一份負面清單。負面:文字、浮水印、多餘的手指、雜亂的背景、罐頭式的微笑。一張圖片看起來像AI生成的,大多來自一小組反覆出現的瑕疵,把它們指名出來就能去除。

讓這一切變簡單的訣竅

你不必自己寫這些提示詞。要求文字AI幫你寫。

為以下內容寫一則圖片產生提示詞:[你粗略的想法]。用途是[用途]。按照主體、場景、光線、構圖、風格、色調和氛圍的結構來寫,接著附上一份負面清單。給我三個版本,差異在構圖,而不是在形容詞。

語言模型寫圖片提示詞的能力,比大多數人強得多,因為這個格式是已知的,而且它們看過大量的範例。這正是為什麼在聊天裡產生圖片,真的比一個獨立的圖片方框更有用:寫提示詞的工具,就緊挨著畫圖的工具。

為什麼你的圖片出錯了

一份簡短的診斷清單,涵蓋幾乎每一個新手會遇到的問題。

無聊又籠統。你沒有指定光線或構圖。這兩項比其他任何一對元素做的功都多。

東西對了,但排列錯了。明確說出構圖:從下方拍攝的遠景特寫,主體位於左三分之一處。除非你說出來,否則模型完全不知道你想把東西放在哪裡。

你要求不要出現的東西,卻出現在圖片裡。在主要提示詞裡提到它,只會讓它更可能出現,而不是更不可能。把它移到負面清單裡。

手、臉,或小型重複細節出錯了。這依然是所有工具最弱的地方。試試更貼近的裁切、換個角度,或讓手不要出現在畫面裡。有時候直接重新產生就好。

文字亂七八糟。這是意料中事。看下一節。

看起來像圖庫照片。加上candid(自然抓拍),描述一個動作,而不是一個姿勢,並把對著鏡頭微笑的圖庫照片放進負面清單裡。

形狀跟你需要的地方不合。要求你實際需要的長寬比。把正方形裁成橫幅,會丟掉你要求的構圖。

反覆調整而不原地打轉

新手常常重複同一則提示詞,希望能碰上更好的運氣。有些隨機性無法避免,但大多數白費的嘗試,都是因為一次改了好幾件事。

  • 每次嘗試只改一件事。光線,或構圖,或風格。不要三個都改,不然你不會知道是哪個改動有幫助。
  • 先修構圖,再修細節。先把構圖和光線弄對,遠比把一個位置放錯的主體修得完美有效率得多。
  • 描述哪裡對了。當一張圖片已經接近你要的了,就在下一則提示詞裡用文字說出來,而不是假設工具會記得。
  • 儲存有效的提示詞。六到八套可靠的提示詞模式,比任何單一一張圖片都更有價值,也正是這些模式,讓一系列圖片看起來像是同一組的。

它依然做不到的事

文字。圖片裡的文字,在所有工具上依然不可靠。短的單字有時候還行;標題或標誌通常不行。產生一張乾淨的圖片,再用任何設計工具加上文字,這樣還能用對字型。

精確的排列。「剛好三個物件,紅色的那個在左邊」並不可靠。如果排列很重要,就分別產生各個部分,自己組合起來。

同一個角色出現兩次。在一系列圖片裡,讓同一個人物或產品保持一致很困難。詳細、重複的描述能有幫助,但不保證結果完全一致。

精確編輯一張真實照片。它能把背景、光線,和風格調整得不錯。但它無法可靠地把一個物件往左移動兩英寸。

關於使用這些成果:在任何生成的圖片用於商業用途之前,先查清楚規則。對長得像真實人物、可辨識地點,或在世藝術家獨特風格的圖片,要格外小心。不同工具的條款各不相同,而責任在於發布圖片的人身上。

操作清單
  • 包含全部六個要素:主體、場景、光線、構圖、風格、氛圍
  • 把你不想要的東西放進負面清單,絕不要放進主要描述裡
  • 要求文字AI根據你粗略的想法,寫出圖片提示詞
  • 用你實際需要的長寬比來產生圖片
  • 每次嘗試只改一個變數,這樣你才能知道是什麼改動有幫助
  • 在設計工具裡加上文字,而不是在圖片模型裡加
  • 儲存有效的提示詞,讓你的圖片看起來風格一致

常見問題

我需要有藝術技能才能產生AI圖片嗎?

不需要,但你需要描述能力,這正是新手低估的部分。一張令人失望的圖片和一張好圖片之間的差距,幾乎全都在於你把光線、構圖,和風格描述得多具體。如果詳細描述一個場景對你來說不是件自然的事,就要求文字AI把你粗略的想法,展開成一則結構化的提示詞。

我能用AI幫我想圖片的點子嗎?

能,而且它比大多數人以為的還有用。要求聊天機器人給你五個具描述性的構想,接著要求它把你最喜歡的那個,變成一則完整、結構化、附負面清單的圖片提示詞。語言模型寫圖片提示詞的能力,比大多數新手都好,這正是為什麼在聊天裡產生圖片,勝過一個獨立的圖片方框。

為什麼我圖片裡的文字看起來像亂碼?

因為圖片裡呈現的文字,真的是每一個圖片模型最弱的地方,沒有一則提示詞能可靠地修好它。簡短的單字有時候會正確出現;標題、標誌,和標籤通常不會。產生一張沒有文字的圖片,再用任何設計工具加上文字排版,這樣還能用對字型,並正確擺放位置。

哪個圖片產生器最好?

這比大多數人以為的更取決於主題。在寫實照片,和任何該看起來像是相機拍的內容上,Flux最強。在插畫上,Stable Diffusion提供更多的風格掌控和變化性。最快的判斷方式,是用同一則提示詞在兩者上都跑一遍,並排比較結果,因為在人像上贏的那個,在室內場景上往往不是贏家。

我需要另外訂閱圖片產生功能嗎?

不一定需要。圖片產生功能包含在Whizi的Pro以上方案裡,跟文字模型放在一起,能涵蓋一般的創意和內容工作,不必再付第二筆費用。對每天專業從事這項工作、想要非常精細風格掌控的人來說,一個專門的圖片工具依然有意義。