如何在Whizi對話中生成圖片

快速解答

要在Whizi對話中生成圖片,打開模型選單,把「文字」切換成「圖片與影片」,選擇Whizi Image、Nano Banana、Flux或Stable Diffusion,然後描述你想要的圖片。Pro方案(每月100張)和Powerhouse方案(500張)都包含圖片生成功能。在同一段對話裡反覆修改,再下載結果。

簡短答案

打開模型選單,把上方的切換開關從「文字」切換成「圖片與影片」,選擇一個圖片模型,然後描述你想要的圖片。輸入框的提示文字會變成「描述你想生成的圖片…」,結果會直接串流回到同一段對話裡。

模型用途
Whizi Image製作任何圖片,是創意選單中的第一個選項
Nano Banana編輯你附加的照片
Flux銳利的擬真藝術風格
Stable DiffusionStability AI推出的圖片模型

圖片生成功能包含在Pro方案內,每個計費月可生成100張,Powerhouse方案則是500張。Free和Starter帳號的圖片額度是零。一則圖片提示可以是1到4,000個字元,生成的圖片會保留30天,每張圖片上都有下載按鈕。如果生成失敗而不是成功產出結果,錯誤訊息會說明原因,詳見圖片生成失敗

為什麼在對話裡生成圖片不一樣

一般的圖片生成流程是另一套產品、另一份訂閱,還有一個完全不知道你在做什麼的空白輸入框。直接在對話裡生成圖片,會改變兩件實際的事。

第一,模型已經有上下文。如果你才剛花了二十則訊息討論一個活動概念,這時說「幫我生成這個的主視覺」就已經帶著所有背景資訊。你不必再向另一個工具重新描述一次需求。

第二,你可以用文字模型來撰寫圖片提示詞。這是大多數人忽略的技巧:請ClaudeGPT把你粗略的想法轉換成結構完整的圖片提示詞,再拿去執行。語言模型在撰寫圖片提示詞這件事上,通常比大多數人都拿手,因為這是一種固定的格式,而且它們看過非常多這類範例。

提示詞:讓文字模型幫你寫圖片提示詞

幫我寫一段圖片生成提示詞,主題是:[粗略的想法]。用途是:[用途與放置位置]。請依照以下順序組織:主體、動作或狀態、場景、光線、構圖與取景、媒材或鏡頭、色彩處理、氛圍。並加上一份「絕對不能出現」的負面清單。給我三個版本,差異在構圖而非形容詞。

有效的提示詞結構

幾乎每一則好的圖片提示詞,都依照大致相同的順序包含這七個部分。缺少的部分會由模型用預設值補上,而這些預設值正是為什麼籠統的提示詞會產生千篇一律的圖庫感圖片。如果這是你第一次寫圖片提示詞,如何製作AI圖片從頭說明了同樣的內容。

部分該寫什麼省略的後果
主體具體的事物,加上真正重要的細節得到這個名詞最普通的版本
動作或狀態它正在做什麼,或呈現什麼姿態靜止、擺拍、毫無生氣
場景地點,以及畫面中能看到多少範圍空白或雜亂的預設背景
光線方向、質感、一天中的時段平淡、均勻打光、缺乏個性
構圖角度、距離、主體在畫面中的位置每次都是置中的中景
媒材或鏡頭攝影的焦段,或是插畫風格預設變成光滑的數位藝術風格
色調與氛圍色彩配置與情緒過度飽和、對比過高

來看一個實際範例。弱:一個在辦公室工作的人。強:一位五十多歲的女性站在站立式辦公桌前檢視列印出來的圖稿,午後陽光從她左側的窗戶照進來,鏡頭從她肩膀後方稍微偏低的角度拍攝,與視線同高,50mm鏡頭,柔和的綠色調與溫暖的中性色,氣氛平靜而不匆忙。負面清單:對著鏡頭微笑的圖庫照片感、雜亂的桌面、可見的品牌標誌、文字。

負面清單比大多數人以為的更重要。讓生成圖片看起來一眼就是「生成的」,通常來自一小組反覆出現的瑕疵,把它們指名列出就能去除:圖庫照片式微笑過度飽和文字浮水印多餘的手指對稱的公司感構圖

選擇模型

  • Whizi Image用來製作任何圖片。它是內建生成器,也是創意選單中的第一個選項。
  • Nano Banana用來編輯你已經擁有的照片。附加圖片並描述你想要的改動,只要一附加圖片,輸入框的提示文字就會從生成切換成編輯。
  • Flux適合銳利的擬真藝術風格,也適合任何需要和真實攝影並列呈現的作品。
  • Stable Diffusion是Stability AI推出的模型,可以當作第二種意見:它對具體的提示反應良好,同樣的文字也能產生不同的風格。

你可以在同一段對話裡切換不同模型,這是回答唯一重要問題最快的方法:把同一句提示詞分別丟給兩個模型,然後把結果並排比較。模型的表現會因主題而有很大差異,人像表現最好的模型,未必是室內空間或平面插畫表現最好的那一個。

如何反覆修改而不是原地打轉

常見的失敗做法,是不斷重新生成同一句提示詞,指望能碰運氣出一張更好的結果。這有一部分無可避免,但大多數浪費掉的嘗試,都是因為一次改了好幾件事,結果搞不清楚到底是哪個改動有幫助。

  • 每次只改一個變數。光線、構圖或色調,不要三個一起改。
  • 把有效的部分寫成文字。當某張圖片已經很接近理想時,在下一次提示中描述它哪裡做對了,而不要假設模型還記得。
  • 先修正構圖,再修正細節。先把取景和光線調對,會比修飾一個位置本身就不對的主體有效率得多。
  • 以最終需要的長寬比生成。把正方形裁成寬版橫幅,會犧牲你原本要求的構圖。一開始就直接要求你實際需要的比例。
  • 儲存有效的提示詞。八組可靠、能重複貼上使用的固定風格提示詞,價值超過任何單一一張圖片,而重複使用它們,正是讓一整套素材看起來像同一套的關鍵。

如果要編輯你已經有的圖片,上傳它並描述你想要的改動。這種方式很適合調整背景、光線和色調,但不太適合精確的結構性修改,那類修改在真正的圖片編輯軟體裡處理,速度依然比較快。

圖片模型目前仍然做不好的事

文字。在所有模型中,圖片裡呈現的文字仍然是最弱的一環。簡短的單字有時能正確出現,但標題、標誌或標籤通常不行。先生成沒有文字的乾淨圖片,再用你的設計工具加上文字。

手部、數量與重複的小細節。手指、牙齒、椅腳,還有建築物上的窗戶,都是模型最容易數錯的地方。使用任何圖片前,先放大檢查。

精確的空間指示。「剛好三個物件,紅色那個在左邊」這類指示並不可靠。如果排列方式真的很重要,就在你的編輯軟體裡自己排版。

跨圖片的一致性。要讓同一個角色或產品,在一系列圖片中呈現得完全一致並不容易。詳細且重複的描述會有幫助,但無法保證得到完全相同的結果。

關於使用權:在任何生成內容用於付費用途之前,先確認你的使用權利,尤其要特別留意任何近似真實人物、可辨識地點,或和某位在世藝術家風格高度相似的內容。各家供應商的條款不盡相同,一旦圖片發布出去,商業風險就落在發布者身上。

操作清單
  • 請文字模型根據你粗略的想法撰寫圖片提示詞
  • 包含全部七個部分:主體、動作、場景、光線、構圖、媒材、氛圍
  • 加上一份負面清單,指名你絕對不想出現的瑕疵
  • 以你實際會用到的長寬比生成
  • 每次反覆修改只改一個變數
  • 把同一句提示詞丟給兩個模型並比較結果
  • 文字用設計工具加上,不要靠圖片模型生成
  • 把有效的提示詞儲存成可重複使用的範本

常見問題

我每個月可以生成多少張圖片?

Pro方案每個計費月包含100次圖片生成,Powerhouse方案則是500次。Free和Starter帳號的圖片額度是零,所以Pro是最低、包含圖片生成功能的方案。如果是週結算週期,額度就是月額度除以四後無條件進位。由於反覆修改正是消耗生成次數的地方,先寫一份結構完整的提示詞(最好搭配文字模型),能明顯減少產出一張可用圖片所需的嘗試次數。

我可以編輯現有的圖片嗎?

可以。在「圖片與影片」模式下,附加照片並描述你想要的改動;只要一附加圖片,輸入框的提示文字就會從生成切換成編輯,而Nano Banana正是專為照片編輯打造的模型。這種方式很適合調整背景、光線、色調和風格。但不太適合精確的結構性修改,例如把物件移動特定距離或修改文字,那類修改在一般的圖片編輯軟體裡處理依然比較快。

我應該使用哪一個圖片模型?

製作任何圖片用Whizi Image,編輯你附加的照片用Nano Banana,需要與真實攝影並列的銳利擬真藝術風格用Flux,想要用同一句提示詞得到不同風格則用Stable Diffusion。由於模型表現會因主題有很大差異,最快的判斷方式,就是把同一句提示詞在同一段對話裡分別丟給兩個模型,然後比較結果。

為什麼我圖片裡的文字會出錯?

在所有圖片模型中,呈現文字仍然是最弱的一環,沒有任何提示詞能可靠地解決這個問題。簡短的單字有時能成功,但標題、標誌和標籤通常不行。生成不含文字的乾淨圖片,再用你的設計工具加上字體排印,這樣也能讓你使用正確的字型,並精確控制文字位置。

我需要在Whizi之外,另外訂閱一個圖片生成服務嗎?

對大多數活動、內容和概念發想的工作來說,不需要。圖片生成功能已經包含在Pro(每月100次)和Powerhouse(500次)方案內,涵蓋一般行銷與社群輸出時,獨立訂閱服務所能提供的內容。如果團隊有非常特定的風格需求,或是已經建立了龐大的提示詞庫且不想重新打造,獨立工具仍然有其意義。