手短な答え
モデルピッカーを開き、上部のトグルをテキストから画像&動画に切り替えて、画像モデルを選び、生成したい画像を説明します。コンポーザーのヒントは「生成したい画像を説明してください...」に変わり、結果は同じ会話にそのままストリーミングされます。
| モデル | 用途 |
|---|---|
| Whizi Image | どんな画像でも作成できる、クリエイティブピッカーの一番上の行 |
| Nano Banana | 添付した写真を編集する |
| Flux | シャープなフォトリアル系アート |
| Stable Diffusion | Stability AIの画像モデル |
画像生成はProで月100枚、Powerhouseで500枚が含まれています。FreeとStarterの画像利用枠はゼロです。画像プロンプトは1文字から4,000文字まで指定でき、生成された画像は30日間保存され、それぞれにダウンロード用のコントロールが付いています。生成がエラーになりレンダリングされない場合は、原因を示す文言が表示されます。詳しくは画像生成が失敗する場合をご覧ください。
チャット内で生成することの違い
通常の画像生成ワークフローは、別のプロダクト、別のサブスクリプション、そして今取り組んでいる内容を何も知らない別の空白のボックスです。会話の中で生成すると、実務上2つの点が変わります。
まず、モデルはすでに文脈を把握しています。すでに20メッセージを費やしてキャンペーンのコンセプトを練り上げていたなら、「このためのヒーロー画像を生成して」という一言にそのすべてが含まれます。別のツールにブリーフを説明し直す必要はありません。
次に、テキストモデルを使って画像プロンプトを書かせることができます。これはほとんどの人が見落としているコツで、ClaudeやGPTにざっくりしたアイデアをきちんと構成された画像プロンプトに変換してもらい、それを実行します。言語モデルは画像プロンプトを書くのが多くの人よりもかなり上手です。形式が決まっており、大量の実例を見てきているからです。
プロンプト: テキストモデルに画像プロンプトを書かせる
次のアイデアの画像生成プロンプトを書いてください:[大まかなアイデア]。用途は[目的と掲載場所]です。被写体、動作や状態、舞台、照明、構図とフレーミング、媒体やレンズ、色調、雰囲気の順で構成してください。出てはいけないもののネガティブリストも加えてください。形容詞ではなく構図が異なる3パターンをください。
効果的なプロンプト構成
優れた画像プロンプトのほぼすべてが、だいたいこの順番で同じ7つの要素を持っています。抜けている要素はモデルが既定値で埋めてしまい、その既定値こそが、ありきたりなプロンプトがありきたりなストック画像を生み出す理由です。初めて書く場合は、AI画像の作り方でゼロから同じ内容を扱っています。
| 要素 | 書くべきこと | 省略した場合の影響 |
|---|---|---|
| 被写体 | 重要なディテールを含む具体的なもの | その名詞の最も一般的なバージョンになる |
| 動作や状態 | 何をしているか、どう佇んでいるか | 静的で、ポーズを取ったような、生気のない画像になる |
| 舞台 | どこで、どの範囲が見えているか | 空白か、ごちゃごちゃした既定の背景になる |
| 照明 | 向き、質、時間帯 | 平坦で均一に照らされた、特徴のない画像になる |
| 構図 | アングル、距離、フレーム内での被写体の位置 | 毎回センターの中距離ショットになる |
| 媒体やレンズ | 写真と焦点距離、またはイラストのスタイル | 光沢のあるデジタルアート寄りの既定値になる |
| 色と雰囲気 | パレットと感じ方 | 彩度が高すぎて、コントラストが強すぎる画像になる |
実例です。弱い例:オフィスで働く人。強い例:スタンディングデスクで印刷した図面を確認している50代の女性、左側の窓から差し込む午後遅くの光、肩越しにやや後ろから目線の高さで撮影、50mm、くすんだ緑と暖かいニュートラルカラー、落ち着いて急いでいない雰囲気。ネガティブ:カメラに向かってほほ笑むストックフォト風、散らかった机、目立つブランドロゴ、文字。
ネガティブリストは、思われている以上に重要です。生成された画像が「いかにも生成された感じ」に見える原因の多くは、繰り返し現れる一部のアーティファクトであり、それらを名指しすることで取り除けます:カメラに向かってほほ笑むストックフォト風、彩度が高すぎる、文字、透かし、指が多すぎる、左右対称の企業的な構図。
モデルを選ぶ
- Whizi Image:どんな画像でも作成できます。自社の生成モデルで、クリエイティブピッカーの一番上の行です。
- Nano Banana:すでに手元にある写真を編集するためのものです。写真を添付して変更内容を説明すると、画像を添付した時点でコンポーザーのヒントが生成用から編集用に切り替わります。
- Flux:シャープなフォトリアル系アートや、実際の写真と並べて使うものに向いています。
- Stable Diffusion(Stability AIのモデル):セカンドオピニオンとして。具体的なプロンプトに応え、同じ言葉からでも違う仕上がりを出します。
同じチャットの中でこれらを切り替えられるので、唯一重要な問いに答える最も速い方法になります。同じプロンプトを2つのモデルに通して、並べて見比べるのです。モデルの品質は被写体によって大きく変わり、ポートレートで勝つモデルがインテリアやフラットイラストでも勝つとは限りません。
堂々巡りにならずに反復する
よくある失敗は、より良い結果を期待して同じプロンプトを何度も再生成することです。それがある程度避けられないのは事実ですが、無駄になる試行の大半は、一度に複数のことを変えてしまい、何が効いたのか分からなくなることから生まれます。
- 1回の試行につき変える変数は1つだけ。 照明か、フレーミングか、パレットか。3つ全部ではありません。
- うまくいった点を言葉で残しておく。 画像が近づいてきたら、モデルが覚えていると仮定せず、次のプロンプトでその画像の良い点を説明してください。
- ディテールより先に構図を固める。 フレーミングと光を先に正しく決める方が、フレームの間違った位置にある被写体を完璧に仕上げるよりもはるかに効率的です。
- 最終的なアスペクト比で生成する。 正方形を横長のバナーにトリミングすると、意図した構図が失われます。実際に必要な比率を最初から指定しましょう。
- うまくいったプロンプトを保存する。 何度も貼り付けられる信頼できる8個のハウススタイルのプロンプトは、どの1枚の画像よりも価値があり、それを使い回すことでアセット一式がひとまとまりに見えるようになります。
すでに手元にある画像を編集する場合は、それをアップロードして変更内容を説明してください。背景、照明、パレットの調整にはよく効きますが、正確な構造上の編集にはあまり向いておらず、その場合は今も実際の画像編集ツールの方が速いです。
画像モデルがまだ苦手なこと
文字。 レンダリングされた文字は、どのモデルでも依然として最も弱い部分です。短い単語ならうまくいくこともありますが、見出し、ロゴ、ラベルは通常うまくいきません。画像は文字なしで生成し、デザインツールで文字を追加してください。
手、個数、繰り返される小さなディテール。 指、歯、椅子の脚、建物の窓など、モデルが数を数え間違える場所はすべてここに含まれます。使う前に必ず拡大して確認してください。
正確な空間指示。 「ちょうど3つの物体、赤いものは左側に」のような指示は信頼できません。配置が本当に重要な場合は、編集ツールで構成してください。
画像間の一貫性。 一連の画像で同じキャラクターや製品を同一に見せるのは難しいです。詳細で繰り返しの説明は助けになりますが、同一の結果が保証されるわけではありません。
利用について:生成物を有料の掲載物に使う前に権利を確認し、実在の人物、特定できる場所、存命のアーティストに関連づけられる独特なスタイルに似たものには特に注意してください。プロバイダーの規約はそれぞれ異なり、商業的なリスクは画像を公開した側が負うことになります。
- テキストモデルに大まかなアイデアから画像プロンプトを書かせる
- 被写体、動作、舞台、照明、構図、媒体、雰囲気の7要素すべてを含める
- 出てほしくないアーティファクトを名指しするネガティブリストを加える
- 実際に使うアスペクト比で生成する
- 1回の反復につき変数を1つだけ変える
- 同じプロンプトを2つのモデルに通して比較する
- 文字は画像モデルではなくデザインツールで追加する
- うまくいったプロンプトを再利用可能なテンプレートとして保存する
よくある質問
画像は月に何枚まで生成できますか?
Proは月100回の画像生成、Powerhouseは500回を含みます。FreeとStarterの画像利用枠はゼロなので、画像生成が使える最も安いプランはProです。週単位の請求サイクルでは、利用枠は月間の数値を4で割り、切り上げた値になります。反復こそが生成回数を消費する部分なので、最初に構成されたプロンプトを(できればテキストモデルで)書いておくと、使える画像にたどり着くまでの試行回数が目に見えて減ります。
既存の画像を編集できますか?
はい。画像&動画モードで写真を添付し、変更内容を説明してください。画像を添付した時点でコンポーザーのヒントが生成用から編集用に切り替わり、Nano Bananaが写真編集のために作られたモデルです。背景、照明、パレット、スタイルの調整にはよく効きます。物体を特定の距離だけ動かす、文字を変えるといった正確な構造上の編集にはあまり向いておらず、その場合は今も通常の画像編集ツールの方が速いです。
どの画像モデルを使うべきですか?
どんな画像でも作りたいならWhizi Image、添付した写真を編集するならNano Banana、実際の写真と並べるシャープなフォトリアル系アートならFlux、同じプロンプトから違う仕上がりが欲しいならStable Diffusionです。モデルの品質は被写体によって大きく変わるため、最も速い決め方は同じプロンプトを2つのモデルに同じチャット内で通し、結果を比較することです。
画像内の文字がおかしくなるのはなぜですか?
レンダリングされた文字は、どのモデルでも依然として最も弱い部分であり、どんなプロンプトでも確実には直りません。短い単語なら1つだけならうまくいくこともありますが、見出し、ロゴ、ラベルは通常うまくいきません。文字なしで画像を生成し、デザインツールでタイポグラフィを追加してください。正しいフォントと配置の適切なコントロールも手に入ります。
Whiziとは別に画像専用のサブスクリプションが必要ですか?
多くのキャンペーン、コンテンツ、コンセプト制作の作業では不要です。画像生成はPro(月100枚)とPowerhouse(500枚)に含まれており、一般的なマーケティングやソーシャル向けの出力であれば、単体のサブスクリプションと同じ範囲をカバーします。非常に特殊なスタイル要件があるチームや、作り直したくない既存のプロンプトライブラリを大量に持つチームには、専用ツールが依然として理にかなう場合もあります。