モデルとアプリとAPIは別物
ChatGPT、Claude、Geminiをめぐる議論の多くは、比べる層を間違えています。3つの名前はそれぞれ、モデル系統、一般ユーザー向けアプリ、開発者向けAPIという別々の製品をまとめて指しています。どれが勝つかは、買う層によって変わります。アプリの層では価格がほぼ横並びです。モデルの層はそうではありません。
APIの層では差が数字で出ます。Whiziコストインデックスが追っている2026年8月20日時点のOpenRouterの表示価格では、GPT-5.5は入力100万トークンあたり $5、出力100万トークンあたり $30、Claude Sonnet 5は入力 $2 と出力 $10、Gemini 3.5 Flashは入力 $1.50 と出力 $9 です。標準的な回答1件(入力1000トークン、出力500トークン)なら GPT-5.5, $0.02 / Sonnet 5, $0.007 / Gemini 3.5 Flash, $0.006 となります。同じ長さの回答で、GPT-5.5は他の2つの主力モデルのおよそ3倍かかります。
アプリの層では、主力プランの価格が寄っています。ChatGPT Plusは月 $20、Claude Proは $20(年払いなら月 $17)、Gemini AdvancedはGoogle AI Proに統合されて同じ $20 の段に収まりました。OpenAIは上限つきの日常利用向けにChatGPT Goを $8 でも売っています。つまり、サブスクの判断が価格で決まることはほとんどありません。決め手は、自分の実際の仕事を手直し少なく片づけてくれるのはどれか、です。
この記事はタスクごとに比較し、用途ごとに勝者を名指しします。3強の外まで候補を広げている段階なら、まずChatGPTの代替から読んでください。すでにこの3つに絞れているなら、下の振り分け表が短い答えで、さらに下のプロンプト手順がその裏づけです。
能力の比較:画像認識、ツール、長い文脈
2026年の能力論は、3つの事実が枠組みになります。まずコンテキストウィンドウはもう差になりません。Whiziコストインデックスでは GPT-5.5、Claude Sonnet 5、Gemini 3.5 Flash がいずれも1Mトークンで、それぞれ原稿用紙にしておよそ1900ページ分です。3つともマルチモーダルなので、画像とPDFは前提条件にすぎません。差が残っているのは価格で、主力モデル同士で3倍開きます。問いは「できるか」から「どれくらいうまく、いくらで」へ移ります。
| 能力 | ChatGPT(GPT-5.5) | Claude(Sonnet 5) | Gemini(3.5 Flash) | テストの仕方 |
|---|---|---|---|---|
| コンテキストウィンドウ | 1Mトークン | 1Mトークン | 1Mトークン | 長いPDFの300ページ目に事実を1つ埋めておき、ページ番号つきで答えさせる |
| 標準的な回答1件の費用 | $0.02 | $0.007 | $0.006 | 契約前に自分の実際の月間量を掛けて確かめる |
| メッセージ1件のWhiziクレジット | 20 | 10 | 8 | 既定のモデルで枠がどこまで持つか |
| 文章と編集 | 構造のある下書き、構成案、素早い案出し | 勝者。口調、長文の編集、丁寧な統合 | 文章の声では3つの中で最も弱い | 同じ荒い下書きと同じ読者で書かせ、あとから自分が入れた修正を数える |
| コードとデバッグ | 勝者。きれいな再現手順があれば段階的な修正とテストまで | 勝者。大きな差分のレビューとリファクタリング計画 | リポジトリ全体を1回のプロンプトで読ませる最安の方法 | バグ報告1件、失敗するテスト1つ、ファイルの抜粋1つで最小限の安全な変更を評価する |
それでも機能表だけでは何も決まりません。Gemini 3.5 FlashはSonnet 5と同じ100万トークンを、Sonnetの10に対して8 Whiziクレジットで受け取れますが、口調が問われる書き直しでは編集に1時間かかるほど外すこともあります。自分の仕事で試してください。下の手順に必要なのは、実際のタスク1件とタブ3つだけです。
用途別のベスト
2026年に最良のAIモデルとは、ブランドではなく振り分けの規則です。タスクごとに既定を1つ決め、タスクの形が変わったら挑戦させます。この記事の残りが裏づけるのは、次の振り分けです。
| タスク | 勝者 | 挑戦者 | 決め手になる数字 |
|---|---|---|---|
| 仕上げの文章と編集 | Claude | ChatGPT | Sonnet 5は標準的な回答1件 $0.007、Whiziでは10クレジット |
| きれいな再現手順からのデバッグ | ChatGPT | Claude | GPT-5.5は回答1件 $0.02 で、3つの中で最も高い |
| コードレビューとリファクタリング計画 | Claude | ChatGPT | GPT-5.5と同じ1Mウィンドウを、回答あたりおよそ3分の1の費用で |
| 長文の書類と混在メディア | Gemini | Claude | 入力100万トークン $1.50 で、主力モデルの中で最安の入力単価 |
| 資料一式からの調査統合 | Claude | Gemini | 1Mトークンのウィンドウに資料およそ1900ページ分が入る |
| 日常の安い大量処理 | Gemini | ChatGPT | Gemini 3.5 Flashは回答1件 $0.006、Gemini 3.7 Flashは $0.0013 |
数字はすべてWhiziコストインデックスからで、2026年8月20日時点の表示価格を、入力1000トークンと出力500トークンの標準的な回答で計算しています。
文章作成
文章はClaudeが勝ちます。粗いメモ、口調が問われる顧客向けメール、声を平板にせずに構成し直したい3000語の原稿を渡す相手はClaudeです。その一歩手前はChatGPTが勝ちます。構成案、フレームワーク、見出し案20本、そして散らかったメモを反応できる下書きに変える作業です。Geminiはこの分野を声で落としますが、原稿が大きな資料一式に依存するなら話は別で、背景資料500ページを読ませる費用は他の2つより安く済みます。GoogleとOpenAIの2モデル対決はGemini vs ChatGPTにまとめています。
出力を比べるには、この文章用のプロンプトを使ってください。「下の下書きを、懐疑的な現場責任者に向けて書き直して。主張は事実に基づいたまま、AIっぽい決まり文句は消し、具体例は残して、次の3つを返して。1)最終稿、2)加えた編集を3つ、3)公開前に自分で確認すべき主張を2つ。」
採点は第一印象ではなく、手直しにかかる時間で行ってください。勝者は、事実をすべて信頼したまま、いちばん少ない修正で公開できる下書きです。この記事の振り分けではそれがClaudeで、差は十分に大きく、最終原稿ならChatGPT Lunaの1クレジットに対してメッセージ1件10クレジットを払う価値があります。
コーディング
コーディングは条件ひとつで分かれます。きれいな再現手順があるときはChatGPTが勝ちます。失敗するテストから最小の修正まで段階的に進み、回帰テストも二度言わずに書きます。作業が機械的な処理ではなく判断のときはClaudeが勝ちます。大きな差分のレビュー、リファクタリングの計画、その修正がなぜ危ういかの説明などです。2モデルでの判断はClaude vs ChatGPTで詳しく分解しています。
このコーディング用のプロンプトを使ってください。「あなたはバグ修正をレビューしています。まず再現手順から、想定される根本原因を言い直して。次に、最も小さく安全な変更を提案して。そのあと、修正前には失敗し修正後には通るテストを挙げて。関係のないコードは書き換えないで。以下がバグ報告、関連するコード、テストの出力です。」
ここでのGeminiは3番手ですが、確かな居場所が1つあります。入力100万トークン $1.50 という価格は、コードベース全体を1Mトークンのウィンドウに載せて「この変更はどこに効くか」と聞く最も安い方法です。テストで何が勝っても原則は変わりません。AIが書いた変更は、テストと人間のレビューなしには出しません。最も小さい差分を提案するモデルが、翌週いちばん安くつくモデルです。
調べもの
調べものでは、自信ありげな文章より追跡できることが大事で、決まった資料一式からの統合はClaudeが勝ちます。資料から取ったものと自分で推測したものを、他の2つより明確に分けます。仕事の中身はまさにそこです。資料が膨大だったり形式が混在したりする場合はGeminiが挑戦者になります。1Mトークンのウィンドウにおよそ1900ページ分が入り、入力単価は3つの中で最も安いからです。ChatGPTは出典の扱いでは3番手ですが、まとまった調査を構造化した成果物に変える力では1番です。
この調べもの用のプロンプトを使ってください。「私が渡した情報源だけを使って質問に答えて。主張、情報源、確信度、備考の4列の表を作って。そのうえで250語程度で統合をまとめて。最後に、未解決の問いと、結論が変わるとしたらどんな証拠かを書いて。」
「渡した資料だけを使う」という指示を破ったモデルは、その時点で失格にしてください。出典つきの資料に外部知識を黙って混ぜるモデルは、ベンチマークの点数がどうであれ意思決定には使えません。同じ資料一式を3つとも一度通してみれば、その失敗は起きた瞬間にはっきり分かります。
書類仕事
書類仕事はGeminiが勝ちます。理由はもう容量ではなく価格です。主力3モデルはいずれも1Mトークン、原稿でおよそ1900ページ分を読めますが、そのウィンドウを埋める費用は入力100万トークンあたり Gemini 3.5 Flashで $1.50、Claude Sonnet 5で $2、GPT-5.5で $5 です。毎朝400ページの契約書を各モデルに渡すと、同じ読み込みがGPT-5.5では3倍を超えます。取り込みより成果物のほうが重いときはClaudeが挑戦者です。密度の高い資料が読みやすい文章になって出てくるからです。主力より下の層ではウィンドウの大きさがまだばらつくので(Claude Haiku 4.5は200K)、ブランドではなく個別のモデルを確認してください。
「これを要約して」で止めないでください。構成、固有名詞、決定事項、リスク、矛盾を出させ、ワークフローが対応しているならページ番号もつけさせ、そのうえで自信のない箇所に印をつけさせます。ページを示せない長文対応モデルは、真ん中を読んでいません。100万トークンの真ん中でこそ再現率が落ちる理由は、コンテキストウィンドウの比較で扱っています。
判断表
理由つきの判断表の全体です。勝者から始め、同じ入力で挑戦者にも本気の1回を与え、自分の採点基準を生き残ったほうを残してください。
| タスクがこれなら | まず使う | 挑戦させる | 理由 |
|---|---|---|---|
| 計画や構造のある回答の初稿 | ChatGPT | Claude | 白紙から反応できる下書きまでが最速 |
| 記事、メモ、顧客向け成果物の仕上げ | Claude | ChatGPT | 口調と編集で勝つ。Whiziではメッセージ1件10クレジット |
| 大きな書類の分析や抽出 | Gemini | Claude | 1Mウィンドウで最安の入力単価(100万トークン $1.50) |
| コードレビューやリファクタリング計画 | Claude | ChatGPT | 大きな差分の丁寧なレビューを、GPT-5.5の回答あたり費用のおよそ3分の1で |
| ログとテストを使ったデバッグ | ChatGPT | Claude | きれいな再現手順からの段階的な推論が最も強い |
| 画像、書類、文章が混ざる仕事 | Gemini | ChatGPT | 3つの中で最も安いマルチモーダルの取り込み |
| 資料一式からの調査統合 | Claude | Gemini | 出典と推測を分けるのが最もうまい |
| 予算を抑えた日常の大量処理 | Gemini 3.5 Flash か GPT-5.6 Luna | 3つとも | 標準的な回答1件で $0.006 と $0.0008 |
表が決めるのは、最初の1回を誰に任せるかだけです。その仕事を任せ続けるかどうかは、あなたのタスクであなたの採点基準が決めます。
繰り返し使えるA/B/Cプロンプトテストの手順
「ChatGPT、Claude、Geminiのどれがいいか」にいちばんきれいに答える方法は、議論をやめて同じプロンプトを3つすべてに通すことです。既定のモデルを決める前に、重要なワークフローではこの手順を使ってください。
- 本物のタスクを1つ選ぶ。お試しのプロンプトは使わないこと。今週じっさいに片づける必要がある仕事を選びます。営業メール、コードレビュー、市場調査の統合、PDFからの抽出、サポートの返信などです。
- 入力の一式を固定する。同じ元資料、制約、読者、希望する形式、品質の基準を、どのモデルにも同じように渡します。1つのモデルだけ多くの背景情報をもらっていたら、そのテストは公平ではありません。
- 答えを読む前に採点基準を決める。各出力を、正確さ、有用性、形式への準拠、編集にかかる時間、リスク、確信度の妥当さで、1から5点で採点します。
- 同じプロンプトを、文面を変えずに各モデルで走らせる。最初のプロンプトに不備があれば、一度だけ直して全モデルで走らせ直します。
- 2周目の挑戦をする。各モデルにこう尋ねます。「この答えの何が間違いうるか。どんな前提を置いたか。私は何を確認すべきか。」
- ワークフローのルールを決める。たとえば「最終的な文章はClaude、実装計画はChatGPT、長い書類はGemini、比べる価値があるほど重要な仕事はWhizi」といった具合にです。
コピペ用のテストプロンプト:「このワークフローのためにAIモデルを比べています。渡した背景情報だけを使って、下のタスクをやり遂げて。出力形式には正確に従って。答えのあとに、前提、リスク、確認チェックリスト、そしてプロンプトを改善する提案を1つ付けて。タスク:[タスクを貼る]。背景情報:[背景情報を貼る]。出力形式:[形式を貼る]。」
コスト:契約は1つか、複数か
2026年8月時点のサブスクの計算です。ChatGPT Plus、Claude Pro、Google AI Proはそれぞれ月 $20 前後なので、3つとも直接契約すると $60 近くになります。ChatGPTとClaudeを併用する最も安い方法で計算した組み合わせは、月およそ $28(ChatGPT GoとClaude Pro)か $40(PlusとClaude Pro)に収まりますが、どちらにもGeminiは入りません。
Whiziにまとめる根拠は、1つのプランで3系統すべてを扱える点です。月 $15.99(年払いなら $10.99)のStarterには、メッセージ1件1クレジットのChatGPT LunaとGemini Flashが入ります。正直に言うと落とし穴もあって、StarterにClaudeのモデルは1つも入りません。Claudeの行は上位プランにあり、Sonnet 5はメッセージ1件10クレジット、Opus 5は20クレジットです。1日中Claudeだけを使うなら、定額 $20 のClaude Proのほうが、Whizi Starterより多くのClaudeを使えます。直接契約がまとめ買いに勝つのは、まさにこの場合です。
いま使っている組み合わせをAIサブスク節約計算ツールに通し、その結果をWhiziの料金と突き合わせてください。ほしいのは数字です。いくら払っているか、まとめたらいくらか、そして乗り換えで実際に失うモデルはどれか。
同じプロンプトを複数のモデルで試す
結論をぼかさずに書きます。文章とコードレビューはClaude、デバッグと構造のある下書きはChatGPT、長文の書類と安い大量処理はGeminiです。この既定は、あなた自身のA/B/Cテストが違う結果を出すまで有効で、テストのほうがこのページより上位です。
Whiziなら同じプロンプトを3系統すべてに並べて流し、送信前にメッセージ1件の価格まで確認できます。ChatGPT Lunaは1クレジット、Gemini 3.5 Flashは8、Claude Sonnet 5は10、GPT-5.5は20です。単一プロバイダのアプリがこの比較を出すことはありません。競合のモデルに値段をつける提供元はないからです。
準備ができたらWhiziで比較を走らせて、いちばん繰り返しているタスクから始め、点数に振り分けを決めさせてください。
- どの層を買うのかをはっきりさせる。$20 のアプリはほぼ横並び、APIは価格が3倍違う。
- ChatGPT、Claude、Geminiをテストするときは、同じタスク、同じ背景情報、同じ出力形式を使う。
- 出力は正確さ、形式の遵守、手直しの時間、リスクで採点する。採点基準は読む前に書いておく。
- 1つの万能な勝者を決めようとせず、ChatGPT、Claude、Geminiを振り分けの仕組みとして使う。
- 2本目の $20 のプランを更新する前に、いまのAI支出を節約計算ツールで合計する。
よくある質問
ChatGPT、Claude、Geminiのどれが一番いいですか?
タスクごとに分かれます。仕上がった文章とコードレビューはClaude、きれいな再現手順からのデバッグと構造のある下書きはChatGPT、長文の書類仕事とマルチモーダルは最安のGeminiです。標準的な回答1件あたりの費用は Gemini 3.5 Flash $0.006、Claude Sonnet 5 $0.007、GPT-5.5 $0.02 です。
文章に最適なAIモデルはどれですか?
Claudeです。長い書き直しでも口調を保ち、書き手の声を平板にせずに編集できるので、この記事の振り分けでは最終原稿をClaudeに任せています。構成案や案出しの最初の一歩はChatGPTのほうが向いていて、Geminiが文章の仕事を取れるのは、原稿が数百ページの資料に依存するときだけです。
コーディングに最適なAIモデルはどれですか?
きれいな再現手順があるならChatGPT、レビューとリファクタリング計画ならClaudeです。同じバグ報告と失敗するテストを両方に渡し、最小限の安全な変更と回帰テストを必須にして、触るコードが少ないほうを採用してください。Geminiのコード面での強みは、1Mトークンのウィンドウでコードベース全体を安く読ませられることです。
AIの契約は複数した方がいいですか?
定価のままなら勧めません。直接契約3本は月 $60 近くになり、しかも大半のタスクで役割が重なります。いちばん多いタスクで勝つ1つに絞るか、まとめるかです。Whizi Starterは月 $15.99(年払いなら $10.99)で、Claudeが使えるのはPro以上です。