WhiziでAIモデルを並べて比較する方法

簡潔な回答

WhiziでAIモデルを並べて比較するには、チャットヘッダーのCompareを押し、各列にモデルを選び、同じプロンプトを両方に送ります。各列は自分の文脈を保持するため、どちらの答えももう一方に引きずられません。サイドバイサイドはPowerhouse機能で、各回答はそのモデル自身のクレジット料率で課金されます。

結論

チャットヘッダーのCompareを押し、各列にモデルを選び、同じプロンプトを両方に送ります。各列は隠された会話を独自に保持するため、どちらのモデルも相手の出力を見ることがなく、どちらの答えも引きずられません。これこそがこの比較に価値がある理由そのものです。列は左から右へ順に生成されます。1つのアカウントにつき同時に1つの生成しか走らないためです。

サイドバイサイド比較はPowerhouse機能で、一度に2つのモデルを動かします。各回答はそのモデル自身のクレジット料率で課金されるため、10クレジットのモデルと20クレジットのモデルを比較すると30クレジットかかります。

ある種の作業でどのモデルを既定にすべきか決めるために使ってください。2つの答えを比較するのではなく1つの答えを改善したい場合は、別の方法を取ります。同じスレッド内でモデルを切り替え、2つ目のモデルに最初の答えを批評させるのです。

ベンチマークがあなたの疑問に答えない理由

公開されているベンチマークは標準化されたタスクでの性能を測ります。あなたの疑問はもっと狭く、もっと役立つものです。自分が週に20回行うその作業で、どのモデルが優れているか、というものです。これは別の問いであり、あなた自身の作業量を抱えている人は他にいないため、2つ目の問いに公開された答えは存在しません。

1つのプロンプトを2つのモデルに送るのは30秒ほどで、その問いに直接答えます。重要なのは2つの答えを得ることではなく、その差がどれほど大きいかがわかることです。出力がほぼ同一のこともあり、その場合はその作業についてモデル選びを考えるのをやめてよいとわかります。片方が使い物にならないこともあり、それはワークフローを組む前に知っておく価値があります。

比較がもう1つ捉えるのは、自信満々な誤りです。事実に関する質問で2つのモデルが実質的に異なる答えを出すとき、少なくとも一方は間違っており、どちらか一方だけを読んでいたら気づけなかったはずです。この兆候は、単一モデルのワークフローではどんな価格でも得られません。

読む前に「良い」の基準を決める

サイドバイサイド比較の落とし穴は、より長く、より自信ありげで、より洗練された出力を好んでしまうことです。それらは品質ではありません。先に基準を決めてから読んでください。

タスク「良い」の意味無視すべきもの
文章作成そのまま送れるまでの編集が少ない長さ、語彙、熱意
事実調査主張を裏付け、確認できる出典流暢さと自信
抽出正しいスキーマ、架空フィールドなし、一貫したラベル表の周りの文章の質
推論手順が成り立ち、エッジケースに対応している結論が自分の予想と一致するか
コード失敗経路を処理し、レビューしやすい巧妙さ、簡潔さ
要約重要な点を残し、不要な点を落としている網羅性

実用的なコツとして、どちらの出力も読む前に、良い答えに含まれるべき内容を一文で書き出しておきます。読むのは10秒で済み、無意識に強く働く「洗練バイアス」を防げます。

事実に関する質問では、勝者ではなく不一致に注目してください。2つのモデルが特定の数字と出典で一致していれば、その確信度は妥当です。食い違う箇所こそ確認すべき点であり、この演習全体の中で最も価値のある成果です。

本当の違いを引き出すプロンプト

モデルをはっきり分ける作業もあれば、そうでない作業もあります。比較から何かを学びたいなら、特定の能力に負荷をかけるプロンプトを使ってください。

  • 困難な状況での口調。 締め切りに間に合わなかったことをクライアントに説明するメモを書いてください。過度に謝罪せず、言い訳もせず、責任を取る内容で。120語以内。 ここでは口調の違いがすぐに現れます。
  • 厳密な抽出。 この文章からすべての日付、金額、当事者を、これらのキーを使ったJSON配列として抽出してください。フィールドが存在しない場合はnullを使い、推測はしないでください。 形式規律と、でっち上げる傾向を試します。
  • 落とし穴のある推論。 直感的な解き方が誤りになる、比率や割合の問題など、もっともらしい誤答がある問題を与えます。近道を取るかどうかでモデルに差が出ます。
  • 長文脈からの想起。 長い文書をアップロードし、途中にある内容について尋ねます。宣伝されている文脈長ではなく、実際に使える文脈が明らかになります。
  • 無知を認めること。 [本当に無名か、非常に最近の何か]について何が発表されましたか? 最良の答えは明確な「わかりません」か、出典のある取得結果です。ここでの捏造は失格です。
  • 否定的な制約に従うこと。 比喩や例えを一切使わずにXを説明してください。 否定的な指示への従い方は、思っている以上にばらつきます。

パズルではなく自分の実際の仕事で比較を行ってください。ロジックパズルで優れているモデルより、あなたの四半期報告書で優れているモデルの方が役に立ちます。

1週間の比較をルーティングマップに変える

1回の比較は興味深いだけですが、1週間分の比較は行動につながります。ルーティンはこうです。

  1. 5日間、重要な作業のたびに、1つではなく2つのモデルにかけてみます。
  2. 作業の種類、勝者、差の大きさを記録します。3語で十分です。
  3. 週の終わりに、どのモデルが繰り返し勝っていたか、どこで出力が互換的だったかを確認します。
  4. そこから既定のモデルを決め、差が一貫してなかった作業では比較をやめます。

多くの人が気づくのは、比較が意味を持つのは自分の仕事のうち一部だけで、残りでは時間の無駄になるということです。素早い事実確認、単純な書き換え、日常的な整形はモデル間の差がほとんど出ません。顧客が読む文章、意思決定に使う調査、なじみのない事柄についての推論は、大きな差を生みます。

その結果こそが成果です。差が出ない場面での比較をやめ、結果を左右する作業のためだけに残せるようになります。

サイドバイサイド対シーケンシャル

区別しておく価値のある、2つの異なる手法です。

サイドバイサイドは、互いの出力を見ることができない2つのモデルに同じプロンプトを送ります。各列は独自の隠された会話を保持し、[Compare]という接頭辞が付けられてサイドバーには表示されません。そのため追加の質問をしても公正な比較のままです。どちらのモデルも独立した複数ターンの文脈を保持します。これは既定のモデルを選んだり、事実の食い違いを見つけたりするのに適した手法です。

シーケンシャルとは、答えを1つ得てから同じスレッド内でモデルを切り替え、新しいモデルにそれを批評させることです。比較を作るのではなく欠陥を見つけたいときに使います。2つ目のモデルが特定の論点に直接踏み込めるためです。会話の途中でモデルを切り替えるを参照してください。

大まかな目安として、どのモデルにするか決めるにはサイドバイサイド、答えを改善するにはシーケンシャルです。

チェックリスト
  • 比較する前に、通常のチャットでプロンプトを書いて磨いておく
  • どちらの出力も読む前に、この作業における「良い」の意味を決める
  • 洗練バイアスを避けるため、良い答えの一文を書いてから読む
  • 事実に関する質問では、不一致そのものを発見とみなし、確認しに行く
  • パズルではなく自分の実際の仕事で比較する
  • 1週間、勝者と差の大きさを記録し、そのパターンから既定を決める
  • 差が一貫してなかった作業では比較をやめる

よくある質問

一度に何個のモデルを比較できますか?

サイドバイサイド比較はPowerhouse機能で、一度に2つのモデルを動かします。これは意図的な設計です。2列こそが実際にじっくり読める配置だからです。3列になると流し読みになりがちで、流し読みはこの演習の目的を損ないます。この演習の価値は、答えが本当に異なる箇所に気づくことにあるからです。

サイドバイサイドは月間メッセージをより多く消費しますか?

はい、2倍かかります。2つのモデルがそれぞれ答えを出し、各回答はそのモデル自身のクレジット料率で課金されるため、10クレジットのモデルと20クレジットのモデルを比較すると、10や20ではなく30クレジットを消費します。誤った答えや使い物にならない下書きを、送信する前に見つけられるなら、たいていその価値はあります。効率的なやり方は、意思決定や成果物では比較を行い、日常的な調べ物や素早い書き換えには単一のモデルを使うことです。

両方の答えが同じくらい良い場合はどうすればよいですか?

それは実際に役立つ結果です。この作業がモデル選びに依存しないとわかるので、そこに注意を割くのをやめ、既定のモデルをそのまま使えばよいということです。多くの作業量はこのように分かれます。大半の作業ではモデルが互換的で、一部の作業では差が大きいのです。どちらがどちらかを見つけ出すことが、1週間比較を行う目的です。

より良く聞こえる答えをただ選んでしまうのを避けるにはどうすればよいですか?

読む前に基準を決めてください。より長く、より自信ありげで、より洗練された出力は、たとえ質が低くても一貫して好まれがちで、そのバイアスはほとんど無意識です。見る前に良い答えに含まれるべき内容を一文書いておくだけで、その大部分を打ち消せます。事実に関する作業では、答えの読み心地ではなく、出典が主張を裏付け、確認できるかどうかで判断してください。

どの2つのモデルを比較すればよいですか?

その特定の作業について実際に迷っている2つを比較してください。多くの人にとっては文章作成や推論ではClaudeとGPTの比較、文書が絡む場合は大きな文脈のモデルと既定のモデルの比較になります。決して使わないモデルとお気に入りのモデルを比較しても、行動につながる情報は何も得られません。