データに質問する前にまずプロファイリングする
スプレッドシート分析が失敗する最も一般的な原因は、AIとは関係ありません。地域名の末尾に空白が入った行が14行あったり、日付の形式が2種類混在していたり、誰かが途中に残した小計行があったり、これから平均を取ろうとしている列に300個の空欄があったりするからです。質問を先に投げれば、ゴミデータの上で計算された自信満々な答えが返ってくるだけです。
だから最初のプロンプトはどのファイルでも同じです。
プロンプト:プロファイリング
このファイルを分析する前にプロファイリングしてください。次を返してください。行数、推定される型を含む列名、列ごとの欠損値の件数と割合、完全に重複する行の数、値の種類が25未満のすべての列についての一意な値、すべての数値列と日付列の最小値と最大値、そして値が一貫していないように見える列(形式の混在、末尾の空白、単位の混在、日付形式の混在)。まだ分析や解釈はしないでください。ファイルに何が含まれていて、何がおかしいのかだけを教えてください。
このプロンプト一つで、分析を台無しにしかねない問題の大半を捕まえられます。特に一意な値のリストからは、「UK」「U.K.」「United Kingdom」がデータ上では別々の3つの地域として扱われていることが発覚したりします。
プロンプト:見つかった問題を修正する
特定した問題を標準化してください。空白をトリムし、[列]を単一の形式に統一し、次のバリエーションを統合してください:[列挙]。適用する前に、適用するマッピングを表として見せてください。行を削除する場合は、削除する前にどの行をなぜ削除するのか必ず伝えてください。
検証可能な答えが返ってくる質問をする
曖昧な質問には曖昧な答えしか返ってきません。うまくいくプロンプトは、列名、演算、出力形式を明示し、計算過程も求めます。
プロンプト:計算過程を示した集計
[列]でグループ化し、[指標]を計算してください。グループ、そのグループの行数、指標の値を含むMarkdownの表を返してください。表の下に、指標をどう計算したか、どの行を除外してその理由、欠損値をどう扱ったかを正確に記してください。[列]で降順に並べ替えてください。
プロンプト:コホートの質問
各[コホートの軸、例えば登録月]について、[間隔]ごとに[指標]を計算してください。すべての数値の横にコホートのサイズを示してください。行数が[n]未満のコホートは、割合として報告せず、解釈するには小さすぎるとフラグを立ててください。
最後の指示は、スプレッドシート分析で最も誤解を招く出力を防ぎます。4人しかいないコホートが「継続率75%」として報告され、9000人のコホートと同じ表に並んでしまうケースです。
プロンプト:異常検知
このデータの何が怪しいか教えてください。妥当な範囲を外れた値、時系列の急な断絶、途中で分布が変化する列、完全または近似的な重複行、丸すぎるように見える値、データの収集方法が変わったことを示唆する兆候を探してください。それぞれについて、該当する具体的な行を引用してください。
これはこのページで最も価値のあるプロンプトで、通常のスプレッドシート作業には相当するものがありません。トラッキングが壊れた日、途中から異なる通貨で報告し始めたベンダー、四半期の数値を水増しした重複インポートなどを日常的に見つけ出します。
プロンプト:チャートの仕様
この質問とこのデータの形状に適したチャートを提案し、なぜ他の一見わかりやすい選択肢がここでは劣るのかを説明してください。次に仕様を教えてください。チャートの種類、x軸、y軸、系列、集計方法、並び順、軸の扱い。二重軸は使わないでください。棒グラフの軸を途中で切らないでください。
計算が実際にどこで間違えるか
これには率直な答えが必要です。「AIは計算が苦手」というのは真実である一方、あまりに漠然としていて役に立たないからです。
文章中の数値について推論する言語モデルは、計算をしているのではなくパターン補完をしています。構造を説明したり、行を分類したり、必要な計算を特定したりするのは得意です。しかし何百行にもわたる長い算術の連鎖を実行するのはずっと苦手で、しかも静かに失敗します。出力は警告サインのない、きれいに整った間違った数字の表になります。
実践的なルールです。
- 結果だけでなく計算方法を求める。 「これをどう計算したか、何を除外したかを正確に述べてください」と求めれば、間違いがあった場合にそれが見えるようになります。
- 一つのグループを手作業で照合する。 出力された表の中で最も小さいグループを選び、実際のスプレッドシートで検証します。一致すれば方法はおそらく正しく、一致しなければ表の中の何も信用できません。
- 重要なものは第二のモデルで照合する。 独立した2つのモデルが同じ数字にたどり着くことは、1つのモデルが同じことを繰り返すよりも意味のある証拠です。Whiziの並列表示ビューはまさにこのためにあります。
- 二重カウントに注意する。 ファイルに残った小計行と、1対多の結合が二大原因で、モデルはそれが間違っていることに気づきません。
- 正確でなければならないものは、数式やコードを求める。 「Excelの数式を教えてください」や「pandasのコードを教えてください」と頼めば、計算を決定論的なエンジンに任せられます。モデルには得意な部分、つまりどの計算を実行すべきかを判断する役割を残せます。
最後の項目こそが、財務やレポート業務における本当の答えです。分析の設計にはモデルを使い、実行にはスプレッドシートやスクリプトを使いましょう。
どのモデルがどのファイルを読むか、どこまでの大きさなら大丈夫か
CSVもExcelもそのままアップロードでき、3つのモデルで作業がきれいに分担できます。
| モデル | コンテキストウィンドウ | メッセージあたりのクレジット | 使い所 |
|---|---|---|---|
| GPT-5.6 Terra | 100万トークン | 4 | 厳密な形式:整ったテーブル、JSON、正確な列のマッピング |
| Claude Sonnet 5 | 100万トークン | 10 | 複数ステップの集計に対する照合パス |
| Gemini 3.5 Flash | 100万トークン、原稿換算で約1,900ページ | 8 | 最大級のファイル、またはスプレッドシートとPDFを1つのスレッドで扱う場合 |
コンテキストとクレジットの数値はWhiziのモデルコストインデックスによるもので、料金は2026年8月20日時点のリスト価格です。
実践的な注意点をいくつか。
- きれいな長方形のデータを渡す。 ヘッダー行は1行だけ、結合セルなし、空白の区切り行なし、K列に注釈なし。複数ヘッダーで整形されたレポートは、どんなファイルサイズの上限よりも抽出を混乱させます。
- プレゼン用シートではなく、生のシートを送る。 書式や小計が入ったバージョンは二重カウントを引き起こします。
- 非常に横に長いファイルは、まず列のリストがあると役立つ。 列名が読み取りにくい場合は、分析の前に各列の意味を尋ね、モデルが間違えた部分を伝えてください。
- 非常に大きなファイルにはGemini 3.5 Flashを使う。 Claude Sonnet 5やGPT-5.6 Terraと同じ100万トークンのコンテキストを、3つの中で最も低い回答あたりのコストで読み込めます。それを超える場合は、意図的にサンプリングしましょう。「ランダムに5000行のサンプルを分析し、各数値で見込まれるサンプリング誤差を教えてください」と頼む方が、黙って切り捨てられるより優れています。
- まず個人情報を取り除く。 氏名、メールアドレス、識別子は分析にほぼ不要で、それらを削除する方が、アップロードが許されるかどうかを議論するより早く済みます。
アップロードの詳しい仕組みはドキュメントのアップロードで解説しています。
実際のファイルにおける8ステップの全体像
実際のファイルにおけるワークフロー全体を順番に示します。
- アップロードする。プロファイリングのプロンプトを実行する。一意な値と欠損数を注意深く読む。
- 見つかった問題を修正する。適用する前にマッピング表を確認する。
- データが何についてのものか、そしてモデルが尋ねるべきだと考える3つの質問の要約を求める。このステップは短時間で、分析の枠組みを大きく変えることが多い。
- 実際の質問をする。答えには計算方法と除外事項を必須にする。
- 常に異常検知のプロンプトを実行する。ここに驚きが隠れている。
- 最小のグループを手作業で照合する。
- 見出しとなる数字を第二のモデルで照合する。
- チャートの仕様を求める。数値が正確で再現可能である必要がある場合は数式を求める。
ステップ1、5、6は人々が飛ばしがちな部分ですが、まさにこの3つが、根拠を持って擁護できる分析と、見た目だけ整った当てずっぽうとを分けています。
- 分析の質問を一つでもする前に、ファイルをプロファイリングする
- 一意な値のリストを読み、表記ゆれや形式の混在を見つける
- すべての数値について、計算方法と除外事項を必須にする
- 小さなグループは割合として報告せず、小さすぎるとフラグを立てる
- 「このデータの何が怪しいか」というプロンプトを必ず実行する
- 信頼する前に、最小のグループを手作業で照合する
- 重要な数値は第二のモデルで照合する
- 数値が正確でなければならないときは、数式やコードを求める
よくある質問
スプレッドシートはどのくらいの大きさまで扱えますか。
プランとモデルによって異なりますが、実用上の上限はファイルサイズの制限ではなく、モデルのコンテキストウィンドウです。Claude Sonnet 5、GPT-5.6 Terra、Gemini 3.5 Flashはいずれも、Whizi内で100万トークンのコンテキスト、データにして原稿換算で約1,900ページを読み込めます。それを超える場合は意図的にサンプリングし、ファイルが黙って切り捨てられるのではなく、サンプリング誤差をモデルに明示させましょう。これはデータのごく一部について自信満々な答えを生む失敗モードです。
AIは自分のスプレッドシートの誤りを見つけられますか。
はい、これは利用できる中で最も効果の高いプロンプトの一つです。「このデータの何が怪しいか」と尋ねれば、重複したインポート、トラッキングが壊れた日、単位や通貨の混在、データ内に残った小計行、途中で変化する分布などを確実に見つけ出せます。該当する具体的な行を引用させれば、リストを鵜呑みにせず各発見を検証できます。
AIが出す数字は信用できますか。
構造は信用し、計算は検証しましょう。言語モデルは必要な計算を見極めたり、データセットの中身を説明したりするのは得意ですが、多くの行にわたる長い算術の連鎖には弱く、きれいに整った間違った答えで静かに失敗します。最小のグループを手作業で照合し、見出しとなる数字を第二のモデルで照合し、正確でなければならないものについてはExcelの数式やPythonのコードを求めて自分で実行しましょう。
スプレッドシート作業にはどのモデルが最適ですか。
構造化された推論、厳密な出力形式、整ったテーブルやJSONにはGPT。複数ステップの集計の照合には、同じ間違いではなく違う間違いをする傾向があるためClaude。ファイルが非常に大きい場合や、同じ会話内でスプレッドシートとPDFやレポートを合わせて分析したい場合にはGemini。
Excelの数式や複数シートにも対応していますか。
ワークブックを実行するのではなく値を読み取るため、数式の結果は反映されますが、生きた数式のロジックは反映されません。複数シートのワークブックでは、どのシートを指しているか、シート同士がどう関係しているかを伝えるか、対象のシートをCSVとして書き出してください。結合セルや小計がデータ内に混在した、プレゼン用に作られたファイルは、大きなファイルよりもはるかに多くの問題を引き起こします。