在提问之前先给数据做画像
电子表格分析出错最常见的原因,其实和AI无关。真正的问题是:文件里有14行地区名称带着多余的空格,日期格式还分两种,中间被人不小心留了一行小计,而你正要求平均值的那一列还有300个空白。如果你先提问,得到的只会是一个在垃圾数据上算出来的、看起来很自信的答案。
所以第一条提示词,在任何文件上都是一样的。
提示词:数据画像
在我们分析任何内容之前,先给这个文件做数据画像。请返回:行数,每一列的列名及推断出的数据类型,每列缺失值的数量和占比,完全重复行的数量,每一列若唯一值少于25个则列出所有唯一值,每个数值列和日期列的最小值和最大值,以及任何数值看起来不一致的列(格式混用、多余空格、单位混用、日期格式混用)。暂时不要分析或解读,只需告诉我文件里有什么,以及哪里看起来有问题。
光这一条提示词,就能拦下大部分原本会毁掉分析结果的问题。尤其是唯一值列表,你会从中发现"UK"、"U.K."和"United Kingdom"在你的数据里被当成了三个不同的地区。
提示词:修复发现的问题
将你发现的问题标准化:去除多余空格,把[列名]统一成单一格式,并合并以下这些变体:[列出它们]。在应用之前,先用表格向我展示你打算使用的映射关系。如果要删除任何行,必须先告诉我删除了哪些行以及原因。
提出能产生可核查答案的问题
含糊的问题只会得到含糊的答案。真正管用的提示词会明确指出列名、操作方式和输出格式,并要求对方展示计算过程。
提示词:附带计算过程的聚合
按[列名]分组,计算[指标]。返回一个Markdown表格,列出分组、该组的行数和对应指标。在表格下方,说明你具体是如何计算这个指标的,排除了哪些行以及原因,以及如何处理空白值。按[列名]降序排列。
提示词:分群问题
针对每个[分群维度,例如注册月份],按[时间间隔]计算[指标]。在每个数字旁边都标出该分群的规模。如果某个分群的行数少于[n],就标注为样本太小、不适合解读,而不是给出一个百分比。
最后这一条指令能防止电子表格分析中最容易造成误导的一种输出:一个只有四名用户的分群被报告为"75%留存率",还和一个九千人的分群并排出现在同一张表格里。
提示词:排查异常
这份数据里有哪些可疑之处?请留意:超出合理范围的数值、时间序列中的突然断层、分布在中途发生变化的列、完全重复或近似重复的行、显得过于整齐的数值,以及任何暗示数据采集方式发生变化的迹象。每一项都请引用具体的行。
这是本文里价值最高的一条提示词,在普通的电子表格工作流程中根本没有对应的操作。它经常能找出埋点失效的那一天、突然改用另一种货币上报的供应商,以及那次把整个季度数据夸大的重复导入。
提示词:图表规格
针对这个问题和这种数据形态,推荐合适的图表类型,并解释为什么那个看似显然的替代方案在这里其实更差。然后给我具体规格:图表类型、x轴、y轴、系列、聚合方式、排序方式和坐标轴处理方式。不要使用双坐标轴,也不要截断柱状图的坐标轴。
运算到底在哪里出错
这个问题值得一个直截了当的答案,因为"AI不擅长数学"这句话虽然没错,却含糊得没什么用。
语言模型在文本中对数字进行推理时,做的其实是模式补全,而不是真正的计算。它擅长描述结构、给行分类、判断你需要哪种计算方式。但让它在几百行数据上完成一长串运算,可靠性就大打折扣,而且它会悄无声息地出错:输出的是一张格式工整、数字却是错的表格,看不出任何异常信号。
几条实用的原则:
- 要方法,不要只要结果。"确切说明你是怎么计算的,排除了什么"这样的要求,能让存在的错误暴露出来。
- 手动抽查一组数据。在输出表格中挑最小的一组,去实际表格里核实。如果对得上,方法大概率是对的;如果对不上,整张表都不能信。
- 用第二个模型交叉核对任何有实际影响的结果。两个独立的模型算出同一个数字,是比一个模型重复自己更有力的证据。Whizi的并排对比视图正是为此而设计的。
- 留意重复计数。文件里遗留的小计行和一对多的关联,是两个最常见的元凶,而模型并不知道它们是错的。
- 凡是必须精确的结果,就要公式或代码。
给我Excel公式或给我pandas代码能把运算交给一个确定性的引擎去做,模型则专心做它擅长的部分,也就是判断该用哪种计算方式。
最后这一条,才是财务或报表类工作真正的答案:用模型来设计分析思路,用你的电子表格或脚本来执行计算。
哪个模型该读哪种文件,多大算太大?
CSV和Excel都可以直接上传,三个模型之间的分工也很清晰。
| 模型 | 上下文窗口 | 每条消息消耗积分 | 适用场景 |
|---|---|---|---|
| GPT-5.6 Terra | 100万tokens | 4 | 严格格式:整洁的表格、JSON、精确的列映射 |
| Claude Sonnet 5 | 100万tokens | 10 | 多步聚合运算的交叉核对 |
| Gemini 3.5 Flash | 100万tokens,约1900页书稿 | 8 | 最大体量的文件,或在同一对话中同时分析电子表格和PDF |
上下文和积分数据来自Whizi的模型成本索引,价目表抓取于2026-08-20。
几个实用建议:
- 给它一张干净的矩形表。一行表头,没有合并单元格,没有留白的间隔行,K列里也没有备注。多层表头的格式化报表比任何文件大小限制都更容易搞乱提取结果。
- 发送原始表,而不是演示版表格。带格式和小计的那个版本,正是导致重复计数的版本。
- 列很多的文件,先要一份列说明。如果列名难以理解,就在分析之前先问模型每一列是什么意思,并告诉模型它理解错的地方。
- 文件特别大时,用Gemini 3.5 Flash,它和Claude Sonnet 5、GPT-5.6 Terra读取相同的100万tokens上下文,而且是三者中每次回答成本最低的。再往上,就要有意识地抽样:
随机抽取5000行样本进行分析,并告诉我每个数字应该预期多大的抽样误差,这比让文件被悄悄截断要好得多。 - 先剥离个人数据。姓名、邮箱和身份标识几乎从来都不是分析所需要的,提前删除它们,比争论你是否有权上传它们要快得多。
上传的具体操作细节,参见上传文档。
在真实文件上的完整八步流程
在真实文件上的完整工作流程,按顺序如下:
- 上传文件,运行数据画像提示词,仔细阅读唯一值列表和缺失值统计。
- 修复发现的问题,在应用映射表之前先审阅一遍。
- 让模型总结这份数据大致讲的是什么,以及它认为你应该问的三个问题。这一步很快,也常常会让你重新思考该怎么分析。
- 提出你真正想问的问题,并要求答案里包含计算方法和排除项。
- 每次都要运行异常排查提示词,惊喜通常就藏在这里。
- 手动抽查其中最小的一组数据。
- 用第二个模型交叉核对最核心的那个数字。
- 要图表规格,如果数字必须精确且可复现,就要公式。
第1、5、6步是大家最容易跳过的步骤,也正是这几步,决定了你的分析是站得住脚的,还是一份包装精美的猜测。
- 在提出任何分析性问题之前,先给文件做画像
- 查看唯一值列表,找出拼写变体和格式混用的问题
- 要求每个数字都附带计算方法和排除项
- 把样本太小的分组标注出来,而不是为它们报告百分比
- 务必运行"这份数据里有哪些可疑之处"这条提示词
- 在相信表格之前,先手动抽查最小的一组
- 用第二个模型交叉核对有实际影响的数字
- 当数字必须完全准确时,就要公式或代码
常见问题
我的电子表格能有多大?
这取决于你的套餐和使用的模型,实际的限制是模型的上下文窗口,而不是文件大小上限。在Whizi中,Claude Sonnet 5、GPT-5.6 Terra和Gemini 3.5 Flash都能读取100万tokens的上下文,大约相当于1900页书稿的数据量。超过这个范围,就要有意识地抽样,并让模型说明抽样误差,而不是任由文件被悄悄截断,因为那种失败模式会让你对一小部分数据得到过度自信的答案。
AI能发现我电子表格里的错误吗?
可以,而且这是目前最划算的提示词之一。询问数据里有哪些可疑之处,能稳定地发现重复导入、埋点失效的那一天、单位或货币混用、遗留在数据中的小计行,以及分布在文件中途发生变化的情况。让它引用具体的行,这样你就能逐一核实每个发现,而不是全盘相信这份清单。
它给出的数字能相信吗?
结构可以相信,运算需要核实。语言模型擅长判断需要哪种计算方式、描述数据集里有什么,但在跨越大量行的长串运算上就比较弱,会悄无声息地给出一个格式工整的错误答案。手动抽查最小的一组,用第二个模型交叉核对核心数字,对必须精确的结果,就要Excel公式或Python代码,自己运行一遍。
做电子表格工作,哪个模型最好?
结构化推理、严格的输出格式、整洁的表格或JSON,用GPT。多步聚合运算的交叉核对,用Claude,因为它出错的方式往往和GPT不一样。文件特别大,或者想在同一个对话里同时分析电子表格和PDF、报告,就用Gemini。
它能处理Excel公式和多个工作表吗?
它读取的是数值,而不是运行你的工作簿,所以公式的计算结果会显示出来,但实时的公式逻辑不会。对于多工作表的文件,要说明你指的是哪一个工作表,并描述各表之间的关系,或者把你关心的那个工作表导出为CSV。为演示而制作的文件,比如带合并单元格、数据中混有小计行的文件,造成的问题远比文件本身大要多得多。