支持的文件类型,以及每种类型实际发生了什么
把文件拖进对话框或点击回形针图标附加它,然后提出你的问题。模型收到的内容因文件类型而异,弄清楚这一点能解释大多数出乎意料的结果。
| 类型 | 扩展名 | 模型处理的内容 |
|---|---|---|
| 文本型PDF | 按阅读顺序提取的文字,表格也会转成文字 | |
| 扫描版PDF | 服务器端视觉识别生成的逐页文字稿 | |
| Word文档 | .docx | 在你的浏览器中提取出的文档文字 |
| 表格 | .xlsx, .csv | 以文字形式呈现的单元格数值,不是可运行的公式 |
| 图片 | .png, .jpg, .jpeg | 图片本身,由多模态模型读取 |
| 代码和纯文本 | .py, .js, .ts, .go, .md, .txt等 | 文件的原始内容 |
有两点值得记住。第一,表格文件是以数值而非可运行工作簿的形式送达的,所以模型能读到公式算出的结果,却无法重新执行公式。第二,扫描版PDF经过的是视觉识别转录,而不是纯文本提取,不常见的字体、手写批注或低分辨率扫描仍可能导致数字中出现读错的字符。请拿扫描文档得出的数字去核对原件。关于图片还有一点:对话框不接受GIF文件,会要求换成PNG或JPEG。
在提问之前先准备好文件
这里花五分钟,能省掉之后一场令人困惑的对话。
- 给文件起一个能说明内容的名字。模型能看到文件名,
2025-q3-vendor-contract-acme.pdf比document(3).pdf提供的有用信息多得多。一旦对话里有好几个文件,这一点的重要性会大大增加。 - 发送原始版本,而不是排版好的展示版。尤其是表格,含合并单元格、数据里穿插小计、边距里有批注的版本,比一份干净的大文件更容易出错。
- 按用途拆分超大文档,而不是按大小拆分。如果你只需要方法论和结果部分,上传这些部分要比上传400页、再指望模型的注意力刚好落在正确位置更靠谱。
- 去掉不需要的个人信息。姓名、邮箱和身份标识很少是分析所必需的,提前删掉它们,比事后纠结自己是否有权上传它们要快。
- 确认一份PDF是否真的是文字版。试着在你的PDF阅读器里选中文字。如果选不中,说明它是扫描件,Whizi会用视觉识别转录它,数字部分值得对照原件核实一遍。
为文件挑选合适的模型
对处理文档来说,这个选择比提示词本身更重要。
- 长文档选Gemini。Whizi里的Gemini模型拥有100万token的上下文窗口,这意味着一份200页的报告、一整套合同,或十几篇论文可以同时存在,而不必被拆成几段处理。跨文档的问题只有在所有内容都真正进入上下文时才能问得准。
- 需要细微差别时选Claude。法律语言、政策文件,以及任何含义取决于限定和留有余地表述的场合。它也最擅长告诉你一份文档没有说什么,而这往往才是真正的问题所在。
- 提取信息选GPT。发票、表单、结构化数据,任何你想拿回严格表格或JSON、并让上百行数据保持字段名一致的场合。
- 图片、图表、截图和示意图选任意多模态模型。先让它描述看到了什么,再让它解读,这样能尽早发现读错的地方。
你可以在同一个对话里中途切换模型,不用重新上传文件,这正是把工作放在同一个工作区的意义所在。用Gemini阅读、用GPT提取、再让Claude写总结,全都针对同一份附件进行。参见对话中途切换模型。
同时处理多份文档
针对单份文档提问是有用的。针对多份文档提问,才是它从一个便利功能变成一种你之前没有的能力的地方。
提示词:比较
比较contract-a.pdf和contract-b.pdf。返回一个表格,列出每一处不同的条款:条款内容、A怎么说、B怎么说,以及哪一方对我们更有利、为什么。忽略格式和编号上的差异。把只在其中一份出现、另一份没有的条款单独列出。
提示词:汇总
在所有附件中,建一张表回答[问题]。每份文档一行,第一列写文档名。如果某份文档没有涉及,写"未涉及"。不要在未提示的情况下把使用不同定义的文档合并处理。
提示词:找出矛盾之处
这些文档在哪里互相矛盾?把两处段落并排引用出来,并注明各自来自哪个文件。区分真正的矛盾和范围或日期上的差异。
一旦附件超过一份,提问时务必用文件名指明具体文件。"在供应商协议里,通知期是多久?"意思明确;而"通知期是多久?"会让模型自己选一份文件,而且它不会告诉你它选的是哪一份。
当答案看起来不对劲
一套简短的排查流程能解决大多数问题。
模型说它看不到文件。先确认附件确实上传成功,然后明确引用它:"在附件report.pdf里"。对图片来说尤其如此,说"看一下附件里的图片"能确保走的是多模态路径,而不是模型只根据你问题里的文字来回答。
答案答非所问,指向了错误的文档。一旦对话里有好几份文档,每次提问都要点名文件。
扫描文档上的数字有些微妙的错误。这是扫描件转录的问题,不是推理的问题。让模型逐字引用周围那一行,你就能看到它读到了什么,再去核对原件。
它漏掉了你明明知道文档里有的内容。先问一个定位性的问题:引用讨论[主题]的段落,并给出它的页码或章节。如果它找不到,问题出在提取环节,不在推理环节。可以换一个模型试试,或者单独上传相关页面。
它在总结而不是在回答。要求它给出依据而不是结论:引用支持你答案的原文。这也能揪出答案其实是凭常识推断、而非依据你的文档得出的情况,这是最需要抓住的一种失误。
最后这条检查值得特别强调。面对一种常见的合同类型、一项常见法规,或一篇知名论文,模型可以完全不查看你的文件,仅凭训练数据就给出看似合理的答案。要求引用原文能强迫答案锚定在眼前这份真实文档上。
上传前该考虑的隐私问题
上传的附件被设置为最多30天后过期,你也可以随时更早删除某个文件或整段对话。Whizi不会用你的提示词、文件、对话、语音转录或生成内容来训练Whizi自有的AI模型,也不会把这些内容作为训练数据出售。你选用的模型背后的服务商会收到回答问题所需的内容,并可能按其自身政策保留临时缓存。
真正取决于你的判断,是这份文档是否属于你有权交给第三方服务处理的那种。值得留意的类别包括:属于他人的个人信息、受特定保密条款约束的内容、重大非公开信息,以及受特殊处理规则约束的敏感数据,比如健康或财务记录。
对大多数人来说,更实际的折中做法是脱敏而不是干脆不用。把姓名换成角色、用相对数值代替绝对数字、去掉身份标识,这样能在保留分析所需全部信息的同时,去掉让文档变得敏感的大部分内容。
- 给文件起有描述性的名字,因为模型能看到文件名
- 在信任提取出的数字之前,先确认PDF是文本版还是扫描版
- 上传原始表格,而不是排版好的展示版
- 长文件选Gemini,细微差别选Claude,信息提取选GPT
- 一旦附件超过一份,提问时用文件名指明
- 要求给出支持性引用,让答案锚定在文档上
- 去掉分析不需要的个人信息
常见问题
我上传的内容私密吗?
上传的内容存储在你的账户下,被设置为最多30天后过期,你也可以随时更早删除。Whizi不会用你的提示词、文件、对话、语音转录或生成内容来训练Whizi自有的AI模型,也不会把这些内容作为训练数据出售。真正取决于你的,是某份文档是否属于你有权发送给第三方服务处理的内容,这通常由你自己的合同或内部政策决定,而不是由我们决定。
文件大小上限是多少?
每个文件上限为10MB,一条消息最多可携带6个文件。在这些上限之内,真正的约束是模型的上下文窗口:对于长合同、报告和多文档集合,可以选择大上下文模型,比如Gemini,或者只上传相关章节而不是整份文件,因为有针对性的上下文往往反而能得到更好的答案。
聊完之后我能删除文件吗?
可以,文件随时可以移除,你不管的上传内容也会在最多30天后自动过期。请注意,删除文件不会追溯性地抹去对话中已经讨论过的内容,所以如果内容敏感到需要删除文件,也应该一并删除这段对话。
它能处理扫描版PDF吗?
可以。Whizi会根据页面产出的文字量很少来判断一份PDF是图片密集型还是扫描件,并把它整份送入一次服务器端视觉识别,返回逐页文字稿。干净的扫描件识别准确率很高,但遇到低分辨率、不常见字体、手写内容和复杂表格版式时会下降。因为数字里读错的字符在一段流畅的回答中并不显眼,所以来自扫描文档的任何数字都应该对照原件核实。
我能在同一段对话里上传多份文档吗?
可以,而且这正是价值最大的地方。逐条比较两份合同的条款、汇总一批报告里的发现,或者找出多份文档之间的矛盾,这些都需要所有内容同时进入上下文。一旦附件超过一份,提问时要用文件名指明,否则模型会替你选一份,而且不会说明它选的是哪一份。