如何用Whizi在线与PDF对话

快速解答

将PDF拖入消息框或点击回形针图标即可上传,然后用日常语言提出问题。你所在套餐内的任意模型都能读取该文件,切换模型时无需重新上传同一份文件。在采信答案之前,先让模型引用它所依据的原文段落。

简短答案

把PDF拖入消息框,或点击回形针图标进行上传,然后用日常语言提出问题。你所在套餐内的任意模型都能读取它,切换模型对着同一份文件提问也无需重新上传。

在采信答案之前先做一件事:让模型引用它所依据的原文段落。一个信心十足、却是从训练数据而不是从你的文件中得出的答案,是最容易让人蒙受损失的失误,而一个定位性提问大约十秒钟就能揪出它。这个页面接下来讲的,就是如何把这件事做好。

首先,确认它读的是你的文档

文档对话中最危险的失误不是答错,而是模型信心十足地给出一个来自训练数据、而非你文件内容的答案。这种情况在文档很像某种常见类型时最容易发生:一份标准商业租约、一项广为人知的法规、一篇被广泛讨论的论文。模型对这类体裁足够熟悉,即便不查阅你的具体文本也能编出一个看似合理的答案,而输出结果里不会有任何迹象提示它这么做了。

有一个习惯能消除这个风险:在提出真正的问题之前,先问一个定位性问题。

引用所附文档中讨论[主题]的段落,并给出它出现的页码或章节。如果文档中没有,请直接说明。

如果它给出了真实的引文,说明它确实在读你的文件。如果它给出的是笼统的转述,或者找不到你明知存在的内容,说明抽取环节出了问题,之后的所有回答都值得怀疑。这只需要十秒钟,却是工具和隐患之间的分界线。

把这个习惯也带入真正的提问:任何答案会被采信的提示词,都应该包含引用支持你答案的确切原文这样的要求。

为文档挑选合适的模型

文档模型原因
100页以上的报告、申报文件、整套合同Gemini拥有1,000,000 token的上下文窗口,文档能完整呈现,而不是被拆成片段
合同、政策,以及任何措辞分寸很重要的场景Claude最擅长把握细微差别,也最擅长指出文档中没有写的内容
发票、表单、结构简单的短文件GPT速度快,在严格抽取为表格或JSON方面最可靠
带图表、扫描页、示意图的论文任何多模态模型在文本抽取失效时,能把页面当作图像来读取

上下文窗口这一点值得展开说说。当文档超出模型能容纳的范围,它就得被拆成片段处理,而那些需要一次性纵览全文的问题(这里有没有和第14条相互矛盾的地方、这个术语在文档里有没有被定义、这三个部分里哪一个前后不一致)就会变得不可靠。这正是长文档要优先选用大上下文模型的具体原因,而不只是一种笼统的偏好。

你可以不重新上传就切换模型,所以可以用一个模型来阅读,再用另一个模型对着同一份文件做抽取。参见对话中途切换模型

按文档类型划分的提示词

合同与协议

从所附协议中提取一张表格,列出:期限与续约、终止通知期、付款条款、责任上限、赔偿条款、适用法律、可转让性,以及任何在合同终止后仍然有效的条款。每一项都给出条款编号,并引用其中的核心句子。然后单独列出那些落在我方而非对方身上的义务。

紧接着问一个真正关键的问题:与这类合同的标准条款相比,这份协议里有哪些不同寻常之处,又明显缺失了什么?风险通常就藏在缺失的部分,而这是关键词搜索永远找不到的东西。

研究论文

针对所附论文,请返回:研究问题、研究设计、样本与研究对象、主要结局指标、带效应量的核心结果、作者自述的局限性,以及资金来源。然后告诉我,这篇论文中有哪三个论断在被引用前需要独立核实。

长篇报告与申报文件

把所附报告总结成10条要点,按重要性而不是按文档顺序排列。然后列出:决策者会关心的三个数字及其页码出处、报告中未注明来源却当作事实陈述的内容,以及摘要或执行概要与后文细节相矛盾的地方。

最后这一项检查经常能发现真正的问题。执行摘要往往写得早,修改得却比它所概括的正文部分少。

对比两份文档

逐条对比contract-a.pdf和contract-b.pdf。返回一张表格,列出每一处实质性差异:主题、A怎么说、B怎么说,以及哪一方对我方更有利。忽略格式和编号上的差异。另外单独列出只在其中一份里出现、另一份缺失的内容。

把它变成能直接用的东西

把发现的结论改写成面向高管的150字版本,开头先给出需要做的决定。不使用未经解释的行话。标出任何在分发之前我应该核实的内容。

排查问题

"我看不到文档。" 先确认文件已经上传完成,然后在消息中明确提到它的文件名。在很长的对话里,重新上传文件或者只带着这份文件开一个新对话,比来回争论要快。

扫描版PDF,文字乱码或缺失。 这份文档本质上是图片,纯文本抽取几乎读不到内容。Whizi会根据页面提取到的文字量之少,识别出图片密集型PDF,并把它整体送入一次服务器端的视觉识别流程,返回逐页转写文本。分辨率低、字体特殊、手写体和密集表格都会降低准确率。由于识别错的数字在流畅的答案里看不出破绽,来自扫描文档的每一个数字都要对照原始页面核实。

表格解析出错。 PDF里的表格底层结构往往非常混乱。先要求原样复现表格,对照页面核对,然后再要求分析。对于表格密集的工作,让多模态模型把页面当作图像来读取,往往比文本抽取更可靠。

它漏掉了你明知存在的内容。 问一个定位性问题。如果模型引用不出你能看到的段落,问题出在抽取环节,而不是推理环节。可以换一个模型试试,或者只上传相关的那几页。

文件太大。 使用大上下文模型,或者按用途而不是按页数拆分文件。只上传你真正需要的那三个部分,效果好过上传400页然后碰运气。

对话越往后,回答越含糊。 长对话会积累与文档竞争注意力的上下文。带着文件和一句简明的需求说明,重新开一个对话。

采信之前先核实

三项检查,按重要性排序。

任何有实际影响的内容都要求给出原文引用。 一段被引用的原文几秒钟就能核实,转述则不行。仅凭这一条习惯,就能消除文档处理工作中的大部分风险。

用第二个模型交叉核对。 针对同一份文件,把同一个问题再问一遍另一个模型。答案一致就是有力的佐证,答案不一致则准确指出了需要留意的地方。Whizi的并排对比功能就是为此而存在。

问它对哪些地方没有把握。 在你上面给出的答案中,你对哪一个最没有把握,文档中哪里存在歧义?模型在自我评估上并不完美,但它指出的歧义通常确实是原文本身存在的歧义,这本身就是关于这份文档的有用信息。

对于任何有实际后果的内容,也就是涉及法律、财务、医疗或合规的材料,一条一贯适用的原则是:模型负责找到相关段落,判断由你来做。它是一个阅读助手,不是顾问,依据它的输出做出的决定,责任完全在你自己。

操作清单
  • 先问一个定位性问题,确认模型读的是你的文件
  • 任何有实际影响的答案都要求给出确切引文
  • 长文档使用大上下文模型,避免内容被拆碎丢失
  • 既要问文档写了什么,也要问它明显缺了什么
  • 对照原始页面核实扫描文档中的数字
  • 先原样复现表格并核对,再进行分析
  • 重要内容用第二个模型交叉核对

常见问题

PDF文件的大小上限是多少?

每个上传的文件上限为10MB,一条消息最多可以携带6个文件。在这个范围内,真正的限制其实是模型的上下文窗口,而不是文件大小上限。Whizi中的Gemini拥有1,000,000 token的上下文窗口,这也是它被推荐用于长篇报告、申报文件和多份合同的原因。超出这个范围时,上传你真正需要的部分,而不是整份文档,因为聚焦的上下文通常也能带来更精准的答案。

Whizi会存储我的PDF吗?

上传的文件会保存在你的账户下,设置为最长30天后过期,你也可以随时提前删除。Whizi不会用你的提示词、文件、对话、语音转写或生成内容来训练Whizi自有的AI模型,也不会把这些内容作为训练数据出售。删除文件并不会移除对话中已经讨论过的相关内容,所以如果文档本身敏感到需要删除,那么连对话也要一并删除。

我可以同时和多份PDF对话吗?

可以,跨文档对比正是这个功能最有价值的地方。把多个文件上传到同一个对话中,并在提示词里用文件名明确指出你指的是哪一份,否则模型会自行选择依据哪一份文件回答,而不会告诉你。逐条对比合同、汇总多份报告的发现、找出文档之间的矛盾之处,这些都需要所有内容同时在场,这也是使用大上下文模型的另一个理由。

扫描版PDF可以用吗?

可以。Whizi会根据页面提取到的文字量之少,识别出扫描版或图片密集型PDF,并逐页通过服务器端的视觉识别流程进行转写。在干净清晰的扫描件上准确率很高,分辨率低、字体特殊、手写体和密集表格会降低准确率。由于识别错的字符会在一个看似流畅的答案里生成一个错误的数字,来自扫描文档的任何数字都要对照原始页面核查。

我怎么知道答案确实来自我的文档?

要求它给出引文。让模型引用支持其答案的确切原文段落,并注明页码或章节,如果文档中没有相关信息就直接说明。答案来自训练数据而不是你的文件,是文档对话中最危险的失误,恰恰因为这类答案对常见文档类型来说看起来很合理,而要求可核实的引文是分辨真假的唯一可靠方法。