研究人员的AI工作台:长上下文阅读加引用写作

快速解答

科研场景中的AI工作分成三项任务,没有哪个单一模型都擅长:Gemini能在一个上下文窗口里容纳15到30篇论文,GPT负责提取结构化的证据表格,Claude起草能保留学术性谨慎措辞的文字。应该上传每一份原始资料,而不是依赖模型的记忆,并且必须自己核实每一个DOI,因为编造引用是最严重的失败模式。

研究流程中的三项模型任务

研究是多模型工作台最典型的应用场景,因为这条流程里有三种真正不同的需求。你需要一个能一次性容纳海量文本的模型,一个写作足够严谨、经得起同行评审的模型,还有一个能稳定返回结构化输出而不走样的模型。没有哪一款产品能同时在这三方面都做到最好,而在三款产品之间切换的代价,就是把同一批语料反复上传。在同一个工作台内部切换的边际成本很小,而且可以预估:根据Whizi的模型成本指数(OpenRouter挂牌价格,抓取于2026-08-20),Gemini 3.7 Flash每次标准回答约为$0.001313,Claude Sonnet 5约为$0.007,GPT-5.6 Terra约为$0.008,全部都在一美分以内。

阶段模型具体做什么
阅读一批论文Gemini100万token的上下文窗口,让15到30篇PDF可以放进同一次对话
搭建证据表格GPT严格的结构,字段值保持一致,不会随意发挥
起草文字和综合分析Claude谨慎、带学术性保留措辞的行文,忠于原文
查找最新研究并核对引用联网模型面向实时信息源检索,而不是依赖记忆
对自己的论证进行对抗性审阅任何没有参与起草的模型独立读者视角,没有沉没成本

在开始之前,最重要的一点是:如果只凭记忆去问一个语言模型某篇论文的内容,它会编造细节,而且编得非常流畅。而一个正在阅读你上传的PDF的模型,处理的是真实的文本。这是两种可靠性完全不同的行为,几乎所有关于AI用于科研的可怕案例,都是把第一种误当成了第二种。永远上传原始资料。

阅读20篇论文而不丢线索

常见的错误是要求生成摘要。20篇论文的摘要,只是一段可以用来描述该领域任意20篇论文的文字。真正需要的是一张证据表格,因为表格会迫使模型对每篇论文给出具体数值,让空白之处一目了然。

提示词:证据表格

我已经上传了[n]篇论文。请建立一张表格,每篇论文一行,包含以下列:引用信息(作者、年份)、研究问题、研究设计、样本量和研究人群、测量的主要结局、带有效应量或关键统计量的核心发现、已说明的局限性,以及资助来源(如披露)。如果某篇论文没有报告某个字段,写NOT REPORTED。不要推断数值。不要包含我没有上传的论文。

提示词:综合分析

只使用你刚才建立的表格回答:这些研究在哪些地方一致,哪些地方不一致,这些分歧可以用什么来解释(研究设计、人群、测量方式或时间段)?找出这批已上传研究都没有回答的问题。每一个论断都要标注它依据的具体行。

提示词:方法学批评

针对表格中的每一项研究,指出对其效度威胁最大的因素:抽样、测量、混杂因素、统计效力,或可推广性。要针对论文实际报告的内容具体展开,不要泛泛而谈。如果某项研究方法确实扎实,就如实说明,不要硬找问题。

最后这条指令真正起作用。让模型去找问题,它永远都能找到问题,哪怕是一项设计良好的研究也不例外,因为这个要求本身就暗示了问题的存在。明确允许它承认某篇论文是可靠的,才能让批评保持诚实。

关于如何把长文档干净地导入对话,可参考如何与PDF对话,以及用AI总结PDF的指南。

提取:从非结构化文本中获取结构化数据

系统性提取是AI最能省下确凿可查时间的任务,因为输出结果是可核实的。你可以对照第7页核对一个数字,但没法核对一种感觉。

提示词:严格结构提取

把这篇论文中每一个报告过的统计数据提取为JSON。结构:{"value": number, "unit": string, "measure": string, "population": string, "location_in_paper": string, "confidence_interval": string or null, "p_value": string or null}。只包含出现在正文、表格或图注中的数字。不要计算衍生数值。不要四舍五入。如果某个数字在表格和正文中出现的数值不同,两条都返回,并标注这一差异。

location_in_paper这个字段是大家最容易漏掉的部分,但正是它让输出真正好用。它把核实过程从重新通读整篇论文,变成一次有针对性的检查,这样核实工作才真的会被执行。

提示词:跨论文比较

在已上传的论文中,找出所有关于[你关心的那个量]的报告估计值。返回一张表格:论文、估计值、单位、研究人群、估算方法、数据采集年份。不要对它们取平均值。明确指出哪些估计值因为定义或人群不同而不可比。

要求模型不要取平均值,这不是吹毛求疵。对不可比的估计值取平均,是AI辅助文献综述最常出现的错误之一,它会自信满满地给出一个错误的数字,而且是审稿人一眼就能发现的那种错误。

起草综述,而不借用别人的句子

Claude在这里是最好的起草者,但提示词必须强制执行学术写作中最重要的两条规则:论断必须挂钩到具体来源,谨慎的措辞必须保留。以「有用」为训练目标的模型,往往会不自觉地加强本来谨慎的措辞,把「与……相关」在没人要求的情况下变成「导致」。

提示词:章节草稿

只使用上面的证据表格,起草文献综述的[章节名称]部分。规则:每个论断都必须能追溯到表格中的具体一行,保留原始的谨慎措辞(不要把相关性升级为因果性),使用[引用格式],并在任何你想要超出证据范围进行概括的句子上标注[CHECK]。读者对象:[领域]研究人员。篇幅:约[n]字。

提示词:谨慎措辞审查

对照原始资料审查这份草稿。列出每一句表述的确定性超出了原始研究支持范围的句子,以及每一句把发现归错了来源的句子。把该句子和冲突的原文并排引用出来。不要改写。

也在自己写的文字上跑一遍这项谨慎措辞审查,而不只是对模型的输出。它同样能揪出深夜11点写下的人类初稿里的同一种偏移。

引用核实,这一步没有商量余地

这一部分最为重要,所以说得很直接。语言模型会编造引用。它们生成的引用会带上真实存在的作者姓名,听起来合理的期刊名称,看起来正确的卷号和页码,以及无法解析或指向另一篇不相关论文的DOI。已经有被撤稿的论文,就是这样进入文献体系的。也有学术声誉因此受损。

防止这一点的规则:

  • 永远不要让模型凭记忆为某个论断「找来源」。应该让联网模型去检索,然后自己打开每一个链接核对。
  • 通过实际解析来核实每一个DOI。一个无法解析的DOI就是编造,而不是打错字。
  • 核实被引用的论文是否真的说了引用所声称的内容。一篇真实存在、却被挂到它并不支持的论断上的论文,是更难发现的错误,也比凭空捏造的论文更常见。
  • 永远不要引用你没有打开过的东西。这条规则在AI出现之前就存在,AI只是让它变得更加不可回避。
  • 把上传的PDF当作事实的最终来源。凡是模型告诉你、但你没有上传过的论文相关信息,从结构上就是未经核实的。

提示词:引用审计

对列表中的每一条引用,说明:你能否从这次对话中的某个来源确认它,还是它来自你的训练数据、因此是未经核实的。不要猜测。清楚标出每一条未经核实的条目。我会手动核对它们。

这条提示词并不会让模型变得可靠。它做的是让模型明确说出,哪些论断是锚定在你提供的资料上的,而这正是你判断该核实什么所需要的区分。

这套方法无法替代什么

它无法替代系统性综述规程。如果你的工作需要PRISMA,检索策略、筛选和纳入决定仍然需要由你来记录和辩护。AI可以帮你起草规程、加快对已纳入研究的提取速度,但它不能充当检索本身。

它无法替代你的文献管理工具。让Zotero、Mendeley或EndNote继续作为你实际读过内容的记录。对话窗口是工作记忆,不是档案库。

它无法替代统计分析。模型可以解释一种方法,为它写出R或Python代码,并对你的解读做合理性检查,但在对话窗口里跑分析、又直接相信运算结果,是站不住脚的。生成代码,在自己的环境里运行,再检查输出结果。

它也无法替代披露义务。期刊和机构越来越要求说明AI工具的使用方式。在每个阶段用了什么就随手记下来,因为等到投稿时再回忆会很痛苦。

操作清单
  • 上传论文本身,而不是询问模型对它们的记忆
  • 在要求任何综合分析之前,先建立一张每篇论文一行的证据表格
  • 为每一个提取出的数字要求location_in_paper字段,让核实变得有的放矢
  • 指示模型保留谨慎措辞,永远不要把相关性升级为因果性
  • 在把每一个来源写进参考文献列表之前,解析它的DOI并打开它
  • 让模型标出哪些论断锚定在已上传文本上,哪些来自记忆
  • 持续记录每个阶段AI的使用方式,用于披露声明

常见问题

Whizi能处理很长的论文吗?

可以。Whizi里的Gemini标称拥有100万token的上下文窗口,实际使用中意味着一篇长篇学位论文、一整份监管申报文件,或者15到30篇论文,都可以放进同一次对话并被整体查询。这和逐块总结一份文档不同,因为诸如「这些研究在哪里存在分歧」这类跨文档问题,只有在所有内容同时存在时才有效。

Whizi会标注引用来源吗?

使用联网模型时,它会返回链接;上传文档时,它可以指出某个论断来自原文的哪个位置。两者都不能替代核实。必须解析每一个DOI,打开每一个链接,并确认被引用的研究确实支持挂在它上面的论断。编造和张冠李戴的引用,是AI辅助科研中最严重的失败模式,唯一可靠的防线是亲自打开原始资料核对。

为什么不干脆用一个模型解决全部问题?

因为这三个阶段需要的是截然相反的表现。阅读海量语料需要巨大的上下文窗口。提取需要严格、刻板地遵循结构。起草需要保留学术性谨慎措辞的细致文字。把这三步都放进同一个工作台,意味着语料只需上传一次,切换模型时上下文能够延续,而不必向三款不同的产品重新解释一遍。

在学术工作中使用AI是否被接受?

不同期刊、资助方和机构的政策各不相同,而且变化很快,所以要核对适用于你的具体要求。总体趋势是:在披露的前提下,使用AI进行提取、起草和编辑通常是可以接受的,但把模型列为作者则不可以,你依然对成果中的每一个论断和引用负全部责任。随手记录你用了什么。

可以上传未发表或保密数据吗?

Whizi不会用你的对话来训练模型,每家供应商的政策在启用该模型之前都可以查看,但你的伦理审批和任何数据共享协议才是真正的约束条件。人类受试者数据几乎总是应该排除在外,除非你的审批明确覆盖第三方处理。去标识化的摘录和你自己写的草稿,属于通常安全的情形。