研究流程中的三项模型任务
研究是多模型工作台最典型的应用场景,因为这条流程里有三种真正不同的需求。你需要一个能一次性容纳海量文本的模型,一个写作足够严谨、经得起同行评审的模型,还有一个能稳定返回结构化输出而不走样的模型。没有哪一款产品能同时在这三方面都做到最好,而在三款产品之间切换的代价,就是把同一批语料反复上传。在同一个工作台内部切换的边际成本很小,而且可以预估:根据Whizi的模型成本指数(OpenRouter挂牌价格,抓取于2026-08-20),Gemini 3.7 Flash每次标准回答约为$0.001313,Claude Sonnet 5约为$0.007,GPT-5.6 Terra约为$0.008,全部都在一美分以内。
| 阶段 | 模型 | 具体做什么 |
|---|---|---|
| 阅读一批论文 | Gemini | 100万token的上下文窗口,让15到30篇PDF可以放进同一次对话 |
| 搭建证据表格 | GPT | 严格的结构,字段值保持一致,不会随意发挥 |
| 起草文字和综合分析 | Claude | 谨慎、带学术性保留措辞的行文,忠于原文 |
| 查找最新研究并核对引用 | 联网模型 | 面向实时信息源检索,而不是依赖记忆 |
| 对自己的论证进行对抗性审阅 | 任何没有参与起草的模型 | 独立读者视角,没有沉没成本 |
在开始之前,最重要的一点是:如果只凭记忆去问一个语言模型某篇论文的内容,它会编造细节,而且编得非常流畅。而一个正在阅读你上传的PDF的模型,处理的是真实的文本。这是两种可靠性完全不同的行为,几乎所有关于AI用于科研的可怕案例,都是把第一种误当成了第二种。永远上传原始资料。
阅读20篇论文而不丢线索
常见的错误是要求生成摘要。20篇论文的摘要,只是一段可以用来描述该领域任意20篇论文的文字。真正需要的是一张证据表格,因为表格会迫使模型对每篇论文给出具体数值,让空白之处一目了然。
提示词:证据表格
我已经上传了[n]篇论文。请建立一张表格,每篇论文一行,包含以下列:引用信息(作者、年份)、研究问题、研究设计、样本量和研究人群、测量的主要结局、带有效应量或关键统计量的核心发现、已说明的局限性,以及资助来源(如披露)。如果某篇论文没有报告某个字段,写NOT REPORTED。不要推断数值。不要包含我没有上传的论文。
提示词:综合分析
只使用你刚才建立的表格回答:这些研究在哪些地方一致,哪些地方不一致,这些分歧可以用什么来解释(研究设计、人群、测量方式或时间段)?找出这批已上传研究都没有回答的问题。每一个论断都要标注它依据的具体行。
提示词:方法学批评
针对表格中的每一项研究,指出对其效度威胁最大的因素:抽样、测量、混杂因素、统计效力,或可推广性。要针对论文实际报告的内容具体展开,不要泛泛而谈。如果某项研究方法确实扎实,就如实说明,不要硬找问题。
最后这条指令真正起作用。让模型去找问题,它永远都能找到问题,哪怕是一项设计良好的研究也不例外,因为这个要求本身就暗示了问题的存在。明确允许它承认某篇论文是可靠的,才能让批评保持诚实。
提取:从非结构化文本中获取结构化数据
系统性提取是AI最能省下确凿可查时间的任务,因为输出结果是可核实的。你可以对照第7页核对一个数字,但没法核对一种感觉。
提示词:严格结构提取
把这篇论文中每一个报告过的统计数据提取为JSON。结构:{"value": number, "unit": string, "measure": string, "population": string, "location_in_paper": string, "confidence_interval": string or null, "p_value": string or null}。只包含出现在正文、表格或图注中的数字。不要计算衍生数值。不要四舍五入。如果某个数字在表格和正文中出现的数值不同,两条都返回,并标注这一差异。
location_in_paper这个字段是大家最容易漏掉的部分,但正是它让输出真正好用。它把核实过程从重新通读整篇论文,变成一次有针对性的检查,这样核实工作才真的会被执行。
提示词:跨论文比较
在已上传的论文中,找出所有关于[你关心的那个量]的报告估计值。返回一张表格:论文、估计值、单位、研究人群、估算方法、数据采集年份。不要对它们取平均值。明确指出哪些估计值因为定义或人群不同而不可比。
要求模型不要取平均值,这不是吹毛求疵。对不可比的估计值取平均,是AI辅助文献综述最常出现的错误之一,它会自信满满地给出一个错误的数字,而且是审稿人一眼就能发现的那种错误。
起草综述,而不借用别人的句子
Claude在这里是最好的起草者,但提示词必须强制执行学术写作中最重要的两条规则:论断必须挂钩到具体来源,谨慎的措辞必须保留。以「有用」为训练目标的模型,往往会不自觉地加强本来谨慎的措辞,把「与……相关」在没人要求的情况下变成「导致」。
提示词:章节草稿
只使用上面的证据表格,起草文献综述的[章节名称]部分。规则:每个论断都必须能追溯到表格中的具体一行,保留原始的谨慎措辞(不要把相关性升级为因果性),使用[引用格式],并在任何你想要超出证据范围进行概括的句子上标注[CHECK]。读者对象:[领域]研究人员。篇幅:约[n]字。
提示词:谨慎措辞审查
对照原始资料审查这份草稿。列出每一句表述的确定性超出了原始研究支持范围的句子,以及每一句把发现归错了来源的句子。把该句子和冲突的原文并排引用出来。不要改写。
也在自己写的文字上跑一遍这项谨慎措辞审查,而不只是对模型的输出。它同样能揪出深夜11点写下的人类初稿里的同一种偏移。
引用核实,这一步没有商量余地
这一部分最为重要,所以说得很直接。语言模型会编造引用。它们生成的引用会带上真实存在的作者姓名,听起来合理的期刊名称,看起来正确的卷号和页码,以及无法解析或指向另一篇不相关论文的DOI。已经有被撤稿的论文,就是这样进入文献体系的。也有学术声誉因此受损。
防止这一点的规则:
- 永远不要让模型凭记忆为某个论断「找来源」。应该让联网模型去检索,然后自己打开每一个链接核对。
- 通过实际解析来核实每一个DOI。一个无法解析的DOI就是编造,而不是打错字。
- 核实被引用的论文是否真的说了引用所声称的内容。一篇真实存在、却被挂到它并不支持的论断上的论文,是更难发现的错误,也比凭空捏造的论文更常见。
- 永远不要引用你没有打开过的东西。这条规则在AI出现之前就存在,AI只是让它变得更加不可回避。
- 把上传的PDF当作事实的最终来源。凡是模型告诉你、但你没有上传过的论文相关信息,从结构上就是未经核实的。
提示词:引用审计
对列表中的每一条引用,说明:你能否从这次对话中的某个来源确认它,还是它来自你的训练数据、因此是未经核实的。不要猜测。清楚标出每一条未经核实的条目。我会手动核对它们。
这条提示词并不会让模型变得可靠。它做的是让模型明确说出,哪些论断是锚定在你提供的资料上的,而这正是你判断该核实什么所需要的区分。
这套方法无法替代什么
它无法替代系统性综述规程。如果你的工作需要PRISMA,检索策略、筛选和纳入决定仍然需要由你来记录和辩护。AI可以帮你起草规程、加快对已纳入研究的提取速度,但它不能充当检索本身。
它无法替代你的文献管理工具。让Zotero、Mendeley或EndNote继续作为你实际读过内容的记录。对话窗口是工作记忆,不是档案库。
它无法替代统计分析。模型可以解释一种方法,为它写出R或Python代码,并对你的解读做合理性检查,但在对话窗口里跑分析、又直接相信运算结果,是站不住脚的。生成代码,在自己的环境里运行,再检查输出结果。
它也无法替代披露义务。期刊和机构越来越要求说明AI工具的使用方式。在每个阶段用了什么就随手记下来,因为等到投稿时再回忆会很痛苦。
- 上传论文本身,而不是询问模型对它们的记忆
- 在要求任何综合分析之前,先建立一张每篇论文一行的证据表格
- 为每一个提取出的数字要求location_in_paper字段,让核实变得有的放矢
- 指示模型保留谨慎措辞,永远不要把相关性升级为因果性
- 在把每一个来源写进参考文献列表之前,解析它的DOI并打开它
- 让模型标出哪些论断锚定在已上传文本上,哪些来自记忆
- 持续记录每个阶段AI的使用方式,用于披露声明
常见问题
Whizi能处理很长的论文吗?
可以。Whizi里的Gemini标称拥有100万token的上下文窗口,实际使用中意味着一篇长篇学位论文、一整份监管申报文件,或者15到30篇论文,都可以放进同一次对话并被整体查询。这和逐块总结一份文档不同,因为诸如「这些研究在哪里存在分歧」这类跨文档问题,只有在所有内容同时存在时才有效。
Whizi会标注引用来源吗?
使用联网模型时,它会返回链接;上传文档时,它可以指出某个论断来自原文的哪个位置。两者都不能替代核实。必须解析每一个DOI,打开每一个链接,并确认被引用的研究确实支持挂在它上面的论断。编造和张冠李戴的引用,是AI辅助科研中最严重的失败模式,唯一可靠的防线是亲自打开原始资料核对。
为什么不干脆用一个模型解决全部问题?
因为这三个阶段需要的是截然相反的表现。阅读海量语料需要巨大的上下文窗口。提取需要严格、刻板地遵循结构。起草需要保留学术性谨慎措辞的细致文字。把这三步都放进同一个工作台,意味着语料只需上传一次,切换模型时上下文能够延续,而不必向三款不同的产品重新解释一遍。
在学术工作中使用AI是否被接受?
不同期刊、资助方和机构的政策各不相同,而且变化很快,所以要核对适用于你的具体要求。总体趋势是:在披露的前提下,使用AI进行提取、起草和编辑通常是可以接受的,但把模型列为作者则不可以,你依然对成果中的每一个论断和引用负全部责任。随手记录你用了什么。
可以上传未发表或保密数据吗?
Whizi不会用你的对话来训练模型,每家供应商的政策在启用该模型之前都可以查看,但你的伦理审批和任何数据共享协议才是真正的约束条件。人类受试者数据几乎总是应该排除在外,除非你的审批明确覆盖第三方处理。去标识化的摘录和你自己写的草稿,属于通常安全的情形。