研究流程中的三項模型任務
研究是多模型工作空間最清楚的應用案例,因為整個流程有三種截然不同的需求。你需要一個能一次容納大量文字的模型、一個寫作嚴謹到能通過同儕審查的模型,以及一個能穩定回傳嚴格結構化輸出、不會偏離格式的模型。沒有單一產品能同時在這三方面都表現最好,而在三個產品之間切換的成本,就是要重新上傳同一批資料。在同一個工作空間內切換的邊際成本很小而且可以預估:根據Whizi的模型成本指數(OpenRouter牌價,擷取於2026-08-20),Gemini 3.7 Flash每則標準回答的成本是$0.001313,Claude Sonnet 5是$0.007,GPT-5.6 Terra是$0.008,全部都不到一美分。
| 階段 | 模型 | 負責的工作 |
|---|---|---|
| 閱讀一批論文 | Gemini | 100萬token的上下文視窗,讓15到30份PDF能放進同一段對話 |
| 建立證據表格 | GPT | 嚴格的結構描述、一致的欄位數值、沒有編輯上的偏離 |
| 撰寫文字與統整 | Claude | 謹慎、保留學術用語的語氣,忠於原始資料 |
| 尋找最新研究並查核引用 | 具備網路連線功能的模型 | 對即時來源進行檢索,而不是依賴記憶 |
| 對自己的論點進行對抗性審查 | 任何沒有參與草擬的模型 | 獨立讀者視角,沒有沉沒成本 |
在開始之前,最重要的一件事情是要理解:如果你只問語言模型對某篇論文的記憶,它會編造細節,而且說得非常流暢。而讀取你上傳的PDF的模型,則是根據實際文字內容在運作。這是兩種可靠程度完全不同的行為,幾乎每一個關於AI用於研究的可怕故事,都是把前者誤認成後者所造成的。務必上傳原始資料,永遠都要這樣做。
閱讀20篇論文而不迷失重點
常見的錯誤是要求一份摘要。20篇論文的摘要,會是一段幾乎可以套用在該領域任何20篇論文上的文字。你真正需要的是一份證據表格,因為表格會強迫模型針對每一篇論文給出具體的數值,並讓缺漏之處變得明顯。
提示:證據表格
我已經上傳了[n]篇論文。請建立一份表格,每篇論文一列,欄位如下:引用資訊(作者、年份)、研究問題、研究設計、樣本數與研究對象、主要測量結果、含效應量或關鍵統計數字的重點發現、聲明的研究限制,以及若有揭露的資金來源。如果某篇論文沒有報告某個欄位,請填寫「未報告」。不要推論數值。不要納入任何我沒有上傳的論文。
提示:統整分析
只根據你剛剛建立的表格回答:這些研究在哪些地方一致,在哪些地方分歧,分歧的原因是什麼(研究設計、研究對象、測量方式,或時間點)?找出這批文獻中,沒有任何已上傳研究處理到的問題。每一項論述都要引用它所依據的具體列。
提示:方法學評論
針對表格中的每一項研究,指出對其效度最嚴重的威脅:樣本選取、測量、干擾因子、統計檢定力,或是可推論性。請針對論文實際報告的內容具體說明,而不是給出泛泛之詞。如果某項研究在方法學上很紮實,請直接這麼說,不要硬是捏造一個批評。
最後那一條指示確實發揮了作用。只要要求模型找出問題,它就一定會找到問題,即使是一項執行嚴謹的研究也不例外,因為這個要求本身就暗示了問題必然存在。明確給予模型說「這篇論文很紮實」的許可,能讓評論維持誠實。
擷取:從非結構化文字中取出結構化資料
系統性的擷取,是AI能節省最多可驗證時間的工作,因為輸出結果是可以查核的。你可以拿一個數字去對照第7頁核對,但你沒辦法核對一種「感覺」。
提示:嚴格結構描述擷取
請將這篇論文中每一個有報告的統計數字擷取成JSON格式。結構描述:{"value": number, "unit": string, "measure": string, "population": string, "location_in_paper": string, "confidence_interval": string or null, "p_value": string or null}。只納入出現在正文、表格,或圖表說明中的數字。不要計算衍生數值。不要四捨五入。如果同一個數字在表格和正文中出現不同的數值,請兩個都回傳並標註這個差異。
location_in_paper那個欄位,是大家最常漏掉的部分,卻也是讓輸出真正能用的關鍵。它能把驗證這道程序,從重新閱讀整篇論文,變成有目標的查核,這也代表驗證這件事真的會被執行。
提示:跨論文比較
在所有已上傳的論文中,找出每一個關於[你關心的數量]的估計值。回傳一份表格,欄位包含:論文、估計值、單位、研究對象、估計方法,以及資料蒐集年份。不要對它們取平均值。請明確標註因為定義或研究對象不同而無法比較的估計值。
指示模型不要取平均值,並不是在吹毛求疵。對無法比較的估計值取平均,是AI輔助文獻回顧產生一個看似自信卻錯誤數字的最常見方式,也是審查者一眼就能抓到的錯誤類型。
撰寫回顧,而不是借用別人的句子
Claude在這裡是最好的起草工具,但提示必須落實學術寫作中真正重要的兩條規則:論述要緊扣來源,謹慎用語要保留下來。被訓練成樂於幫忙的模型,往往會在沒有被要求的情況下,把謹慎的用語加強,把「與……相關」變成「導致」。
提示:章節草稿
請只根據上面那份證據表格,起草文獻回顧的[章節名稱]。規則:每一項論述都必須能追溯到具體的一列;保留原本的謹慎用語(不要把相關性升級成因果關係);使用[引用格式];如果你曾經想在證據之外做出過度推論,請在那句話標上[CHECK]。讀者對象:[領域]研究人員。長度:約[n]字。
提示:謹慎用語查核
請將這份草稿對照原始資料檢查。列出每一句表達出比研究本身更高確定性的句子,以及每一句把發現歸因給錯誤來源的句子。請把該句子與相互牴觸的原始文字並列引用。不要改寫內容。
也請把謹慎用語查核用在自己的寫作上,而不只是模型的輸出上。它同樣能抓出人類在晚上11點寫稿時出現的同一種偏移。
引用文獻查核,這不是可有可無的步驟
這是最重要的一節,所以用詞刻意直接。語言模型會捏造參考文獻。它們產出的引用資訊帶有真實作者姓名、看起來合理的期刊名稱、格式正確的卷期和頁碼,以及指向空白頁面或無關論文的DOI。已經有被撤回的論文是這樣進入文獻的,也已經有名譽因此受損的案例。
能防止這種情況發生的規則:
- 絕對不要要求模型單靠記憶為某項論述「找出來源」。請要求具備網路連線功能的模型去檢索,然後自己親自打開每一個連結。
- 逐一解析每一個DOI來驗證。無法解析的DOI是捏造的結果,不是打字錯誤。
- 確認被引用的論文,內容真的支持這項引用所宣稱的內容。一篇真實存在的論文被附加到它並不支持的論述上,是更難察覺的錯誤,也比憑空捏造的論文更常見。
- 絕對不要引用你沒有親自打開過的東西。這條規則在AI出現之前就存在,AI只是讓它變得不可或缺。
- 把已上傳的PDF當作事實的來源。任何模型告訴你、但你沒有上傳的論文相關資訊,本質上都是未經驗證的。
提示:參考文獻查核
針對這份清單中的每一筆參考文獻,請說明:你是否能從這段對話中的來源確認它,或者它是來自你的訓練資料因此未經驗證。不要用猜的。請清楚標示每一筆未經驗證的項目。我會親自逐一查核。
那個提示並不會讓模型變得可靠。它做到的是讓模型明確表態,哪些論述是錨定在你提供的資料上,而這正是你判斷該查核什麼的關鍵依據。
這套做法無法取代什麼
它無法取代系統性回顧的規範流程。如果你的研究需要PRISMA,搜尋策略、篩選,和納入決策,仍然是你自己必須記錄與捍衛的事。AI可以協助你起草規範流程,並加快從納入研究中擷取資料的速度,但它不能替代搜尋這個動作本身。
它無法取代你的文獻管理工具。請繼續使用Zotero、Mendeley,或EndNote,作為你實際讀過內容的紀錄。對話視窗是工作記憶,不是檔案庫。
它無法取代統計分析。模型可以解釋一套方法、幫你寫出對應的R或Python程式碼,也可以幫你檢查詮釋是否合理,但在對話視窗裡直接執行你的分析,並相信其中的運算,是站不住腳的做法。請產生程式碼,在你自己的環境中執行,並檢查輸出結果。
它也無法取代揭露義務。期刊和機構越來越要求說明AI工具是如何被使用的。請在每個階段隨手記下你用了什麼,因為等到投稿時才要重建這些紀錄,會是件很痛苦的事。
- 上傳論文本身,而不是問模型它記得什麼
- 在要求任何統整分析之前,先建立每篇論文一列的證據表格
- 在每一個擷取出來的數字上,都要求一個location_in_paper欄位,讓驗證有明確目標
- 指示模型保留謹慎用語,絕對不要把相關性升級成因果關係
- 在任何來源進入你的參考文獻清單之前,先解析每一個DOI並親自打開每一個來源
- 要求模型標示哪些論述是錨定在已上傳文字上,哪些是來自記憶
- 持續記錄每個階段AI是如何被使用的,作為你的揭露聲明
常見問題
Whizi能處理很長的論文嗎?
可以。Whizi中的Gemini提供100萬token的上下文視窗,實際上代表一篇很長的博士論文、一份完整的法規申報文件,或是15到30篇論文,都能放進同一段對話,並且整體被查詢。這和逐段摘要一份文件不同,因為像「這些研究在哪裡不一致」這類跨文件的問題,只有在所有內容同時存在時才有辦法回答。
Whizi會標註來源嗎?
當你使用具備網路連線功能的模型時,它會回傳連結;當你上傳文件時,它可以指出某項論述是來自你的來源中的哪個位置。兩者都不能取代驗證。請解析每一個DOI、打開每一個連結,並確認被引用的著作確實支持附加在它身上的論述。捏造和誤植的參考文獻,是AI輔助研究最嚴重的失敗模式,而唯一可靠的防線,就是自己親自打開來源。
為什麼不乾脆只用一個模型處理所有事?
因為這三個階段需要的是完全相反的表現。閱讀大量文獻需要龐大的上下文視窗。擷取需要對結構描述嚴格且無趣的遵守。起草需要保留學術謹慎用語的細膩文字。把這三件事都放在同一個工作空間中執行,代表整批資料只需要上傳一次,脈絡會隨著切換一併帶過去,而不是要對三個不同產品重新解釋一次。
在學術工作中使用AI是否可以接受?
政策因期刊、資助單位,和機構而異,而且變動得很快,所以請查核適用於你的具體規定。整體趨勢是:在有揭露的前提下,使用AI進行擷取、起草,和編輯普遍是可以接受的,但把模型列為作者則不被接受,而且完成作品中每一項論述與引用的全部責任,仍然在你身上。請隨手記錄下你在過程中用了什麼。
我可以上傳尚未發表或機密的資料嗎?
Whizi不會用你的對話內容做訓練,而且每一家供應商的政策,在你啟用該模型之前都可以查看,但你的倫理審查核准,以及任何資料共享協議,才是真正有約束力的條件。除非你的核准明確涵蓋第三方處理,否則人體受試者資料幾乎都應該排除在外。去識別化的摘錄,以及你自己撰寫的草稿,是常見的安全情況。