AI為什麼會給出錯誤答案?在它讓你付出代價之前先抓出來

快速解答

AI會給出錯誤答案,是因為它產生的是符合正確答案模式的文字,而這個過程裡沒有任何一個環節在查核答案是不是真的。錯誤最常聚集在具體事實、引用來源、訓練截止日之後的任何事、算術,以及帶有引導性的問題上。最快的查核方法,是把問題拿去問另一家公司的模型。

這個過程裡沒有任何環節在查核答案是不是真的

當你問AI聊天機器人一個問題時,它並不是在查找任何資料,而是一小段、一小段地產生文字,這些文字符合這類問題的正確答案通常會被寫成的樣子。這就是它全部的工作。符合模式和是不是真的,是兩個不同的目標,而這整個過程裡,沒有任何一步是朝著第二個目標去的。

大多數時候你根本不會發現,因為這兩個目標其實有重疊。這些系統學習的文字,大多是由大部分時候都答對的人所寫的,所以長得像答案的文字,通常也就是正確的文字。這個重疊只有在邊緣地帶才會變薄:稀有的、最近的、非常具體的,或模型根本沒讀過的事實。在這些邊緣地帶,產生一個正確答案該有的樣子依然很容易,產生正確答案的內容卻不容易。於是你得到的,是一句像事實一樣被建構出來的句子,數字擺在該擺的位置,還附上一個聽起來很可信的名字,描述著一件從未發生過的事。

這也解釋了為什麼最直覺的追問方式沒用。問「你確定嗎?」感覺像是在做查核,但其實不是。順應對方感覺起來很像一個有幫助的回覆,所以外部的壓力,往往只會換來順應,模型常常會道歉,然後把一個正確的答案,換成一個更糟的答案。花兩分鐘測試看看:問一件你已經知道答案的事,先接受正確的答案,再說一句「這個聽起來不太對」,然後觀察它的反應。你會看到的,是同一套機制,只是在產生一段順應你的文字。想了解這一切最基本的原理,AI究竟是什麼用不涉及數學的方式說明了這件事。

它最常出錯的五個地方

錯誤不會平均分布在你可能問的每一件事上,它們是聚集出現的。認識這五個聚集點,能在對的時機,在你心裡響起一個小小的警鈴,這比那種一直保持警戒、最後乾脆完全麻木的模糊謹慎感,要有用得多。

出錯的地方看起來的樣子一句話範例
具體的事實和數字一個精確的數字,背後卻什麼都沒有告訴你一間本地商店1987年開幕,實際上是1994年
引用來源、引言、連結標題聽起來很真、網址看起來也很真,卻一個都打不開一篇由兩位真實研究者發表在真實期刊上的研究,其實從來沒被寫過
訓練截止日之後的任何事對一個已經停格好幾個月的世界,給出篤定的答案引用去年的訂閱價格,而該方案在三月就已經調整過了
算術和計數方法對了,總數卻錯了把十一筆發票金額加起來,結果差了40美元
自帶答案的問題把順從包裝成分析問「為什麼X是比較好的選擇?」,得到的永遠是支持X的理由,從不質疑它

引用來源這一列,付出過一次很有名的代價。2023年6月,一位聯邦法官對兩位紐約律師和他們的事務所開出5,000美元的罰款,原因是他們提交的一份訴狀,建立在六個ChatGPT捏造出來的判例上,還附上了看似真實的姓名、引註和引述段落(Mata v. Avianca案)。不過最後一列,才是你自己造成的,也是實際使用中最常見的一種。問「為什麼X比Y好」,幾乎注定會得到一份支持X的說詞,而一個問題裡帶著「肯定」或「難道不是」這類字眼,通常也會得到肯定的回答。改問這樣的問題:「針對這個情況比較X和Y,然後不管你選了哪一個,都給我反對它的最強理由。」讓問題不夾帶答案,是大家所說的「提示詞技巧」的一半,怎麼跟AI對話講的就是另一半。還有一個值得早點知道的怪癖:在一段很長的對話裡,或你貼上一份很長的文件之後,一開始的細節可能會滑出模型的視野之外,而它會自己填補這個空洞,而不是告訴你它已經跟丟了。這是容量上的限制,不是真實性的問題,什麼是上下文視窗解釋了這個上限落在哪裡。

篤定的語氣不是在虛張聲勢

大多數人來到這裡時,都帶著一個聽起來很合理的假設:這東西知道自己有多確定,只是為了顯得能幹,才把疑慮藏起來。這個假設是錯的,而且這件事很重要,因為它會讓你去尋找一個根本不存在的篤定信號。

沒有什麼確定度指標被隱藏起來不給你看。這套系統並不是私下握有一個62%的數字,卻選擇用聽起來像100%的方式講出來。它產生一個錯誤答案的過程,跟產生一個正確答案的過程完全一樣,流暢度也完全一樣。這正是為什麼語氣在這裡毫無參考價值的原因,跟對待人的時候不一樣。像「我不是完全確定,不過」這類保留語氣的說法,同樣是生成出來的文字。它會出現,是因為這種措辭適合這類問題,而不是因為內部觸發了什麼警訊。請一個模型幫自己打確定度,滿分十分,你會拿到一個數字,而且經常是個很高的數字,就緊挨在它捏造出來的引用來源旁邊。那個分數,跟那則引用來源,是用同一套過程產生出來的。

所以像「只有在你確定的時候才回答」或「不要捏造任何內容」這類指示,效果沒有大家希望的那麼好。在重要的問題後面加上「如果你不知道,就說你不知道」,還是值得做,因為比較新的模型,確實比以前更願意直接說不知道,但把它當成一個提醒,而不是一個保證。真正靠得住的做法,是把方向轉向外部:讓答案給你一個你能親自打開查看的東西。當一款應用程式有搜尋網路並附上連結時,你就能自己讀那個網頁,不必單靠它的一面之詞。當它只靠記憶回答時,它的話就是你唯一擁有的東西。

四種查核方法,按代價由小到大排列

你不可能查核每一件事,硬要這麼做,最後結果只會是什麼都沒查核。你要的,是一種代價比犯錯本身還低的查核方法。以下這四種,從幾乎免費到稍微麻煩,而對大多數問題來說,你隨手拿來用的第一種就已經夠了。

  1. 要求提供來源,然後真的打開來看。不要只是把「請附上來源」當成一種儀式,要真的點進去。一個失效的連結,或一個根本沒提到這項說法的正常網頁,大概十秒鐘就能讓你有答案。
  2. 在一段新的對話裡再問一次。同樣的問題,換一段新對話,不帶前面任何一來一往的內容。如果數字、名字或日期跟前一次不一樣,代表模型在填補空缺,而不是在回想什麼。這不花你任何成本,卻能抓出不少捏造出來的細節。
  3. 問另一個模型。對事實類問題來說,這是單一最有價值的查核方式。把同一個問題貼給第二家供應商,比較的是細節,不是語氣。
  4. 用一般方式搜尋一次。任何你要寄出、簽署、發布,或要花錢的事,花九十秒用搜尋引擎查一次。AI很擅長當作第一輪初步結果,但第一輪初步結果不等於查核完成。

第三點是有道理才排進來的。兩個由不同公司打造、用不同資料和不同方法訓練出來的模型,可能同時對同一個問題答錯。但它們幾乎不會捏造出一模一樣的錯誤細節,因為一項捏造出來的具體內容,來自於某一套特定系統獨有的漏洞。當Claude和ChatGPT各自獨立給你同一個數字時,這個數字大概是真的。當它們的答案不一致時,你就找到了確切值得查核的那句話,這比一種說不上來的、隱約覺得哪裡怪怪的感覺要有用得多。偶爾查核一次,兩家供應商的免費方案就夠用,也不花你一毛錢。一旦交叉查核變成一種習慣,免費就撐不住了,因為每家供應商的付費方案大約每月20美元,而這正是像Whizi這種多模型訂閱能補上的缺口。一起使用多個模型講解了這整套工作流程。

哪些地方真的要在意,哪些其實不用

一套什麼都要查核的習慣,撐不過一個星期就會崩潰。你問的大多數事情,風險都很低,而且能自己判斷對錯。請它把你自己的郵件改短,你自己就能看出來是不是真的變短了、意思有沒有跑掉。腦力激盪、取名字、列大綱、起草,或翻譯一則你送出前會自己再讀一遍的訊息,還有把雜亂的筆記整理成清單,都是同樣的道理。你自己就是查核者,出錯的話會立刻出現在你眼前。

兩個問題就能把任何任務分到對的類別裡,而且問自己這兩個問題只要三秒鐘。

  1. 如果這是錯的,誰會發現,什麼時候發現?是你,十秒鐘後讀到的時候,還是三個月後的客戶?
  2. 這件事能撤銷嗎?刪掉一段寫壞的文字不花任何代價。重新申報一次稅、收回一份已經送出的報價,或撤銷一筆付款,可就不是這麼回事。

如果任何一個答案讓你猶豫了,那就在行動之前,把每一項具體說法都查核一遍。明顯屬於這一類的:藥物名稱和劑量、法律和申報期限、稅務數字、合約條款、任何牽涉到某人健康或移民身分的事,以及會動用金錢或處理個資的程式碼。郵件裡用錯一個同義詞,頂多讓你看起來有點奇怪一整天。劑量錯了或錯過期限,事後AI可不會替你收拾。AI安不安全更深入談了這個面向,包括絕對不該貼進去的內容。從一個習慣開始:只要答案裡出現數字、姓名、日期或連結,就把那個部分單獨當成未經查核的內容,去核對它。其他部分通常沒問題。

操作清單
  • 把答案裡的每一個數字、姓名、日期和連結,都當成未經查核,直到你自己確認過為止
  • 別再用「你確定嗎?」來測試,因為外部壓力只會換來順應,不會換來修正
  • 要求提供來源,打開它們,確認頁面上真的寫著答案所說的內容
  • 把重要的問題在一段新對話裡再問一次,看看細節是否一致
  • 在依賴事實類問題的答案之前,先拿去問另一家公司的模型
  • 把帶引導性的問題重新表述,不要透露你想要哪個答案
  • 問自己這件事錯了誰會發現、你能不能撤銷,再決定要查核到什麼程度

常見問題

什麼是AI幻覺?

幻覺指的是一個語氣篤定、結構完整,卻根本不是真的的答案:一項捏造出來的統計數字、一個不存在的引用來源、一項產品從來沒有過的功能。這個名字取得不太好,因為它其實沒有在「想像」任何東西。系統產生的是符合正確答案模式的文字,只是這一次,模式和真相剛好對不上。

AI為什麼會捏造內容,而不是直接說不知道?

說「我不知道」只是眾多符合這個問題的回覆之一,而一個流暢的答案,通常更符合這個問題。模型並沒有一個獨立的步驟,會在產生一項事實之前先查核它,所以沒有任何東西能觸發拒答。比較新的模型,比舊模型更常拒絕回答,而在它真的不知道時,直接要求它說「不知道」,確實多少有點幫助。

AI的答案能信任嗎?

可以信任它的推理、結構和起草能力,這些正是這類工具真正擅長的地方。但不要在沒查核的情況下信任細節:數字、姓名、日期、引言、引用來源,以及任何最近發生的事。這種區分,就是在這裡實際可行的信任方式,讓你能每天用AI,卻不會因此吃虧。

問「你確定嗎?」能修正錯誤答案嗎?

很少能,甚至可能讓情況更糟。模型往往會順應你的質疑,所以常常會放棄一個正確的答案,換成一個更差的答案。用同樣的問題開一段新對話,是好得多的測試方式,因為第二次的答案,不會帶著你質疑的壓力被產生出來。

我該怎麼快速查核AI的答案?

打開它給你的任何來源,確認上面真的寫著它所說的內容。如果沒有來源,就在一段新對話裡問同樣的問題,看看細節有沒有維持一致。任何你打算據以行動的事實類內容,都拿去問另一家供應商的模型,因為兩套系統很少會捏造出一模一樣的細節。