怎麼在Whizi中並排比較AI模型

快速解答

若要在Whizi中並排比較AI模型,請在聊天標題列按下比較,為每一欄選擇一個模型,然後把同一個提示詞送給兩者。每一欄都保有自己的對話內容,因此其中一個答案不會受到另一個的影響。並排比較是Powerhouse功能,且每個答案都會依照該模型自己的點數費率計費。

簡短答案

在聊天標題列按下比較,為每一欄選擇一個模型,然後把同一個提示詞同時送給兩者。每一欄都保有各自隱藏的對話內容,因此沒有任何一個模型能看到另一個的輸出,答案也不會被彼此影響,這正是這種比較之所以有意義的全部原因。兩欄會依序輸出,先左後右,因為每個帳號同一時間只能執行一次生成。

並排比較是Powerhouse功能,一次執行兩個模型。每個答案都依照該模型自己的點數費率計費,所以拿一個10點的模型和一個20點的模型比較,總共要花30點。

用它來決定某一類工作應該把哪個模型當作預設選項。如果你要的是把一個答案改得更好,而不是比較兩個答案,那就改用另一種做法:在同一個對話串裡切換模型,請第二個模型批評第一個答案。

為什麼基準測試回答不了你的問題

已公開的基準測試衡量的是標準化任務上的表現。你的問題範圍更窄,也更實用:對於你自己每週要做二十次的那件事,哪個模型比較擅長。這是兩個不同的問題,而第二個問題沒有公開的答案,因為沒有人跟你的工作量一樣。

用同一個提示詞測試兩個模型,大約三十秒就能直接得到答案。重點不在於你拿到了兩個答案,而在於你能知道兩者的差距有多大。有時候輸出結果幾乎一樣,這就告訴你這項任務不必再糾結該選哪個模型。有時候其中一個根本不能用,這一點最好在你把整個工作流程建立在它之上以前就先知道。

比較還能抓到另一件事:自信滿滿的錯誤。當兩個模型對同一個事實性問題給出實質不同的答案時,其中至少有一個是錯的,而如果你只看其中一個答案,根本不會發現。這種訊號無論花多少代價,在只用單一模型的工作流程裡都得不到。

在你閱讀之前,先決定「更好」代表什麼

並排比較最容易踩到的陷阱,就是偏好比較長、比較有自信,或是比較修飾過的輸出。這些都不等於品質。先選好你的判斷標準,再開始閱讀。

任務「更好」代表什麼該忽略什麼
寫作需要的修改越少,越能直接送出長度、詞彙、熱情程度
事實查證來源能夠查證並支持該論點流暢度和自信程度
資料擷取結構正確、沒有捏造欄位、標籤一致表格周圍的文字品質
推理每個步驟都站得住腳,且處理了邊界情況結論是否符合你原先的預期
程式碼有處理失敗路徑,且可供審查巧妙程度、簡潔度
摘要保留重點、捨棄不重要的內容涵蓋範圍是否夠廣

一個實用的小技巧:在閱讀任何一個輸出之前,先寫下一句話,描述一個好答案應該包含什麼內容,然後再開始閱讀。這只要花十秒鐘,卻能防止「修飾偏誤」,這種偏誤很強,而且大多是不自覺的。

對於事實性問題,該檢查的是兩者的分歧之處,而不是誰贏了。如果兩個模型對某個具體數字和來源意見一致,那麼你可以合理地有信心。如果它們出現分歧,那正是你該去查證的地方,也是整個練習中最有價值的產出。

能凸顯真正差異的提示詞

有些任務能清楚區分模型的高下,有些則不行。如果你想從比較中學到一些東西,就要用能考驗特定能力的提示詞。

  • 語氣的考驗。 寫一封信給客戶,說明我們趕不上期限,願意承擔責任,但不要過度道歉、也不要找藉口。字數在120字以內。語域上的差異在這裡會立刻顯現出來。
  • 嚴格擷取。 把這段文字裡的每個日期、金額和當事人擷取出來,放進一個JSON陣列,欄位名稱要完全一致。如果某個欄位不存在,就填null,不要用猜測補上。測試的是格式紀律,以及模型是否有捏造內容的傾向。
  • 有陷阱的推理。 給模型一個乍看合理、其實答案錯誤的問題,例如直覺解法是錯的比率或比例問題。模型是否會抄捷徑,彼此表現不同。
  • 長文脈絡回憶。 上傳一份長文件,詢問中間段落的內容。這能揭露真正可用的脈絡長度,而不是官方宣稱的脈絡長度。
  • 承認不知道。 關於[某個真的很冷門或非常新的事件],官方公布了什麼? 最好的答案是清楚說「我不知道」,或是附上來源的檢索結果。在這裡捏造內容是不及格的。
  • 遵守否定限制。 不要用任何比喻或譬喻來解釋X。 模型遵守否定指示的程度,落差比你想像的還大。

拿你自己真實的工作來做比較,而不是拿益智謎題。一個更擅長寫你的季報的模型,遠比一個更擅長解邏輯謎題的模型來得實用。

把一週的比較結果變成模型分派地圖

單一一次比較很有趣,但一整週的比較才能真正拿來行動。做法如下:

  1. 連續五天,只要遇到重要的任務,就用兩個模型而不是一個來執行。
  2. 記下任務類型、哪個模型贏了,以及差距有多大,三個字就夠了。
  3. 一週結束後,找出哪個模型反覆勝出,哪些輸出結果其實可以互換。
  4. 依此設定你的預設模型,並停止在差距一直是零的任務上繼續比較。

大家通常會發現,比較只在少數工作上有意義,剩下的則是浪費時間。快速的事實查詢、簡單的改寫,以及例行的格式整理,很少能分出模型的高下。但要給客戶看的文字、會影響決策的研究,以及對不熟悉主題的推理,模型之間的差距就會很明顯。

這個結果就是收穫所在:在沒有差別的地方停止比較,把心力留給真正會改變結果的任務。

並排比較 vs 循序比較

這是兩種不同的技巧,值得分清楚。

並排比較會把同一個提示詞送給兩個看不到彼此輸出的模型。每一欄都保有各自隱藏的對話內容,名稱會加上[Compare]前綴,並且不會出現在側邊欄裡,所以後續追問仍然是公平的測試:兩個模型都各自保有獨立的多輪對話脈絡。這是用來選定預設模型,以及抓出事實性分歧的正確工具。

循序比較指的是先拿到一個答案,然後在同一個對話串裡切換模型,請新的模型批評前一個答案。當你要的是找出瑕疵,而不是做比較時,就用這個做法,因為第二個模型可以直接針對特定論點提出意見。詳見在對話中途切換模型

粗略的原則是:想決定用哪個模型,就用並排比較;想把一個答案改得更好,就用循序比較。

操作清單
  • 先在一般聊天中把提示詞寫好、修改好,再進行比較
  • 在閱讀任何一個輸出之前,先決定這項任務的「更好」代表什麼
  • 先寫下一句話描述好答案的樣子,再開始閱讀,以避免修飾偏誤
  • 面對事實性問題時,把兩者的分歧當成發現,並去查證它
  • 拿自己真實的工作來比較,而不是拿益智謎題
  • 連續一週記錄誰贏了、差距有多大,再依照這個模式設定預設值
  • 在差距一直是零的任務上,停止繼續比較

常見問題

我一次最多可以比較幾個模型?

並排比較是Powerhouse功能,一次執行兩個模型,這是刻意的設計:兩欄才是你真的能仔細閱讀的版面配置。三欄很容易變成隨便瀏覽,而隨便瀏覽會讓整件事失去意義,因為這個做法的價值就在於察覺答案真正不同的地方。

並排比較會多用掉我每個月的訊息額度嗎?

是的,費用會加倍:兩個模型各自產出一個答案,每個答案都依照該模型自己的點數費率計費,所以拿一個10點的模型和一個20點的模型比較,總共會花30點,而不是10點或20點。在成果送出以前抓到錯誤答案或不能用的草稿,通常值得這個代價。比較有效率的做法是把比較用在重要決策和交付成果上,日常查詢和快速改寫則交給單一模型就好。

如果兩個答案一樣好,該怎麼辦?

這也是一個真實而有用的結果:它告訴你這項任務不必依賴模型選擇,所以不用再花心力在上面,直接用你的預設模型就好。大多數的工作量都是這樣分布的:大部分任務模型可以互換,少部分任務差距很大。找出哪些屬於哪一類,正是連續一週做比較的意義所在。

我要怎麼避免只挑聽起來比較好的那個答案?

在閱讀之前先決定你的判斷標準。比較長、比較有自信、比較修飾過的輸出,即使品質其實更差,仍然會被系統性地偏好,而這種偏誤大多是不自覺的。在看答案之前,先寫下一句話描述好答案應該包含什麼,就足以抵銷大部分這種偏誤。對於事實性的工作,判斷標準應該是來源能不能查證並支持該論點,而不是答案讀起來順不順。

我應該比較哪兩個模型?

比較你在那項特定任務中,真正在猶豫要選哪個的那兩個模型,對大多數人來說,寫作和推理通常是Claude對上GPT,牽涉到文件時則是大脈絡模型對上你的預設模型。拿一個你根本不會用的模型去和你最愛用的模型比較,得不到任何你會採取行動的結論。