你用完了額度,被換到了備援模型
這不是你的錯覺。當你用完強力模型的額度時,ChatGPT通常不會直接擋下你、拒絕回答。它會把對話交給一個比較小、比較便宜的模型,在同一個對話串裡繼續下去,連打字動畫都一樣。回覆裡完全沒有任何東西會告訴你,背後那台機器已經換了。你會注意到,只是因為答案變短了、變得比較平淡、比較容易忘記東西,而且錯得更有自信。
OpenAI把這個機制記載成刻意設計的行為。它的模型發布說明裡,描述了一款使用者在主要模型碰到速率限制之後,會被導向的迷你模型,並註明因為它是備援用途,所以不會出現在模型選單裡。光是這一個設計上的選擇,就解釋了大部分的困惑:你沒辦法主動選擇這個備援模型,所以你根本不會想到要去檢查自己是不是正在用它。
所以誠實的診斷是:模型很可能確實變差了,而且沒有人對你選的那個模型動過手腳。你只是被換掉了而已。這篇文章接下來要談的,就是怎麼在三十秒內確認這件事,以及怎麼不再對它感到意外。
先確認這真的是你遇到的問題,而不是另外兩種容易搞混的情況。如果你是被一則明確寫出你的方案或額度的訊息直接擋下,那是一個看得見的額度上限,ChatGPT說我已達到使用上限這篇會處理這個問題。如果每段對話都跳出通用的錯誤訊息,那是服務中斷,ChatGPT無法使用時可以用什麼這篇讀起來會更快解決問題。這篇文章談的是第三種情況,也就是完全沒有錯誤訊息的那種:一切看起來都還正常運作,只是變差了。
碰到額度上限時,實際上發生了什麼事
每一個消費者AI方案,都會用某種方式計量用量,因為執行一個大型模型,每則訊息都要花真金白銀。真正不同的地方,在於碰到上限的那一刻會發生什麼事,而你遇到下面這三種情況裡的哪一種,決定了你會有多困惑。
| 碰到上限時的行為 | 你會看到什麼 | 有多讓人困惑 |
|---|---|---|
| 直接停止 | 一則橫幅告訴你,要等到某個時間才能繼續,什麼都送不出去 | 令人惱火,但很誠實。你清楚知道自己的處境 |
| 明顯降級 | 一則通知告訴你,已經被換到一個比較小的模型 | 有點惱火,但還是誠實的 |
| 悄悄備援 | 對話就這樣繼續下去,但回答的其實是另一個模型 | 這是讓人以為產品壞掉的那一種 |
ChatGPT大多落在第三種情況。切換的那一刻,通常會有一則通知,但通知會被捲動出畫面,不會一直留在後面接續的回覆旁邊。在一段很長的對話裡,你關注的是答案本身,而不是介面上的細節,所以根本不會注意到。之後等你的視窗重置,模型又會悄悄恢復正常,這也是為什麼大家會覺得品質是隨機的,而不是被計量出來的。
關於數字,值得特別說明一下,因為這正是大多數談這個主題的文章會出錯的地方。供應商會不斷調整額度,而且不會事先公告,額度也會因方案、模型、功能,有時候還會因當下的系統負載而不同,所以任何寫在文章裡的數字,保鮮期都很短。這個數字光是這兩個月就變過兩次。OpenAI多年來都是用幾個小時為單位的滾動視窗來計量,Engadget報導指出,免費方案在2026年7月左右,似乎改成了單一的每週額度,而到了2026年8月初,OpenAI又宣布純文字聊天在各個方案裡都將變成無限使用,同時對檔案、圖片、語音和圖片生成,維持各自獨立的限制。把這個當成對「寫死的數字」的提醒來看,而不是當成現況,這篇文章自己也不例外。請直接在你自己帳戶裡的供應商限制頁面查看,而不要相信第三方的摘要。ChatGPT說我已達到使用上限這篇文章完整處理了重置的問題。
怎麼知道現在是哪個模型在回答你
不要相信感覺,去查證。介面每隔幾個月就會重新設計一次,所以與其描述今天按鈕在哪裡,不如告訴你該找什麼。這些方法對應的是功能,不是像素位置,所以就算介面改版,也一樣適用。
- 對話最上方的模型名稱。每一款聊天應用程式,都會在標題列或輸入框旁邊,顯示目前選定的模型。這告訴你的是選了什麼,不一定是誰在回答。
- 單則回覆下方的控制項。把游標移到某則答案上,或長按它。那一小排選項(複製、按讚、重試)裡,通常會有一個重新產生或「再試一次」的選項,而在ChatGPT裡,這個選單能讓你把問題重新送給一個指名的模型。這對強迫使用更強的模型很有用,但要把它當成一種重新提問的方式,而不是一張收據:截至2026年8月,我們沒辦法從OpenAI自己的文件裡確認,ChatGPT會不會標示出目前這則回覆是哪個模型寫的。不要把你的診斷方法,寄託在找到一個每則訊息都有的標籤上。
- 帳戶設定裡的用量或額度頁面。可以去看看,但別抱太大期望:消費者方案不見得會可靠地顯示一個持續計數的數字,而重置時間,出現在額度訊息裡的機率,通常比出現在設定頁面裡更高。
- 切換那一刻出現的通知。如果有出現通知,它會留在對話串裡,而不是彈出視窗,所以就算你捲過去了,它還是留在紀錄裡的某個地方。
- 不要問聊天機器人自己是哪個模型。模型並不可靠地知道自己的名字或版本,而且會很有自信地說出它訓練資料裡討論最多的那個名字。這種答案毫無價值。為什麼AI會出錯談的正是這一類很有自信的胡說八道。
因為上面每一種方法,都依賴一個可能會改變的介面,真正靠得住的檢查方法,是看行為表現。找個地方存一則簡短的基準提示詞,一則你能瞬間認出好答案的提示詞。可以是一段有難度的改寫,或是你工作裡的一道小邏輯題。當你覺得品質不太對勁時,就送出這則提示詞。幾秒鐘之內,你就會知道自己是不是在跟你以為的那個模型對話,而不管介面怎麼改版,這一招都不會被拿走。
為什麼比較小的模型感覺不一樣
備援模型不是大模型被動了手腳的版本。它是一個不同的、更小的模型,經過獨立訓練,之所以被選中,是因為執行成本低很多。比較小的模型,在大多數簡單的請求上,其實表現得相當不錯,這也是為什麼它能勝任備援這個角色。它們失敗的方式,有一套很明顯的模式,一旦你認得這套模式,就算完全不靠介面,也能看出模型被換掉了。
- 實際運作中的短期記憶比較短。比較小的模型,上下文視窗通常也比較小,就算標示出來的視窗大小差不多,它保留早期細節的可靠度也比較差。症狀就是你得重新解釋二十則訊息前就講定的事,或是它悄悄丟掉你一開始設下的限制條件。什麼是上下文視窗解釋了為什麼品質常常在碰到上限之前就開始下滑。
- 指令遵循能力較弱,尤其是疊加的指令。單一一條指令,它還跟得上。四條指令一次來(例如「兩百字以內、不要用條列、用第二人稱、不要提到客戶名字」),它就開始悄悄漏掉其中一兩條。這是最可靠的判斷依據。
- 結構變得比較平淡。答案會往一個通用的形狀靠攏:簡短開場、三個標題、總結。比較大的模型,更擅長判斷你的問題該用不一樣的結構來回答。
- 錯得更有自信。用的語氣一樣流暢,但背後的能力稍微弱一點,所以聽起來多篤定和實際上多正確之間的落差,就變得更大了。
- 多步驟推理能力較弱。任何需要同時記住好幾個中間結果的任務(帶條件的計算、有相依關係的計畫、除錯),退步的幅度,會遠大於單純的改寫。
注意這份清單裡沒有的東西:閒聊、簡短改寫、快速解釋、語氣調整、修一段文字。在這類工作上,比較小的模型幾乎分辨不出差別,而且速度更快。這是設計出來的結果,不是意外。備援模型只有在碰上真正需要大模型的請求時,才會變成問題,而你根本看不出自己拿到的是哪一個。
還有一件事,要跟備援機制放在一起看:助理也會自動路由,替你決定一個問題該用快速模型還是比較慢的推理模型來回答。當這套路由邏輯被重新調整時,同一則提示詞得到的回答深度,會跟上週不一樣,從外面看起來,就跟模型變差了一模一樣。不管是備援還是路由,都是同一款應用程式在你不知情的狀況下做出的決定,所以你沒辦法分辨「模型變了」「我被換掉了」和「我這次問得比較差」這三件事,到底是哪一件真正發生了。
該怎麼辦
大致依花費的心力排序。前三項免費,而且只要幾分鐘。
- 先確認,再抱怨。送出你存好的基準提示詞。如果答案比你知道那則提示詞該有的水準還要平淡,你就是在用備援模型,通常等視窗重置後就會恢復正常。
- 把強力模型的用量分配好。丟掉不重要的工作(改寫、腦力激盪、快速問答)找便宜的地方做。冗長又沒有焦點的對話串,最快把額度用光。
- 每項任務都開一個新對話。冗長的對話串,會把整段歷史都帶進每一次請求裡,這樣成本更高,也讓比較小的備援模型更快撐不住。
- 在小模型上時,把指令拆開來下。它能可靠地跟上一條指令,但四條就不太可靠了,所以就分四則訊息送出去。
- 任何你會拿去採取行動的內容,都要查證。在備援視窗裡,模型的自信程度依然很高,準確度卻下降了。這正是一個錯誤數字最容易溜過去的時候。
- 手邊留一個可以隨時用的第二個強力模型。只有當一款應用程式獨占了路由決定權,而它把你換掉時你又無處可去,這種意外才會真正傷到你。一個備用帳號,或是一個能同時容納好幾個模型的工作區,能把一次悄悄的降級,變成一個你自己能做的選擇。
上面這些做法,都不會讓速率限制消失,也不應該有人告訴你它會消失。運算能力到哪裡都要花錢。真正改變的是,這個限制變得看得見、也能應付得了,而不是等你一週後才發現,自己一半的工作,都是一個你從沒選過的模型寫出來的。如果你不確定哪個模型適合哪種工作,怎麼選AI模型提供的是一套判斷架構,而不是一張排行榜。
- 在斷定產品本身變差之前,先送出你的基準提示詞。
- 絕對不要問聊天機器人自己是哪個模型,因為它並不可靠地知道答案。
- 存好一則基準提示詞,讓你能瞬間認出一個好答案。
- 到供應商自己的額度頁面查看目前的上限,而不是靠文章裡的數字。
- 當你被困在比較小的模型上時,一次只下一條指令。
- 每項任務都開新對話,避免冗長的對話串把額度用光。
- 在你需要之前,就先準備好一個來自另一家公司的強力模型。
常見問題
為什麼ChatGPT把我換成了迷你模型?
幾乎都是因為你在目前的用量視窗內,用完了主要模型的額度。ChatGPT並不會直接擋下對話,而是把它交給一個比較小的備援模型,繼續回答。OpenAI在自己的模型發布說明裡有記載這件事,包括備援模型是刻意不出現在模型選單裡的。
這個降級狀態會持續多久?
會持續到你的額度重新填滿為止,而額度背後的計算方式,改變時通常不太會事先公告。OpenAI多年來都用幾個小時為單位的滾動視窗計量,免費方案在2026年7月左右,似乎改成了單一的每週額度,而到了2026年8月初,OpenAI宣布純文字聊天在各方案裡都變成無限使用,但推理、檔案、圖片和語音,仍然分開計量。這類機制都不會在你當地的午夜重置。你自己的帳戶,是唯一能可靠看到適用於你的重置時間的地方。
我要怎麼知道是哪個模型回答了某一則特定訊息?
通常沒辦法,至少從介面上看不出來。對話最上方的選單,顯示的是選定了什麼,但在備援視窗期間,這不代表實際情況,而截至2026年8月,我們無法確認ChatGPT會不會替每則回覆標示出寫下它的模型。可靠的檢查方式是看行為表現:送出一則你能瞬間認出好答案的存檔提示詞,再拿來比較。不要直接問模型本身,因為它並不可靠地知道自己的真實身分。
迷你模型是真的變差了,還是只是感覺變差了?
它確實是一個更小的模型,所以在多步驟推理、同時遵循好幾條疊加的指令,以及在長對話裡保留細節這幾方面,都比較弱。在簡短的改寫、摘要和閒聊式問題上,差異很小,而且速度更快。問題在於,你根本看不出自己什麼時候用的是它。
付更多錢,能避免這種情況發生嗎?
它只是拉高了天花板,而不是把天花板拆掉。等級比較高的方案,額度也比較大,但每一個消費者方案,都會用某種方式計量用量,重度使用者就算用的是付費方案,還是會碰到上限,還是會被換到備援模型。把升級當成是買到更多空間,而不是買到豁免權。
其他AI助理,也會做同樣的事嗎?
備援和自動路由,是整個業界普遍的做法,不是單一一家公司才有。Google的Gemini CLI,在碰到額度上限時,會從Pro模型降到速度更快的Flash模型(用個人Google帳號的話,免費方案允許每分鐘60次模型請求,每天1,000次),而它的做法算是比較誠實的,因為它會在對話過程中印出一行文字,說明自己已經這樣做了。Anthropic在Claude Code裡,也記載了一個可設定的備援模型,用在主要模型過載的時候。細節因產品而異,所以請去查你實際依賴的那項工具,而不要假設你的助理,行為一定跟這篇文章講的一樣。