沒有人回頭檢查
2025年3月,Dario Amodei告訴外交關係協會,AI將在三到六個月內寫出90%的程式碼,十二個月內幾乎寫出全部。那個十二個月的期限在今年3月已經過去,幾乎沒有人回頭檢查過。
這正是AI預測界奇怪的默契:預測聲量大、有明確日期、講得斬釘截鐵,等到日期一到,大家早已轉向下一個預測。沒有計分板,所以我做了一個。
2025年2月,我基於Altman對2025年的判斷是對的這個假設,把代理人工作流程排進了Whizi的產品規劃。六週後我砍掉了這個專案,因為算完一次多步驟代理人任務的成本後,發現遠比固定月費訂閱貴太多。我自己的六週產品時程,就這樣花在了別人的預測上。我找出每一則我能查到、有明確日期且期限已過的2024與2025年預測,只要有第一手來源,一共18則入選。
評分規則,方便你來吵架:一則預測依它自己說出口的話,在它自己訂的期限內打分。如果你說9月前達到90%,結果9月只有30%,「反正遲早會到」不是分數,是藉口。
計分板
| 誰,何時 | 預測內容 | 實際結果 | 分數 |
|---|---|---|---|
| Sam Altman,2025年1月 | AI代理人在2025年「加入職場」 | 95%的企業試點沒有損益影響;表現最好的代理人只完成30.3%的辦公室任務 | C- |
| Marc Benioff,2024年9月 | 2025年底前推出十億個Agentforce代理人 | 約2.9萬筆交易,年度經常性收入$1B | F |
| Klarna,2024年2月 | AI助理做700名客服人員的工作量 | 2025年5月起重新聘僱人力,因品質下降 | C |
| Dario Amodei,2025年3月 | 三到六個月內程式碼達90% | 全產業約25%到41%,Google到2026年中約75% | C+ |
| Dario Amodei,2025年3月 | 十二個月內幾乎全部程式碼 | 差距很大 | F |
| Eric Schmidt,2025年4月 | 一年內絕大多數程式設計師被取代 | 程式設計師仍在職;入門職缺約減少16% | F |
| Mark Zuckerberg,2025年1月 | 2025年內推出AI中階工程師、領先全球的十億用戶助理,以及最頂尖的Llama模型 | 三項全數落空,人類工程師薪酬反而創新高 | F |
| Elon Musk,2024年4月 | 2025年底前AI智力超越任何人類 | Grok 4在「人類最後考試」拿下25.4% | F |
| Mira Murati,2024年6月 | 約18個月內在「特定任務」上達到博士級智慧 | 2025年國際數學奧林匹亞拿下正式認證金牌 | B- |
| Gary Marcus,2025年1月 | 25則有日期的預測,本文評分其中4則 | 4則全對,但錯過了年度所有的成功案例 | A- |
從未真正上工的職場
Sam Altman,2025年1月:「我們相信,2025年,我們可能會看到第一批AI代理人『加入職場』,並實質改變企業的產出。」
MIT的NANDA計畫在2025年8月發現,95%的企業生成式AI試點沒有帶來可衡量的損益影響。卡內基美隆大學讓一家虛擬公司完全由AI代理人組成,並衡量它們完成的辦公室工作:表現最好的模型只完成了30.3%的任務。一個做到30%的員工不算加入你的職場,而是連試用期都過不了。
有一個例外讓這項預測免於不及格:在軟體公司內部,程式碼代理人確實改變了產出。評分:C-。
Marc Benioff,2024年9月:「我們的願景很大膽:到2025年底前,用Agentforce賦能十億個代理人。」
Salesforce回報,截至2026年初累計約2.9萬筆Agentforce交易,年度經常性收入突破$1B。這是真實的業務,但若以交易數而非代理人數計算,離目標差了約3.4萬倍。我最喜歡的細節是:Salesforce現在改用「服務的代理工作單位」(38億個)作為指標,不再公布代理人數量。當數字達不到目標,就換一個單位。評分:F。
Klarna,2024年2月:其AI助理「正在做相當於700名全職客服人員的工作量」。
接著在2025年5月,執行長Sebastian Siemiatkowski改變方向,開始重新聘僱人力:「我們過度專注在效率與成本上,結果是品質下降。」AI保留了例行工單,重要的事全部交回人類。值得肯定的是他公開了這場實驗並承認結果。評分:C。
真正被寫出來的程式碼
Amodei的90%。方向是對的,分母卻錯了。Google表示,截至2026年中,新程式碼中有75%由AI生成,較2024年底的25%大幅提升,不過這個數字把每一次接受的自動補全都算進去,而且部署前人類仍會審查。2026年初全產業的估計值大致落在25%到41%之間。
所以:六個月內達到全部程式碼的90%,沒有。十二個月內幾乎全部,差距很大。程式碼寫作方式出現歷史性轉變,絕對是真的。這則預測描述了一場真實的革命,卻把每個數字都猜錯了。評分:90%給C+,「幾乎全部」給F。
Eric Schmidt,2025年4月:「在接下來的一年內,絕大多數程式設計師將被AI程式設計師取代。」
一年期限已到。程式設計師幾乎在原本工作的地方都還在職。真正的勞動衝擊比預測更狹窄也更殘酷:史丹佛與ADP的薪資數據顯示,自2022年底以來,22到25歲、從事AI高曝險工作的族群就業率下降約16%,而且仍在下滑。受衝擊的是入門職位,絕大多數人保住了工作,還多了Copilot授權。評分:F。
還有一個沒人預測到的數字:Cursor的年度經常性收入約17個月內從$100M衝到$4B,8月14日SpaceX完成對該公司的$60B收購,創下史上最大的新創收購紀錄。我查過的2024年預測清單裡,沒有一份寫著「一款程式碼編輯器將成為史上最大新創出場案」。
Meta代價高昂的一年
Mark Zuckerberg,2025年1月,在Joe Rogan的節目上說:「大概在2025年,我們Meta……會擁有一個能有效扮演公司中階工程師角色、能寫程式碼的AI。」幾週後在財報會議上,他又追加了2025年的另外兩項:Meta AI成為領先全球的十億用戶助理,以及Llama成為最先進、使用最廣的模型。
三項全部沒有實現。Llama 4推出時反應平淡,Gemini 3則在2025年11月奪下最前沿模型的寶座。而Meta這一年反而拿出真金白銀下了相反的賭注:以$14.3B收購Scale AI一半股權,研究員薪酬據報介於$100M到$450M之間,接著10月從超級智慧實驗室裁掉600人,2026年5月又裁員約8000人。
Meta預測會有一個像中階工程師一樣寫程式的AI,結果卻花了18個月替真人工程師刷新了全球薪酬紀錄。評分:F。
Elon Musk,2024年4月:AI「大概在明年底前,智力會超越任何一個人類」。
到2025年底,xAI的旗艦模型是Grok 4,上市時號稱「全世界最聰明的AI」,卻在一個名叫「人類最後考試」的基準測驗上只拿到25.4%。這項宣稱一遇到考試就撐不住了。評分:F。
Mira Murati,2024年6月:大約18個月內,在「特定任務」上達到博士級智慧。
在數學領域,這基本上成真了:Google DeepMind的Deep Think在2025年國際數學奧林匹亞拿下正式認證的金牌,遠遠早於多數2024年的預測。她用的限定詞「特定任務」發揮了很大作用,而這正是她那些嗓門更大的同行不願使用的限定詞。有限定條件的版本說中了,不設限的版本,也就是2025年8月以GPT-5「博士級」為賣點推出的那個版本,結果糟到讓Altman承認OpenAI「徹底搞砸了」這次發表。評分:B-。
懷疑論者的成績單
Gary Marcus在2025年1月1日發表了25則有明確日期的預測。整個產業大多對他不屑一顧。以下是對他可評分內容的打分:
- 「今年不會出現通用人工智慧。」正確。
- 代理人在2025年會「被大肆炒作,但遠遠稱不上可靠」。正確,參見本文第一部分整段內容。
- 「AI模型的獲利將持續平平或幾乎沒有。」營收確實爆發性成長,但他說的是獲利,而各大實驗室至今仍在燒錢。就字面而言正確。
- 2025年可能不會出現「GPT-5等級」的共識性躍進。GPT-5推出了,但躍進沒有出現。就精神而言正確。
評分:A-。扣分是因為這份清單沒有預測到的事:沒有預測到價值$4B的程式碼工具品類、沒有預測到IMO金牌,也沒有預測到代理人會在少數結果可驗證的領域真正變得有用。2025年預測最準的人,把每個失敗都說中了,卻錯過了每一個成功。
還有一個令人不太舒服的第二層事實:說對了幾乎沒有得到任何回報。押注他整套世界觀都是錯的那批投資人,正是把Cursor估值推到$60B的人。預測準確度和財務報酬跑在不同的計分板上,而且只有其中一個會複利成長。
能力預測成真了,部署預測沒有
把這18則預測分成兩堆,雜訊就會消失。
關於能力的預測,也就是模型能做到什麼,表現良好,有時甚至提前成真。根據METR的數據,代理人能完成的任務長度大約每四到七個月就翻倍一次,這個趨勢一直成立。
關於部署的預測,也就是組織會真正放手讓AI做什麼,幾乎全部落空。職場代理人、十億代理人平台、被取代的程式設計師、AI員工,這些全都撞上了同一堵牆:品質門檻、責任歸屬、整合成本,以及一個殘酷的事實,一個只能完成30%任務的系統只是展示品,不是可以聘用的員工。
Altman說代理人會加入職場。它們加入的其實是IDE,因為IDE是唯一一個答錯了會被編譯器抓到、而不是被客戶抓到的職場。
所以這是我現在自己拿真金白銀在用的判斷原則:聽到能力預測時要認真看待,就算聽起來很誇張,因為趨勢線一直在贏。聽到附帶日期的部署預測時,把時程加倍,再看看說這話的人在賣什麼。我用同樣的原則來挑選要付費使用的模型:基準測試是能力宣稱,實際工作流程才是部署宣稱。
從現在起,每一季我都會評分到期的預測,下一篇也會開出我自己有明確日期的預測,讓你用同一套規則來評分我。打分免費,被打分才是代價。
- 依預測自己的原話,在它自己的期限內打分;「反正遲早會到」不是分數
- 認真看待能力預測,就算聽起來很誇張,因為趨勢線一直在贏
- 把任何附帶日期的部署預測時程加倍
- 看看說這話的人在賣什麼
- 把你自己的預測寫下來並附上日期,讓別人也能回頭評分你
常見問題
Dario Amodei說AI會寫出90%的程式碼,說對了嗎?
以他訂的期限來看沒有。他說2025年3月起三到六個月內達到90%,十二個月內幾乎寫出全部程式碼。2026年初全產業估計值大致落在25%到41%,Google到2026年中約75%的新程式碼由AI生成,但這把每一次接受的自動補全都算進去。方向是對的,數字全錯。
2025年AI代理人真的加入職場了嗎?
軟體業以外沒有。MIT的NANDA計畫發現,95%的企業生成式AI試點沒有帶來可衡量的損益影響,卡內基美隆大學的代理人公司測試中,表現最好的模型只完成30.3%的辦公室任務。軟體公司內部的程式碼代理人是唯一真正的例外。
誰對2025年AI的預測最準?
懷疑論者Gary Marcus,就本文評分的內容而言:沒有出現通用人工智慧、代理人被炒作但不可靠、獲利仍然平平、沒有出現GPT-5等級的共識性躍進,四項全部說中。但他的清單也錯過了那一年所有的成功案例,從價值$4B的程式碼工具品類到IMO金牌都沒預測到。