没有人回头核对
2025年3月,Dario Amodei在外交关系委员会上表示,AI将在三到六个月内写出90%的代码,十二个月内几乎写出全部代码。那个十二个月的截止日期在今年3月就已经过去。几乎没有人回头核对过。
这正是AI预测圈的奇怪礼节:预测喊得响亮、有明确日期、说得斩钉截铁,然后日期一到,大家都已经在谈论下一个预测了。没有记分牌。所以我做了一个。
2025年2月,我在Whizi里规划了agent工作流,赌的是Altman对2025年的判断是对的。六周后我砍掉了这个项目,因为算清楚了单次多步agent运行的成本,相比一份固定月费订阅根本不划算。我自己路线图里的六周时间,就这样花在了别人的预测上。我找出了每一条能查到原始出处、且截止日期已经过去的2024和2025年预测。最终有18条入选。
打分规则说在前头,方便你反驳:一条预测,就按它自己的原话和自己的截止日期来打分。如果你说9月前达到90%,结果9月只到了30%,“早晚会实现”不是一个分数,是一个借口。
记分牌
| 谁,何时 | 预测内容 | 实际情况 | 评级 |
|---|---|---|---|
| Sam Altman,2025年1月 | AI agent在2025年“加入职场” | 95%的企业试点没有带来利润影响;表现最好的agent完成了30.3%的办公任务 | C- |
| Marc Benioff,2024年9月 | 到2025年底实现十亿个Agentforce agent | 约29,000笔交易,年经常性收入$1B | F |
| Klarna,2024年2月 | AI助手完成相当于700名客服的工作量 | 2025年5月起因质量下降重新招人 | C |
| Dario Amodei,2025年3月 | 三到六个月内90%的代码由AI完成 | 全行业25%到41%,2026年年中Google达到75% | C+ |
| Dario Amodei,2025年3月 | 十二个月内几乎全部代码 | 远未实现 | F |
| Eric Schmidt,2025年4月 | 一年内绝大多数程序员被取代 | 程序员仍在职;入门级岗位下降约16% | F |
| Mark Zuckerberg,2025年1月 | 2025年内实现AI中级工程师、领先的十亿用户助手,以及Llama成为最强模型,三者兼得 | 三者均未实现;反而给人类工程师开出破纪录薪酬 | F |
| Elon Musk,2024年4月 | 到2025年底AI比任何人类都聪明 | Grok 4在Humanity's Last Exam上得分25.4% | F |
| Mira Murati,2024年6月 | 约18个月内“在特定任务上”达到博士级智能 | 2025年国际数学奥林匹克竞赛获认证金牌 | B- |
| Gary Marcus,2025年1月 | 25条有日期的预测,这里评了其中4条 | 全部四条正确,但没有押中今年的任何一个成功案例 | A- |
从未真正上岗的职场
Sam Altman,2025年1月:“我们相信,在2025年,我们可能会看到第一批AI agent‘加入职场’,并实质性地改变公司的产出。”
MIT的NANDA项目在2025年8月发现,95%的企业生成式AI试点没有带来可衡量的利润影响。卡内基梅隆大学用AI agent组建了一家虚拟公司,并测量它们完成的办公室工作:表现最好的模型只完成了30.3%的任务。一个完成度30%的员工不是加入职场,而是没通过试用期就被淘汰。
有一个例外能把它从F里拉回来:在软件公司内部,编程agent确实改变了产出。评级:C-。
Marc Benioff,2024年9月:“我们的愿景很大胆:到2025年底,通过Agentforce赋能十亿个agent。”
Salesforce报告称,截至2026年初累计约有29,000笔Agentforce交易,年经常性收入突破$1B。这是一门真实的生意,但按交易数而非agent数来算,与承诺相差约34,000倍。我最喜欢的一个细节是:Salesforce现在改用“已完成的agentic工作单元”(38亿个)来汇报,而不再统计agent数量。数字达不到,就换个统计口径。评级:F。
Klarna,2024年2月:其AI助手“完成的工作量相当于700名全职客服”。
然后在2025年5月,CEO Sebastian Siemiatkowski转变方向,开始重新招聘人类:“我们太过专注于效率和成本,结果是质量下降。”AI保留了常规工单,人类回来处理所有重要的事。值得肯定的是,他们公开做了这个实验,也公开承认了结果。评级:C。
真正被写出来的代码
Amodei说的90%。方向是对的,分母错了。Google表示,截至2026年年中,其75%的新代码由AI生成,高于2024年底的25%,不过这个统计把每一次被采纳的自动补全都算了进去,而且人类在部署前仍会审核。2026年初的全行业估计集中在25%到41%之间。
所以:六个月内90%的全部代码,没有;十二个月内几乎全部代码,远未实现;代码写法发生历史性转变,这一点绝对是真的。这条预测描述了一场真实的变革,却把每个数字都说错了。评级:90%那部分C+,“几乎全部”那部分F。
Eric Schmidt,2025年4月:“未来一年内,绝大多数程序员将被AI程序员取代。”
一年期限已到。程序员几乎在原来就业的地方仍然在职。真正的劳动市场冲击比这条预测更窄也更残酷:斯坦福和ADP的薪资数据显示,自2022年底以来,22到25岁、从事AI暴露度最高工作的人群就业率下降了约16%,且仍在下滑。受冲击的是入门级岗位,绝大多数人保住了工作,还拿到了Copilot授权。评级:F。
而没有人预测到的数字是:Cursor在约十七个月内从年经常性收入$100M涨到$4B,8月14日SpaceX完成了对这家公司$60B的收购,创下史上最大的创业公司收购纪录。我查过的2024年预测清单,没有一份写着“一个代码编辑器会成为史上最大的创业公司退出案例”。
Meta花了很贵的一年
Mark Zuckerberg,2025年1月,在Joe Rogan的节目上:“大概在2025年,我们Meta……会拥有一个能有效充当中级工程师的AI,可以帮公司写代码。”几周后在财报电话会上,他又为2025年追加了两个目标:Meta AI成为领先的十亿用户助手,以及Llama成为最先进、使用最广泛的模型。
三个目标全部落空。Llama 4发布时反响平平,而Gemini 3在2025年11月夺得了前沿模型的桂冠。与此同时,Meta在这一年用真金白银押了相反的注:花$14.3B收购Scale AI一半股份,研究人员薪酬包据报道在$100M到$450M之间,随后在10月从超级智能实验室裁员600人,2026年5月又裁员约8,000人。
Meta预测会有一个能像中级工程师那样写代码的AI,结果却花了十八个月,为真人工程师创下了世界纪录级别的市场薪酬。评级:F。
Elon Musk,2024年4月:AI“可能在明年底前比任何一个人类都聪明”。
到2025年底,xAI的旗舰模型是Grok 4,发布时号称“世界上最聪明的AI”,却在一个名字就叫Humanity's Last Exam的基准测试上只得了25.4%。这个说法一遇到考试就站不住了。评级:F。
Mira Murati,2024年6月:约十八个月内“在特定任务上”达到博士级智能。
在数学上基本实现了:Google DeepMind的Deep Think在2025年国际数学奥林匹克竞赛上拿到官方认证的金牌,比多数2024年的预测提前了好几年。她用的限定语“在特定任务上”起了很大作用,恰恰是她那些声音更响的同行不愿意用的限定语。有限定的版本应验了,没有限定的版本,也就是2025年8月GPT-5那套“博士级”的宣传,翻车得很厉害,以至于Altman承认OpenAI“把发布彻底搞砸了”。评级:B-。
怀疑论者的成绩单
Gary Marcus在2025年1月1日发布了25条有日期的预测。业界大多对他不屑一顾。给他那些可以打分的说法打分:
- “今年不会出现通用人工智能。”正确。
- Agent会在“2025年被无休止地炒作,但远未可靠”。正确,参见第一部分的全部内容。
- “AI模型的利润将继续保持低迷或不存在。”收入是爆发式增长了,但他说的是利润,而各大实验室至今仍在烧钱。字面意义上正确。
- 2025年可能不会出现“GPT-5级别”的共识性跨越。GPT-5发布了,但那个跨越没有出现。精神上正确。
评级:A-。之所以扣分,是因为这份清单里没有的内容:没有预测到$4B规模的编程工具赛道,没有预测到IMO金牌,也没有预测到agent会在“产出可核实”这个唯一的领域里变得真正有用。2025年最准的预言家说中了每一次失败,却错过了每一次成功。
还有一个让人不太舒服的次生事实:说对了几乎什么也没换来。押注反对他整套世界观的投资人,正是把Cursor估值定到$60B的那批人。预测的准确度和财务回报走的是两块不同的记分牌,只有一块会复利增长。
能力预测应验了,部署预测没有
把这18条预测分成两堆,噪音就消失了。
关于能力的预测,也就是模型能做什么,普遍表现良好,有的甚至提前应验。根据METR的数据,agent能完成的任务长度大约每四到七个月翻一倍,这个趋势一直成立。
关于部署的预测,也就是组织会真的让AI做什么,几乎全部落空。职场agent、十亿agent平台、被取代的程序员、AI员工,全都撞上了同一堵墙:质量门槛、责任归属、集成成本,以及一个完成率只有30%的系统终究是个演示,不是一次雇用的现实。
Altman说agent会加入职场。它们加入的其实是IDE,因为IDE是唯一一个错误答案会被编译器而不是被客户抓住的工作场所。
所以这是我现在用的判断规则,而且是拿自己的钱押上的:听到能力预测,认真对待,哪怕是很疯狂的那种,因为趋势线一直在赢。听到带日期的部署预测,把时间线翻倍,然后看看说这话的人在卖什么。我用挑选值得付费的模型时也是同一套规则:跑分是能力主张,工作流才是部署主张。
从现在起,每个季度我都会给到期的预测打分,下一期开头会放上我自己带日期的预测,好让你用同一套标准来评判我。打分是免费的,被打分是要付出代价的。
- 按一条预测自己的原话和自己的截止日期打分,“早晚会实现”不是一个分数
- 认真对待能力预测,哪怕是很疯狂的那种,因为趋势线一直在赢
- 把任何带日期的部署预测时间翻倍
- 看看做出这条预测的人在卖什么
- 把自己的预测写下来并注明日期,好让别人反过来给你打分
常见问题
Dario Amodei说AI会写出90%的代码,说对了吗?
按他自己的截止日期算,没有对。他说2025年3月起的三到六个月内达到90%,十二个月内几乎全部代码。2026年初的全行业估计集中在25%到41%,Google到2026年年中的新代码占比是75%,且把每一次被采纳的自动补全都算了进去。方向是对的,数字是错的。
2025年AI agent真的加入职场了吗?
在软件行业之外没有。MIT的NANDA项目发现95%的企业生成式AI试点没有带来可衡量的利润影响,卡内基梅隆大学的agent公司测试中,表现最好的模型只完成了30.3%的办公任务。软件公司内部的编程agent是唯一真正的例外。
谁对2025年AI的预测最准?
怀疑论者Gary Marcus,就这里评分的说法而言:没有出现通用人工智能,agent被炒作但不可靠,利润仍然低迷,没有出现GPT-5级别的共识性跨越,全部四条都成立。但他的清单也错过了这一年的每一个成功案例,从$4B规模的编程工具赛道到IMO金牌。