De mensen die AI bouwen zijn er het slechtst in om het te voorspellen

Kort antwoord

Achttien gedateerde AI voorspellingen uit 2024 en 2025, beoordeeld op hun eigen woorden en hun eigen deadline. Capaciteitsvoorspellingen kwamen grotendeels uit, sommige zelfs vroeg. Inzetvoorspellingen, agents die aansluiten bij de werkvloer, een miljard Agentforce agents, programmeurs binnen een jaar vervangen, faalden bijna allemaal. De hoogste score ging naar scepticus Gary Marcus met een A-, en gelijk hebben leverde hem niets op.

Niemand kijkt achteraf nog terug

In maart 2025 vertelde Dario Amodei aan de Council on Foreign Relations dat AI binnen drie tot zes maanden 90% van alle code zou schrijven, en binnen twaalf maanden vrijwel alles. Die deadline van twaalf maanden verstreek in maart. Bijna niemand ging terugkijken.

Dat is de vreemde etiquette van AI voorspellingen. De claims zijn luid, gedateerd en met volledig vertrouwen gebracht, en dan komt de datum en is iedereen alweer bij de volgende claim. Er is geen scorebord. Dus heb ik er een gemaakt.

In februari 2025 plande ik agentworkflows in voor Whizi, uitgaand van het idee dat Altman gelijk zou krijgen over 2025. Zes weken later trok ik de stekker eruit, nadat ik had uitgerekend wat een enkele meerstaps agentrun kost tegenover een vast maandabonnement. Zes weken van mijn eigen roadmap, gespendeerd aan andermans voorspelling. Ik heb elke gedateerde voorspelling uit 2024 en 2025 verzameld met een primaire bron en een deadline die al verstreken is. Achttien haalden de lijst.

De beoordelingsregel, zodat je ertegenin kunt gaan: een voorspelling wordt beoordeeld op wat de eigen woorden beloofden, op de eigen deadline. Zei je 90% tegen september en bracht september 30%, dan is "nou ja, uiteindelijk wel" geen cijfer. Het is een excuus.

Het scorebord

Wie, wanneerDe voorspellingWat er gebeurdeCijfer
Sam Altman, januari 2025AI agents "sluiten aan bij de werkvloer" in 202595% van de bedrijfspilots liet geen impact op de winst-en-verliesrekening zien; het beste agent voltooide 30,3% van de kantoortakenC-
Marc Benioff, september 2024Eén miljard Agentforce agents eind 2025Ongeveer 29.000 deals en $1B aan jaarlijkse terugkerende omzetF
Klarna, februari 2024AI assistent doet het werk van 700 medewerkersVanaf mei 2025 weer mensen aannemen voor lagere kwaliteitC
Dario Amodei, maart 202590% van de code binnen drie tot zes maanden25% tot 41% branchebreed, 75% bij Google medio 2026C+
Dario Amodei, maart 2025Vrijwel alle code binnen twaalf maandenKwam niet in de buurtF
Eric Schmidt, april 2025De overgrote meerderheid van programmeurs vervangen binnen een jaarProgrammeurs nog steeds in dienst; instapfuncties ongeveer 16% lagerF
Mark Zuckerberg, januari 2025Een AI middenkader engineer, de leidende assistent met een miljard gebruikers, en Llama als het beste model, alles in 2025Geen van de drie; recordsalarissen voor menselijke engineers in plaats daarvanF
Elon Musk, april 2024AI slimmer dan elk mens eind 2025Grok 4 scoorde 25,4% op Humanity's Last ExamF
Mira Murati, juni 2024Doctoraatsniveau intelligentie "voor specifieke taken" binnen ongeveer 18 maandenEen gecertificeerd goud op de Internationale Wiskunde Olympiade van 2025B-
Gary Marcus, januari 202525 gedateerde voorspellingen, hier vier beoordeeldAlle vier correct, en geen van de successen van het jaar op de lijstA-

De werkvloer die nooit inklokte

Sam Altman, januari 2025: "We denken dat we in 2025 misschien de eerste AI agents zien 'aansluiten bij de werkvloer' en de output van bedrijven wezenlijk veranderen."

Het NANDA project van MIT ontdekte in augustus 2025 dat 95% van de generatieve AI pilots bij bedrijven geen meetbare impact op de winst-en-verliesrekening opleverde. Carnegie Mellon bemande een nepbedrijf volledig met AI agents en mat het kantoorwerk dat ze voltooiden: het beste model rondde 30,3% van de taken af. Een werknemer die 30% presteert, sluit niet aan bij je werkvloer. Die verlaat je proeftijd.

Eén uitzondering redt dit van een F: binnen softwarebedrijven veranderden coding agents de output echt. Cijfer: C-.

Marc Benioff, september 2024: "Onze visie is gedurfd: eind 2025 een miljard agents versterken met Agentforce."

Salesforce meldde begin 2026 ongeveer 29.000 cumulatieve Agentforce deals en overschreed $1B aan jaarlijkse terugkerende omzet. Een echt bedrijf, en ongeveer 34.000 keer te kort op de belofte, waarbij deals worden geteld in plaats van agents. Mijn favoriete detail: Salesforce rapporteert nu "agentic work units served" (3,8 miljard ervan) in plaats van een telling van agents. Als je het getal niet haalt, verander je de eenheid. Cijfer: F.

Klarna, februari 2024: hun AI assistent "doet het equivalent van het werk van 700 fulltime medewerkers."

Toen draaide CEO Sebastian Siemiatkowski in mei 2025 de koers om en begon weer mensen aan te nemen: "We hebben ons te veel gericht op efficiëntie en kosten. Het resultaat was lagere kwaliteit." De AI hield de routinematige tickets. De mensen kwamen terug voor alles dat ertoe deed. Krediet voor het openbaar uitvoeren van het experiment en het toegeven van het resultaat. Cijfer: C.

De code die daadwerkelijk geschreven werd

Amodei's 90%. De richting klopte en de teller klopte niet. Google zegt dat 75% van zijn nieuwe code AI gegenereerd is per medio 2026, tegenover 25% eind 2024, al telt dat elke geaccepteerde autocomplete mee en controleren mensen nog steeds voor het live gaat. Brancheschattingen begin 2026 lagen rond de 25% tot 41%.

Dus: 90% van alle code binnen zes maanden, nee. Vrijwel alle code binnen twaalf maanden, kwam niet in de buurt. Een historische verschuiving in hoe code geschreven wordt, absoluut ja. De voorspelling beschreef een echte revolutie en had elk getal fout. Cijfer: C+ voor de 90%, F voor "vrijwel alles".

Eric Schmidt, april 2025: "binnen het komende jaar wordt de overgrote meerderheid van programmeurs vervangen door AI programmeurs."

Het jaar is voorbij. Programmeurs blijven bijna overal in dienst waar ze al in dienst waren. De echte schade aan de arbeidsmarkt is smaller en wreder dan de voorspelling: gegevens van Stanford en ADP payroll tonen dat de werkgelegenheid voor 22 tot 25 jarigen in de meest AI blootgestelde banen sinds eind 2022 ongeveer 16% is gedaald en nog steeds krimpt. Instapfuncties kregen de klap; de overgrote meerderheid hield hun baan en kreeg Copilot licenties. Cijfer: F.

En het getal dat niemand voorspelde: Cursor ging van $100M naar $4B aan jaarlijkse terugkerende omzet in ongeveer zeventien maanden, en op 14 augustus sloot SpaceX de overname van $60B van het bedrijf, de grootste startup-overname ooit geregistreerd. Niet één voorspellingenlijst uit 2024 die ik nakeek, had "een code editor wordt de grootste startup exit in de geschiedenis" erop staan.

Meta's zeer dure jaar

Mark Zuckerberg, januari 2025, bij Joe Rogan: "Waarschijnlijk in 2025 hebben wij bij Meta... een AI die effectief kan fungeren als een soort middenkader engineer die je bij je bedrijf hebt en die code kan schrijven." Op de winstoproep weken later voegde hij er nog twee toe voor 2025: Meta AI als de leidende assistent met een miljard gebruikers, en Llama als het meest geavanceerde en meest gebruikte model.

Geen van de drie gebeurde. Llama 4 landde met een plof terwijl Gemini 3 in november 2025 de koppositie overnam. En Meta deed het hele jaar de tegenovergestelde inzet met zijn portemonnee: $14.3B voor de helft van Scale AI, onderzoekerssalarissen gemeld tussen $100M en $450M, daarna 600 mensen ontslagen bij het superintelligence lab in oktober en ongeveer 8.000 ontslagen in mei 2026.

Meta voorspelde een AI die codeert als een middenkader engineer, en besteedde in plaats daarvan achttien maanden aan het vestigen van het wereldrecord marktprijs voor menselijke engineers. Cijfer: F.

Elon Musk, april 2024: AI "waarschijnlijk slimmer dan wat voor mens dan ook, rond het einde van volgend jaar."

Eind 2025 was het vlaggenschip model van xAI Grok 4, gelanceerd als "de slimste AI ter wereld", met een score van 25,4% op een benchmark die letterlijk Humanity's Last Exam heet. De claim overleefde het contact met het examen niet. Cijfer: F.

Mira Murati, juni 2024: doctoraatsniveau intelligentie "voor specifieke taken" binnen ongeveer achttien maanden.

Voor wiskunde gebeurde het eigenlijk wel: Deep Think van Google DeepMind haalde een officieel gecertificeerd goud op de Internationale Wiskunde Olympiade van 2025, jaren voor de meeste voorspellingen uit 2024. De kwalificatie die zij gebruikte, "voor specifieke taken", doet zwaar werk, en het is precies de kwalificatie die haar luidruchtigere collega's weigerden te gebruiken. De genuanceerde versie kwam uit. De ongenuanceerde versie, verscheept als GPT-5's "PhD-level" branding in augustus 2025, verliep zo slecht dat Altman toegaf dat OpenAI de uitrol "totaal verkloot" had. Cijfer: B-.

Het rapportcijfer van de scepticus

Gary Marcus publiceerde op 1 januari 2025 25 gedateerde voorspellingen. De sector rolt meestal met de ogen bij hem. De beoordeling van zijn te beoordelen claims:

  • "We zullen dit jaar geen kunstmatige algemene intelligentie zien." Correct.
  • Agents zullen "het hele jaar 2025 eindeloos gehypet worden maar verre van betrouwbaar zijn." Correct, zie de hele eerste sectie.
  • "Winsten uit AI modellen blijven bescheiden of afwezig." De omzet explodeerde, maar hij had het over winsten, en de labs verbranden nog steeds geld. Correct volgens de letter.
  • Mogelijk geen consensus-sprong naar "GPT-5-niveau" in 2025. GPT-5 kwam uit; de sprong niet. Correct in de geest.

Cijfer: A-. De minpunt is voor wat de lijst niet bevat: er stond niets in over een codeertool categorie van $4B, een IMO goud, of agents die echt nuttig worden in het ene domein waar output controleerbaar is. De beste voorspeller van 2025 zag elke mislukking aankomen en miste elk succes.

En het ongemakkelijke tweede-orde feit: gelijk hebben leverde hem vrijwel niets op. De investeerders die tegen zijn hele wereldbeeld inzetten, zijn degenen die Cursor op $60B prijsden. Voorspellingsprecisie en financieel rendement lopen op aparte scoreborden, en maar één daarvan groeit exponentieel.

Capaciteitsvoorspellingen kwamen uit. Inzetvoorspellingen niet

Verdeel de 18 voorspellingen in twee stapels en de ruis verdwijnt.

Voorspellingen over capaciteit, wat modellen zouden kunnen, hielden goed stand en kwamen soms vroeg uit. De lengte van taken die agents kunnen afronden verdubbelt ongeveer elke vier tot zeven maanden, volgens METR, en die trend hield stand.

Voorspellingen over inzet, wat organisaties AI daadwerkelijk zouden laten doen, faalden bijna allemaal. Werkvloer agents, platforms met een miljard agents, vervangen programmeurs, AI werknemers: het liep allemaal tegen dezelfde muur op van kwaliteitseisen, aansprakelijkheid, integratiekosten, en het hardnekkige feit dat een systeem dat 30% van de taken voltooit een demo is, geen aanwerving.

Altman zei dat agents zouden aansluiten bij de werkvloer. Ze sloten aan bij de IDE, want de IDE is de ene werkplek waar een fout antwoord wordt opgevangen door een compiler in plaats van door een klant.

Dus dit is de vuistregel die ik nu gebruik, met mijn eigen geld op het spel: hoor je een capaciteitsvoorspelling, neem hem serieus, zelfs de wilde, want de trendlijnen blijven winnen. Hoor je een inzetvoorspelling met een datum eraan, verdubbel de termijn, en check dan wat de persoon die het zegt eigenlijk verkoopt. Dezelfde regel gebruik ik om te kiezen welk model ik betaal: de benchmark is een capaciteitsclaim, de workflow is een inzetclaim.

Elk kwartaal vanaf nu beoordeel ik wat er vervalt, en de volgende editie opent met mijn eigen gedateerde voorspellingen, zodat je mij door dezelfde rubriek kunt halen. Beoordelen is gratis. Beoordeeld worden is de prijs.

Checklist
  • Beoordeel een voorspelling op de eigen woorden, op de eigen deadline; "uiteindelijk wel" is geen cijfer
  • Neem capaciteitsvoorspellingen serieus, zelfs de wilde; de trendlijnen blijven winnen
  • Verdubbel elke inzettermijn die een datum draagt
  • Check wat de persoon die de voorspelling doet eigenlijk verkoopt
  • Schrijf je eigen voorspellingen met data op zodat iemand jou terug kan beoordelen

Veelgestelde vragen

Had Dario Amodei gelijk dat AI 90% van de code zou schrijven?

Niet op zijn deadline. Hij zei 90% binnen drie tot zes maanden na maart 2025 en vrijwel alle code binnen twaalf maanden. Brancheschattingen begin 2026 lagen rond de 25% tot 41%, met Google op 75% van de nieuwe code medio 2026, waarbij elke geaccepteerde autocomplete meetelt. De richting klopte en de getallen niet.

Sloten AI agents in 2025 aan bij de werkvloer?

Niet buiten software. Het NANDA project van MIT ontdekte dat 95% van de generatieve AI pilots bij bedrijven geen meetbare impact op de winst-en-verliesrekening opleverde, en de test van Carnegie Mellon met een agentbedrijf zag het beste model 30,3% van de kantoortaken afronden. Coding agents binnen softwarebedrijven waren de enige echte uitzondering.

Wie voorspelde 2025 in AI het meest accuraat?

Gary Marcus, de scepticus, op de hier beoordeelde claims: geen AGI, agents gehypet maar onbetrouwbaar, winsten nog steeds bescheiden, geen consensus GPT-5 sprong. Alle vier hielden stand. Zijn lijst miste ook elk succes van het jaar, van de codeertool categorie van $4B tot het IMO goud.