De som bygger AI är sämst på att förutspå den

Snabbt svar

Arton daterade AI prognoser från 2024 och 2025, bedömda mot sina egna ord på sina egna deadlines. Förmågeprognoserna slog mestadels in, en del i förtid. Utrullningsprognoserna, agenter som går med i arbetsstyrkan, en miljard Agentforce agenter, programmerare ersatta inom ett år, floppade nästan helt. Toppresultatet gick till skeptikern Gary Marcus med A minus, och att ha rätt gav honom ingenting.

Ingen går tillbaka och kollar

I mars 2025 sa Dario Amodei till Council on Foreign Relations att AI skulle skriva 90 procent av all kod inom tre till sex månader, och i princip all kod inom tolv. Den tolvmånadersdeadlinen passerade i mars. Nästan ingen gick tillbaka och kollade.

Det är det märkliga med AI prognoser. De är högljudda, daterade och levereras med total säkerhet, och sedan kommer datumet och alla har redan gått vidare till nästa. Det finns ingen resultattavla. Så jag byggde en.

I februari 2025 planerade jag in agentflöden i Whizi utifrån antagandet att Altman hade rätt om 2025. Jag lade ner projektet sex veckor senare, efter att ha räknat på vad en enda flerstegs agentkörning kostar jämfört med en fast månadsprenumeration. Sex veckor av min egen roadmap, spenderade på någon annans prognos. Jag samlade in varenda daterad prognos från 2024 och 2025 jag kunde hitta med en primärkälla och en deadline som redan hade passerat. Arton kvalade in.

Bedömningsregeln, så du kan argumentera mot den: en prognos bedöms mot vad dess egna ord lovade, på sin egen deadline. Om du sa 90 procent till september och september gav 30 procent, då är "det kommer nog med tiden" inte ett betyg. Det är en ursäkt.

Resultattavlan

Vem, närPrognosenVad händeBetyg
Sam Altman, januari 2025AI agenter "går med i arbetsstyrkan" 202595 procent av företagspiloter visade ingen effekt på resultatet; bästa agenten klarade 30,3 procent av kontorsuppgifternaC-
Marc Benioff, september 2024En miljard Agentforce agenter i slutet av 2025Cirka 29 000 affärer och $1B i årlig återkommande intäktF
Klarna, februari 2024AI assistent som gör jobbet motsvarande 700 agenterNyanställer människor igen från maj 2025 för lägre kvalitetC
Dario Amodei, mars 202590 procent av koden inom tre till sex månader25 till 41 procent branschgenomsnitt, 75 procent hos Google i mitten av 2026C+
Dario Amodei, mars 2025I princip all kod inom tolv månaderInte i närhetenF
Eric Schmidt, april 2025Majoriteten av programmerare ersatta inom ett årProgrammerare fortfarande anställda; nybörjarroller ner cirka 16 procentF
Mark Zuckerberg, januari 2025En AI mellannivåingenjör, den ledande assistenten med en miljard användare, och Llama som den bästa modellen, allt under 2025Ingen av de tre; rekordlöner för mänskliga ingenjörer iställetF
Elon Musk, april 2024AI smartare än vilken människa som helst i slutet av 2025Grok 4 fick 25,4 procent på Humanity's Last ExamF
Mira Murati, juni 2024Doktorandnivå intelligens "för specifika uppgifter" på cirka 18 månaderEtt certifierat guld i International Math Olympiad 2025B-
Gary Marcus, januari 202525 daterade prognoser, fyra bedömda härAlla fyra rätt, och inget av årets framgångar fanns med på listanA-

Arbetsstyrkan som aldrig stämplade in

Sam Altman, januari 2025: "Vi tror att vi under 2025 kan se de första AI agenterna 'gå med i arbetsstyrkan' och materiellt förändra företagens output."

MIT:s NANDA projekt fann i augusti 2025 att 95 procent av företagens generativa AI piloter inte gav någon mätbar effekt på resultatet. Carnegie Mellon bemannade ett låtsasföretag helt med AI agenter och mätte kontorsarbetet de slutförde: bästa modellen klarade 30,3 procent av uppgifterna. En anställd som presterar 30 procent går inte med i din arbetsstyrka. De åker ut under provanställningen.

Ett undantag räddar detta från ett F: inom mjukvarubolag förändrade kodningsagenter verkligen outputen. Betyg: C-.

Marc Benioff, september 2024: "Vår vision är djärv: att stärka en miljard agenter med Agentforce innan slutet av 2025."

Salesforce rapporterade omkring 29 000 kumulativa Agentforce affärer i början av 2026 och passerade $1B i årlig återkommande intäkt. En riktig verksamhet, men ungefär 34 000 gånger under löftet, om man räknar affärer snarare än agenter. Min favoritdetalj: Salesforce rapporterar nu "agentic work units served" (3,8 miljarder av dem) istället för ett antal agenter. När man inte kan nå siffran byter man enhet. Betyg: F.

Klarna, februari 2024: deras AI assistent "gör motsvarande arbete av 700 heltidsanställda agenter."

Sedan i maj 2025 gjorde VD Sebastian Siemiatkowski en helomvändning och började nyanställa människor: "Vi fokuserade för mycket på effektivitet och kostnad. Resultatet blev lägre kvalitet." AI:n behöll rutinärendena. Människorna kom tillbaka för allt som faktiskt spelade roll. Cred för att köra experimentet offentligt och erkänna resultatet. Betyg: C.

Koden som faktiskt skrevs

Amodeis 90 procent. Riktningen var rätt och nämnaren var fel. Google säger att 75 procent av deras nya kod är AI genererad från mitten av 2026, upp från 25 procent i slutet av 2024, även om det räknar varje accepterad autokomplettering och människor fortfarande granskar innan lansering. Branschuppskattningar i början av 2026 klustrade runt 25 till 41 procent.

Så: 90 procent av all kod på sex månader, nej. I princip all kod på tolv, inte i närheten. Ett historiskt skifte i hur kod skrivs, absolut ja. Prognosen beskrev en verklig revolution och fick varje siffra fel. Betyg: C+ för 90 procenten, F för "i princip all".

Eric Schmidt, april 2025: "under det kommande året kommer majoriteten av programmerare att ersättas av AI programmerare."

Året är slut. Programmerare är fortfarande anställda nästan överallt där de var anställda tidigare. Den verkliga skadan på arbetsmarknaden är smalare och grymmare än prognosen: Stanford och ADP:s löneuppgifter visar att sysselsättningen för 22 till 25 åringar i de mest AI utsatta jobben är ner ungefär 16 procent sedan slutet av 2022 och fortsätter krympa. Nybörjarnivån tog smällen, majoriteten behöll sina jobb och fick Copilot licenser istället. Betyg: F.

Och siffran ingen förutsåg alls: Cursor gick från $100M till $4B i årlig återkommande intäkt på ungefär sjutton månader, och den 14 augusti slutförde SpaceX sitt $60B förvärv av bolaget, det största startup förvärvet någonsin registrerat. Inte en enda 2024 prognoslista jag kollade hade "en kodredigerare blir historiens största startup exit" med.

Metas väldigt dyra år

Mark Zuckerberg, januari 2025, hos Joe Rogan: "Troligen under 2025 kommer vi på Meta... att ha en AI som effektivt kan vara en slags mellannivåingenjör som du har på ditt företag som kan skriva kod." På resultatsamtalet några veckor senare lade han till två till för 2025: Meta AI som den ledande assistenten med en miljard användare, och Llama som den mest avancerade och mest använda modellen.

Ingen av de tre hände. Llama 4 landade med ett duns medan Gemini 3 tog täten i november 2025. Och Meta spenderade året på att göra motsatt satsning med plånboken: $14.3B för halva Scale AI, forskarlöner rapporterade mellan $100M och $450M, sedan 600 personer bortskurna från superintelligenslabbet i oktober och ungefär 8 000 uppsägningar i maj 2026.

Meta förutsåg en AI som kodar som en mellannivåingenjör, och spenderade istället arton månader på att sätta världsrekord i marknadspris för mänskliga sådana. Betyg: F.

Elon Musk, april 2024: AI "smartare än vilken enskild människa som helst, troligen runt slutet av nästa år."

Vid slutet av 2025 var xAI:s flaggskeppsmodell Grok 4, lanserad som "den smartaste AI:n i världen", och fick 25,4 procent på ett benchmark som bokstavligen heter Humanity's Last Exam. Påståendet överlevde inte mötet med provet. Betyg: F.

Mira Murati, juni 2024: doktorandnivå intelligens "för specifika uppgifter" på cirka arton månader.

För matematik hände det i princip: Google DeepMinds Deep Think tog ett officiellt certifierat guld i International Math Olympiad 2025, år före de flesta 2024 prognoser. Reservationen hon använde, "för specifika uppgifter", gör mycket av jobbet, och det är exakt den reservation hennes högljuddare kollegor vägrade använda. Den försiktiga versionen slog in. Den ovillkorade versionen, lanserad som GPT-5:s "PhD-level" varumärke i augusti 2025, gick tillräckligt illa för att Altman erkände att OpenAI "totalt skruvade upp" utrullningen. Betyg: B-.

Skeptikerns betyg

Gary Marcus publicerade 25 daterade prognoser den 1 januari 2025. Branschen rullar mestadels med ögonen åt honom. Bedömer hans bedömbara påståenden:

  • "Vi kommer inte se allmän AI (AGI) i år." Rätt.
  • Agenter kommer "hypas oändligt under 2025 men vara långt ifrån tillförlitliga." Rätt, se hela första avsnittet.
  • "Vinster från AI modeller kommer fortsätta vara blygsamma eller obefintliga." Intäkterna exploderade, men han sa vinster, och labben bränner fortfarande pengar. Rätt enligt bokstaven.
  • Möjligen inget "GPT-5 nivå" konsensussprång under 2025. GPT-5 lanserades, språnget uteblev. Rätt i sak.

Betyg: A-. Minuset dras för det listan inte innehåller: inget i den förutsåg en $4B kodverktygskategori, ett IMO guld, eller agenter som blev genuint användbara inom just den domän där outputen går att kontrollera. Årets bästa prognosmakare förutsåg varje misslyckande och missade varje framgång.

Och den obekväma andraordningsfakta: att ha rätt gav honom ungefär ingenting. Investerarna som satsade emot hela hans världsbild är de som prissatte Cursor till $60B. Prognossäkerhet och avkastning körs på skilda resultattavlor, och bara en av dem växer med ränta på ränta.

Förmågeprognoser slog in. Utrullningsprognoser gjorde inte det

Sortera de 18 prognoserna i två högar så försvinner bruset.

Prognoser om förmåga, vad modellerna skulle klara av, höll bra och kom ibland i förtid. Längden på uppgifter agenter kan slutföra har fördubblats ungefär var fjärde till sjunde månad, enligt METR, och trenden höll i sig.

Prognoser om utrullning, vad organisationer faktiskt skulle låta AI göra, floppade nästan helt. Arbetsstyrkeagenter, plattformar med en miljard agenter, ersatta programmerare, AI anställda: allt slog i samma vägg av kvalitetskrav, ansvarsfrågor, integrationskostnader och det envisa faktum att ett system som klarar 30 procent av uppgifterna är en demo, inte en anställning.

Altman sa att agenter skulle gå med i arbetsstyrkan. De gick med i IDE:n, för IDE:n är den enda arbetsplats där ett fel svar fångas av en kompilator istället för en kund.

Så här är tumregeln jag använder nu, med mina egna pengar på spel: när du hör en förmågeprognos, ta den på allvar, även de vilda, för trendlinjerna fortsätter vinna. När du hör en utrullningsprognos med ett datum kopplat till sig, dubbla tidslinjen och kolla sedan vad personen som säger det faktiskt säljer. Samma regel styr hur jag väljer vilken modell jag betalar för: benchmarken är ett förmågepåstående, arbetsflödet är ett utrullningspåstående.

Varje kvartal från och med nu bedömer jag vad som förfaller, och nästa utgåva öppnar med mina egna daterade prognoser, så du kan köra mig genom samma bedömningsmall. Att bedöma är gratis. Att bli bedömd är priset.

Checklista
  • Bedöm en prognos mot sina egna ord, på sin egen deadline; "det kommer nog med tiden" är inte ett betyg
  • Ta förmågeprognoser på allvar, även de vilda; trendlinjerna fortsätter vinna
  • Dubbla varje utrullningstidslinje som har ett datum
  • Kolla vad personen som gör prognosen faktiskt säljer
  • Skriv ner dina egna prognoser med datum så någon kan bedöma dig tillbaka

Vanliga frågor

Hade Dario Amodei rätt om att AI skulle skriva 90 procent av koden?

Inte på hans deadline. Han sa 90 procent inom tre till sex månader från mars 2025 och i princip all kod inom tolv. Branschuppskattningar i början av 2026 klustrade runt 25 till 41 procent, med Google på 75 procent av ny kod i mitten av 2026 om man räknar varje accepterad autokomplettering. Riktningen var rätt och siffrorna var fel.

Gick AI agenter med i arbetsstyrkan 2025?

Inte utanför mjukvara. MIT:s NANDA projekt fann att 95 procent av företagens generativa AI piloter inte gav någon mätbar effekt på resultatet, och Carnegie Mellons agentbolagstest visade att bästa modellen klarade 30,3 procent av kontorsuppgifterna. Kodningsagenter inom mjukvarubolag var det enda riktiga undantaget.

Vem förutspådde 2025 mest korrekt inom AI?

Gary Marcus, skeptikern, på de påståenden som bedöms här: ingen AGI, agenter hypade men opålitliga, vinster fortfarande blygsamma, inget konsensus GPT-5 språng. Alla fyra höll. Hans lista missade också varje framgång under året, från $4B kodverktygskategorin till IMO guldet.