Ludzie budujący AI najgorzej przewidują jej rozwój

Krótka odpowiedź

Osiemnaście datowanych prognoz AI z 2024 i 2025 roku, ocenionych na podstawie ich własnych słów i własnych terminów. Prognozy dotyczące możliwości w większości się sprawdziły, niektóre wcześniej niż zakładano. Prognozy dotyczące wdrożeń, agenci dołączający do siły roboczej, miliard agentów Agentforce, programiści zastąpieni w rok, zawiodły niemal jednolicie. Najlepszy wynik osiągnął sceptyk Gary Marcus z oceną A-, a bycie w porę nie przyniosło mu nic.

Nikt nie wraca, żeby sprawdzić

W marcu 2025 roku Dario Amodei powiedział Council on Foreign Relations, że AI będzie pisać 90% kodu w ciągu trzech do sześciu miesięcy, a niemal cały kod w dwanaście miesięcy. Ten dwunastomiesięczny termin minął w marcu. Prawie nikt nie wrócił, żeby to sprawdzić.

Taka jest dziwna etykieta prognozowania AI. Prognozy są głośne, datowane i wygłaszane z pełnym przekonaniem, a potem nadchodzi termin i wszyscy już zajmują się kolejną prognozą. Nie ma tablicy wyników. Więc ją zbudowałem.

W lutym 2025 roku zaplanowałem prace nad agentami w Whizi, zakładając, że Altman ma rację co do 2025 roku. Zamknąłem projekt sześć tygodni później, po policzeniu, ile kosztuje jeden wieloetapowy przebieg agenta w porównaniu do płaskiej miesięcznej subskrypcji. Sześć tygodni mojego własnego planu wydane na czyjąś prognozę. Zebrałem każdą datowaną prognozę z 2024 i 2025 roku, jaką znalazłem, z pierwotnym źródłem i terminem, który już minął. Osiemnaście się zakwalifikowało.

Zasada oceny, żeby można było się z nią kłócić: prognoza jest oceniana według tego, co obiecywały jej własne słowa, w jej własnym terminie. Jeśli ktoś powiedział 90% do września, a wrzesień przyniósł 30%, "no, ostatecznie" to nie jest ocena. To wymówka.

Tablica wyników

Kto, kiedyPrognozaCo się stałoOcena
Sam Altman, styczeń 2025Agenci AI "dołączą do siły roboczej" w 202595% pilotaży w przedsiębiorstwach nie dało wpływu na wynik finansowy; najlepszy agent ukończył 30,3% zadań biurowychC-
Marc Benioff, wrzesień 2024Miliard agentów Agentforce do końca 2025Około 29 000 transakcji i $1B rocznych przychodów cyklicznychF
Klarna, luty 2024Asystent AI wykonujący pracę 700 agentówPonowne zatrudnianie ludzi od maja 2025 z powodu niższej jakościC
Dario Amodei, marzec 202590% kodu w trzy do sześciu miesięcy25% do 41% w całej branży, 75% w Google do połowy 2026C+
Dario Amodei, marzec 2025Praktycznie cały kod w dwanaście miesięcyDaleko od prawdyF
Eric Schmidt, kwiecień 2025Zdecydowana większość programistów zastąpiona przez AI w rokProgramiści nadal zatrudnieni; stanowiska podstawowe spadły o około 16%F
Mark Zuckerberg, styczeń 2025Inżynier AI średniego szczebla, wiodący asystent z miliardem użytkowników i Llama jako najlepszy model, wszystko w 2025Żadne z trzech się nie spełniło; zamiast tego rekordowe pakiety wynagrodzeń dla ludzkich inżynierówF
Elon Musk, kwiecień 2024AI mądrzejsza od każdego człowieka do końca 2025Grok 4 uzyskał 25,4% w Humanity's Last ExamF
Mira Murati, czerwiec 2024Inteligencja na poziomie doktoratu "w konkretnych zadaniach" w około 18 miesięcyOficjalnie certyfikowany złoty medal na Międzynarodowej Olimpiadzie Matematycznej 2025B-
Gary Marcus, styczeń 202525 datowanych prognoz, cztery ocenione tutajWszystkie cztery trafne, i żaden z sukcesów roku nie znalazł się na liścieA-

Siła robocza, która nigdy nie stawiła się do pracy

Sam Altman, styczeń 2025: "Wierzymy, że w 2025 roku możemy zobaczyć pierwsze agenty AI 'dołączające do siły roboczej' i istotnie zmieniające wyniki firm".

Projekt NANDA z MIT ustalił w sierpniu 2025, że 95% pilotaży generatywnej AI w przedsiębiorstwach nie dało wymiernego wpływu na wynik finansowy. Carnegie Mellon obsadziło fikcyjną firmę wyłącznie agentami AI i zmierzyło ukończoną przez nich pracę biurową: najlepszy model ukończył 30,3% zadań. Pracownik na poziomie 30% nie dołącza do siły roboczej. On kończy okres próbny.

Jeden wyjątek ratuje to przed oceną F: wewnątrz firm software'owych agenty do kodowania rzeczywiście zmieniły wyniki. Ocena: C-.

Marc Benioff, wrzesień 2024: "Nasza wizja jest odważna: dać moc miliardowi agentów z Agentforce do końca 2025".

Salesforce zgłosił około 29 000 skumulowanych transakcji Agentforce na początku 2026 i przekroczył $1B rocznych przychodów cyklicznych. Prawdziwy biznes, i około 34 000 razy mniejszy od obietnicy, licząc transakcje zamiast agentów. Mój ulubiony szczegół: Salesforce teraz raportuje "jednostki pracy agentowej dostarczone" (3,8 miliarda z nich) zamiast liczby agentów. Kiedy nie można trafić w liczbę, zmienia się jednostkę. Ocena: F.

Klarna, luty 2024: jej asystent AI "wykonuje pracę odpowiadającą 700 pełnoetatowym agentom".

Potem w maju 2025 CEO Sebastian Siemiatkowski zmienił kurs i zaczął ponownie zatrudniać ludzi: "Skupiliśmy się zbytnio na wydajności i kosztach. Efektem była niższa jakość". AI zatrzymała rutynowe zgłoszenia. Ludzie wrócili do wszystkiego, co miało znaczenie. Uznanie za publiczne przeprowadzenie eksperymentu i przyznanie się do wyniku. Ocena: C.

Kod, który naprawdę powstał

90% Amodeia. Kierunek był trafny, mianownik zły. Google podaje, że 75% jego nowego kodu jest generowane przez AI od połowy 2026, wobec 25% pod koniec 2024, choć to liczy każde zaakceptowane autouzupełnienie, a ludzie i tak przeglądają kod przed wdrożeniem. Szacunki dla całej branży na początku 2026 skupiały się wokół 25% do 41%.

Więc: 90% całego kodu w sześć miesięcy, nie. Praktycznie cały kod w dwanaście, daleko od prawdy. Historyczna zmiana w sposobie pisania kodu, zdecydowanie tak. Prognoza opisała prawdziwą rewolucję i pomyliła się co do każdej liczby. Ocena: C+ za 90%, F za "praktycznie cały".

Eric Schmidt, kwiecień 2025: "w ciągu najbliższego roku zdecydowana większość programistów zostanie zastąpiona przez programistów AI".

Rok minął. Programiści pozostają zatrudnieni niemal wszędzie tam, gdzie byli zatrudnieni wcześniej. Prawdziwa szkoda dla rynku pracy jest węższa i okrutniejsza niż prognoza: dane Stanford i ADP dotyczące płac pokazują, że zatrudnienie osób w wieku 22 do 25 lat w zawodach najbardziej narażonych na AI spadło o około 16% od końca 2022 roku i wciąż się kurczy. Ucierpiały stanowiska podstawowe; zdecydowana większość zachowała pracę i dostała licencje Copilot. Ocena: F.

I liczba, której nikt nie przewidział: Cursor wzrósł z $100M do $4B rocznych przychodów cyklicznych w około siedemnaście miesięcy, a 14 sierpnia SpaceX zamknął akwizycję firmy za $60B, największe przejęcie startupu w historii. Ani jedna lista prognoz z 2024 roku, jaką sprawdziłem, nie zawierała punktu "edytor kodu stanie się największym wyjściem z startupu w historii".

Bardzo kosztowny rok Mety

Mark Zuckerberg, styczeń 2025, u Joego Rogana: "Prawdopodobnie w 2025 roku, w Mecie... będziemy mieć AI, która może w praktyce być czymś w rodzaju inżyniera średniego szczebla w twojej firmie, który potrafi pisać kod". Kilka tygodni później, na rozmowie o wynikach finansowych, dodał jeszcze dwie prognozy na 2025 rok: Meta AI jako wiodący asystent z miliardem użytkowników i Llama jako najbardziej zaawansowany i szeroko stosowany model.

Żadna z trzech się nie spełniła. Llama 4 wystartowała z hukiem, podczas gdy Gemini 3 przejął koronę frontieru w listopadzie 2025. A Meta spędziła rok, robiąc przeciwny zakład swoim portfelem: $14.3B za połowę Scale AI, pakiety wynagrodzeń badaczy raportowane między $100M a $450M, a potem 600 osób zwolnionych z laboratorium superinteligencji w październiku i około 8000 zwolnień w maju 2026.

Meta przewidziała AI, która koduje jak inżynier średniego szczebla, a zamiast tego spędziła osiemnaście miesięcy, ustanawiając światowy rekord ceny rynkowej dla ludzkich inżynierów. Ocena: F.

Elon Musk, kwiecień 2024: AI "mądrzejsza od jednego dowolnego człowieka prawdopodobnie pod koniec przyszłego roku".

Do końca 2025 roku flagowym modelem xAI był Grok 4, wprowadzony jako "najmądrzejsza AI na świecie", zdobywający 25,4% w benchmarku nazwanym dosłownie Humanity's Last Exam. Twierdzenie nie przetrwało kontaktu z egzaminem. Ocena: F.

Mira Murati, czerwiec 2024: inteligencja na poziomie doktoratu "w konkretnych zadaniach" w około osiemnaście miesięcy.

W matematyce to się właściwie spełniło: Deep Think od Google DeepMind zdobyło oficjalnie certyfikowany złoty medal na Międzynarodowej Olimpiadzie Matematycznej 2025, lata przed większością prognoz z 2024 roku. Zastrzeżenie, którego użyła, "w konkretnych zadaniach", robi ogromną robotę i jest dokładnie tym zastrzeżeniem, którego jej głośniejsi koledzy odmówili użyć. Zabezpieczona wersja się sprawdziła. Ta bez zastrzeżeń, dostarczona jako marketing "poziomu doktoratu" GPT-5 w sierpniu 2025, poszła na tyle źle, że Altman przyznał, że OpenAI "totalnie schrzaniło" wdrożenie. Ocena: B-.

Świadectwo sceptyka

Gary Marcus opublikował 25 datowanych prognoz 1 stycznia 2025 roku. Branża zwykle przewraca oczami na jego widok. Ocena jego mierzalnych twierdzeń:

  • "Nie zobaczymy sztucznej inteligencji ogólnej w tym roku". Trafne.
  • Agenty będą "bez końca hypowane przez cały 2025, ale dalekie od niezawodnych". Trafne, patrz cała pierwsza sekcja.
  • "Zyski z modeli AI nadal będą skromne albo żadne". Przychody eksplodowały, ale on mówił o zyskach, a laboratoria wciąż palą gotówkę. Trafne co do litery.
  • Możliwy brak konsensusu co do skoku "na poziomie GPT-5" w 2025. GPT-5 wystartował; skoku nie było. Trafne w duchu.

Ocena: A-. Minus w dół za to, czego lista nie zawiera: nic w niej nie przewidziało kategorii narzędzi do kodowania wartej $4B, złotego medalu na IMO ani agentów stających się naprawdę użytecznymi w jedynej dziedzinie, gdzie wynik da się zweryfikować. Najlepszy prognosta 2025 roku trafił w każdą porażkę i przegapił każdy sukces.

I niewygodny fakt drugiego rzędu: bycie w porę nie przyniosło mu praktycznie nic. Inwestorzy, którzy postawili przeciwko całemu jego światopoglądowi, to ci sami, którzy wycenili Cursor na $60B. Trafność prognoz i zwroty finansowe działają na osobnych tablicach wyników, i tylko jedna z nich się kumuluje.

Prognozy o możliwościach się sprawdziły. Prognozy o wdrożeniach nie

Podziel 18 prognoz na dwie kupki, a hałas zniknie.

Prognozy dotyczące możliwości, tego, co potrafiłyby robić modele, sprawdziły się dobrze i czasem wcześniej niż zakładano. Długość zadań, które agenty potrafią ukończyć, podwaja się mniej więcej co cztery do siedmiu miesięcy, według METR, i trend się utrzymał.

Prognozy dotyczące wdrożeń, tego, na co organizacje pozwolą AI faktycznie robić, zawiodły niemal jednolicie. Agenci w miejscu pracy, platformy z miliardem agentów, zastąpieni programiści, pracownicy AI: wszystko to uderzyło w tę samą ścianę progów jakości, odpowiedzialności, kosztów integracji i uporczywego faktu, że system kończący 30% zadań to demo, a nie pracownik.

Altman powiedział, że agenci dołączą do siły roboczej. Dołączyli do IDE, bo IDE to jedyne miejsce pracy, gdzie błędną odpowiedź wyłapuje kompilator, a nie klient.

Więc oto zasada decyzyjna, której teraz używam, stawiając na nią własne pieniądze: kiedy słyszysz prognozę o możliwościach, traktuj ją poważnie, nawet te szalone, bo linie trendów wciąż wygrywają. Kiedy słyszysz prognozę wdrożenia z konkretną datą, podwój ten termin, a potem sprawdź, co sprzedaje osoba, która to mówi. Ta sama zasada kieruje tym, jak wybieram model, za który płacę: benchmark to twierdzenie o możliwościach, przepływ pracy to twierdzenie o wdrożeniu.

Co kwartał od teraz oceniam to, co właśnie minęło, a kolejne wydanie otwiera się moimi własnymi datowanymi prognozami, żebyś mógł przepuścić mnie przez tę samą rubrykę. Ocenianie jest darmowe. Bycie ocenianym ma swoją cenę.

Lista kontrolna
  • Oceniaj prognozę według jej własnych słów, w jej własnym terminie; "ostatecznie" to nie jest ocena
  • Traktuj prognozy dotyczące możliwości poważnie, nawet te szalone; linie trendów wciąż wygrywają
  • Podwajaj każdy termin wdrożenia, który niesie konkretną datę
  • Sprawdź, co sprzedaje osoba wygłaszająca prognozę
  • Spisuj własne prognozy z datami, żeby ktoś mógł potem ocenić ciebie

Najczęstsze pytania

Czy Dario Amodei miał rację, że AI napisze 90% kodu?

Nie w jego terminie. Powiedział 90% w ciągu trzech do sześciu miesięcy od marca 2025 i praktycznie cały kod w dwanaście miesięcy. Szacunki dla całej branży na początku 2026 skupiały się wokół 25% do 41%, przy Google na poziomie 75% nowego kodu do połowy 2026, licząc każde zaakceptowane autouzupełnienie. Kierunek był trafny, liczby były błędne.

Czy agenci AI dołączyli do siły roboczej w 2025 roku?

Nie poza software'em. Projekt NANDA z MIT ustalił, że 95% pilotaży generatywnej AI w przedsiębiorstwach nie dało wymiernego wpływu na wynik finansowy, a test firmy agentów Carnegie Mellon pokazał, że najlepszy model ukończył 30,3% zadań biurowych. Agenty do kodowania wewnątrz firm software'owych były jedynym prawdziwym wyjątkiem.

Kto najtrafniej przewidział 2025 rok w AI?

Gary Marcus, sceptyk, w twierdzeniach ocenionych tutaj: brak AGI, agenty hypowane, ale niezawodne, zyski wciąż skromne, brak konsensusu co do skoku GPT-5. Wszystkie cztery się utrzymały. Jego lista przegapiła też każdy sukces roku, od kategorii narzędzi do kodowania wartej $4B po złoty medal na IMO.