Orang yang membangun AI justru paling buruk memprediksinya

Jawaban singkat

Delapan belas prediksi AI bertanggal dari 2024 dan 2025, dinilai berdasarkan kata-kata mereka sendiri pada batas waktu mereka sendiri. Prediksi kemampuan sebagian besar terbukti benar, bahkan ada yang datang lebih awal. Prediksi penerapan, seperti agen bergabung dengan tenaga kerja, satu miliar agen Agentforce, atau programmer digantikan dalam setahun, hampir semuanya gagal total. Peraih nilai tertinggi adalah si skeptis Gary Marcus dengan A-, dan menjadi benar tidak memberinya apa-apa.

Tidak ada yang mengecek ulang

Pada Maret 2025, Dario Amodei mengatakan kepada Council on Foreign Relations bahwa AI akan menulis 90% kode dalam tiga sampai enam bulan, dan hampir semuanya dalam dua belas bulan. Batas waktu dua belas bulan itu berlalu pada bulan Maret. Hampir tidak ada yang mengecek ulang.

Itulah etika aneh dalam peramalan AI. Prediksinya keras, bertanggal, dan disampaikan dengan percaya diri penuh, lalu tanggalnya tiba dan semua orang sudah pindah ke prediksi berikutnya. Tidak ada papan skor. Jadi saya membuatnya.

Pada Februari 2025, saya merancang alur kerja agen ke dalam Whizi dengan asumsi Altman benar soal 2025. Saya menghentikan proyek itu enam minggu kemudian, setelah menghitung berapa biaya satu proses agen multilangkah dibandingkan langganan bulanan tetap. Enam minggu dari rencana kerja saya sendiri, dihabiskan untuk ramalan orang lain. Saya mengumpulkan setiap prediksi bertanggal dari 2024 dan 2025 yang bisa saya temukan dengan sumber utama dan batas waktu yang sudah lewat. Delapan belas lolos seleksi.

Aturan penilaiannya, supaya kamu bisa mendebatnya: sebuah prediksi dinilai berdasarkan apa yang dijanjikan kata-katanya sendiri, pada batas waktunya sendiri. Jika kamu bilang 90% pada September dan September hanya membawa 30%, "ya, akhirnya nanti" bukan nilai. Itu alasan.

Papan skor

Siapa, kapanPrediksinyaYang terjadiNilai
Sam Altman, Januari 2025Agen AI "bergabung dengan tenaga kerja" pada 202595% uji coba perusahaan tidak menunjukkan dampak laba rugi; agen terbaik menyelesaikan 30,3% tugas kantorC-
Marc Benioff, September 2024Satu miliar agen Agentforce pada akhir 2025Sekitar 29.000 kesepakatan dan $1B pendapatan berulang tahunanF
Klarna, Februari 2024Asisten AI mengerjakan pekerjaan setara 700 agenMerekrut kembali manusia sejak Mei 2025 karena kualitas menurunC
Dario Amodei, Maret 202590% kode dalam tiga sampai enam bulan25% sampai 41% di seluruh industri, 75% di Google pada pertengahan 2026C+
Dario Amodei, Maret 2025Hampir semua kode dalam dua belas bulanJauh dari ituF
Eric Schmidt, April 2025Sebagian besar programmer digantikan dalam setahunProgrammer masih dipekerjakan; posisi pemula turun sekitar 16%F
Mark Zuckerberg, Januari 2025Insinyur AI level menengah, asisten miliaran pengguna terdepan, dan Llama sebagai model teratas, semuanya pada 2025Tak satu pun dari ketiganya terjadi; malah paket gaji rekor untuk insinyur manusiaF
Elon Musk, April 2024AI lebih pintar dari manusia mana pun pada akhir 2025Grok 4 hanya meraih 25,4% di Humanity's Last ExamF
Mira Murati, Juni 2024Kecerdasan level PhD "untuk tugas tertentu" dalam sekitar 18 bulanMeraih emas resmi di Olimpiade Matematika Internasional 2025B-
Gary Marcus, Januari 202525 prediksi bertanggal, empat dinilai di siniKeempatnya benar, dan tidak satu pun keberhasilan tahun ini ada di daftarnyaA-

Tenaga kerja yang tidak pernah masuk kantor

Sam Altman, Januari 2025: "Kami percaya bahwa pada 2025, kita mungkin akan melihat agen AI pertama 'bergabung dengan tenaga kerja' dan secara nyata mengubah hasil kerja perusahaan."

Proyek NANDA milik MIT menemukan pada Agustus 2025 bahwa 95% uji coba AI generatif perusahaan tidak menghasilkan dampak laba rugi yang terukur. Carnegie Mellon mengisi sebuah perusahaan tiruan sepenuhnya dengan agen AI dan mengukur pekerjaan kantor yang mereka selesaikan: model terbaik menyelesaikan 30,3% tugas. Karyawan dengan performa 30% tidak bergabung dengan tenaga kerjamu. Mereka keluar di masa percobaan.

Ada satu pengecualian yang menyelamatkan ini dari nilai F: di dalam perusahaan software, agen coding benar-benar mengubah hasil kerja. Nilai: C-.

Marc Benioff, September 2024: "Visi kami berani: memberdayakan satu miliar agen dengan Agentforce pada akhir 2025."

Salesforce melaporkan sekitar 29.000 kesepakatan Agentforce kumulatif pada awal 2026 dan melampaui $1B pendapatan berulang tahunan. Bisnis yang nyata, tapi sekitar 34.000 kali lebih kecil dari janjinya, itu pun menghitung kesepakatan bukan agen. Detail favorit saya: Salesforce sekarang melaporkan "unit kerja agentik yang dilayani" (3,8 miliar unit) alih-alih jumlah agen. Kalau tidak bisa mencapai angkanya, ganti saja satuannya. Nilai: F.

Klarna, Februari 2024: asisten AI-nya "mengerjakan pekerjaan setara 700 agen penuh waktu."

Lalu pada Mei 2025 CEO Sebastian Siemiatkowski berbalik arah dan mulai merekrut kembali manusia: "Kami terlalu fokus pada efisiensi dan biaya. Hasilnya kualitas menurun." AI tetap menangani tiket rutin. Manusia kembali untuk semua hal yang benar-benar penting. Poin plus karena menjalankan eksperimen ini secara terbuka dan mengakui hasilnya. Nilai: C.

Kode yang benar-benar ditulis

Angka 90% dari Amodei. Arahnya benar, penyebutnya yang salah. Google menyebut 75% kode barunya dihasilkan AI per pertengahan 2026, naik dari 25% di akhir 2024, meski itu menghitung setiap autocomplete yang diterima dan manusia tetap meninjau sebelum diterapkan. Estimasi industri secara luas di awal 2026 berkumpul di kisaran 25% sampai 41%.

Jadi: 90% dari semua kode dalam enam bulan, tidak. Hampir semua kode dalam dua belas bulan, jauh dari itu. Pergeseran bersejarah dalam cara kode ditulis, ya, benar-benar iya. Prediksinya menggambarkan revolusi nyata tapi salah di setiap angka. Nilai: C+ untuk angka 90%, F untuk "hampir semuanya."

Eric Schmidt, April 2025: "dalam satu tahun ke depan, sebagian besar programmer akan digantikan oleh programmer AI."

Setahun sudah berlalu. Programmer tetap dipekerjakan hampir di semua tempat mereka sebelumnya dipekerjakan. Kerusakan tenaga kerja yang nyata lebih sempit dan lebih kejam dari prediksi itu: data Stanford dan penggajian ADP menunjukkan lapangan kerja untuk usia 22 sampai 25 tahun di pekerjaan paling terdampak AI turun sekitar 16% sejak akhir 2022 dan masih menyusut. Posisi pemula yang terkena dampak; sebagian besar lainnya tetap bekerja dan malah mendapat lisensi Copilot. Nilai: F.

Dan angka yang tidak diprediksi siapa pun: Cursor melonjak dari $100M ke $4B pendapatan berulang tahunan dalam sekitar tujuh belas bulan, dan pada 14 Agustus SpaceX merampungkan akuisisi $60B atas perusahaan itu, akuisisi startup terbesar yang pernah tercatat. Tidak ada satu pun daftar prediksi 2024 yang saya periksa mencantumkan "editor kode menjadi eksit startup terbesar dalam sejarah."

Tahun yang sangat mahal bagi Meta

Mark Zuckerberg, Januari 2025, di Joe Rogan: "Mungkin pada 2025, kami di Meta... akan punya AI yang secara efektif bisa jadi semacam insinyur level menengah di perusahaanmu yang bisa menulis kode." Pada panggilan laporan laba beberapa minggu kemudian dia menambahkan dua lagi untuk 2025: Meta AI sebagai asisten miliaran pengguna terdepan, dan Llama sebagai model paling canggih dan paling banyak digunakan.

Tak satu pun dari ketiganya terjadi. Llama 4 dirilis dengan sambutan datar sementara Gemini 3 merebut mahkota terdepan pada November 2025. Dan Meta justru menghabiskan tahun itu untuk taruhan sebaliknya dengan dompetnya: $14.3B untuk separuh saham Scale AI, paket gaji periset yang dilaporkan antara $100M dan $450M, lalu 600 orang dipangkas dari lab superintelligence pada Oktober dan sekitar 8.000 PHK pada Mei 2026.

Meta memprediksi AI yang menulis kode seperti insinyur level menengah, dan malah menghabiskan delapan belas bulan mencatat rekor dunia untuk harga pasar insinyur manusia. Nilai: F.

Elon Musk, April 2024: AI "lebih pintar dari manusia mana pun, mungkin sekitar akhir tahun depan."

Pada akhir 2025, model unggulan xAI adalah Grok 4, diluncurkan sebagai "AI paling pintar di dunia," tapi hanya meraih 25,4% di benchmark yang namanya secara harfiah adalah Humanity's Last Exam. Klaim itu tidak selamat begitu bertemu ujian sebenarnya. Nilai: F.

Mira Murati, Juni 2024: kecerdasan level PhD "untuk tugas tertentu" dalam sekitar delapan belas bulan.

Untuk matematika hal itu nyaris terjadi: Deep Think milik Google DeepMind meraih medali emas bersertifikat resmi di Olimpiade Matematika Internasional 2025, bertahun-tahun lebih cepat dari kebanyakan ramalan 2024. Kata kualifikasi yang dia pakai, "untuk tugas tertentu," berperan sangat besar, dan justru itulah kualifikasi yang menolak dipakai oleh rekan-rekannya yang lebih lantang. Versi yang dibatasi itu terbukti benar. Versi tanpa batasan, yang dirilis sebagai branding "level PhD" milik GPT-5 pada Agustus 2025, berjalan cukup buruk sampai Altman mengakui OpenAI "benar-benar kacau" dalam peluncurannya. Nilai: B-.

Rapor si skeptis

Gary Marcus mempublikasikan 25 prediksi bertanggal pada 1 Januari 2025. Industri kebanyakan menganggapnya remeh. Menilai klaimnya yang bisa dinilai:

  • "Kita tidak akan melihat kecerdasan umum buatan tahun ini." Benar.
  • Agen akan "terus dihebohkan sepanjang 2025 tapi jauh dari andal." Benar, lihat seluruh bagian pertama.
  • "Keuntungan dari model AI akan tetap sedang atau tidak ada." Pendapatan meledak, tapi dia bicara soal keuntungan, dan lab-lab AI masih membakar uang. Benar secara harfiah.
  • Kemungkinan tidak ada lompatan konsensus "level GPT-5" pada 2025. GPT-5 dirilis; lompatannya tidak terjadi. Benar secara esensi.

Nilai: A-. Minus itu diberikan karena apa yang tidak ada dalam daftarnya: tidak ada yang memprediksi kategori alat coding senilai $4B, medali emas IMO, atau agen yang benar-benar berguna di satu-satunya domain yang hasilnya bisa diverifikasi. Peramal terbaik tahun 2025 menebak setiap kegagalan dan meleset dari setiap keberhasilan.

Dan fakta orde kedua yang tidak nyaman: menjadi benar hampir tidak memberinya apa pun. Investor yang bertaruh melawan seluruh pandangan dunianya justru yang menghargai Cursor senilai $60B. Akurasi ramalan dan imbal hasil finansial berjalan di papan skor yang terpisah, dan cuma satu yang berbunga majemuk.

Prediksi kemampuan terbukti benar. Prediksi penerapan tidak

Pisahkan 18 prediksi itu ke dua tumpukan dan kebisingannya hilang.

Prediksi soal kemampuan, apa yang bisa dilakukan model, bertahan dengan baik dan kadang datang lebih awal. Panjang tugas yang bisa diselesaikan agen telah berlipat ganda kira-kira setiap empat sampai tujuh bulan, menurut METR, dan trennya bertahan.

Prediksi soal penerapan, apa yang benar-benar diizinkan organisasi untuk dilakukan AI, hampir seluruhnya gagal. Agen tenaga kerja, platform miliaran agen, programmer yang digantikan, karyawan AI: semuanya membentur tembok yang sama berupa standar kualitas, tanggung jawab hukum, biaya integrasi, dan fakta keras bahwa sistem yang menyelesaikan 30% tugas adalah demo, bukan karyawan.

Altman bilang agen akan bergabung dengan tenaga kerja. Mereka bergabung dengan IDE, karena IDE adalah satu-satunya tempat kerja di mana jawaban salah tertangkap oleh compiler, bukan pelanggan.

Jadi ini aturan keputusan yang saya pakai sekarang, dengan uang saya sendiri dipertaruhkan: kalau kamu dengar prediksi kemampuan, anggap serius, bahkan yang paling liar sekalipun, karena garis trennya terus menang. Kalau kamu dengar prediksi penerapan yang punya tanggal, lipat gandakan linimasanya, lalu periksa apa yang sedang dijual orang yang mengatakannya. Aturan yang sama juga cara saya memilih model mana yang layak dibayar: benchmark adalah klaim kemampuan, alur kerja adalah klaim penerapan.

Setiap kuartal mulai sekarang saya akan menilai apa pun yang jatuh tempo, dan edisi berikutnya dibuka dengan prediksi bertanggal saya sendiri, supaya kamu bisa menilai saya dengan rubrik yang sama. Menilai itu gratis. Dinilai itu ada harganya.

Daftar Periksa
  • Nilai sebuah prediksi berdasarkan kata-katanya sendiri, pada batas waktunya sendiri; "akhirnya nanti" bukan nilai
  • Anggap serius prediksi kemampuan, bahkan yang paling liar sekalipun; garis trennya terus menang
  • Lipat gandakan setiap linimasa penerapan yang punya tanggal
  • Periksa apa yang sedang dijual orang yang membuat prediksi itu
  • Tulis prediksimu sendiri dengan tanggal supaya orang lain bisa menilaimu balik

Pertanyaan Umum

Apakah Dario Amodei benar bahwa AI akan menulis 90% kode?

Tidak sesuai batas waktunya. Dia bilang 90% dalam tiga sampai enam bulan sejak Maret 2025 dan hampir semua kode dalam dua belas bulan. Estimasi industri secara luas di awal 2026 berkumpul di kisaran 25% sampai 41%, dengan Google di angka 75% kode baru pada pertengahan 2026 yang menghitung setiap autocomplete yang diterima. Arahnya benar, angkanya salah.

Apakah agen AI benar-benar bergabung dengan tenaga kerja pada 2025?

Tidak di luar dunia software. Proyek NANDA milik MIT menemukan 95% uji coba AI generatif perusahaan tidak menghasilkan dampak laba rugi yang terukur, dan uji coba perusahaan agen milik Carnegie Mellon melihat model terbaik hanya menyelesaikan 30,3% tugas kantor. Agen coding di dalam perusahaan software adalah satu-satunya pengecualian nyata.

Siapa yang paling akurat memprediksi 2025 di bidang AI?

Gary Marcus, si skeptis, untuk klaim yang dinilai di sini: tidak ada AGI, agen dihebohkan tapi tidak andal, keuntungan masih sedang, tidak ada lompatan konsensus GPT-5. Keempatnya terbukti. Daftarnya juga meleset dari setiap keberhasilan tahun itu, mulai dari kategori alat coding senilai $4B sampai medali emas IMO.