Tiada siapa kembali menyemak
Pada Mac 2025, Dario Amodei memberitahu Council on Foreign Relations bahawa AI akan menulis 90% kod dalam tempoh tiga hingga enam bulan, dan hampir semuanya dalam dua belas bulan. Tarikh akhir dua belas bulan itu berlalu pada Mac. Hampir tiada siapa kembali menyemak.
Itulah etika pelik ramalan AI. Ramalan itu lantang, bertarikh, dan disampaikan dengan keyakinan penuh, kemudian tarikh tiba dan semua orang sudah beralih kepada ramalan seterusnya. Tiada papan skor. Jadi saya membina satu.
Pada Februari 2025, saya merancang aliran kerja ejen ke dalam Whizi berdasarkan andaian bahawa Altman betul tentang 2025. Saya membatalkan projek itu enam minggu kemudian, selepas mengira kos satu larian ejen berbilang langkah berbanding langganan bulanan tetap. Enam minggu daripada pelan hala tuju saya sendiri, dibelanjakan atas ramalan orang lain. Saya mengumpul setiap ramalan bertarikh 2024 dan 2025 yang dapat saya cari dengan sumber utama dan tarikh akhir yang sudah berlalu. Lapan belas berjaya masuk senarai.
Peraturan penilaian, supaya anda boleh bertikai dengannya: sesuatu ramalan dinilai berdasarkan apa yang dijanjikan oleh kata-katanya sendiri, pada tarikh akhirnya sendiri. Jika anda kata 90% menjelang September dan September membawa 30%, "nanti-nanti akan sampai" bukan gred. Itu alasan.
Papan skor
| Siapa, bila | Ramalan | Apa yang berlaku | Gred |
|---|---|---|---|
| Sam Altman, Januari 2025 | Ejen AI "menyertai tenaga kerja" pada 2025 | 95% projek rintis perusahaan tiada kesan untung rugi; ejen terbaik menyiapkan 30.3% tugas pejabat | C- |
| Marc Benioff, September 2024 | Satu bilion ejen Agentforce menjelang akhir 2025 | Kira-kira 29,000 urus niaga dan $1B hasil berulang tahunan | F |
| Klarna, Februari 2024 | Pembantu AI melakukan kerja setara 700 ejen | Mengambil semula manusia sejak Mei 2025 kerana kualiti rendah | C |
| Dario Amodei, Mac 2025 | 90% kod dalam tiga hingga enam bulan | 25% hingga 41% seluruh industri, 75% di Google menjelang pertengahan 2026 | C+ |
| Dario Amodei, Mac 2025 | Hampir semua kod dalam dua belas bulan | Jauh meleset | F |
| Eric Schmidt, April 2025 | Majoriti besar pengaturcara digantikan dalam setahun | Pengaturcara masih bekerja; jawatan peringkat masuk turun kira-kira 16% | F |
| Mark Zuckerberg, Januari 2025 | Jurutera AI pertengahan, pembantu berbilion pengguna terdepan, dan Llama sebagai model teratas, semuanya pada 2025 | Tiada satu pun daripada tiga tercapai; pakej gaji rekod untuk jurutera manusia pula | F |
| Elon Musk, April 2024 | AI lebih bijak daripada mana-mana manusia menjelang akhir 2025 | Grok 4 mendapat 25.4% dalam Humanity's Last Exam | F |
| Mira Murati, Jun 2024 | Kecerdasan setaraf PhD "untuk tugas tertentu" dalam kira-kira 18 bulan | Emas rasmi disahkan di International Math Olympiad 2025 | B- |
| Gary Marcus, Januari 2025 | 25 ramalan bertarikh, empat dinilai di sini | Kesemua empat betul, dan tiada satu pun kejayaan tahun itu tersenarai | A- |
Tenaga kerja yang tidak pernah masuk kerja
Sam Altman, Januari 2025: "Kami percaya bahawa, pada 2025, kita mungkin melihat ejen AI pertama 'menyertai tenaga kerja' dan mengubah secara ketara output syarikat."
Projek NANDA MIT mendapati pada Ogos 2025 bahawa 95% projek rintis AI generatif perusahaan tidak memberi kesan untung rugi yang boleh diukur. Carnegie Mellon menempatkan syarikat palsu sepenuhnya dengan ejen AI dan mengukur kerja pejabat yang siap: model terbaik menyiapkan 30.3% tugasan. Pekerja 30% tidak menyertai tenaga kerja anda. Mereka keluar semasa tempoh percubaan.
Satu pengecualian menyelamatkannya daripada gred F: dalam syarikat perisian, ejen pengekodan memang mengubah output secara sebenar. Gred: C-.
Marc Benioff, September 2024: "Visi kami berani: memperkasa satu bilion ejen dengan Agentforce menjelang akhir 2025."
Salesforce melaporkan kira-kira 29,000 urus niaga Agentforce terkumpul menjelang awal 2026 dan melepasi $1B hasil berulang tahunan. Perniagaan sebenar, tetapi kira-kira 34,000 kali lebih rendah daripada janji, mengira urus niaga dan bukan ejen. Butiran kegemaran saya: Salesforce kini melaporkan "unit kerja agentik dihantar" (3.8 bilion daripadanya) berbanding kiraan ejen. Apabila tidak dapat capai nombor, tukar unit. Gred: F.
Klarna, Februari 2024: pembantu AInya "melakukan kerja setara 700 ejen sepenuh masa."
Kemudian pada Mei 2025 ketua eksekutif Sebastian Siemiatkowski membalikkan haluan dan mula mengambil semula manusia: "Kami terlalu fokus pada kecekapan dan kos. Hasilnya kualiti lebih rendah." AI mengekalkan tiket rutin. Manusia kembali untuk segala yang penting. Diberi kredit kerana menjalankan eksperimen secara terbuka dan mengaku hasilnya. Gred: C.
Kod yang benar-benar ditulis
90% Amodei. Arah tuju betul tetapi penyebutnya salah. Google menyatakan 75% kod barunya dijana AI menjelang pertengahan 2026, naik daripada 25% pada akhir 2024, walaupun ini mengira setiap autolengkap yang diterima dan manusia masih menyemak sebelum dikeluarkan. Anggaran seluruh industri pada awal 2026 berkelompok sekitar 25% hingga 41%.
Jadi: 90% semua kod dalam enam bulan, tidak. Hampir semua kod dalam dua belas bulan, jauh meleset. Perubahan bersejarah dalam cara kod ditulis, memang ya. Ramalan itu menggambarkan revolusi sebenar tetapi tersilap setiap nombor. Gred: C+ untuk 90%, F untuk "hampir semua."
Eric Schmidt, April 2025: "dalam setahun akan datang, majoriti besar pengaturcara akan digantikan oleh pengaturcara AI."
Tahun itu sudah tamat. Pengaturcara kekal bekerja di hampir semua tempat mereka bekerja sebelum ini. Kerosakan buruh sebenar lebih sempit dan lebih kejam daripada ramalan: data gaji Stanford dan ADP menunjukkan guna tenaga bagi usia 22 hingga 25 tahun dalam pekerjaan paling terdedah AI turun kira-kira 16% sejak akhir 2022 dan masih menyusut. Peringkat masuk terkena kesan; majoriti besar mengekalkan pekerjaan dan mendapat lesen Copilot. Gred: F.
Dan nombor yang tiada siapa meramal langsung: Cursor melonjak daripada $100M kepada $4B hasil berulang tahunan dalam kira-kira tujuh belas bulan, dan pada 14 Ogos SpaceX menyelesaikan pengambilalihan $60B syarikat itu, pengambilalihan syarikat permulaan terbesar yang pernah direkodkan. Tiada satu senarai ramalan 2024 yang saya semak menyebut "editor kod menjadi jualan keluar syarikat permulaan terbesar dalam sejarah."
Tahun yang amat mahal untuk Meta
Mark Zuckerberg, Januari 2025, di Joe Rogan: "Mungkin pada 2025, kami di Meta... akan mempunyai AI yang boleh berfungsi seperti jurutera pertengahan yang anda ada di syarikat anda dan boleh menulis kod." Dalam panggilan pendapatan beberapa minggu kemudian dia menambah dua lagi untuk 2025: Meta AI sebagai pembantu berbilion pengguna terdepan, dan Llama sebagai model paling canggih dan digunakan secara meluas.
Tiada satu daripada tiga itu berlaku. Llama 4 mendarat tanpa gemilang manakala Gemini 3 merampas takhta terdepan pada November 2025. Dan Meta membelanjakan tahun itu membuat pertaruhan berbeza dengan wangnya: $14.3B untuk separuh Scale AI, pakej gaji penyelidik dilaporkan antara $100M dan $450M, kemudian 600 orang dipotong daripada makmal superintelligence pada Oktober dan kira-kira 8,000 pemberhentian pada Mei 2026.
Meta meramal AI yang mengkod seperti jurutera pertengahan, dan sebaliknya menghabiskan lapan belas bulan menetapkan rekod dunia harga pasaran untuk yang manusia. Gred: F.
Elon Musk, April 2024: AI "lebih bijak daripada mana-mana seorang manusia mungkin sekitar penghujung tahun depan."
Menjelang akhir 2025, model unggulan xAI ialah Grok 4, dilancarkan sebagai "AI paling bijak di dunia," mendapat 25.4% dalam penanda aras yang secara literalnya bernama Humanity's Last Exam. Dakwaan itu tidak bertahan apabila berdepan peperiksaan sebenar. Gred: F.
Mira Murati, Jun 2024: kecerdasan setaraf PhD "untuk tugas tertentu" dalam kira-kira lapan belas bulan.
Untuk matematik ia hampir menjadi kenyataan: Deep Think milik Google DeepMind meraih emas disahkan secara rasmi di International Math Olympiad 2025, bertahun-tahun lebih awal daripada kebanyakan ramalan 2024. Syarat yang digunakannya, "untuk tugas tertentu," memainkan peranan besar, dan itulah tepatnya syarat yang enggan digunakan oleh rakan sebayanya yang lebih lantang. Versi berhati-hati itu menjadi kenyataan. Versi tanpa syarat, dijenamakan sebagai "PhD-level" GPT-5 pada Ogos 2025, menjadi teruk sehingga Altman mengaku OpenAI "benar-benar rosakkan" pelancarannya. Gred: B-.
Kad laporan si skeptik
Gary Marcus menerbitkan 25 ramalan bertarikh pada 1 Januari 2025. Industri kebanyakannya memperlekehkannya. Menilai dakwaannya yang boleh dinilai:
- "Kita tidak akan melihat kecerdasan am buatan (AGI) tahun ini." Betul.
- Ejen akan "dihebohkan tanpa henti sepanjang 2025 tetapi jauh daripada boleh dipercayai." Betul, lihat keseluruhan bahagian pertama.
- "Keuntungan daripada model AI akan terus sederhana atau tiada langsung." Hasil meletup, tetapi dia sebut keuntungan, dan makmal-makmal masih membakar wang tunai. Betul dari segi harfiah.
- Mungkin tiada lonjakan konsensus setaraf "GPT-5" pada 2025. GPT-5 dilancarkan; lonjakannya tidak berlaku. Betul dari segi semangat.
Gred: A-. Tanda tolak diberikan kerana apa yang tiada dalam senarai itu: tiada satu pun meramal kategori alat pengekodan bernilai $4B, emas IMO, atau ejen menjadi benar-benar berguna dalam satu-satunya domain di mana output boleh disemak. Peramal terbaik tahun 2025 betul tentang setiap kegagalan dan terlepas setiap kejayaan.
Dan fakta peringkat kedua yang tidak selesa: menjadi betul memberinya lebih kurang tiada apa-apa. Pelabur yang bertaruh menentang seluruh pandangan dunianya adalah mereka yang menghargai Cursor pada $60B. Ketepatan ramalan dan pulangan kewangan berjalan pada papan skor berasingan, dan hanya satu daripadanya yang berganda ganda.
Ramalan keupayaan menjadi kenyataan. Ramalan penggunaan tidak
Susun 18 ramalan itu kepada dua timbunan dan kekeliruan itu hilang.
Ramalan tentang keupayaan, apa yang model mampu lakukan, bertahan dengan baik dan kadangkala tiba lebih awal. Panjang tugasan yang mampu diselesaikan ejen telah berganda kira-kira setiap empat hingga tujuh bulan, menurut METR, dan trend itu bertahan.
Ramalan tentang penggunaan, apa yang organisasi akan benarkan AI benar-benar lakukan, gagal hampir seragam. Ejen tenaga kerja, platform berbilion ejen, pengaturcara digantikan, pekerja AI: semuanya terlanggar dinding yang sama iaitu piawaian kualiti, liabiliti, kos integrasi, dan hakikat keras bahawa sistem yang menyiapkan 30% tugasan adalah demo, bukan pekerja tetap.
Altman berkata ejen akan menyertai tenaga kerja. Mereka menyertai IDE, kerana IDE ialah satu-satunya tempat kerja di mana jawapan salah ditangkap oleh pengkompil, bukan pelanggan.
Jadi inilah peraturan keputusan yang saya guna sekarang, dengan wang saya sendiri dipertaruhkan: apabila anda mendengar ramalan keupayaan, ambil ia dengan serius, walaupun yang paling melampau, kerana garis trend terus menang. Apabila anda mendengar ramalan penggunaan dengan tarikh dilampirkan, gandakan jangka masa itu, kemudian semak apa yang dijual oleh orang yang mengatakannya. Peraturan yang sama ialah cara saya memilih model untuk dibayar: penanda aras ialah dakwaan keupayaan, aliran kerja ialah dakwaan penggunaan.
Setiap suku tahun dari sini saya akan menilai apa jua yang sampai tarikh akhirnya, dan edisi seterusnya dibuka dengan ramalan bertarikh saya sendiri, supaya anda boleh menilai saya dengan rubrik yang sama. Menilai adalah percuma. Dinilai ada harganya.
- Nilai ramalan berdasarkan kata-katanya sendiri, pada tarikh akhirnya sendiri; "nanti-nanti akan sampai" bukan gred
- Ambil ramalan keupayaan dengan serius, walaupun yang paling melampau; garis trend terus menang
- Gandakan mana-mana jangka masa penggunaan yang membawa tarikh
- Semak apa yang dijual oleh orang yang membuat ramalan itu
- Tulis ramalan anda sendiri dengan tarikh supaya seseorang boleh menilai anda kembali
Soalan Lazim
Betulkah Dario Amodei bahawa AI akan menulis 90% kod?
Tidak pada tarikh akhirnya. Dia kata 90% dalam tiga hingga enam bulan dari Mac 2025 dan hampir semua kod dalam dua belas bulan. Anggaran seluruh industri pada awal 2026 berkelompok sekitar 25% hingga 41%, dengan Google pada 75% kod baru menjelang pertengahan 2026 yang mengira setiap autolengkap diterima. Arah tuju betul dan nombornya salah.
Adakah ejen AI menyertai tenaga kerja pada 2025?
Tidak di luar perisian. Projek NANDA MIT mendapati 95% projek rintis AI generatif perusahaan tidak memberi kesan untung rugi yang boleh diukur, dan ujian syarikat ejen Carnegie Mellon melihat model terbaik menyiapkan 30.3% tugasan pejabat. Ejen pengekodan dalam syarikat perisian adalah satu-satunya pengecualian sebenar.
Siapa meramal 2025 dalam AI dengan paling tepat?
Gary Marcus, si skeptik, berdasarkan dakwaan yang dinilai di sini: tiada AGI, ejen dihebohkan tetapi tidak boleh dipercayai, keuntungan masih sederhana, tiada lonjakan konsensus GPT-5. Kesemua empat bertahan. Senarainya juga terlepas setiap kejayaan tahun itu, daripada kategori alat pengekodan $4B hingga emas IMO.