कोई वापस जाकर जांच नहीं करता
मार्च 2025 में, Dario Amodei ने Council on Foreign Relations से कहा कि AI तीन से छह महीनों में 90% कोड लिखने लगेगा, और बारह महीनों में लगभग सारा कोड। वह बारह महीने की डेडलाइन मार्च में निकल चुकी है। लगभग किसी ने भी वापस जाकर जांच नहीं की।
यही AI पूर्वानुमान की अजीब परंपरा है। भविष्यवाणियां ज़ोर-शोर से, तारीख़ के साथ और पूरे भरोसे के साथ की जाती हैं, फिर वह तारीख़ आती है और सब अगली भविष्यवाणी पर चले जाते हैं। कोई स्कोरबोर्ड नहीं होता। इसलिए मैंने एक बनाया।
फरवरी 2025 में, मैंने यह मानकर कि Altman 2025 के बारे में सही थे, Whizi में एजेंट वर्कफ़्लो को स्कोप किया। एक फ्लैट मासिक सब्सक्रिप्शन के मुकाबले एक मल्टीस्टेप एजेंट रन की लागत का हिसाब लगाने के छह हफ्ते बाद, मैंने वह प्रोजेक्ट बंद कर दिया। मेरे अपने रोडमैप के छह हफ्ते, किसी और की भविष्यवाणी पर खर्च हुए। मैंने हर वह तारीख़वार 2024 और 2025 की भविष्यवाणी खोजी जिसका एक प्राथमिक स्रोत हो और जिसकी डेडलाइन पहले ही निकल चुकी हो। अठारह इसमें फिट बैठीं।
ग्रेडिंग का नियम, ताकि आप इस पर बहस कर सकें: किसी भविष्यवाणी को उसके अपने शब्दों ने जो वादा किया, उसी पर, उसी की डेडलाइन पर परखा जाता है। अगर आपने सितंबर तक 90% कहा और सितंबर में 30% आया, तो "अच्छा, आखिरकार तो हो ही जाएगा" कोई ग्रेड नहीं है। वह एक बहाना है।
स्कोरबोर्ड
| कौन, कब | भविष्यवाणी | क्या हुआ | ग्रेड |
|---|---|---|---|
| Sam Altman, जनवरी 2025 | AI एजेंट 2025 में "वर्कफोर्स में शामिल" होंगे | 95% एंटरप्राइज़ पायलट में कोई P&L असर नहीं दिखा; सबसे अच्छे एजेंट ने 30.3% ऑफिस काम पूरे किए | C- |
| Marc Benioff, सितंबर 2024 | 2025 के अंत तक एक अरब Agentforce एजेंट | लगभग 29,000 डील और $1B की वार्षिक आवर्ती आय | F |
| Klarna, फरवरी 2024 | AI असिस्टेंट 700 एजेंट के बराबर काम कर रहा | मई 2025 से कम गुणवत्ता के चलते इंसानों की फिर से भर्ती | C |
| Dario Amodei, मार्च 2025 | तीन से छह महीनों में 90% कोड | उद्योग भर में 25% से 41%, मध्य 2026 तक Google पर 75% | C+ |
| Dario Amodei, मार्च 2025 | बारह महीनों में लगभग सारा कोड | सच के करीब भी नहीं | F |
| Eric Schmidt, अप्रैल 2025 | एक साल में ज़्यादातर प्रोग्रामर AI प्रोग्रामरों से बदल जाएंगे | प्रोग्रामर अब भी नौकरी में; एंट्री लेवल भूमिकाएं लगभग 16% घटीं | F |
| Mark Zuckerberg, जनवरी 2025 | एक AI मिडलेवल इंजीनियर, अग्रणी एक अरब उपयोगकर्ता वाला असिस्टेंट, और शीर्ष मॉडल के रूप में Llama, सब 2025 में | तीनों में से कोई नहीं; इसके बजाय इंसानी इंजीनियरों के लिए रिकॉर्ड वेतन पैकेज | F |
| Elon Musk, अप्रैल 2024 | 2025 के अंत तक किसी भी इंसान से ज़्यादा स्मार्ट AI | Grok 4 ने Humanity's Last Exam में 25.4% स्कोर किया | F |
| Mira Murati, जून 2024 | लगभग 18 महीनों में "विशिष्ट कार्यों" के लिए PhD स्तर की बुद्धिमत्ता | 2025 की International Math Olympiad में एक प्रमाणित गोल्ड | B- |
| Gary Marcus, जनवरी 2025 | 25 तारीख़वार भविष्यवाणियां, यहां चार को परखा गया | चारों सही, और साल की किसी भी कामयाबी का इस सूची में ज़िक्र नहीं | A- |
वह वर्कफोर्स जो कभी हाज़िर ही नहीं हुई
Sam Altman, जनवरी 2025: "हमें विश्वास है कि 2025 में हम पहली बार AI एजेंटों को 'वर्कफोर्स में शामिल' होते और कंपनियों के आउटपुट में असल बदलाव लाते देख सकते हैं।"
MIT के NANDA प्रोजेक्ट ने अगस्त 2025 में पाया कि 95% एंटरप्राइज़ जेनरेटिव AI पायलट का कोई मापने लायक P&L असर नहीं था। Carnegie Mellon ने एक नकली कंपनी में पूरी तरह AI एजेंट भरे और उनका ऑफिस काम मापा: सबसे अच्छे मॉडल ने 30.3% काम पूरे किए। 30% वाला कर्मचारी आपके वर्कफोर्स में शामिल नहीं होता। वह अपने प्रोबेशन पीरियड में ही निकल जाता है।
एक अपवाद इसे F से बचाता है: सॉफ्टवेयर कंपनियों के भीतर, कोडिंग एजेंटों ने वाकई आउटपुट बदला। ग्रेड: C-।
Marc Benioff, सितंबर 2024: "हमारा विज़न साहसिक है: 2025 के अंत तक Agentforce के साथ एक अरब एजेंटों को सशक्त बनाना।"
Salesforce ने 2026 की शुरुआत तक करीब 29,000 संचयी Agentforce डील और $1B की वार्षिक आवर्ती आय पार करने की रिपोर्ट दी। एक असली कारोबार, और वादे से लगभग 34,000 गुना कम, वह भी एजेंट नहीं बल्कि डील गिनकर। मेरी पसंदीदा बात: Salesforce अब एजेंटों की गिनती के बजाय "एजेंटिक वर्क यूनिट" (उनमें से 3.8 अरब) रिपोर्ट करता है। जब आंकड़ा हासिल न हो सके, तो यूनिट ही बदल दो। ग्रेड: F।
Klarna, फरवरी 2024: उसका AI असिस्टेंट "700 पूर्णकालिक एजेंटों के बराबर काम कर रहा है।"
फिर मई 2025 में CEO Sebastian Siemiatkowski ने रुख पलटा और इंसानों की भर्ती फिर शुरू कर दी: "हमने दक्षता और लागत पर बहुत ज़्यादा ध्यान दिया। नतीजा गुणवत्ता में गिरावट रहा।" AI के पास सामान्य टिकट रह गए। जो भी मायने रखता था, उसके लिए इंसान वापस आए। सार्वजनिक रूप से यह प्रयोग करने और नतीजा मानने का श्रेय बनता है। ग्रेड: C।
वह कोड जो असल में लिखा गया
Amodei का 90%। दिशा सही थी और हर (denominator) गलत। Google का कहना है कि मध्य 2026 तक उसका 75% नया कोड AI द्वारा जनरेट किया जा रहा है, जो देर 2024 के 25% से बढ़ा है, हालांकि इसमें हर स्वीकृत ऑटोकम्प्लीट गिना जाता है और डिप्लॉय से पहले इंसान अब भी समीक्षा करते हैं। 2026 की शुरुआत में उद्योगव्यापी अनुमान 25% से 41% के आसपास इकट्ठे थे।
तो: छह महीनों में सारे कोड का 90%, नहीं। बारह महीनों में लगभग सारा कोड, सच के करीब भी नहीं। कोड लिखे जाने के तरीके में एक ऐतिहासिक बदलाव, बिल्कुल हां। भविष्यवाणी ने एक असली क्रांति बताई और हर आंकड़ा गलत निकाला। ग्रेड: 90% के लिए C+, "लगभग सब कुछ" के लिए F।
Eric Schmidt, अप्रैल 2025: "अगले एक साल में, ज़्यादातर प्रोग्रामर AI प्रोग्रामरों से बदल दिए जाएंगे।"
साल पूरा हो चुका है। प्रोग्रामर लगभग हर जगह नौकरी में बने हुए हैं जहां वे पहले थे। असली श्रम नुकसान भविष्यवाणी से कहीं संकरा और क्रूर निकला: Stanford और ADP पेरोल डेटा दिखाता है कि सबसे ज़्यादा AI-प्रभावित नौकरियों में 22 से 25 साल के लोगों का रोज़गार देर 2022 से लगभग 16% घटा है और अभी भी सिकुड़ रहा है। मार लगी एंट्री लेवल पर; ज़्यादातर लोगों ने नौकरी बचाई और साथ में Copilot लाइसेंस पाया। ग्रेड: F।
और वह आंकड़ा जिसकी किसी ने भविष्यवाणी नहीं की: Cursor करीब सत्रह महीनों में $100M से $4B की वार्षिक आवर्ती आय पर पहुंच गया, और 14 अगस्त को SpaceX ने कंपनी का $60B अधिग्रहण पूरा किया, जो अब तक का सबसे बड़ा स्टार्टअप अधिग्रहण दर्ज हुआ। मैंने जितनी भी 2024 की भविष्यवाणी सूचियां देखीं, किसी में "एक कोड एडिटर इतिहास का सबसे बड़ा स्टार्टअप एग्ज़िट बनेगा" नहीं लिखा था।
Meta का बहुत महंगा साल
Mark Zuckerberg, जनवरी 2025, Joe Rogan के साथ: "शायद 2025 में, हम Meta पर... एक ऐसा AI लाएंगे जो असल में एक तरह का मिडलेवल इंजीनियर हो सकता है, जो आपकी कंपनी में कोड लिख सके।" कुछ हफ्तों बाद अर्निंग्स कॉल पर उन्होंने 2025 के लिए दो और जोड़े: Meta AI को अग्रणी एक अरब उपयोगकर्ता वाला असिस्टेंट, और Llama को सबसे उन्नत और सबसे ज़्यादा इस्तेमाल होने वाला मॉडल।
तीनों में से कोई नहीं हुआ। Llama 4 फीका साबित हुआ जबकि Gemini 3 ने नवंबर 2025 में फ्रंटियर का ताज पहन लिया। और Meta ने अपने पैसे से बिल्कुल उलटा दांव खेला: Scale AI के आधे हिस्से के लिए $14.3B, शोधकर्ताओं के लिए $100M से $450M के बीच बताए गए वेतन पैकेज, फिर अक्टूबर में सुपरइंटेलिजेंस लैब से 600 लोगों की छंटनी और मई 2026 में करीब 8,000 छंटनियां।
Meta ने ऐसे AI की भविष्यवाणी की जो मिडलेवल इंजीनियर की तरह कोड लिखे, और इसके बजाय अठारह महीने इंसानी इंजीनियरों के लिए दुनिया का रिकॉर्ड बाज़ार मूल्य तय करने में बिता दिए। ग्रेड: F।
Elon Musk, अप्रैल 2024: AI "शायद अगले साल के अंत तक किसी भी एक इंसान से ज़्यादा स्मार्ट।"
2025 के अंत तक, xAI का फ्लैगशिप मॉडल Grok 4 था, जिसे "दुनिया का सबसे स्मार्ट AI" कहकर लॉन्च किया गया, और उसने Humanity's Last Exam नाम की एक बेंचमार्क में 25.4% स्कोर किया। यह दावा उस परीक्षा के सामने टिक नहीं पाया। ग्रेड: F।
Mira Murati, जून 2024: लगभग अठारह महीनों में "विशिष्ट कार्यों" के लिए PhD स्तर की बुद्धिमत्ता।
गणित के मामले में यह लगभग सच हुआ: Google DeepMind के Deep Think ने 2025 की International Math Olympiad में एक आधिकारिक रूप से प्रमाणित गोल्ड जीता, जो ज़्यादातर 2024 के अनुमानों से कई साल आगे था। उन्होंने जो शर्त लगाई, "विशिष्ट कार्यों के लिए", वही असली मेहनत कर रही है, और यह ठीक वही शर्त है जिसे उनके ज़्यादा शोर मचाने वाले साथियों ने लगाने से इनकार किया। सशर्त वाला हिस्सा सच निकला। बिना शर्त वाला हिस्सा, जो अगस्त 2025 में GPT-5 की "PhD-level" ब्रांडिंग के रूप में सामने आया, इतना बुरा निकला कि Altman ने माना कि OpenAI ने रोलआउट "पूरी तरह गड़बड़" कर दिया। ग्रेड: B-।
संशयवादी का रिपोर्ट कार्ड
Gary Marcus ने 1 जनवरी 2025 को 25 तारीख़वार भविष्यवाणियां प्रकाशित कीं। उद्योग अक्सर उनका मज़ाक उड़ाता है। उनके परखे जा सकने वाले दावों को ग्रेड देते हैं:
- "हम इस साल आर्टिफिशियल जनरल इंटेलिजेंस नहीं देखेंगे।" सही।
- एजेंट "2025 भर बेहद हाइप होंगे लेकिन भरोसेमंद होने से कोसों दूर।" सही, पूरा पहला सेक्शन देखें।
- "AI मॉडलों से मुनाफा मामूली या न के बराबर बना रहेगा।" राजस्व तो उछला, लेकिन उन्होंने मुनाफे की बात कही थी, और लैब्स अब भी नकदी फूंक रही हैं। शब्दशः सही।
- 2025 में शायद कोई "GPT-5 स्तर" वाली सर्वसम्मत छलांग नहीं। GPT-5 आया; वह छलांग नहीं आई। भावना के लिहाज़ से सही।
ग्रेड: A-। घटाया गया माइनस उस चीज़ के लिए है जो सूची में नहीं है: इसमें $4B के कोडिंग टूल क्षेत्र, IMO गोल्ड, या उस एकमात्र क्षेत्र में एजेंटों के वाकई उपयोगी बनने की कोई भविष्यवाणी नहीं थी जहां आउटपुट जांचा जा सकता है। 2025 के सबसे अच्छे पूर्वानुमानकर्ता ने हर नाकामी सही पकड़ी और हर कामयाबी चूक गया।
और वह असहज दूसरा तथ्य: सही होने से उन्हें लगभग कुछ नहीं मिला। जिन निवेशकों ने उनके पूरे नज़रिए के खिलाफ दांव लगाया, वे ही Cursor को $60B पर आंकने वाले निकले। पूर्वानुमान की सटीकता और वित्तीय रिटर्न अलग-अलग स्कोरबोर्ड पर चलते हैं, और उनमें से सिर्फ एक ही बढ़ता (compound) है।
क्षमता वाली भविष्यवाणियां सच निकलीं। तैनाती वाली नहीं
18 भविष्यवाणियों को दो ढेरों में बांटिए और शोर गायब हो जाता है।
क्षमता से जुड़ी भविष्यवाणियां, यानी मॉडल क्या कर पाएंगे, सही साबित हुईं और कई बार समय से पहले भी। METR के अनुसार, एजेंट जितने लंबे काम पूरे कर सकते हैं, वह अवधि हर चार से सात महीनों में लगभग दोगुनी हो रही है, और यह रुझान कायम रहा।
तैनाती से जुड़ी भविष्यवाणियां, यानी संगठन AI को असल में क्या करने देंगे, लगभग पूरी तरह फेल रहीं। वर्कफोर्स एजेंट, अरबों एजेंट वाले प्लेटफॉर्म, छंटे प्रोग्रामर, AI कर्मचारी: यह सब गुणवत्ता की शर्तों, देनदारी, इंटीग्रेशन लागत, और इस अड़ियल हकीकत की एक ही दीवार से टकराया कि 30% काम पूरा करने वाला सिस्टम एक डेमो है, कोई भर्ती नहीं।
Altman ने कहा था कि एजेंट वर्कफोर्स में शामिल होंगे। वे IDE में शामिल हुए, क्योंकि IDE वह इकलौता कार्यस्थल है जहां गलत जवाब को ग्राहक नहीं बल्कि एक कंपाइलर पकड़ता है।
तो यह वह फैसले का नियम है जो मैं अब अपने ही पैसे पर लागू करता हूं: जब आप कोई क्षमता वाली भविष्यवाणी सुनें, तो उसे गंभीरता से लें, यहां तक कि सबसे अजीब वाली को भी, क्योंकि रुझान की रेखाएं जीतती रहती हैं। जब आप तारीख़ वाली कोई तैनाती की भविष्यवाणी सुनें, तो समय-सीमा दोगुनी कर दें, फिर देखें कि कहने वाला व्यक्ति क्या बेच रहा है। मैं यही नियम इस्तेमाल करता हूं जब यह तय करना होता है कि किस मॉडल के लिए भुगतान करूं: बेंचमार्क एक क्षमता वाला दावा है, वर्कफ़्लो एक तैनाती वाला दावा।
अब से हर तिमाही मैं जो भी डेडलाइन पूरी होती है उसे ग्रेड दूंगा, और अगला संस्करण अपनी ही तारीख़वार भविष्यवाणियों के साथ खुलेगा, ताकि आप भी मुझे उसी पैमाने पर परख सकें। ग्रेड देना मुफ्त है। ग्रेड पाना कीमत है।
- किसी भविष्यवाणी को उसके अपने शब्दों पर, उसी की डेडलाइन पर परखें; "आखिरकार हो ही जाएगा" कोई ग्रेड नहीं है
- क्षमता से जुड़ी भविष्यवाणियों को गंभीरता से लें, यहां तक कि सबसे अजीब वाली को भी; रुझान की रेखाएं जीतती रहती हैं
- तारीख़ वाली किसी भी तैनाती की समय-सीमा को दोगुना करें
- देखें कि भविष्यवाणी करने वाला व्यक्ति क्या बेच रहा है
- अपनी खुद की भविष्यवाणियां तारीख़ों के साथ लिख लें ताकि कोई आपको भी परख सके
अक्सर पूछे जाने वाले सवाल
क्या Dario Amodei सही थे कि AI 90% कोड लिखेगा?
अपनी डेडलाइन पर नहीं। उन्होंने मार्च 2025 से तीन से छह महीनों में 90% और बारह महीनों में लगभग सारा कोड कहा था। 2026 की शुरुआत में उद्योगव्यापी अनुमान 25% से 41% के आसपास इकट्ठे थे, जबकि Google मध्य 2026 तक 75% नए कोड पर था, वह भी हर स्वीकृत ऑटोकम्प्लीट गिनकर। दिशा सही थी, आंकड़े गलत।
क्या AI एजेंट 2025 में वर्कफोर्स में शामिल हुए?
सॉफ्टवेयर के बाहर नहीं। MIT के NANDA प्रोजेक्ट ने पाया कि 95% एंटरप्राइज़ जेनरेटिव AI पायलट का कोई मापने लायक P&L असर नहीं था, और Carnegie Mellon के एजेंट कंपनी टेस्ट में सबसे अच्छे मॉडल ने 30.3% ऑफिस काम पूरे किए। सॉफ्टवेयर कंपनियों के भीतर कोडिंग एजेंट ही एकमात्र असली अपवाद थे।
2025 में AI के बारे में सबसे सटीक भविष्यवाणी किसने की?
संशयवादी Gary Marcus ने, यहां परखे गए दावों पर: कोई AGI नहीं, एजेंट हाइप्ड लेकिन भरोसेमंद नहीं, मुनाफा अब भी मामूली, कोई सर्वसम्मत GPT-5 छलांग नहीं। चारों सही निकले। उनकी सूची साल की हर कामयाबी भी चूक गई, $4B के कोडिंग टूल क्षेत्र से लेकर IMO गोल्ड तक।