AI بنانے والے لوگ اس کے مستقبل کی پیش گوئی میں سب سے کمزور ہیں

فوری جواب

2024 اور 2025 کی اٹھارہ مؤرخہ AI پیش گوئیاں، ان کے اپنے الفاظ اور اپنی ہی ڈیڈ لائنز پر پرکھی گئیں۔ صلاحیت سے متعلق پیش گوئیاں زیادہ تر درست نکلیں، بعض تو وقت سے پہلے۔ ڈیپلائمنٹ سے متعلق پیش گوئیاں، جیسے ورک فورس میں شامل ہونے والے ایجنٹس، ایک ارب Agentforce ایجنٹس، اور ایک سال میں پروگرامرز کا متبادل، تقریباً سب ناکام رہیں۔ سب سے بہتر اسکور شکی گیری مارکس نے A- کے ساتھ حاصل کیا، اور صحیح ہونے کے باوجود اسے کچھ حاصل نہ ہوا۔

کوئی واپس جا کر نہیں دیکھتا

مارچ 2025 میں، ڈاریو امودائی نے Council on Foreign Relations کو بتایا کہ AI تین سے چھ مہینوں میں 90% کوڈ لکھے گا، اور بارہ مہینوں میں تقریباً سارا کوڈ۔ وہ بارہ ماہ کی ڈیڈ لائن مارچ میں گزر چکی ہے۔ تقریباً کسی نے واپس جا کر نہیں دیکھا۔

AI پیش گوئی کا عجیب طور طریقہ یہی ہے۔ پیش گوئیاں اونچی آواز میں، تاریخ کے ساتھ اور مکمل اعتماد کے ساتھ کی جاتی ہیں، پھر وہ تاریخ آتی ہے اور سب اگلی پیش گوئی کی طرف بڑھ چکے ہوتے ہیں۔ کوئی اسکور بورڈ نہیں ہوتا۔ تو میں نے ایک بنا دیا۔

فروری 2025 میں، میں نے یہ سمجھتے ہوئے کہ آلٹمین کا 2025 کے بارے میں اندازہ درست ہے، Whizi میں ایجنٹ ورک فلوز کا منصوبہ بنایا۔ چھ ہفتے بعد میں نے یہ منصوبہ بند کر دیا، جب حساب لگایا کہ ایک ہی ملٹی اسٹیپ ایجنٹ رن کی لاگت ایک فلیٹ ماہانہ سبسکرپشن کے مقابلے میں کتنی ہے۔ میرے اپنے روڈ میپ کے چھ ہفتے، کسی اور کی پیش گوئی پر خرچ ہوئے۔ میں نے 2024 اور 2025 کی ہر وہ مؤرخہ پیش گوئی نکالی جس کا کوئی بنیادی مآخذ ہو اور جس کی ڈیڈ لائن گزر چکی ہو۔ اٹھارہ اس میں شامل ہوئیں۔

گریڈنگ کا اصول، تاکہ آپ اس پر بحث کر سکیں: کسی پیش گوئی کو اسی کے اپنے الفاظ کے وعدے پر، اس کی اپنی ڈیڈ لائن پر پرکھا جاتا ہے۔ اگر آپ نے کہا ستمبر تک 90%، اور ستمبر نے 30% دیا، تو "خیر، بالآخر" کوئی گریڈ نہیں ہے۔ یہ ایک بہانہ ہے۔

اسکور بورڈ

کون، کبپیش گوئیکیا ہواگریڈ
سیم آلٹمین، جنوری 2025AI ایجنٹس 2025 میں "ورک فورس میں شامل" ہوں گے95% انٹرپرائز پائلٹس کا P&L پر کوئی اثر نہیں پڑا؛ بہترین ایجنٹ نے 30.3% دفتری کام مکمل کیےC-
مارک بینیوف، ستمبر 20242025 کے اختتام تک ایک ارب Agentforce ایجنٹستقریباً 29,000 ڈیلز اور $1B سالانہ متواتر آمدنیF
Klarna، فروری 2024AI اسسٹنٹ 700 ایجنٹس کے برابر کام کر رہا ہےمئی 2025 سے کم معیار کی وجہ سے انسانوں کی دوبارہ بھرتیC
ڈاریو امودائی، مارچ 2025تین سے چھ مہینوں میں 90% کوڈصنعت بھر میں 25% سے 41%، 2026 کے وسط تک گوگل میں 75%C+
ڈاریو امودائی، مارچ 2025بارہ مہینوں میں تقریباً سارا کوڈقریب سے بھی نہیںF
ایرک شمٹ، اپریل 2025ایک سال کے اندر زیادہ تر پروگرامرز کا متبادلپروگرامرز اب بھی ملازم ہیں؛ انٹری لیول کردار تقریباً 16% کمF
مارک زکربرگ، جنوری 2025AI مڈ لیول انجینئر، سب سے آگے ارب صارف والا اسسٹنٹ، اور Llama سب سے بہتر ماڈل، سب 2025 میںتینوں میں سے کوئی نہیں؛ اس کے بجائے انسانی انجینئرز کے لیے ریکارڈ تنخواہ پیکجزF
ایلون مسک، اپریل 20242025 کے اختتام تک AI کسی بھی انسان سے زیادہ ذہینGrok 4 نے Humanity's Last Exam میں 25.4% اسکور کیاF
میرا مورتی، جون 2024تقریباً 18 مہینوں میں "مخصوص کاموں" کے لیے PhD سطح کی ذہانت2025 کے انٹرنیشنل میتھ اولمپیاڈ میں سرٹیفائیڈ گولڈB-
گیری مارکس، جنوری 202525 مؤرخہ پیش گوئیاں، یہاں چار کو گریڈ کیا گیاچاروں درست، اور سال کی کوئی بھی کامیابی فہرست میں شامل نہیںA-

وہ ورک فورس جو کبھی حاضری نہیں لگاتی

سیم آلٹمین، جنوری 2025: "ہمیں یقین ہے کہ، 2025 میں، ہم پہلی بار AI ایجنٹس کو 'ورک فورس میں شامل' ہوتے اور کمپنیوں کی پیداوار میں نمایاں تبدیلی لاتے دیکھ سکتے ہیں۔"

MIT کے NANDA پروجیکٹ نے اگست 2025 میں پایا کہ 95% انٹرپرائز جنریٹو AI پائلٹس کا P&L پر کوئی قابلِ پیمائش اثر نہیں پڑا۔ Carnegie Mellon نے مکمل طور پر AI ایجنٹس سے چلنے والی ایک نقلی کمپنی بنائی اور دفتری کام کی پیمائش کی: بہترین ماڈل نے 30.3% کام مکمل کیے۔ 30% کارکردگی والا ملازم آپ کی ورک فورس میں شامل نہیں ہوتا، وہ اپنی پروبیشن مدت میں ہی نکل جاتا ہے۔

ایک استثنا اسے F سے بچا لیتا ہے: سافٹ ویئر کمپنیوں کے اندر، کوڈنگ ایجنٹس نے واقعی پیداوار میں تبدیلی لائی۔ گریڈ: C-۔

مارک بینیوف، ستمبر 2024: "ہمارا وژن جرات مندانہ ہے: 2025 کے اختتام تک Agentforce کے ساتھ ایک ارب ایجنٹس کو بااختیار بنانا۔"

Salesforce نے 2026 کے آغاز تک تقریباً 29,000 مجموعی Agentforce ڈیلز رپورٹ کیے اور $1B سالانہ متواتر آمدنی عبور کی۔ ایک حقیقی کاروبار، مگر وعدے سے تقریباً 34,000 گنا کم، اور یہ گنتی ایجنٹس کی نہیں ڈیلز کی ہے۔ میری پسندیدہ تفصیل: Salesforce اب ایجنٹس کی گنتی کے بجائے "agentic work units served" (ان کے 3.8 ارب) رپورٹ کرتا ہے۔ جب عدد پورا نہ ہو تو یونٹ ہی بدل دیں۔ گریڈ: F۔

Klarna، فروری 2024: اس کا AI اسسٹنٹ "700 مکمل وقتی ایجنٹس کے برابر کام کر رہا ہے۔"

پھر مئی 2025 میں CEO سیبسچن سیمیاٹکووسکی نے رخ بدلا اور انسانوں کی دوبارہ بھرتی شروع کی: "ہم نے کارکردگی اور لاگت پر بہت زیادہ توجہ دی۔ نتیجہ کم معیار کی صورت میں نکلا۔" AI نے معمول کی ٹکٹیں سنبھالیں۔ انسان ہر اہم چیز کے لیے واپس آئے۔ عوامی سطح پر تجربہ کرنے اور نتیجہ تسلیم کرنے پر کریڈٹ۔ گریڈ: C۔

وہ کوڈ جو حقیقت میں لکھا گیا

امودائی کا 90%۔ سمت درست تھی اور تناسب غلط۔ گوگل کا کہنا ہے کہ 2026 کے وسط تک اس کا 75% نیا کوڈ AI سے تیار ہوتا ہے، جو 2024 کے آخر میں 25% تھا، اگرچہ اس میں ہر قبول شدہ آٹو کمپلیٹ شامل ہے اور انسان اب بھی ڈیپلائے سے پہلے جائزہ لیتے ہیں۔ 2026 کے آغاز میں صنعت بھر کے تخمینے 25% سے 41% کے درمیان تھے۔

تو: چھ مہینوں میں تمام کوڈ کا 90%، نہیں۔ بارہ مہینوں میں تقریباً سارا کوڈ، قریب سے بھی نہیں۔ کوڈ لکھے جانے کے طریقے میں ایک تاریخی تبدیلی، بالکل ہاں۔ اس پیش گوئی نے ایک حقیقی انقلاب کی نشاندہی کی مگر ہر عدد غلط نکالا۔ گریڈ: 90% کے لیے C+، "تقریباً سب" کے لیے F۔

ایرک شمٹ، اپریل 2025: "اگلے ایک سال میں، زیادہ تر پروگرامرز کی جگہ AI پروگرامرز لے لیں گے۔"

سال گزر چکا ہے۔ پروگرامرز تقریباً ہر جگہ ملازم ہیں جہاں پہلے تھے۔ حقیقی نقصان اس پیش گوئی سے کہیں تنگ اور بے رحم ہے: Stanford اور ADP کا پے رول ڈیٹا دکھاتا ہے کہ سب سے زیادہ AI سے متاثرہ ملازمتوں میں 22 سے 25 سال کے افراد کی ملازمت 2022 کے آخر سے تقریباً 16% کم ہوئی اور اب بھی سکڑ رہی ہے۔ انٹری لیول نے نقصان اٹھایا؛ زیادہ تر نے اپنی ملازمتیں رکھیں اور Copilot لائسنس پا لیے۔ گریڈ: F۔

اور وہ عدد جس کی کسی نے پیش گوئی ہی نہیں کی تھی: Cursor تقریباً سترہ مہینوں میں $100M سے $4B سالانہ متواتر آمدنی تک پہنچا، اور 14 اگست کو SpaceX نے $60B میں اس کمپنی کا حصول مکمل کیا، جو اب تک کا سب سے بڑا اسٹارٹ اپ حصول ہے۔ 2024 کی جن پیش گوئیوں کی فہرستیں میں نے دیکھیں، کسی میں بھی "ایک کوڈ ایڈیٹر تاریخ کا سب سے بڑا اسٹارٹ اپ ایگزٹ بنے گا" شامل نہیں تھا۔

میٹا کا بہت مہنگا سال

مارک زکربرگ، جنوری 2025، جو روگن کے ساتھ: "غالباً 2025 میں، ہم میٹا میں... ایک ایسا AI رکھیں گے جو مؤثر طور پر ایک مڈ لیول انجینئر کی طرح ہو جو آپ کی کمپنی میں کوڈ لکھ سکے۔" چند ہفتے بعد ارننگز کال پر اس نے 2025 کے لیے دو مزید دعوے کیے: میٹا AI کو ایک ارب صارفین والا سب سے آگے اسسٹنٹ، اور Llama کو سب سے جدید اور وسیع پیمانے پر استعمال ہونے والا ماڈل۔

تینوں میں سے کوئی نہ ہوا۔ Llama 4 پھسپھسی لانچ ہوا جبکہ Gemini 3 نے نومبر 2025 میں فرنٹیئر کا تاج پہنا۔ اور میٹا نے اپنے بٹوے سے الٹا شرط لگاتے ہوئے سال گزارا: Scale AI کے آدھے حصے کے لیے $14.3B، رپورٹ شدہ ریسرچر تنخواہ پیکجز $100M اور $450M کے درمیان، پھر اکتوبر میں سپر انٹیلیجنس لیب سے 600 لوگوں کی چھانٹی اور مئی 2026 میں تقریباً 8,000 ملازمین کی برطرفی۔

میٹا نے ایک ایسے AI کی پیش گوئی کی جو مڈ لیول انجینئر کی طرح کوڈ لکھے، اور اس کے بجائے اٹھارہ مہینے انسانی انجینئرز کے لیے دنیا کی سب سے بلند مارکیٹ قیمت کا ریکارڈ قائم کرنے میں گزار دیے۔ گریڈ: F۔

ایلون مسک، اپریل 2024: AI "غالباً اگلے سال کے اختتام تک کسی بھی ایک انسان سے زیادہ ذہین۔"

2025 کے اختتام تک، xAI کا فلیگ شپ ماڈل Grok 4 تھا، جسے "دنیا کا سب سے ذہین AI" کہہ کر لانچ کیا گیا، جس نے ایک بینچ مارک پر جس کا نام ہی Humanity's Last Exam ہے، صرف 25.4% اسکور کیا۔ یہ دعویٰ امتحان کے سامنے ٹِک نہ سکا۔ گریڈ: F۔

میرا مورتی، جون 2024: تقریباً اٹھارہ مہینوں میں "مخصوص کاموں" کے لیے PhD سطح کی ذہانت۔

ریاضی کے لیے یہ بنیادی طور پر ہو گیا: Google DeepMind کے Deep Think نے 2025 کے انٹرنیشنل میتھ اولمپیاڈ میں باضابطہ سرٹیفائیڈ گولڈ حاصل کیا، جو 2024 کے زیادہ تر تخمینوں سے کئی سال آگے تھا۔ اس کی استعمال کردہ شرط، "مخصوص کاموں کے لیے"، بہت اہمیت رکھتی ہے، اور یہی وہ شرط ہے جسے اس کے زیادہ اونچی آواز والے ہم پیشہ افراد نے استعمال کرنے سے انکار کیا۔ محتاط ورژن درست ثابت ہوا۔ غیر محتاط ورژن، جو اگست 2025 میں GPT-5 کی "PhD-level" برانڈنگ کے طور پر پیش ہوا، اتنا برا رہا کہ آلٹمین نے تسلیم کیا کہ OpenAI نے رول آؤٹ "بالکل خراب کر دیا"۔ گریڈ: B-۔

شکی کا رپورٹ کارڈ

گیری مارکس نے یکم جنوری 2025 کو 25 مؤرخہ پیش گوئیاں شائع کیں۔ صنعت زیادہ تر اسے نظرانداز کرتی ہے۔ اس کے قابلِ گریڈ دعووں کو پرکھتے ہیں:

  • "ہم اس سال آرٹیفیشل جنرل انٹیلیجنس نہیں دیکھیں گے۔" درست۔
  • ایجنٹس 2025 بھر "بے تحاشا ہائپ" کے شکار ہوں گے مگر "قابلِ بھروسا سے کوسوں دور" رہیں گے۔ درست، پورا پہلا سیکشن دیکھیں۔
  • "AI ماڈلز سے منافع معمولی یا نہ ہونے کے برابر رہے گا۔" آمدنی میں دھماکہ خیز اضافہ ہوا، مگر اس نے منافع کی بات کی تھی، اور لیبز اب بھی نقد رقم جلا رہی ہیں۔ لفظی طور پر درست۔
  • ممکن ہے 2025 میں "GPT-5 سطح" کی متفقہ چھلانگ نہ ہو۔ GPT-5 لانچ ہوا؛ چھلانگ نہیں ہوئی۔ روحِ کلام میں درست۔

گریڈ: A-۔ منفی نشان اس چیز کی وجہ سے ہے جو فہرست میں نہیں: اس میں $4B کوڈنگ ٹول کیٹیگری، IMO گولڈ، یا اس ایک شعبے میں ایجنٹس کے حقیقی معنوں میں کارآمد ہونے کی کوئی پیش گوئی نہیں تھی جہاں نتیجہ جانچا جا سکتا ہو۔ 2025 کے سب سے بہتر پیش گو نے ہر ناکامی کی نشاندہی کی اور ہر کامیابی کو مِس کیا۔

اور ایک ناخوشگوار دوسرے درجے کی حقیقت: صحیح ہونے سے اسے تقریباً کچھ حاصل نہ ہوا۔ وہ سرمایہ کار جنہوں نے اس کے پورے نظریے کے خلاف شرط لگائی، وہی وہ لوگ ہیں جنہوں نے Cursor کی قیمت $60B لگائی۔ پیش گوئی کی درستگی اور مالی منافع الگ الگ اسکور بورڈز پر چلتے ہیں، اور ان میں سے صرف ایک بڑھتا رہتا ہے۔

صلاحیت والی پیش گوئیاں درست ثابت ہوئیں۔ ڈیپلائمنٹ والی نہیں

18 پیش گوئیوں کو دو ڈھیروں میں تقسیم کریں اور شور ختم ہو جاتا ہے۔

صلاحیت سے متعلق پیش گوئیاں، یعنی ماڈلز کیا کر سکیں گے، اچھی طرح درست ثابت ہوئیں اور کبھی وقت سے بھی پہلے۔ METR کے مطابق، وہ کام جو ایجنٹس مکمل کر سکتے ہیں ان کی مدت تقریباً ہر چار سے سات مہینوں میں دوگنی ہو رہی ہے، اور یہ رجحان برقرار رہا۔

ڈیپلائمنٹ سے متعلق پیش گوئیاں، یعنی ادارے AI کو حقیقت میں کیا کرنے دیں گے، تقریباً یکساں طور پر ناکام ہوئیں۔ ورک فورس ایجنٹس، ارب ایجنٹ پلیٹ فارمز، متبادل پروگرامرز، AI ملازمین: یہ سب معیار کی حدود، ذمہ داری، انضمام کی لاگت، اور اس سخت حقیقت کی دیوار سے ٹکرائے کہ 30% کام مکمل کرنے والا نظام ایک ڈیمو ہے، ملازمت نہیں۔

آلٹمین نے کہا تھا ایجنٹس ورک فورس میں شامل ہوں گے۔ وہ IDE میں شامل ہوئے، کیونکہ IDE وہ واحد کام کی جگہ ہے جہاں غلط جواب کسی صارف کے بجائے کمپائلر کے ہاتھوں پکڑا جاتا ہے۔

تو یہ ہے وہ فیصلے کا اصول جو میں اب اپنے پیسوں کی بازی لگاتے ہوئے استعمال کرتا ہوں: جب کوئی صلاحیت والی پیش گوئی سنیں، اسے سنجیدگی سے لیں، حتیٰ کہ سب سے حیران کن والی بھی، کیونکہ رجحان کی لکیریں جیت جاتی رہتی ہیں۔ جب کوئی تاریخ والی ڈیپلائمنٹ پیش گوئی سنیں، ٹائم لائن دوگنی کر دیں، پھر دیکھیں کہ کہنے والا کیا بیچ رہا ہے۔ یہی اصول اس بات کا فیصلہ کرتا ہے کہ میں کون سا ماڈل خریدنے کے قابل ہے: بینچ مارک ایک صلاحیت کا دعویٰ ہے، ورک فلو ایک ڈیپلائمنٹ کا دعویٰ۔

اب سے ہر سہ ماہی میں میں جو بھی ڈیڈ لائن آئے گی اسے گریڈ کروں گا، اور اگلا ایڈیشن اپنی ہی مؤرخہ پیش گوئیوں کے ساتھ کھلے گا، تاکہ آپ مجھے بھی اسی معیار پر پرکھ سکیں۔ گریڈ دینا مفت ہے۔ گریڈ ہونا اس کی قیمت ہے۔

چیک لسٹ
  • کسی پیش گوئی کو اسی کے اپنے الفاظ پر، اس کی اپنی ڈیڈ لائن پر پرکھیں؛ "بالآخر" کوئی گریڈ نہیں
  • صلاحیت والی پیش گوئیوں کو سنجیدگی سے لیں، حتیٰ کہ سب سے حیران کن والی بھی؛ رجحان کی لکیریں جیت جاتی رہتی ہیں
  • تاریخ والی کسی بھی ڈیپلائمنٹ ٹائم لائن کو دوگنا کر دیں
  • دیکھیں کہ پیش گوئی کرنے والا شخص کیا بیچ رہا ہے
  • اپنی پیش گوئیاں تاریخوں کے ساتھ لکھ رکھیں تاکہ کوئی آپ کو بھی واپس گریڈ کر سکے

عمومی سوالات

کیا ڈاریو امودائی درست تھا کہ AI 90% کوڈ لکھے گا؟

اپنی ڈیڈ لائن پر نہیں۔ اس نے کہا تھا مارچ 2025 کے تین سے چھ مہینوں میں 90% اور بارہ مہینوں میں تقریباً سارا کوڈ۔ 2026 کے آغاز میں صنعت بھر کے تخمینے 25% سے 41% کے درمیان تھے، جبکہ گوگل 2026 کے وسط تک اپنے 75% نئے کوڈ میں ہر قبول شدہ آٹو کمپلیٹ شمار کرتا ہے۔ سمت درست تھی اور اعداد غلط تھے۔

کیا AI ایجنٹس 2025 میں ورک فورس میں شامل ہوئے؟

سافٹ ویئر کے علاوہ نہیں۔ MIT کے NANDA پروجیکٹ نے پایا کہ 95% انٹرپرائز جنریٹو AI پائلٹس کا P&L پر کوئی قابلِ پیمائش اثر نہیں پڑا، اور Carnegie Mellon کے ایجنٹ کمپنی ٹیسٹ میں بہترین ماڈل نے صرف 30.3% دفتری کام مکمل کیے۔ سافٹ ویئر کمپنیوں کے اندر کوڈنگ ایجنٹس ہی واحد حقیقی استثنا تھے۔

2025 میں AI کے بارے میں سب سے درست پیش گوئی کس نے کی؟

شکی گیری مارکس نے، یہاں پرکھے گئے دعووں پر: کوئی AGI نہیں، ایجنٹس ہائپ زدہ مگر ناقابلِ بھروسا، منافع اب بھی معمولی، کوئی متفقہ GPT-5 چھلانگ نہیں۔ چاروں درست ثابت ہوئے۔ اس کی فہرست نے سال کی ہر کامیابی بھی مِس کی، $4B کوڈنگ ٹول کیٹیگری سے لے کر IMO گولڈ تک۔