אף אחד לא חוזר לבדוק
במרץ 2025 דריו אמודיי אמר למועצת היחסים הבינלאומיים (Council on Foreign Relations) ש-AI יכתוב 90% מהקוד תוך שלושה עד שישה חודשים, וכמעט את כולו תוך שנים עשר חודשים. המועד הזה של שנים עשר חודשים חלף במרץ. כמעט אף אחד לא חזר לבדוק.
זו הגינונות המוזרה של תחזיות AI. התחזיות רועשות, מתוארכות, ונמסרות בביטחון מלא, ואז המועד מגיע וכולם כבר עברו לתחזית הבאה. אין לוח תוצאות. אז בניתי אחד.
בפברואר 2025 תכננתי זרימות עבודה של סוכנים בתוך Whizi, מתוך הנחה שאלטמן צדק לגבי 2025. ביטלתי את הפרויקט שישה שבועות אחר כך, אחרי שעשיתי חשבון על מה שריצת סוכן מרובת שלבים עולה מול מנוי חודשי קבוע. שישה שבועות של מפת הדרכים שלי, שהושקעו בתחזית של מישהו אחר. אספתי כל תחזית מתוארכת מ-2024 ומ-2025 שמצאתי עם מקור ראשוני ומועד שכבר עבר. שמונה עשרה עברו את הסף.
כלל הציונים, כדי שתוכלו לחלוק עליו: תחזית מקבלת ציון מול מה שהמילים שלה עצמן הבטיחו, במועד שהיא עצמה קבעה. אם אמרת 90% עד ספטמבר וספטמבר הביא 30%, "טוב, בסופו של דבר" זה לא ציון. זו תירוץ.
לוח התוצאות
| מי, מתי | התחזית | מה קרה בפועל | ציון |
|---|---|---|---|
| סם אלטמן, ינואר 2025 | סוכני AI "מצטרפים לכוח העבודה" ב-2025 | ל-95% מהניסויים הארגוניים לא הייתה השפעה על הרווח וההפסד; הסוכן הטוב ביותר השלים 30.3% ממשימות המשרד | C- |
| מארק בניוף, ספטמבר 2024 | מיליארד סוכני Agentforce עד סוף 2025 | כ-29,000 עסקאות ו-$1B בהכנסה שנתית חוזרת | F |
| Klarna, פברואר 2024 | עוזר AI שעושה את העבודה של 700 נציגים | החזרת עובדים אנושיים החל ממאי 2025 בשל איכות נמוכה יותר | C |
| דריו אמודיי, מרץ 2025 | 90% מהקוד תוך שלושה עד שישה חודשים | 25% עד 41% ברמת התעשייה, 75% ב-Google עד אמצע 2026 | C+ |
| דריו אמודיי, מרץ 2025 | כמעט כל הקוד תוך שנים עשר חודשים | לא קרוב | F |
| אריק שמידט, אפריל 2025 | רוב מוחלט של המתכנתים יוחלפו תוך שנה | מתכנתים עדיין מועסקים; תפקידי כניסה ירדו בכ-16% | F |
| מארק צוקרברג, ינואר 2025 | מהנדס AI בדרג ביניים, העוזר המוביל עם מיליארד משתמשים, ו-Llama כמודל המוביל, הכל ב-2025 | אף אחד משלושת אלה לא קרה; חבילות שכר שיא לעובדים אנושיים במקום | F |
| אילון מאסק, אפריל 2024 | AI חכם יותר מכל בן אדם עד סוף 2025 | Grok 4 קיבל 25.4% במבחן Humanity's Last Exam | F |
| מירה מוראטי, יוני 2024 | אינטליגנציה ברמת דוקטורט "למשימות ספציפיות" תוך כ-18 חודשים | מדליית זהב רשמית באולימפיאדת המתמטיקה הבינלאומית 2025 | B- |
| גארי מרקוס, ינואר 2025 | 25 תחזיות מתוארכות, ארבע נבדקות כאן | כל הארבע נכונות, ואף אחת מהצלחות השנה לא נמצאת ברשימה | A- |
כוח העבודה שאף פעם לא נכנס למשמרת
סם אלטמן, ינואר 2025: "אנחנו מאמינים שב-2025 נראה את סוכני ה-AI הראשונים 'מצטרפים לכוח העבודה' ומשנים באופן מהותי את תפוקת החברות."
פרויקט NANDA של MIT מצא באוגוסט 2025 של-95% מהניסויים הארגוניים בבינה מלאכותית גנרטיבית לא הייתה השפעה נמדדת על הרווח וההפסד. Carnegie Mellon איישה חברה מדומה כולה בסוכני AI ומדדה את העבודה המשרדית שהם השלימו: המודל הטוב ביותר השלים 30.3% מהמשימות. עובד שמשלים 30% מהעבודה לא מצטרף לכוח העבודה שלך. הוא יוצא בתקופת הניסיון.
פטור אחד מציל את זה מציון F: בתוך חברות תוכנה, סוכני קידוד באמת שינו את התפוקה. ציון: C-.
מארק בניוף, ספטמבר 2024: "החזון שלנו נועז: להעצים מיליארד סוכנים באמצעות Agentforce עד סוף 2025."
Salesforce דיווחה על כ-29,000 עסקאות Agentforce מצטברות עד תחילת 2026 ועברה את רף $1B בהכנסה שנתית חוזרת. עסק אמיתי, ופער של פי כ-34,000 מההבטחה, כשסופרים עסקאות ולא סוכנים. הפרט האהוב עליי: Salesforce מדווחת עכשיו על "יחידות עבודה סוכניות שסופקו" (3.8 מיליארד מהן) במקום ספירת סוכנים. כשלא מצליחים להגיע למספר, מחליפים את היחידה. ציון: F.
Klarna, פברואר 2024: העוזר ה-AI שלה "עושה עבודה שקולה ל-700 נציגים במשרה מלאה."
ואז במאי 2025 המנכ"ל סבסטיאן סיאמיאטקובסקי הפך את הכיוון והתחיל להחזיר עובדים אנושיים: "התמקדנו יותר מדי ביעילות ובעלות. התוצאה הייתה איכות נמוכה יותר." ה-AI שמר על הפניות השגרתיות. בני האדם חזרו לכל מה שבאמת חשוב. קרדיט על הרצת הניסוי בפומבי ועל ההודאה בתוצאה. ציון: C.
הקוד שבאמת נכתב
90% של אמודיי. הכיוון היה נכון והמכנה היה שגוי. Google מדווחת ש-75% מהקוד החדש שלה נכתב בעזרת AI נכון לאמצע 2026, עלייה מ-25% בסוף 2024, אם כי זה סופר כל השלמה אוטומטית שאושרה ובני אדם עדיין בודקים לפני הפריסה. הערכות ברמת התעשייה בתחילת 2026 התרכזו סביב 25% עד 41%.
אז: 90% מכל הקוד תוך שישה חודשים, לא. כמעט כל הקוד תוך שנים עשר חודשים, לא קרוב. שינוי היסטורי באופן שבו כותבים קוד, בהחלט כן. התחזית תיארה מהפכה אמיתית וטעתה בכל מספר. ציון: C+ עבור ה-90%, F עבור "כמעט הכל".
אריק שמידט, אפריל 2025: "במהלך השנה הבאה, הרוב המוחלט של המתכנתים יוחלף במתכנתי AI."
השנה חלפה. מתכנתים עדיין מועסקים כמעט בכל מקום שבו הועסקו קודם. הנזק האמיתי לשוק העבודה מצומצם יותר ואכזרי יותר מהתחזית: נתוני שכר של אוניברסיטת סטנפורד ו-ADP מראים שהתעסוקה בקרב בני 22 עד 25 בתפקידים החשופים ביותר ל-AI ירדה בכ-16% מאז סוף 2022 וממשיכה להצטמצם. תפקידי הכניסה ספגו את המכה; הרוב המוחלט שמר על משרתו וקיבל רישיונות Copilot. ציון: F.
והמספר שאף אחד לא חזה בכלל: Cursor עברה מ-$100M ל-$4B בהכנסה שנתית חוזרת תוך כשבעה עשר חודשים, וב-14 באוגוסט SpaceX סגרה עסקת רכישה של $60B עבור החברה, הרכישה הגדולה אי פעם של חברת הזנק. אף רשימת תחזיות אחת מ-2024 שבדקתי לא כללה "עורך קוד הופך ליציאה הגדולה בהיסטוריה של סטארט-אפ".
השנה היקרה מאוד של Meta
מארק צוקרברג, ינואר 2025, בפודקאסט של ג'ו רוגן: "כנראה שב-2025, אנחנו ב-Meta... נהיה בעלי AI שיוכל למעשה לשמש כמו מהנדס ברמת ביניים בחברה שלכם שיודע לכתוב קוד." בשיחת הדוחות הכספיים כמה שבועות אחר כך הוא הוסיף עוד שניים ל-2025: Meta AI כעוזר המוביל עם מיליארד משתמשים, ו-Llama כמודל המתקדם והנפוץ ביותר.
אף אחד משלושתם לא קרה. Llama 4 נחתה בצורה מאכזבת בזמן ש-Gemini 3 חטף את כתר החזית בנובמבר 2025. ו-Meta בילתה את השנה בהימור הפוך עם הארנק שלה: $14.3B עבור מחצית מ-Scale AI, חבילות שכר לחוקרים שדווחו בין $100M ל-$450M, ואז 600 עובדים פוטרו ממעבדת העל-אינטליגנציה באוקטובר וכ-8,000 פיטורים במאי 2026.
Meta חזתה AI שכותב קוד כמו מהנדס בדרג ביניים, ובמקום זאת בילתה שמונה עשרה חודשים בקביעת שיא עולמי חדש למחיר השוק של בני אדם. ציון: F.
אילון מאסק, אפריל 2024: AI "חכם יותר מכל בן אדם, כנראה לקראת סוף השנה הבאה."
עד סוף 2025, הדגל של xAI היה Grok 4, שהושק בתור "ה-AI החכם ביותר בעולם", וקיבל 25.4% במבחן שנקרא ממש Humanity's Last Exam. הטענה לא שרדה את המפגש עם המבחן. ציון: F.
מירה מוראטי, יוני 2024: אינטליגנציה ברמת דוקטורט "למשימות ספציפיות" תוך כ-18 חודשים.
לגבי מתמטיקה זה כמעט קרה: Deep Think של Google DeepMind זכתה במדליית זהב מוסמכת רשמית באולימפיאדת המתמטיקה הבינלאומית 2025, שנים לפני רוב התחזיות של 2024. המילה שהיא בחרה, "למשימות ספציפיות", עושה עבודה כבדה, וזו בדיוק המילה שעמיתיה הרועשים יותר סירבו להשתמש בה. הגרסה המסויגת התממשה. הגרסה הלא מסויגת, שנשלחה בתור המיתוג "PhD-level" של GPT-5 באוגוסט 2025, יצאה כל כך גרוע שאלטמן הודה ש-OpenAI "פישלו לגמרי" את ההשקה. ציון: B-.
תעודת הציונים של הספקן
גארי מרקוס פרסם 25 תחזיות מתוארכות ב-1 בינואר 2025. התעשייה בעיקר מגלגלת עיניים לגביו. בדיקת הטענות שלו הניתנות לציון:
- "לא נראה בינה כללית מלאכותית (AGI) השנה." נכון.
- סוכנים יהיו "מוקצנים ללא סוף לאורך 2025 אך רחוקים מאמינות." נכון, ראו את כל הפרק הראשון.
- "רווחים ממודלי AI ימשיכו להיות צנועים או לא קיימים." ההכנסות התפוצצו, אבל הוא דיבר על רווחים, והמעבדות עדיין שורפות מזומן. נכון על פי האותיות.
- ייתכן שלא תהיה קפיצת קונצנזוס ברמת "GPT-5" ב-2025. GPT-5 יצא; הקפיצה לא. נכון ברוח הדברים.
ציון: A-. המינוס נגזר על מה שהרשימה לא כוללת: שום דבר בה לא חזה קטגוריית כלי קידוד בשווי $4B, מדליית זהב באולימפיאדת מתמטיקה, או סוכנים שהופכים לשימושיים באמת בתחום היחיד שבו התוצאה ניתנת לבדיקה. המנבא הכי טוב של 2025 צדק בכל כישלון ופספס כל הצלחה.
והעובדה הלא נוחה מסדר שני: לצדוק לא הרוויח לו כמעט כלום. המשקיעים שהימרו נגד כל תפיסת העולם שלו הם אלה שתמחרו את Cursor ב-$60B. דיוק בתחזיות ותשואות פיננסיות פועלים על שני לוחות תוצאות נפרדים, ורק אחד מהם צובר ריבית דריבית.
תחזיות היכולת התממשו. תחזיות הפריסה לא
מיינו את 18 התחזיות לשתי ערימות והרעש נעלם.
תחזיות על יכולת, מה שמודלים יוכלו לעשות, התיישנו יפה ולפעמים הגיעו מוקדם. אורך המשימות שסוכנים יכולים להשלים הכפיל את עצמו בערך כל ארבעה עד שבעה חודשים, לפי METR, והמגמה החזיקה מעמד.
תחזיות על פריסה, מה שארגונים יאפשרו ל-AI לעשות בפועל, נכשלו כמעט באופן אחיד. סוכני עבודה, פלטפורמות מיליארד סוכנים, מתכנתים מוחלפים, עובדי AI: כל זה נתקל באותו קיר של רף איכות, אחריות, עלות שילוב, והעובדה העיקשת שמערכת שמשלימה 30% מהמשימות היא הדגמה, לא עובד.
אלטמן אמר שסוכנים יצטרפו לכוח העבודה. הם הצטרפו ל-IDE, כי ה-IDE הוא מקום העבודה היחיד שבו תשובה שגויה נתפסת על ידי קומפיילר ולא על ידי לקוח.
אז הנה כלל ההחלטה שאני משתמש בו עכשיו, עם הכסף שלי על הכף: כששומעים תחזית יכולת, לוקחים אותה ברצינות, אפילו את הפרועות שבהן, כי קווי המגמה ממשיכים לנצח. כששומעים תחזית פריסה עם תאריך מצורף, מכפילים את לוח הזמנים, ואז בודקים מה האדם שאומר את זה מוכר. אותו כלל הוא הדרך שבה אני בוחר איזה מודל לשלם עליו: המדד הוא טענת יכולת, זרימת העבודה היא טענת פריסה.
מכאן, בכל רבעון אבדוק כל מה שהגיע מועדו, והמהדורה הבאה תיפתח בתחזיות המתוארכות שלי עצמי, כדי שתוכלו לבדוק אותי לפי אותו הקריטריון. לתת ציון זה בחינם. לקבל ציון זה המחיר.
- לתת ציון לתחזית מול המילים שלה עצמה, במועד שהיא עצמה קבעה; "בסופו של דבר" זה לא ציון
- לקחת ברצינות תחזיות יכולת, אפילו את הפרועות שבהן; קווי המגמה ממשיכים לנצח
- להכפיל כל לוח זמנים לפריסה שיש לו תאריך
- לבדוק מה האדם שמעלה את התחזית מוכר
- לכתוב את התחזיות שלכם עצמכם עם תאריכים כדי שמישהו יוכל לתת לכם ציון בחזרה
שאלות נפוצות
האם דריו אמודיי צדק שה-AI יכתוב 90% מהקוד?
לא במועד שהוא קבע. הוא אמר 90% תוך שלושה עד שישה חודשים ממרץ 2025 וכמעט כל הקוד תוך שנים עשר חודשים. הערכות ברמת התעשייה בתחילת 2026 התרכזו סביב 25% עד 41%, כאשר Google הגיעה ל-75% מהקוד החדש עד אמצע 2026, בספירת כל השלמה אוטומטית שאושרה. הכיוון היה נכון והמספרים היו שגויים.
האם סוכני AI הצטרפו לכוח העבודה ב-2025?
לא מחוץ לתעשיית התוכנה. פרויקט NANDA של MIT מצא של-95% מהניסויים הארגוניים בבינה מלאכותית גנרטיבית לא הייתה השפעה נמדדת על הרווח וההפסד, ומבחן חברת הסוכנים של Carnegie Mellon הראה שהמודל הטוב ביותר השלים 30.3% ממשימות המשרד. סוכני קידוד בתוך חברות תוכנה היו החריג האמיתי היחיד.
מי חזה את 2025 בתחום ה-AI בצורה המדויקת ביותר?
גארי מרקוס, הספקן, על הטענות שנבדקו כאן: אין AGI, סוכנים מוקצנים אך לא אמינים, רווחים עדיין צנועים, אין קפיצת קונצנזוס ברמת GPT-5. כל הארבע החזיקו מעמד. הרשימה שלו גם פספסה כל הצלחה של השנה, מקטגוריית כלי הקידוד בשווי $4B ועד מדליית הזהב באולימפיאדת המתמטיקה.