Ніхто не перевіряє заднім числом
У березні 2025 року Даріо Амодеі заявив Раді з міжнародних відносин, що ШІ писатиме 90% коду протягом трьох до шести місяців, а практично весь код за дванадцять місяців. Цей дванадцятимісячний дедлайн минув у березні. Майже ніхто не перевірив результат.
Це дивна етика прогнозування ШІ. Прогнози гучні, датовані й подаються з повною впевненістю, а коли настає дата, усі вже перейшли до наступного. Немає таблиці результатів. Тож я її створив.
У лютому 2025 року я запланував агентні робочі процеси у Whizi, виходячи з припущення, що Альтман мав рацію щодо 2025 року. Я закрив проєкт через шість тижнів, після того як порахував, скільки коштує один багатоетапний запуск агента порівняно з фіксованою місячною підпискою. Шість тижнів власного плану розробки витрачено на чужий прогноз. Я зібрав кожен датований прогноз за 2024 і 2025 роки, який зміг знайти з першоджерелом і дедлайном, що вже минув. Вісімнадцять пройшли відбір.
Правило оцінювання, щоб було з чим сперечатися: прогноз оцінюється за тим, що обіцяли власні слова, на власному дедлайні. Якщо ви сказали 90% до вересня, а вересень приніс 30%, "ну, колись" це не оцінка. Це виправдання.
Таблиця результатів
| Хто, коли | Прогноз | Що сталося | Оцінка |
|---|---|---|---|
| Сем Альтман, січень 2025 | AI агенти "приєднаються до робочої сили" у 2025 році | 95% корпоративних пілотів не показали впливу на прибуток; найкращий агент виконав 30,3% офісних завдань | C- |
| Марк Беніофф, вересень 2024 | Мільярд агентів Agentforce до кінця 2025 року | Близько 29 000 угод і $1B річного повторюваного доходу | F |
| Klarna, лютий 2024 | AI асистент виконує роботу 700 агентів | Найм людей назад з травня 2025 через нижчу якість | C |
| Даріо Амодеі, березень 2025 | 90% коду протягом трьох до шести місяців | 25% до 41% по галузі загалом, 75% у Google до середини 2026 | C+ |
| Даріо Амодеі, березень 2025 | Практично весь код за дванадцять місяців | Не близько | F |
| Ерік Шмідт, квітень 2025 | Переважна більшість програмістів замінена за рік | Програмісти досі працюють; посади початкового рівня скоротилися приблизно на 16% | F |
| Марк Цукерберг, січень 2025 | AI-інженер середнього рівня, провідний асистент з мільярдом користувачів і Llama як топова модель, усе у 2025 | Жодне з трьох не справдилося; натомість рекордні зарплати людським інженерам | F |
| Ілон Маск, квітень 2024 | ШІ розумніший за будь-яку людину до кінця 2025 | Grok 4 набрав 25,4% на Humanity's Last Exam | F |
| Міра Мураті, червень 2024 | Інтелект рівня PhD "для конкретних задач" приблизно за 18 місяців | Офіційно підтверджене золото на Міжнародній математичній олімпіаді 2025 | B- |
| Гері Маркус, січень 2025 | 25 датованих прогнозів, чотири оцінені тут | Усі чотири правильні, і жоден з успіхів року не потрапив у список | A- |
Робоча сила, яка так і не вийшла на зміну
Сем Альтман, січень 2025: "Ми вважаємо, що в 2025 році ми можемо побачити, як перші AI агенти 'приєднаються до робочої сили' і суттєво змінять продуктивність компаній".
Проєкт NANDA від MIT виявив у серпні 2025 року, що 95% корпоративних пілотів генеративного ШІ не дали жодного вимірного впливу на прибуток. Carnegie Mellon укомплектувала фейкову компанію повністю AI-агентами і виміряла виконану офісну роботу: найкраща модель завершила 30,3% завдань. Співробітник з результатом 30% не приєднується до вашої робочої сили. Він не проходить випробувальний термін.
Один виняток рятує це від оцінки F: усередині компаній-розробників ПЗ агенти для написання коду дійсно змінили продуктивність. Оцінка: C-.
Марк Беніофф, вересень 2024: "Наше бачення сміливе: наділити мільярд агентів Agentforce до кінця 2025 року".
Salesforce повідомила про приблизно 29 000 сукупних угод Agentforce на початку 2026 року і перетнула позначку $1B річного повторюваного доходу. Реальний бізнес, але приблизно у 34 000 разів менше за обіцянку, якщо рахувати угоди, а не агентів. Мій улюблений момент: Salesforce тепер звітує про "виконані агентні робочі одиниці" (3,8 мільярда) замість кількості агентів. Коли не можеш досягти числа, змінюєш одиницю виміру. Оцінка: F.
Klarna, лютий 2024: її AI асистент "виконує роботу, еквівалентну 700 співробітникам на повній ставці".
Потім у травні 2025 року CEO Себастіан Сім'ятковський розвернувся і почав наймати людей назад: "Ми занадто зосередилися на ефективності та вартості. Результатом стала нижча якість". ШІ залишив собі рутинні звернення. Люди повернулися до всього, що дійсно важило. Заслуга за те, що провели експеримент публічно і визнали результат. Оцінка: C.
Код, який справді написали
90% Амодеі. Напрямок був правильний, а знаменник хибний. Google каже, що 75% нового коду створюється ШІ станом на середину 2026 року, порівняно з 25% наприкінці 2024, хоча це рахує кожне прийняте автозавершення, а люди все ще перевіряють код перед розгортанням. Оцінки по галузі на початку 2026 року групувалися навколо 25% до 41%.
Отже: 90% усього коду за шість місяців, ні. Практично весь код за дванадцять, не близько. Історичний зсув у тому, як пишеться код, безумовно так. Прогноз описав справжню революцію і помилився з кожним числом. Оцінка: C+ за 90%, F за "практично весь".
Ерік Шмідт, квітень 2025: "протягом наступного року переважна більшість програмістів буде замінена AI-програмістами".
Рік минув. Програмісти залишаються працевлаштованими майже всюди, де були раніше. Реальна шкода для ринку праці вужча і жорсткіша за прогноз: дані Stanford і ADP по зарплатах показують, що зайнятість серед людей 22 до 25 років на найбільш вразливих до ШІ посадах впала приблизно на 16% з кінця 2022 року і продовжує скорочуватися. Найбільше постраждав початковий рівень; переважна більшість зберегла роботу і отримала ліцензії Copilot. Оцінка: F.
І число, яке взагалі ніхто не передбачив: Cursor виріс зі $100M до $4B річного повторюваного доходу приблизно за сімнадцять місяців, а 14 серпня SpaceX закрила угоду з придбання компанії за $60B, найбільше поглинання стартапу з усіх зафіксованих. Жоден список прогнозів 2024 року, який я перевірив, не містив пункту "редактор коду стає найбільшим виходом стартапу в історії".
Дуже дорогий рік Meta
Марк Цукерберг, січень 2025, у подкасті Джо Рогана: "Ймовірно, у 2025 році ми в Meta... матимемо ШІ, який фактично зможе бути свого роду інженером середнього рівня у вашій компанії, який пише код". На дзвінку щодо доходів кількома тижнями пізніше він додав ще два прогнози на 2025: Meta AI як провідний асистент з мільярдом користувачів, і Llama як найпередовіша і найпоширеніша модель.
Жоден з трьох не справдився. Llama 4 вийшла провально, тоді як Gemini 3 забрала корону лідера у листопаді 2025 року. А Meta провела рік, роблячи протилежну ставку своїм гаманцем: $14.3B за половину Scale AI, зарплати дослідникам, за повідомленнями, від $100M до $450M, потім скорочення 600 людей з лабораторії суперінтелекту у жовтні і приблизно 8000 звільнень у травні 2026.
Meta передбачила ШІ, що кодує як інженер середнього рівня, а натомість вісімнадцять місяців встановлювала світовий рекорд ринкової ціни на людських інженерів. Оцінка: F.
Ілон Маск, квітень 2024: ШІ "розумніший за будь-яку окрему людину, ймовірно, приблизно до кінця наступного року".
До кінця 2025 року флагманською моделлю xAI був Grok 4, представлений як "найрозумніший ШІ у світі", що набрав 25,4% на бенчмарку, який буквально називається Humanity's Last Exam. Заява не пережила контакту з екзаменом. Оцінка: F.
Міра Мураті, червень 2024: інтелект рівня PhD "для конкретних задач" приблизно за вісімнадцять місяців.
Для математики це фактично справдилося: Deep Think від Google DeepMind отримав офіційно підтверджене золото на Міжнародній математичній олімпіаді 2025 року, на роки випередивши більшість прогнозів 2024 року. Уточнення, яке вона використала, "для конкретних задач", виконує величезну роботу, і це саме те уточнення, від якого відмовилися її гучніші колеги. Обережна версія справдилася. Безумовна версія, подана як брендинг "PhD-рівня" GPT-5 у серпні 2025 року, провалилася настільки, що Альтман визнав, що OpenAI "повністю зіпсувала" запуск. Оцінка: B-.
Табель успішності скептика
Гері Маркус опублікував 25 датованих прогнозів 1 січня 2025 року. Індустрія здебільшого зневажливо ставиться до нього. Оцінюємо його придатні для оцінки твердження:
- "Ми не побачимо загального штучного інтелекту цього року". Правильно.
- Агенти будуть "нескінченно розхвалюватися протягом 2025 року, але залишатимуться далекими від надійності". Правильно, дивіться весь перший розділ.
- "Прибутки від AI-моделей залишатимуться скромними або відсутніми". Дохід вибухнув, але він казав про прибутки, а лабораторії все ще спалюють гроші. Правильно за буквою.
- Можливо, не буде консенсусного стрибка рівня "GPT-5" у 2025 році. GPT-5 вийшов, стрибка не сталося. Правильно за суттю.
Оцінка: A-. Мінус за те, чого немає у списку: у ньому нічого не передбачало категорію інструментів для кодування вартістю $4B, золото IMO чи агентів, що стали справді корисними в єдиній сфері, де результат можна перевірити. Найкращий прогнозист 2025 року вгадав кожен провал і пропустив кожен успіх.
І незручний факт другого порядку: правота не принесла йому практично нічого. Саме інвестори, які поставили проти всього його світогляду, оцінили Cursor у $60B. Точність прогнозу і фінансова віддача рахуються за різними таблицями результатів, і множиться лише одна з них.
Прогнози щодо можливостей справдилися. Прогнози щодо впровадження ні
Розсортуйте 18 прогнозів на дві купки, і шум зникне.
Прогнози щодо можливостей, що моделі зможуть робити, справдилися добре і часом навіть раніше строку. Довжина завдань, які можуть виконувати агенти, подвоюється приблизно кожні чотири до семи місяців, за даними METR, і тренд утримався.
Прогнози щодо впровадження, що організації дозволять ШІ фактично робити, провалилися майже без винятків. Агенти на роботі, платформи з мільярдом агентів, заміна програмістів, AI-співробітники: усе це вдарилося об ту саму стіну стандартів якості, відповідальності, вартості інтеграції і впертого факту, що система, яка виконує 30% завдань, це демонстрація, а не найм.
Альтман сказав, що агенти приєднаються до робочої сили. Вони приєдналися до IDE, бо IDE це те єдине робоче місце, де неправильну відповідь ловить компілятор, а не клієнт.
Тож ось правило прийняття рішень, яким я тепер користуюся, ставлячи на кін власні гроші: коли чуєте прогноз щодо можливостей, сприймайте його серйозно, навіть найдикіші, бо тренди продовжують перемагати. Коли чуєте прогноз щодо впровадження з прив'язаною датою, подвоюйте строк, а тоді перевіряйте, що продає людина, яка це каже. За тим самим правилом я обираю, за яку модель платити: бенчмарк це заява про можливості, робочий процес це заява про впровадження.
Кожного кварталу відтепер я оцінюю все, що настало, а наступний випуск відкривається моїми власними датованими прогнозами, щоб ви могли прогнати мене через ту саму рубрику. Оцінювати безкоштовно. Бути оціненим це і є ціна.
- Оцінюйте прогноз за власними словами, на власному дедлайні; "колись" це не оцінка
- Сприймайте прогнози щодо можливостей серйозно, навіть найдикіші; тренди продовжують перемагати
- Подвоюйте будь-який строк впровадження з прив'язаною датою
- Перевіряйте, що продає людина, яка робить прогноз
- Записуйте власні прогнози з датами, щоб хтось міг оцінити вас у відповідь
Поширені запитання
Чи мав рацію Даріо Амодеі, що ШІ писатиме 90% коду?
Не у свій дедлайн. Він сказав 90% протягом трьох до шести місяців від березня 2025 і практично весь код за дванадцять. Оцінки по галузі на початку 2026 року групувалися навколо 25% до 41%, а Google досяг 75% нового коду до середини 2026, рахуючи кожне прийняте автозавершення. Напрямок був правильний, а числа хибні.
Чи приєдналися AI агенти до робочої сили у 2025 році?
Не за межами програмного забезпечення. Проєкт NANDA від MIT виявив, що 95% корпоративних пілотів генеративного ШІ не дали жодного вимірного впливу на прибуток, а тест агентної компанії Carnegie Mellon показав, що найкраща модель завершила 30,3% офісних завдань. Агенти для кодування всередині компаній-розробників ПЗ стали єдиним справжнім винятком.
Хто найточніше передбачив 2025 рік у ШІ?
Гері Маркус, скептик, за оціненими тут твердженнями: жодного AGI, агенти розхвалені, але ненадійні, прибутки все ще скромні, немає консенсусного стрибка GPT-5. Усі чотири підтвердилися. Його список також пропустив кожен успіх року, від категорії інструментів для кодування вартістю $4B до золота IMO.