아무도 다시 돌아가서 확인하지 않는다
2025년 3월, 다리오 아모데이는 미국외교협회(Council on Foreign Relations)에서 AI가 3개월에서 6개월 안에 코드의 90%를 작성하게 될 것이고, 12개월 안에는 사실상 전부를 작성하게 될 것이라고 말했다. 그 12개월 마감일은 지난 3월에 지났다. 거의 아무도 돌아가서 확인하지 않았다.
이것이 AI 예측의 이상한 관행이다. 예측은 요란하고, 날짜가 명시되어 있으며, 완전한 확신을 담아 발표된다. 그러다 그 날짜가 되면 모두가 이미 다음 예측으로 넘어가 있다. 점수판이 없다. 그래서 내가 하나 만들었다.
2025년 2월, 나는 알트먼이 2025년에 대해 옳았다는 가정 아래 Whizi에 에이전트 워크플로를 설계하기 시작했다. 단일 멀티스텝 에이전트 실행 한 번의 비용을 정액제 월간 구독과 비교 계산해 본 뒤, 6주 만에 그 프로젝트를 접었다. 다른 사람의 예측 때문에 내 로드맵 6주를 썼다. 그래서 출처가 확실하고 이미 지난 마감일이 있는 2024년과 2025년의 날짜가 명시된 예측을 전부 모았다. 18개가 기준을 통과했다.
채점 규칙은 이렇다, 이견이 있다면 논쟁해도 좋다: 예측은 그 자신의 말이 약속한 내용을, 그 자신의 마감일을 기준으로 채점한다. 9월까지 90%라고 했는데 9월에 30%가 나왔다면, "결국에는 되겠지"는 점수가 아니다. 변명일 뿐이다.
점수판
| 누가, 언제 | 예측 내용 | 실제 결과 | 등급 |
|---|---|---|---|
| 샘 알트먼, 2025년 1월 | AI 에이전트가 2025년에 "인력에 합류한다" | 기업 파일럿의 95%가 손익에 미치는 영향 없음; 최고 성능 에이전트가 사무 업무의 30.3%를 완료 | C- |
| 마크 베니오프, 2024년 9월 | 2025년 말까지 Agentforce 에이전트 10억 개 | 약 29,000건의 거래와 연간 반복 매출 $1B | F |
| 클라나(Klarna), 2024년 2월 | AI 어시스턴트가 상담원 700명 몫의 업무를 수행 | 2025년 5월부터 품질 저하로 인력 재고용 | C |
| 다리오 아모데이, 2025년 3월 | 3~6개월 안에 코드의 90% | 업계 전반 25~41%, 2026년 중반 구글 75% | C+ |
| 다리오 아모데이, 2025년 3월 | 12개월 안에 사실상 모든 코드 | 근접하지 못함 | F |
| 에릭 슈미트, 2025년 4월 | 1년 안에 프로그래머 대다수가 AI 프로그래머로 대체 | 프로그래머는 여전히 고용 중; 신입직만 약 16% 감소 | F |
| 마크 저커버그, 2025년 1월 | 2025년 안에 AI 중급 엔지니어, 최고의 10억 사용자 어시스턴트, 최상위 모델 Llama 모두 실현 | 셋 다 실현되지 않음; 대신 인간 엔지니어에게 기록적인 연봉 패키지 지급 | F |
| 일론 머스크, 2024년 4월 | 2025년 말까지 어떤 인간보다도 똑똑한 AI | Grok 4가 Humanity's Last Exam에서 25.4% 기록 | F |
| 미라 무라티, 2024년 6월 | 약 18개월 안에 "특정 작업에서" 박사급 지능 | 2025년 국제수학올림피아드에서 공식 인증 금메달 | B- |
| 게리 마커스, 2025년 1월 | 날짜가 명시된 예측 25개 중 여기서 채점한 4개 | 4개 모두 정확했지만 그 해의 성공 사례는 목록에 하나도 없음 | A- |
출근하지 않은 인력
샘 알트먼, 2025년 1월: "우리는 2025년에 최초의 AI 에이전트가 '인력에 합류'해 기업의 산출물을 실질적으로 바꿀 수 있다고 믿는다."
MIT의 NANDA 프로젝트는 2025년 8월, 기업 생성형 AI 파일럿의 95%가 측정 가능한 손익 영향을 만들어내지 못했다는 사실을 발견했다. 카네기멜런대학교는 가상의 회사를 전부 AI 에이전트로 채운 뒤 그들이 처리한 사무 업무를 측정했다: 최고 모델이 완료한 업무는 30.3%였다. 30% 짜리 직원은 당신의 인력에 합류하지 않는다. 그들은 수습 기간 중에 퇴사한다.
한 가지 예외가 이 결과를 F에서 구해낸다: 소프트웨어 기업 내부에서는 코딩 에이전트가 실제로 산출물을 바꿔놓았다. 등급: C-.
마크 베니오프, 2024년 9월: "우리의 비전은 대담합니다. 2025년 말까지 Agentforce로 10억 개의 에이전트에게 힘을 실어주는 것입니다."
Salesforce는 2026년 초까지 누적 약 29,000건의 Agentforce 거래를 보고했고 연간 반복 매출 $1B를 넘어섰다. 실제 사업이긴 하지만, 에이전트가 아니라 거래 건수를 기준으로 해도 약속보다 약 34,000배 부족하다. 내가 가장 좋아하는 디테일: Salesforce는 이제 에이전트 수 대신 "처리된 에이전틱 작업 단위"(38억 개)를 보고한다. 숫자를 달성할 수 없으면 단위를 바꾼다. 등급: F.
클라나(Klarna), 2024년 2월: AI 어시스턴트가 "상담원 700명의 정규직에 해당하는 업무를 수행하고 있다."
그러다 2025년 5월, CEO 세바스티안 시에미아트코프스키가 방향을 바꿔 인력 재고용을 시작했다: "우리는 효율성과 비용에 너무 집중했습니다. 그 결과 품질이 떨어졌습니다." AI는 단순 상담을 계속 맡았다. 중요한 일은 모두 사람이 돌아와 처리했다. 실험을 공개적으로 진행하고 결과를 인정한 점은 높이 살 만하다. 등급: C.
실제로 작성된 코드
아모데이의 90%. 방향은 맞았고 분모가 틀렸다. 구글은 2026년 중반 기준 신규 코드의 75%가 AI로 생성됐다고 밝혔는데, 이는 2024년 말의 25%에서 늘어난 수치지만, 채택된 모든 자동완성을 포함한 값이며 여전히 배포 전에 사람이 검토한다. 2026년 초 업계 전반의 추정치는 25%에서 41% 사이에 몰려 있었다.
결론: 6개월 안에 모든 코드의 90%, 아니다. 12개월 안에 사실상 모든 코드, 근접하지 못했다. 코드 작성 방식의 역사적 전환, 확실히 그렇다. 그 예측은 진짜 혁명을 묘사했지만 모든 숫자를 틀렸다. 등급: 90% 부분은 C+, "사실상 전부" 부분은 F.
에릭 슈미트, 2025년 4월: "앞으로 1년 안에 프로그래머 대다수가 AI 프로그래머로 대체될 것이다."
그 1년이 지났다. 프로그래머들은 거의 모든 곳에서 예전과 똑같이 고용된 상태로 남아 있다. 실제 노동 피해는 예측보다 더 좁고 더 잔인하다: 스탠퍼드와 ADP 급여 데이터에 따르면 AI 노출도가 가장 높은 직군의 22~25세 고용은 2022년 말 이후 약 16% 감소했고 여전히 줄고 있다. 타격을 받은 것은 신입직이었고, 대다수는 일자리를 유지한 채 Copilot 라이선스를 받았다. 등급: F.
그리고 아무도 예측하지 못했던 숫자: Cursor는 약 17개월 만에 연간 반복 매출 $100M에서 $4B로 성장했고, 8월 14일 SpaceX가 이 회사를 $60B에 인수하는 계약을 마무리 지었다. 이는 역대 최대 규모의 스타트업 인수 기록이다. 내가 확인한 2024년 예측 목록 중 "코드 에디터가 역사상 최대 스타트업 엑시트가 된다"를 담은 것은 하나도 없었다.
메타의 매우 값비쌌던 한 해
마크 저커버그, 2025년 1월, 조 로건 팟캐스트에서: "아마 2025년에 메타는... 코드를 작성할 수 있는 일종의 중급 엔지니어 역할을 하는 AI를 갖게 될 것입니다." 몇 주 후 실적 발표에서 그는 2025년을 위한 두 가지를 더 추가했다: 최고의 10억 사용자 어시스턴트가 될 메타 AI, 그리고 가장 발전되고 가장 널리 쓰이는 모델이 될 Llama.
셋 다 실현되지 않았다. Llama 4는 조용히 등장했고, 2025년 11월 Gemini 3가 최전선의 왕관을 차지했다. 그리고 메타는 그 해 지갑으로는 정반대의 베팅을 했다: Scale AI 지분 절반에 $14.3B, 연구원 연봉 패키지는 $100M에서 $450M 사이로 보도됐으며, 이후 10월에는 슈퍼인텔리전스 랩에서 600명이 해고됐고 2026년 5월에는 약 8,000명이 정리해고됐다.
메타는 중급 엔지니어처럼 코딩하는 AI를 예측했지만, 대신 18개월 동안 인간 엔지니어의 몸값을 세계 기록 수준으로 끌어올리는 데 돈을 썼다. 등급: F.
일론 머스크, 2024년 4월: "아마 내년 말쯤이면" 어떤 한 인간보다도 똑똑한 AI.
2025년 말 기준, xAI의 최신 모델은 Grok 4였고, "세계에서 가장 똑똑한 AI"로 출시됐지만 Humanity's Last Exam이라는 이름의 벤치마크에서 25.4%를 기록했다. 그 주장은 시험 앞에서 살아남지 못했다. 등급: F.
미라 무라티, 2024년 6월: 약 18개월 안에 "특정 작업에서" 박사급 지능.
수학 분야에서는 대체로 실현됐다: 구글 딥마인드의 Deep Think는 2025년 국제수학올림피아드에서 공식 인증된 금메달을 받았고, 이는 대부분의 2024년 예측보다 몇 년이나 앞선 결과였다. 그녀가 사용한 단서, "특정 작업에서"가 큰 역할을 하고 있으며, 이는 더 목소리 큰 동료들이 쓰기를 거부했던 바로 그 단서다. 조건부 버전은 실현됐다. 무조건적인 버전, 즉 2025년 8월 GPT-5의 "박사급" 마케팅으로 출시된 버전은 충분히 나쁘게 흘러가서 알트먼이 OpenAI가 그 출시를 "완전히 망쳤다"고 인정할 정도였다. 등급: B-.
회의론자의 성적표
게리 마커스는 2025년 1월 1일, 날짜가 명시된 예측 25개를 발표했다. 업계는 대체로 그를 비웃는다. 채점 가능한 주장들을 평가해 보면:
- "올해 우리는 범용 인공지능(AGI)을 보지 못할 것이다." 정확함.
- 에이전트는 "2025년 내내 끊임없이 과대광고되지만 신뢰성과는 거리가 멀 것이다." 정확함, 첫 번째 섹션 전체를 보라.
- "AI 모델로 인한 수익은 계속 소박하거나 거의 없을 것이다." 매출은 폭발적으로 늘었지만, 그가 말한 것은 이익이었고 랩들은 여전히 현금을 태우고 있다. 문구 그대로는 정확함.
- 2025년에 "GPT-5급"의 합의된 도약은 없을 가능성. GPT-5는 출시됐지만 그 도약은 없었다. 정신적으로는 정확함.
등급: A-. 감점의 이유는 이 목록이 담지 않은 것 때문이다: $4B 규모의 코딩 도구 카테고리도, IMO 금메달도, 결과를 검증할 수 있는 유일한 영역에서 에이전트가 진짜로 유용해진 것도 그 목록에는 하나도 없었다. 2025년 최고의 예측가는 모든 실패를 맞혔고 모든 성공은 놓쳤다.
그리고 불편한 2차 사실: 옳았던 것이 그에게 가져다준 것은 거의 없었다. 그의 세계관 전체에 반대로 베팅한 투자자들이 바로 Cursor의 가치를 $60B로 매긴 사람들이다. 예측 정확도와 금전적 수익은 서로 다른 점수판 위에서 움직이며, 오직 하나만 복리로 불어난다.
능력 예측은 실현됐다. 도입 예측은 그러지 못했다
18개의 예측을 두 더미로 나누면 잡음이 사라진다.
모델이 무엇을 할 수 있는지에 관한 능력 예측은 대체로 잘 맞았고 때로는 예상보다 일찍 실현됐다. METR에 따르면 에이전트가 완료할 수 있는 작업의 길이는 대략 4~7개월마다 두 배씩 늘어나고 있으며, 그 추세는 유지됐다.
조직이 AI에게 실제로 무엇을 맡길 것인가에 관한 도입 예측은 거의 예외 없이 실패했다. 인력 합류 에이전트, 10억 개 에이전트 플랫폼, 대체된 프로그래머, AI 직원, 이 모든 것이 품질 기준, 책임 소재, 통합 비용이라는 똑같은 벽에 부딪혔고, 업무의 30%를 완료하는 시스템은 데모이지 채용이 아니라는 완고한 사실에도 부딪혔다.
알트먼은 에이전트가 인력에 합류할 것이라고 말했다. 그들이 합류한 곳은 IDE였다. 잘못된 답이 고객이 아니라 컴파일러에게 걸리는 유일한 일터이기 때문이다.
그래서 지금 내가 내 돈을 걸고 쓰는 판단 규칙은 이렇다: 능력 예측을 들으면, 아무리 터무니없어 보여도 진지하게 받아들여라, 추세선은 계속 이기고 있으니까. 날짜가 붙은 도입 예측을 들으면, 그 기간을 두 배로 늘리고, 그것을 말하는 사람이 무엇을 팔고 있는지 확인하라. 같은 규칙으로 나는 어떤 모델에 돈을 낼지 고른다: 벤치마크는 능력 주장이고, 워크플로는 도입 주장이다.
앞으로 분기마다 나는 그때까지 마감된 것을 채점할 것이고, 다음 호는 내가 직접 날짜를 명시한 예측으로 시작해, 당신이 나를 같은 기준으로 채점할 수 있게 할 것이다. 채점은 공짜다. 채점당하는 것이 그 대가다.
- 예측은 그 자신의 말을 기준으로, 그 자신의 마감일에 채점한다; "결국에는"은 채점이 아니다
- 아무리 터무니없어 보여도 능력 예측은 진지하게 받아들여라; 추세선은 계속 이기고 있다
- 날짜가 명시된 도입 예측은 기간을 두 배로 늘려라
- 예측을 하는 사람이 무엇을 팔고 있는지 확인하라
- 자신의 예측도 날짜를 적어 남겨서, 나중에 누군가 당신을 채점할 수 있게 하라
자주 묻는 질문
다리오 아모데이의 말대로 AI가 코드의 90%를 작성하게 됐나?
그의 마감일 기준으로는 아니다. 그는 2025년 3월로부터 3~6개월 안에 90%, 12개월 안에 사실상 모든 코드라고 말했다. 2026년 초 업계 전반 추정치는 25%에서 41% 사이에 몰려 있었고, 구글은 2026년 중반까지 신규 코드의 75%라고 밝혔는데 이는 채택된 모든 자동완성을 포함한 수치다. 방향은 맞았고 숫자는 틀렸다.
AI 에이전트는 2025년에 인력에 합류했나?
소프트웨어 밖에서는 아니다. MIT의 NANDA 프로젝트는 기업 생성형 AI 파일럿의 95%가 측정 가능한 손익 영향을 내지 못했다는 사실을 발견했고, 카네기멜런대학교의 에이전트 회사 테스트에서는 최고 모델이 사무 업무의 30.3%를 완료했다. 소프트웨어 기업 내부의 코딩 에이전트가 유일한 실제 예외였다.
2025년의 AI를 가장 정확하게 예측한 사람은 누구인가?
회의론자 게리 마커스가, 여기서 채점된 주장들 기준으로는 그렇다: AGI 없음, 에이전트는 과대광고됐지만 신뢰할 수 없음, 이익은 여전히 소박함, GPT-5급 합의된 도약 없음. 네 가지 모두 들어맞았다. 그의 목록은 또한 $4B 규모 코딩 도구 카테고리부터 IMO 금메달까지, 그 해의 모든 성공을 놓쳤다.