Những người xây dựng AI lại dở nhất trong việc dự đoán về nó

Trả lời nhanh

Mười tám dự đoán về AI từ năm 2024 và 2025, được chấm điểm dựa trên chính lời nói và thời hạn của người đưa ra chúng. Các dự đoán về năng lực phần lớn thành hiện thực, có cái đến sớm. Các dự đoán về triển khai, agent gia nhập lực lượng lao động, một tỷ agent Agentforce, lập trình viên bị thay thế trong một năm, gần như đều thất bại. Người đạt điểm cao nhất là nhà hoài nghi Gary Marcus với A-, và việc đúng không mang lại cho ông điều gì.

Không ai quay lại kiểm chứng

Vào tháng 3/2025, Dario Amodei nói với Council on Foreign Relations rằng AI sẽ viết 90% code trong vòng ba đến sáu tháng, và gần như toàn bộ code trong mười hai tháng. Thời hạn mười hai tháng đó đã trôi qua vào tháng 3. Gần như không ai quay lại kiểm chứng.

Đó là phép lịch sự kỳ lạ của việc dự đoán AI. Các dự đoán được đưa ra rầm rộ, có ngày tháng rõ ràng, với sự tự tin tuyệt đối, rồi khi ngày đó đến thì mọi người đã chuyển sang dự đoán tiếp theo. Không có bảng điểm nào cả. Vậy nên tôi đã tự làm một cái.

Vào tháng 2/2025, tôi lên kế hoạch đưa quy trình agent vào Whizi với giả định rằng Altman đã đúng về năm 2025. Tôi hủy dự án đó sáu tuần sau, sau khi tính toán chi phí của một lần chạy agent nhiều bước so với một gói thuê bao hàng tháng cố định. Sáu tuần lộ trình của chính tôi, đổ vào dự đoán của người khác. Tôi thu thập mọi dự đoán có ngày tháng từ 2024 và 2025 mà tôi tìm được, có nguồn gốc rõ ràng và có thời hạn đã trôi qua. Mười tám dự đoán được chọn.

Quy tắc chấm điểm, để bạn có thể tranh luận: một dự đoán được chấm dựa trên đúng lời hứa của nó, đúng thời hạn của nó. Nếu bạn nói 90% vào tháng 9 mà tháng 9 chỉ đạt 30%, "thôi thì cuối cùng cũng sẽ đến" không phải là một điểm số. Đó là một lời bào chữa.

Bảng điểm

Ai, khi nàoDự đoánĐiều đã xảy raĐiểm
Sam Altman, tháng 1/2025Agent AI "gia nhập lực lượng lao động" trong 202595% dự án thử nghiệm doanh nghiệp không có tác động đến lợi nhuận; agent tốt nhất hoàn thành 30,3% công việc văn phòngC-
Marc Benioff, tháng 9/2024Một tỷ agent Agentforce vào cuối 2025Khoảng 29.000 hợp đồng và $1B doanh thu định kỳ hàng nămF
Klarna, tháng 2/2024Trợ lý AI làm việc tương đương 700 nhân viênTuyển lại nhân viên từ tháng 5/2025 vì chất lượng kém hơnC
Dario Amodei, tháng 3/202590% code trong ba đến sáu tháng25% đến 41% toàn ngành, 75% tại Google giữa 2026C+
Dario Amodei, tháng 3/2025Gần như toàn bộ code trong mười hai thángKhông hề gần đúngF
Eric Schmidt, tháng 4/2025Đa số lập trình viên bị thay thế trong một nămLập trình viên vẫn giữ việc làm; vị trí mới ra trường giảm khoảng 16%F
Mark Zuckerberg, tháng 1/2025Một kỹ sư AI trung cấp, trợ lý dẫn đầu một tỷ người dùng, và Llama là mô hình hàng đầu, tất cả trong 2025Không cái nào trong ba điều xảy ra; thay vào đó là các gói lương kỷ lục cho kỹ sư con ngườiF
Elon Musk, tháng 4/2024AI thông minh hơn bất kỳ con người nào vào cuối 2025Grok 4 đạt 25,4% trong Humanity's Last ExamF
Mira Murati, tháng 6/2024Trí thông minh cấp tiến sĩ "cho các tác vụ cụ thể" trong khoảng 18 thángĐạt huy chương vàng chính thức tại Olympic Toán Quốc tế 2025B-
Gary Marcus, tháng 1/202525 dự đoán có ngày tháng, bốn dự đoán được chấm ở đâyCả bốn đều đúng, và không dự đoán nào trong đó nằm trong danh sách thành công của nămA-

Lực lượng lao động chưa từng đi làm

Sam Altman, tháng 1/2025: "Chúng tôi tin rằng, trong năm 2025, chúng ta có thể chứng kiến những agent AI đầu tiên 'gia nhập lực lượng lao động' và thay đổi đáng kể sản lượng của các công ty."

Dự án NANDA của MIT phát hiện vào tháng 8/2025 rằng 95% dự án thử nghiệm AI tạo sinh trong doanh nghiệp không tạo ra tác động đo lường được đến lợi nhuận. Carnegie Mellon lập một công ty giả toàn bộ vận hành bằng agent AI và đo lường công việc văn phòng mà chúng hoàn thành: mô hình tốt nhất hoàn thành 30,3% công việc. Một nhân viên đạt 30% không gia nhập lực lượng lao động của bạn. Họ bị loại ngay trong thời gian thử việc.

Một trường hợp ngoại lệ cứu điều này khỏi điểm F: trong các công ty phần mềm, agent lập trình thực sự đã thay đổi sản lượng. Điểm: C-.

Marc Benioff, tháng 9/2024: "Tầm nhìn của chúng tôi rất táo bạo: trao quyền cho một tỷ agent bằng Agentforce vào cuối 2025."

Salesforce báo cáo khoảng 29.000 hợp đồng Agentforce lũy kế vào đầu 2026 và vượt mốc $1B doanh thu định kỳ hàng năm. Một mảng kinh doanh thật sự, nhưng thiếu lời hứa khoảng 34.000 lần, tính theo hợp đồng chứ không phải theo agent. Chi tiết tôi thích nhất: Salesforce giờ báo cáo "đơn vị công việc agentic đã phục vụ" (3,8 tỷ đơn vị) thay vì đếm số agent. Khi không đạt được con số, hãy đổi đơn vị đo. Điểm: F.

Klarna, tháng 2/2024: trợ lý AI của họ "đang làm công việc tương đương 700 nhân viên toàn thời gian."

Rồi đến tháng 5/2025, CEO Sebastian Siemiatkowski đảo ngược quyết định và bắt đầu tuyển lại nhân viên: "Chúng tôi tập trung quá nhiều vào hiệu suất và chi phí. Kết quả là chất lượng thấp hơn." AI giữ lại các yêu cầu thường lệ. Con người quay lại lo mọi việc quan trọng. Ghi nhận vì đã công khai thử nghiệm và thừa nhận kết quả. Điểm: C.

Đoạn code thực sự đã được viết ra

Con số 90% của Amodei. Hướng đi thì đúng, mẫu số thì sai. Google nói rằng 75% code mới của họ do AI tạo ra tính đến giữa 2026, tăng từ 25% cuối 2024, dù con số này tính cả mọi gợi ý autocomplete được chấp nhận và con người vẫn kiểm tra trước khi triển khai. Ước tính toàn ngành đầu 2026 tập trung quanh mức 25% đến 41%.

Vậy: 90% toàn bộ code trong sáu tháng, không đúng. Gần như toàn bộ code trong mười hai tháng, không hề gần đúng. Một sự thay đổi mang tính lịch sử trong cách viết code, hoàn toàn đúng. Dự đoán này mô tả đúng một cuộc cách mạng thật sự nhưng sai mọi con số. Điểm: C+ cho con số 90%, F cho "gần như toàn bộ."

Eric Schmidt, tháng 4/2025: "trong một năm tới, đa số lập trình viên sẽ bị thay thế bởi lập trình viên AI."

Một năm đã trôi qua. Lập trình viên vẫn giữ việc làm ở gần như mọi nơi họ từng làm trước đây. Thiệt hại lao động thật sự lại hẹp hơn và khắc nghiệt hơn dự đoán: dữ liệu lương từ Stanford và ADP cho thấy việc làm cho nhóm 22 đến 25 tuổi trong các công việc chịu ảnh hưởng AI nhiều nhất giảm khoảng 16% kể từ cuối 2022 và vẫn đang thu hẹp. Vị trí mới ra trường chịu thiệt hại nặng nhất; đa số vẫn giữ việc và được cấp thêm giấy phép Copilot. Điểm: F.

Và con số không ai từng dự đoán: Cursor tăng từ $100M lên $4B doanh thu định kỳ hàng năm trong khoảng mười bảy tháng, và ngày 14 tháng 8, SpaceX hoàn tất thương vụ mua lại công ty này với giá $60B, thương vụ mua lại startup lớn nhất từng được ghi nhận. Không một danh sách dự đoán nào của năm 2024 mà tôi kiểm tra có dòng "một trình soạn thảo code trở thành vụ thoái vốn startup lớn nhất lịch sử."

Năm cực kỳ tốn kém của Meta

Mark Zuckerberg, tháng 1/2025, trên chương trình của Joe Rogan: "Có lẽ trong 2025, chúng tôi tại Meta... sẽ có một AI có thể đóng vai trò như một kỹ sư trung cấp mà bạn có trong công ty, có thể viết code." Trong buổi báo cáo lợi nhuận vài tuần sau, ông bổ sung thêm hai điều nữa cho 2025: Meta AI trở thành trợ lý dẫn đầu với một tỷ người dùng, và Llama là mô hình tiên tiến và được sử dụng rộng rãi nhất.

Không điều nào trong ba điều đó xảy ra. Llama 4 ra mắt khá mờ nhạt trong khi Gemini 3 giành ngôi vương vào tháng 11/2025. Và Meta dành cả năm đặt cược ngược lại bằng chính ví tiền của mình: $14.3B cho một nửa Scale AI, các gói lương nghiên cứu viên được báo cáo từ $100M đến $450M, rồi cắt giảm 600 người khỏi phòng lab siêu trí tuệ vào tháng 10 và khoảng 8.000 người bị sa thải vào tháng 5/2026.

Meta dự đoán một AI viết code như một kỹ sư trung cấp, và thay vào đó dành mười tám tháng lập kỷ lục thế giới về giá thị trường cho kỹ sư con người. Điểm: F.

Elon Musk, tháng 4/2024: AI "thông minh hơn bất kỳ con người nào, có lẽ vào khoảng cuối năm sau."

Đến cuối 2025, mô hình chủ lực của xAI là Grok 4, ra mắt với danh xưng "AI thông minh nhất thế giới," đạt 25,4% trong một bài kiểm tra có tên chính xác là Humanity's Last Exam. Tuyên bố này không trụ nổi trước bài kiểm tra. Điểm: F.

Mira Murati, tháng 6/2024: trí thông minh cấp tiến sĩ "cho các tác vụ cụ thể" trong khoảng mười tám tháng.

Với toán học thì điều này gần như đã thành hiện thực: Deep Think của Google DeepMind đạt huy chương vàng được chứng nhận chính thức tại Olympic Toán Quốc tế 2025, sớm hơn nhiều năm so với hầu hết dự đoán của 2024. Cụm từ điều kiện bà dùng, "cho các tác vụ cụ thể," gánh vác rất nhiều ý nghĩa, và đó chính xác là điều kiện mà những đồng nghiệp ồn ào hơn của bà từ chối dùng. Phiên bản có điều kiện đã đúng. Phiên bản không điều kiện, được đóng gói dưới nhãn "cấp tiến sĩ" của GPT-5 vào tháng 8/2025, thất bại đến mức Altman phải thừa nhận OpenAI "đã làm hỏng hoàn toàn" đợt ra mắt đó. Điểm: B-.

Bảng điểm của nhà hoài nghi

Gary Marcus công bố 25 dự đoán có ngày tháng vào ngày 1/1/2025. Ngành công nghiệp phần lớn thường lắc đầu với ông. Chấm điểm các tuyên bố có thể đánh giá được của ông:

  • "Chúng ta sẽ không thấy trí tuệ nhân tạo tổng quát trong năm nay." Đúng.
  • Agent sẽ "bị thổi phồng không ngừng suốt 2025 nhưng còn lâu mới đáng tin cậy." Đúng, xem toàn bộ phần đầu tiên.
  • "Lợi nhuận từ các mô hình AI sẽ tiếp tục khiêm tốn hoặc gần như không có." Doanh thu bùng nổ, nhưng ông nói lợi nhuận, và các phòng lab vẫn đang đốt tiền. Đúng theo đúng nghĩa đen.
  • Có thể không có bước nhảy vọt đồng thuận "cấp GPT-5" trong 2025. GPT-5 đã ra mắt; bước nhảy vọt thì không. Đúng về tinh thần.

Điểm: A-. Điểm trừ nằm ở những gì danh sách không có: không có gì trong đó dự đoán một hạng mục công cụ lập trình trị giá $4B, một huy chương vàng IMO, hay agent trở nên thực sự hữu ích trong đúng lĩnh vực mà kết quả có thể kiểm chứng được. Người dự đoán chính xác nhất năm 2025 đã gọi tên mọi thất bại và bỏ lỡ mọi thành công.

Và sự thật khó chịu ở cấp độ thứ hai: việc đúng không mang lại cho ông gần như bất cứ điều gì. Những nhà đầu tư đặt cược ngược lại toàn bộ quan điểm của ông mới là những người định giá Cursor ở mức $60B. Độ chính xác dự đoán và lợi nhuận tài chính chạy trên hai bảng điểm khác nhau, và chỉ một trong hai bảng đó tích lũy theo thời gian.

Dự đoán về năng lực thì đúng. Dự đoán về triển khai thì không

Chia 18 dự đoán thành hai nhóm là mọi thứ nhiễu loạn sẽ biến mất.

Các dự đoán về năng lực, tức mô hình sẽ có thể làm gì, đúng dần theo thời gian và đôi khi đến sớm. Theo METR, độ dài công việc mà agent có thể hoàn thành đã tăng gấp đôi khoảng mỗi bốn đến bảy tháng, và xu hướng này vẫn đúng.

Các dự đoán về triển khai, tức tổ chức sẽ thực sự để AI làm gì, gần như đều thất bại. Agent lực lượng lao động, nền tảng một tỷ agent, lập trình viên bị thay thế, nhân viên AI: tất cả đều vấp phải cùng một bức tường gồm tiêu chuẩn chất lượng, trách nhiệm pháp lý, chi phí tích hợp, và sự thật khó lay chuyển rằng một hệ thống hoàn thành 30% công việc là một bản demo, không phải một nhân viên được thuê.

Altman nói agent sẽ gia nhập lực lượng lao động. Chúng gia nhập IDE, vì IDE là nơi làm việc duy nhất mà một câu trả lời sai bị trình biên dịch bắt lỗi thay vì khách hàng.

Vậy đây là nguyên tắc quyết định mà tôi dùng bây giờ, với chính tiền của mình đặt cược vào: khi nghe một dự đoán về năng lực, hãy xem trọng nó, kể cả những dự đoán táo bạo nhất, vì các xu hướng vẫn liên tục thắng thế. Khi nghe một dự đoán về triển khai có kèm ngày cụ thể, hãy nhân đôi mốc thời gian đó, rồi kiểm tra xem người nói điều đó đang bán thứ gì. Cùng nguyên tắc đó là cách tôi chọn mô hình nào đáng trả tiền: benchmark là một tuyên bố về năng lực, quy trình làm việc là một tuyên bố về triển khai.

Từ giờ, mỗi quý tôi sẽ chấm điểm bất cứ dự đoán nào đến hạn, và số tiếp theo sẽ mở đầu bằng chính những dự đoán có ngày tháng của tôi, để bạn có thể chấm điểm ngược lại tôi theo cùng thước đo đó. Chấm điểm thì miễn phí. Bị chấm điểm mới là cái giá phải trả.

Danh sách kiểm tra
  • Chấm một dự đoán dựa trên đúng lời của nó, đúng thời hạn của nó; "cuối cùng cũng sẽ đến" không phải là một điểm số
  • Xem trọng các dự đoán về năng lực, kể cả những dự đoán táo bạo nhất; các xu hướng vẫn liên tục thắng thế
  • Nhân đôi bất kỳ mốc thời gian triển khai nào có kèm ngày cụ thể
  • Kiểm tra xem người đưa ra dự đoán đang bán thứ gì
  • Ghi lại dự đoán của chính bạn kèm ngày tháng để ai đó có thể chấm điểm ngược lại bạn

Câu hỏi thường gặp

Dario Amodei có đúng khi nói AI sẽ viết 90% code không?

Không đúng theo thời hạn ông đưa ra. Ông nói 90% trong ba đến sáu tháng kể từ tháng 3/2025 và gần như toàn bộ code trong mười hai tháng. Ước tính toàn ngành đầu 2026 tập trung quanh mức 25% đến 41%, với Google đạt 75% code mới tính đến giữa 2026, tính cả mọi gợi ý autocomplete được chấp nhận. Hướng đi thì đúng, con số thì sai.

Agent AI có gia nhập lực lượng lao động trong 2025 không?

Không, ngoại trừ trong lĩnh vực phần mềm. Dự án NANDA của MIT phát hiện 95% dự án thử nghiệm AI tạo sinh trong doanh nghiệp không tạo ra tác động đo lường được đến lợi nhuận, và bài kiểm tra công ty agent của Carnegie Mellon cho thấy mô hình tốt nhất hoàn thành 30,3% công việc văn phòng. Agent lập trình trong các công ty phần mềm là ngoại lệ thật sự duy nhất.

Ai dự đoán chính xác nhất về AI năm 2025?

Gary Marcus, nhà hoài nghi, xét trên các tuyên bố được chấm ở đây: không có AGI, agent bị thổi phồng nhưng chưa đáng tin cậy, lợi nhuận vẫn khiêm tốn, không có bước nhảy vọt đồng thuận GPT-5. Cả bốn điều đều đúng. Danh sách của ông cũng bỏ lỡ mọi thành công của năm, từ hạng mục công cụ lập trình trị giá $4B đến huy chương vàng IMO.