คนที่สร้าง AI คือคนที่ทำนายมันได้แย่ที่สุด

คำตอบโดยสรุป

คำทำนาย AI 18 ข้อจากปี 2024 และ 2025 ถูกให้คะแนนตามคำพูดของผู้ทำนายเองและตามกำหนดเวลาของตัวเอง คำทำนายด้านความสามารถส่วนใหญ่เป็นจริง บางข้อมาถึงเร็วกว่ากำหนด ส่วนคำทำนายด้านการใช้งานจริง เช่น เอเจนต์เข้าสู่ตลาดแรงงาน เอเจนต์ Agentforce หนึ่งพันล้านตัว โปรแกรมเมอร์ถูกแทนที่ภายในหนึ่งปี ล้มเหลวเกือบทั้งหมด ผู้ทำคะแนนสูงสุดคือ Gary Marcus นักวิจารณ์สายสงสัย ได้เกรด A- และการทายถูกก็ไม่ได้ให้อะไรกับเขาเลย

ไม่มีใครย้อนกลับไปตรวจสอบ

ในเดือนมีนาคม 2025 Dario Amodei บอกกับ Council on Foreign Relations ว่า AI จะเขียนโค้ด 90% ภายในสามถึงหกเดือน และแทบทั้งหมดภายในสิบสองเดือน กำหนดเวลาสิบสองเดือนนั้นผ่านไปแล้วในเดือนมีนาคม แทบไม่มีใครย้อนกลับไปตรวจสอบเลย

นี่คือธรรมเนียมแปลกๆ ของการทำนาย AI คำทำนายดังกึกก้อง มีวันกำกับ และพูดด้วยความมั่นใจเต็มร้อย แล้วพอถึงวันนัดหมาย ทุกคนก็ย้ายไปสนใจคำทำนายถัดไปแล้ว ไม่มีกระดานคะแนนใดๆ ผมจึงสร้างมันขึ้นมาเอง

ในเดือนกุมภาพันธ์ 2025 ผมวางแผนเวิร์กโฟลว์เอเจนต์เข้าไปใน Whizi โดยตั้งสมมติฐานว่า Altman พูดถูกเรื่องปี 2025 ผมยกเลิกโปรเจกต์นั้นหกสัปดาห์ต่อมา หลังจากคำนวณต้นทุนของการรันเอเจนต์แบบหลายขั้นตอนครั้งเดียวเทียบกับค่าสมัครสมาชิกรายเดือนแบบคงที่ หกสัปดาห์ของแผนงานของผมเอง ถูกใช้ไปกับคำทำนายของคนอื่น ผมรวบรวมคำทำนายที่มีวันกำกับจากปี 2024 และ 2025 ทุกข้อที่หาแหล่งที่มาต้นฉบับได้และมีกำหนดเวลาที่ผ่านไปแล้ว ได้มาสิบแปดข้อ

กฎการให้คะแนน เพื่อให้คุณโต้แย้งได้: คำทำนายจะถูกให้คะแนนตามสิ่งที่คำพูดของมันเองสัญญาไว้ ตามกำหนดเวลาของมันเอง ถ้าคุณบอกว่า 90% ภายในเดือนกันยายน แล้วเดือนกันยายนมาพร้อมกับ 30% คำว่า "เดี๋ยวก็ถึง" ไม่ใช่คะแนน มันคือข้อแก้ตัว

กระดานคะแนน

ใคร เมื่อไรคำทำนายสิ่งที่เกิดขึ้นจริงเกรด
Sam Altman, มกราคม 2025เอเจนต์ AI "เข้าสู่ตลาดแรงงาน" ในปี 202595% ของโครงการนำร่องระดับองค์กรไม่มีผลต่อกำไรขาดทุน เอเจนต์ที่ดีที่สุดทำงานสำนักงานได้สำเร็จ 30.3%C-
Marc Benioff, กันยายน 2024เอเจนต์ Agentforce หนึ่งพันล้านตัวภายในสิ้นปี 2025ดีลประมาณ 29,000 รายการ และรายได้ประจำปีต่อเนื่อง $1BF
Klarna, กุมภาพันธ์ 2024ผู้ช่วย AI ทำงานเทียบเท่าเจ้าหน้าที่ 700 คนจ้างมนุษย์กลับมาตั้งแต่เดือนพฤษภาคม 2025 เพราะคุณภาพลดลงC
Dario Amodei, มีนาคม 2025โค้ด 90% ภายในสามถึงหกเดือน25% ถึง 41% ทั่วอุตสาหกรรม, 75% ที่ Google ภายในกลางปี 2026C+
Dario Amodei, มีนาคม 2025โค้ดแทบทั้งหมดภายในสิบสองเดือนไม่ใกล้เคียงเลยF
Eric Schmidt, เมษายน 2025โปรแกรมเมอร์ส่วนใหญ่ถูกแทนที่ภายในหนึ่งปีโปรแกรมเมอร์ยังคงมีงานทำ ตำแหน่งระดับเริ่มต้นลดลงประมาณ 16%F
Mark Zuckerberg, มกราคม 2025วิศวกร AI ระดับกลาง ผู้ช่วยระดับพันล้านผู้ใช้ที่ดีที่สุด และ Llama เป็นโมเดลอันดับหนึ่ง ทั้งหมดในปี 2025ไม่มีข้อไหนเป็นจริง แต่มีแพ็กเกจค่าตอบแทนวิศวกรมนุษย์ที่สูงเป็นประวัติการณ์แทนF
Elon Musk, เมษายน 2024AI ฉลาดกว่ามนุษย์ทุกคนภายในสิ้นปี 2025Grok 4 ได้คะแนน 25.4% ใน Humanity's Last ExamF
Mira Murati, มิถุนายน 2024ความฉลาดระดับปริญญาเอก "สำหรับงานเฉพาะทาง" ภายในประมาณ 18 เดือนได้เหรียญทองที่ได้รับการรับรองในโอลิมปิกคณิตศาสตร์นานาชาติปี 2025B-
Gary Marcus, มกราคม 2025คำทำนาย 25 ข้อที่มีวันกำกับ สี่ข้อถูกให้คะแนนในที่นี้ถูกทั้งสี่ข้อ และไม่มีความสำเร็จใดของปีนี้อยู่ในรายการเลยA-

ตลาดแรงงานที่ไม่เคยมีใครมาตอกบัตร

Sam Altman, มกราคม 2025: "เราเชื่อว่าในปี 2025 เราอาจได้เห็นเอเจนต์ AI ตัวแรก 'เข้าสู่ตลาดแรงงาน' และเปลี่ยนแปลงผลผลิตของบริษัทอย่างมีนัยสำคัญ"

โครงการ NANDA ของ MIT พบในเดือนสิงหาคม 2025 ว่า 95% ของโครงการนำร่อง generative AI ระดับองค์กรไม่มีผลกระทบที่วัดได้ต่อกำไรขาดทุน Carnegie Mellon จัดตั้งบริษัทจำลองที่ใช้เอเจนต์ AI ทั้งหมดและวัดงานสำนักงานที่ทำสำเร็จ โมเดลที่ดีที่สุดทำงานเสร็จ 30.3% พนักงานที่ทำงานสำเร็จ 30% ไม่ใช่คนที่เข้าร่วมตลาดแรงงานของคุณ พวกเขาคือคนที่ออกจากช่วงทดลองงาน

มีข้อยกเว้นหนึ่งข้อที่ช่วยกู้เกรดจาก F: ภายในบริษัทซอฟต์แวร์ เอเจนต์เขียนโค้ด เปลี่ยนแปลงผลผลิตได้จริง เกรด: C-

Marc Benioff, กันยายน 2024: "วิสัยทัศน์ของเรากล้าหาญ: เสริมพลังให้เอเจนต์หนึ่งพันล้านตัวด้วย Agentforce ภายในสิ้นปี 2025"

Salesforce รายงานดีลสะสม Agentforce ประมาณ 29,000 รายการภายในต้นปี 2026 และมีรายได้ประจำปีต่อเนื่องเกิน $1B ธุรกิจจริง แต่ห่างจากคำสัญญาประมาณ 34,000 เท่า โดยนับเป็นดีลไม่ใช่จำนวนเอเจนต์ รายละเอียดที่ผมชอบที่สุด: ตอนนี้ Salesforce รายงาน "agentic work units served" (3.8 พันล้านหน่วย) แทนการนับจำนวนเอเจนต์ เมื่อทำตัวเลขไม่ได้ตามเป้า ก็เปลี่ยนหน่วยวัดแทน เกรด: F

Klarna, กุมภาพันธ์ 2024: ผู้ช่วย AI ของบริษัท "ทำงานเทียบเท่าเจ้าหน้าที่ประจำ 700 คน"

จากนั้นในเดือนพฤษภาคม 2025 CEO Sebastian Siemiatkowski กลับลำและเริ่มจ้างมนุษย์กลับมา: "เรามุ่งเน้นเรื่องประสิทธิภาพและต้นทุนมากเกินไป ผลลัพธ์คือคุณภาพที่ต่ำลง" AI ยังคงดูแลตั๋วงานทั่วไป มนุษย์กลับมาทำทุกอย่างที่สำคัญ ให้เครดิตสำหรับการทดลองอย่างเปิดเผยและยอมรับผลลัพธ์ เกรด: C

โค้ดที่ถูกเขียนขึ้นจริง

ตัวเลข 90% ของ Amodei ทิศทางถูกต้อง แต่ตัวหารผิด Google บอกว่า 75% ของโค้ดใหม่ของบริษัทสร้างโดย AI ณ กลางปี 2026 เพิ่มขึ้นจาก 25% ในปลายปี 2024 แม้ตัวเลขนี้จะนับทุกการยอมรับ autocomplete และมนุษย์ยังคงตรวจสอบก่อนนำไปใช้งานจริง การประมาณการทั่วอุตสาหกรรมในต้นปี 2026 อยู่ที่ประมาณ 25% ถึง 41%

สรุป: โค้ด 90% ภายในหกเดือน ไม่ใช่ โค้ดแทบทั้งหมดภายในสิบสองเดือน ไม่ใกล้เคียง การเปลี่ยนแปลงครั้งประวัติศาสตร์ในวิธีเขียนโค้ด ใช่แน่นอน คำทำนายบรรยายการปฏิวัติจริงแต่ทายตัวเลขผิดทุกตัว เกรด: C+ สำหรับ 90%, F สำหรับ "แทบทั้งหมด"

Eric Schmidt, เมษายน 2025: "ภายในหนึ่งปีข้างหน้า โปรแกรมเมอร์ส่วนใหญ่จะถูกแทนที่ด้วยโปรแกรมเมอร์ AI"

ปีนั้นผ่านไปแล้ว โปรแกรมเมอร์ยังคงมีงานทำในเกือบทุกที่ที่เคยมีงานทำ ความเสียหายทางแรงงานที่แท้จริงนั้นแคบกว่าและโหดร้ายกว่าคำทำนาย: ข้อมูลของ Stanford และ ADP payroll แสดงว่าการจ้างงานของกลุ่มอายุ 22 ถึง 25 ปีในงานที่เสี่ยงต่อ AI มากที่สุดลดลงประมาณ 16% ตั้งแต่ปลายปี 2022 และยังคงลดลงต่อเนื่อง ตำแหน่งระดับเริ่มต้นได้รับผลกระทบหนัก ส่วนคนส่วนใหญ่ยังคงมีงานและได้รับใบอนุญาตใช้ Copilot เกรด: F

และตัวเลขที่ไม่มีใครทำนายไว้เลย: Cursor เติบโตจากรายได้ประจำปีต่อเนื่อง $100M เป็น $4B ภายในประมาณสิบเจ็ดเดือน และในวันที่ 14 สิงหาคม SpaceX ปิดดีลซื้อกิจการบริษัทนี้มูลค่า $60B ซึ่งเป็นการซื้อกิจการสตาร์ทอัพที่ใหญ่ที่สุดเท่าที่เคยมีการบันทึกไว้ ไม่มีรายการคำทำนายปี 2024 ที่ผมตรวจสอบข้อไหนเลยที่มี "เครื่องมือแก้ไขโค้ดกลายเป็นการออกจากธุรกิจสตาร์ทอัพที่ใหญ่ที่สุดในประวัติศาสตร์" อยู่ในรายการ

ปีที่แสนแพงของ Meta

Mark Zuckerberg, มกราคม 2025, ใน Joe Rogan: "น่าจะในปี 2025 ที่ Meta... เราจะมี AI ที่ทำหน้าที่เหมือนวิศวกรระดับกลางในบริษัทของคุณที่เขียนโค้ดได้อย่างมีประสิทธิภาพ" ในการประชุมผลประกอบการไม่กี่สัปดาห์ต่อมาเขาเพิ่มอีกสองข้อสำหรับปี 2025: Meta AI เป็นผู้ช่วยระดับพันล้านผู้ใช้ที่ดีที่สุด และ Llama เป็นโมเดลที่ล้ำหน้าและใช้กันแพร่หลายที่สุด

ไม่มีข้อไหนเป็นจริงเลยทั้งสามข้อ Llama 4 ออกมาแบบเงียบเชียบ ขณะที่ Gemini 3 คว้าตำแหน่งผู้นำแนวหน้าในเดือนพฤศจิกายน 2025 และ Meta ใช้เงินทั้งปีเดิมพันในทิศทางตรงข้าม: $14.3B สำหรับครึ่งหนึ่งของ Scale AI แพ็กเกจค่าตอบแทนนักวิจัยที่รายงานอยู่ระหว่าง $100M ถึง $450M จากนั้นตัดพนักงาน 600 คนจากห้องแล็บ superintelligence ในเดือนตุลาคม และเลิกจ้างประมาณ 8,000 คนในเดือนพฤษภาคม 2026

Meta ทำนายว่าจะมี AI ที่เขียนโค้ดได้เหมือนวิศวกรระดับกลาง แต่กลับใช้เวลาสิบแปดเดือนสร้างสถิติโลกด้านราคาตลาดสำหรับวิศวกรมนุษย์แทน เกรด: F

Elon Musk, เมษายน 2024: AI "ฉลาดกว่ามนุษย์คนใดคนหนึ่งน่าจะราวๆ สิ้นปีหน้า"

ภายในสิ้นปี 2025 โมเดลเรือธงของ xAI คือ Grok 4 เปิดตัวในฐานะ "AI ที่ฉลาดที่สุดในโลก" ทำคะแนนได้ 25.4% ในเกณฑ์วัดที่ชื่อ Humanity's Last Exam อย่างแท้จริง คำกล่าวอ้างไม่รอดพ้นการทดสอบจริง เกรด: F

Mira Murati, มิถุนายน 2024: ความฉลาดระดับปริญญาเอก "สำหรับงานเฉพาะทาง" ภายในประมาณสิบแปดเดือน

สำหรับคณิตศาสตร์ มันเกิดขึ้นจริงโดยพื้นฐาน: Deep Think ของ Google DeepMind คว้าเหรียญทองที่ได้รับการรับรองอย่างเป็นทางการในโอลิมปิกคณิตศาสตร์นานาชาติปี 2025 เร็วกว่าที่การคาดการณ์ส่วนใหญ่ในปี 2024 คาดไว้หลายปี คำจำกัดความ "สำหรับงานเฉพาะทาง" ที่เธอใช้นั้นทำหน้าที่สำคัญมาก และมันคือคำจำกัดความเดียวกับที่เพื่อนร่วมวงการที่พูดเสียงดังกว่าปฏิเสธจะใช้ เวอร์ชันที่มีเงื่อนไขนั้นเป็นจริง ส่วนเวอร์ชันที่ไม่มีเงื่อนไข ซึ่งออกมาเป็นแบรนด์ "PhD-level" ของ GPT-5 ในเดือนสิงหาคม 2025 กลับแย่มากจน Altman ยอมรับว่า OpenAI "ทำพลาดอย่างสิ้นเชิง" ในการเปิดตัว เกรด: B-

ใบรายงานผลของนักวิจารณ์สายสงสัย

Gary Marcus เผยแพร่คำทำนายที่มีวันกำกับ 25 ข้อในวันที่ 1 มกราคม 2025 วงการส่วนใหญ่มักหัวเราะเยาะเขา มาให้คะแนนข้ออ้างที่ตัดสินได้ของเขากัน:

  • "เราจะยังไม่เห็น artificial general intelligence ในปีนี้" ถูกต้อง
  • เอเจนต์จะ "ถูกโหมประโคมข่าวไม่หยุดตลอดปี 2025 แต่ยังห่างไกลจากความน่าเชื่อถือ" ถูกต้อง ดูทั้งหมดในหัวข้อแรก
  • "กำไรจากโมเดล AI จะยังคงพอประมาณหรือไม่มีเลย" รายได้พุ่งทะยาน แต่เขาพูดถึงกำไร และแล็บต่างๆ ก็ยังคงเผาเงินสดอยู่ ถูกต้องตามตัวอักษร
  • อาจไม่มีการก้าวกระโดดที่เป็นที่ยอมรับร่วมกันระดับ "GPT-5" ในปี 2025 GPT-5 เปิดตัวแล้ว แต่การก้าวกระโดดไม่เกิดขึ้น ถูกต้องในเชิงจิตวิญญาณ

เกรด: A- ที่หักลบเล็กน้อยเพราะสิ่งที่รายการนี้ไม่มี: ไม่มีข้อไหนทำนายหมวดหมู่เครื่องมือเขียนโค้ดมูลค่า $4B เหรียญทอง IMO หรือเอเจนต์ที่มีประโยชน์จริงในโดเมนเดียวที่ผลลัพธ์ตรวจสอบได้ นักพยากรณ์ที่แม่นที่สุดของปี 2025 ทายความล้มเหลวได้ทุกครั้งแต่พลาดทุกความสำเร็จ

และข้อเท็จจริงลำดับที่สองที่ไม่สบายใจ: การทายถูกไม่ได้ให้อะไรกับเขาเลย นักลงทุนที่เดิมพันตรงข้ามกับมุมมองทั้งหมดของเขาคือคนที่ตีราคา Cursor ที่ $60B ความแม่นยำในการทำนายและผลตอบแทนทางการเงินวิ่งอยู่บนกระดานคะแนนคนละแผ่น และมีเพียงแผ่นเดียวเท่านั้นที่ทบต้น

คำทำนายด้านความสามารถเป็นจริง คำทำนายด้านการใช้งานจริงไม่เป็นจริง

แยกคำทำนาย 18 ข้อออกเป็นสองกอง แล้วความสับสนวุ่นวายจะหายไป

คำทำนายเกี่ยวกับความสามารถ คือโมเดลจะทำอะไรได้บ้าง แม่นยำและบางครั้งมาถึงเร็วกว่ากำหนด ความยาวของงานที่เอเจนต์สามารถทำสำเร็จได้เพิ่มขึ้นเป็นสองเท่าทุกประมาณสี่ถึงเจ็ดเดือน ตามข้อมูลของ METR และแนวโน้มนี้ยังคงเป็นจริง

คำทำนายเกี่ยวกับการใช้งานจริง คือองค์กรจะปล่อยให้ AI ทำอะไรได้จริง ล้มเหลวเกือบทั้งหมด เอเจนต์แรงงาน แพลตฟอร์มเอเจนต์ระดับพันล้าน โปรแกรมเมอร์ที่ถูกแทนที่ พนักงาน AI ทั้งหมดชนกำแพงเดียวกัน: เกณฑ์คุณภาพ ความรับผิดชอบทางกฎหมาย ต้นทุนการผสานระบบ และข้อเท็จจริงที่ดื้อรั้นว่าระบบที่ทำงานสำเร็จ 30% เป็นเพียงการสาธิต ไม่ใช่การจ้างงาน

Altman บอกว่าเอเจนต์จะเข้าสู่ตลาดแรงงาน แต่พวกมันกลับเข้าไปอยู่ใน IDE เพราะ IDE คือที่ทำงานแห่งเดียวที่คำตอบผิดจะถูกจับได้โดยคอมไพเลอร์แทนที่จะเป็นลูกค้า

นี่คือกฎการตัดสินใจที่ผมใช้อยู่ตอนนี้ โดยเอาเงินของตัวเองเป็นเดิมพัน: เมื่อได้ยินคำทำนายด้านความสามารถ ให้จริงจังกับมัน แม้แต่ข้อที่ดูสุดโต่ง เพราะแนวโน้มยังคงชนะต่อไป เมื่อได้ยินคำทำนายด้านการใช้งานจริงที่มีวันกำกับ ให้เพิ่มระยะเวลาเป็นสองเท่า แล้วตรวจสอบว่าคนพูดกำลังขายอะไร กฎเดียวกันนี้คือวิธีที่ผมเลือกโมเดลที่จะจ่ายเงินซื้อ: เกณฑ์วัดคือข้ออ้างด้านความสามารถ เวิร์กโฟลว์คือข้ออ้างด้านการใช้งานจริง

ทุกไตรมาสนับจากนี้ไป ผมจะให้คะแนนสิ่งที่ครบกำหนด และฉบับถัดไปจะเปิดด้วยคำทำนายที่มีวันกำกับของผมเอง เพื่อให้คุณตรวจสอบผมด้วยเกณฑ์เดียวกัน การให้คะแนนนั้นฟรี การถูกให้คะแนนคือราคาที่ต้องจ่าย

เช็กลิสต์การทำงาน
  • ให้คะแนนคำทำนายตามคำพูดของมันเอง ตามกำหนดเวลาของมันเอง "เดี๋ยวก็ถึง" ไม่ใช่คะแนน
  • จริงจังกับคำทำนายด้านความสามารถ แม้แต่ข้อที่ดูสุดโต่ง เพราะแนวโน้มยังคงชนะต่อไป
  • เพิ่มระยะเวลาของคำทำนายด้านการใช้งานจริงที่มีวันกำกับเป็นสองเท่า
  • ตรวจสอบว่าคนที่พูดคำทำนายนั้นกำลังขายอะไร
  • เขียนคำทำนายของคุณเองพร้อมวันกำกับ เพื่อให้ใครสักคนย้อนกลับมาให้คะแนนคุณได้

คำถามที่พบบ่อย

Dario Amodei พูดถูกไหมที่ว่า AI จะเขียนโค้ด 90%?

ไม่ถูกตามกำหนดเวลาของเขา เขาบอกว่า 90% ภายในสามถึงหกเดือนจากมีนาคม 2025 และแทบทั้งหมดภายในสิบสองเดือน การประมาณการทั่วอุตสาหกรรมในต้นปี 2026 อยู่ที่ประมาณ 25% ถึง 41% โดย Google อยู่ที่ 75% ของโค้ดใหม่ภายในกลางปี 2026 นับรวมทุกการยอมรับ autocomplete ทิศทางถูกต้อง แต่ตัวเลขผิด

เอเจนต์ AI เข้าสู่ตลาดแรงงานในปี 2025 หรือไม่?

ไม่ใช่นอกวงการซอฟต์แวร์ โครงการ NANDA ของ MIT พบว่า 95% ของโครงการนำร่อง generative AI ระดับองค์กรไม่มีผลกระทบที่วัดได้ต่อกำไรขาดทุน และการทดสอบบริษัทเอเจนต์ของ Carnegie Mellon พบว่าโมเดลที่ดีที่สุดทำงานสำนักงานสำเร็จเพียง 30.3% เอเจนต์เขียนโค้ดภายในบริษัทซอฟต์แวร์เป็นข้อยกเว้นจริงเพียงข้อเดียว

ใครทำนายปี 2025 ในวงการ AI ได้แม่นยำที่สุด?

Gary Marcus นักวิจารณ์สายสงสัย จากข้ออ้างที่ให้คะแนนในบทความนี้: ไม่มี AGI, เอเจนต์ถูกโหมข่าวแต่ยังไม่น่าเชื่อถือ, กำไรยังคงพอประมาณ, ไม่มีการก้าวกระโดดที่เป็นที่ยอมรับร่วมกันระดับ GPT-5 ทั้งสี่ข้อเป็นจริง แต่รายการของเขายังพลาดทุกความสำเร็จของปีนั้น ตั้งแต่หมวดหมู่เครื่องมือเขียนโค้ดมูลค่า $4B ไปจนถึงเหรียญทอง IMO