Nadie vuelve a comprobar
En marzo de 2025, Dario Amodei le dijo al Council on Foreign Relations que la IA escribiría el 90% del código en tres a seis meses, y esencialmente todo en doce. Ese plazo de doce meses venció en marzo. Casi nadie volvió a comprobarlo.
Esa es la extraña etiqueta del pronóstico sobre IA. Las predicciones son ruidosas, fechadas y se hacen con total confianza, y luego llega la fecha y todos ya han pasado a la siguiente. No hay marcador. Así que construí uno.
En febrero de 2025, incorporé flujos de trabajo de agentes a Whizi asumiendo que Altman tenía razón sobre 2025. Maté el proyecto seis semanas después, tras hacer las cuentas de lo que cuesta una sola ejecución de agente multipaso frente a una suscripción mensual plana. Seis semanas de mi propia hoja de ruta, gastadas en el pronóstico de otro. Reuní cada predicción fechada de 2024 y 2025 que pude encontrar con una fuente primaria y un plazo ya vencido. Dieciocho pasaron el corte.
La regla de evaluación, para que puedas discutirla: una predicción se evalúa contra lo que sus propias palabras prometieron, en su propio plazo. Si dijiste 90% para septiembre y septiembre trajo 30%, "bueno, eventualmente" no es una calificación. Es una excusa.
El marcador
| Quién, cuándo | La predicción | Qué pasó | Nota |
|---|---|---|---|
| Sam Altman, enero de 2025 | Los agentes de IA "se unen a la fuerza laboral" en 2025 | El 95% de los pilotos empresariales no mostró impacto en resultados; el mejor agente terminó el 30.3% de las tareas de oficina | C- |
| Marc Benioff, septiembre de 2024 | Mil millones de agentes de Agentforce para fines de 2025 | Cerca de 29,000 contratos y $1B en ingresos recurrentes anuales | F |
| Klarna, febrero de 2024 | Asistente de IA que hace el trabajo de 700 agentes | Recontratando humanos desde mayo de 2025 por menor calidad | C |
| Dario Amodei, marzo de 2025 | 90% del código en tres a seis meses | 25% a 41% en toda la industria, 75% en Google a mediados de 2026 | C+ |
| Dario Amodei, marzo de 2025 | Esencialmente todo el código en doce meses | Ni cerca | F |
| Eric Schmidt, abril de 2025 | La gran mayoría de programadores reemplazados en un año | Los programadores siguen empleados; los puestos de nivel inicial cayeron cerca de 16% | F |
| Mark Zuckerberg, enero de 2025 | Un ingeniero de nivel medio con IA, el asistente líder de mil millones de usuarios, y Llama como el modelo top, todo en 2025 | Ninguna de las tres; en cambio, paquetes salariales récord para ingenieros humanos | F |
| Elon Musk, abril de 2024 | IA más inteligente que cualquier humano para fines de 2025 | Grok 4 obtuvo 25.4% en Humanity's Last Exam | F |
| Mira Murati, junio de 2024 | Inteligencia de nivel doctorado "para tareas específicas" en unos 18 meses | Un oro certificado en la Olimpiada Internacional de Matemáticas 2025 | B- |
| Gary Marcus, enero de 2025 | 25 predicciones fechadas, cuatro evaluadas aquí | Las cuatro correctas, y ninguno de los éxitos del año en la lista | A- |
La fuerza laboral que nunca fichó entrada
Sam Altman, enero de 2025: "Creemos que, en 2025, podríamos ver a los primeros agentes de IA 'unirse a la fuerza laboral' y cambiar materialmente el rendimiento de las empresas."
El proyecto NANDA del MIT encontró en agosto de 2025 que el 95% de los pilotos empresariales de IA generativa no produjo un impacto medible en resultados. Carnegie Mellon montó una empresa falsa con agentes de IA y midió el trabajo de oficina que completaron: el mejor modelo terminó el 30.3% de las tareas. Un empleado del 30% no se une a tu fuerza laboral. Sale de su periodo de prueba.
Una excepción salva esto de un F: dentro de las empresas de software, los agentes de código sí cambiaron el rendimiento de verdad. Calificación: C-.
Marc Benioff, septiembre de 2024: "Nuestra visión es audaz: empoderar a mil millones de agentes con Agentforce para fines de 2025."
Salesforce reportó cerca de 29,000 contratos acumulados de Agentforce a principios de 2026 y superó los $1B en ingresos recurrentes anuales. Un negocio real, y unas 34,000 veces por debajo de la promesa, contando contratos en lugar de agentes. Mi detalle favorito: Salesforce ahora reporta "unidades de trabajo agéntico entregadas" (3.8 mil millones de ellas) en lugar de un conteo de agentes. Cuando no puedes alcanzar el número, cambias la unidad. Calificación: F.
Klarna, febrero de 2024: su asistente de IA "hace el trabajo equivalente a 700 agentes de tiempo completo."
Luego, en mayo de 2025, el CEO Sebastian Siemiatkowski dio marcha atrás y empezó a recontratar humanos: "Nos enfocamos demasiado en la eficiencia y el costo. El resultado fue menor calidad." La IA se quedó con los tickets rutinarios. Los humanos volvieron para todo lo que importaba. Crédito por hacer el experimento en público y admitir el resultado. Calificación: C.
El código que en verdad se escribió
El 90% de Amodei. La dirección era correcta y el denominador estaba mal. Google dice que el 75% de su código nuevo es generado por IA a mediados de 2026, subiendo desde el 25% a finales de 2024, aunque eso cuenta cada autocompletado aceptado y los humanos siguen revisando antes de desplegar. Las estimaciones de toda la industria a principios de 2026 se agruparon entre 25% y 41%.
Entonces: 90% de todo el código en seis meses, no. Esencialmente todo el código en doce, ni cerca. Un cambio histórico en cómo se escribe código, absolutamente sí. La predicción describió una revolución real y se equivocó en cada número. Calificación: C+ para el 90%, F para "esencialmente todo."
Eric Schmidt, abril de 2025: "en el próximo año, la gran mayoría de los programadores serán reemplazados por programadores de IA."
El año ya pasó. Los programadores siguen empleados casi en todos los lugares donde lo estaban antes. El daño laboral real es más estrecho y más cruel que la predicción: los datos de nómina de Stanford y ADP muestran que el empleo de 22 a 25 años en los puestos más expuestos a la IA cayó cerca de 16% desde finales de 2022 y sigue reduciéndose. El nivel inicial recibió el golpe; la gran mayoría conservó su empleo y obtuvo licencias de Copilot. Calificación: F.
Y el número que nadie predijo: Cursor pasó de $100M a $4B en ingresos recurrentes anuales en unos diecisiete meses, y el 14 de agosto SpaceX cerró su adquisición de $60B de la empresa, la mayor adquisición de una startup jamás registrada. Ninguna lista de predicciones de 2024 que revisé tenía "un editor de código se convierte en la mayor salida de startup en la historia."
El año muy caro de Meta
Mark Zuckerberg, enero de 2025, en Joe Rogan: "Probablemente en 2025, en Meta... vamos a tener una IA que pueda funcionar efectivamente como una especie de ingeniero de nivel medio que tienes en tu empresa y que puede escribir código." En la llamada de resultados semanas después agregó dos más para 2025: Meta AI como el asistente líder con mil millones de usuarios, y Llama como el modelo más avanzado y más usado.
Ninguna de las tres pasó. Llama 4 llegó con un chasco mientras Gemini 3 se llevó la corona de vanguardia en noviembre de 2025. Y Meta pasó el año haciendo la apuesta contraria con su billetera: $14.3B por la mitad de Scale AI, paquetes salariales para investigadores reportados entre $100M y $450M, luego 600 personas despedidas del laboratorio de superinteligencia en octubre y cerca de 8,000 despidos en mayo de 2026.
Meta predijo una IA que programa como un ingeniero de nivel medio, y en cambio pasó dieciocho meses estableciendo el récord mundial de precio de mercado para los humanos. Calificación: F.
Elon Musk, abril de 2024: IA "más inteligente que cualquier humano, probablemente para fines del próximo año."
Para fines de 2025, el modelo insignia de xAI era Grok 4, lanzado como "la IA más inteligente del mundo", con 25.4% en un examen llamado literalmente Humanity's Last Exam. La afirmación no sobrevivió al contacto con el examen. Calificación: F.
Mira Murati, junio de 2024: inteligencia de nivel doctorado "para tareas específicas" en unos dieciocho meses.
Para matemáticas básicamente pasó: Deep Think de Google DeepMind obtuvo un oro certificado oficialmente en la Olimpiada Internacional de Matemáticas 2025, años antes de la mayoría de los pronósticos de 2024. El calificativo que ella usó, "para tareas específicas", hace todo el trabajo pesado, y es exactamente el calificativo que sus colegas más ruidosos se negaron a usar. La versión moderada se cumplió. La versión sin matices, lanzada como la marca "nivel doctorado" de GPT-5 en agosto de 2025, salió tan mal que Altman admitió que OpenAI "la regó por completo" con el lanzamiento. Calificación: B-.
El boletín de calificaciones del escéptico
Gary Marcus publicó 25 predicciones fechadas el 1 de enero de 2025. La industria en general lo mira con desdén. Evaluando sus afirmaciones evaluables:
- "No veremos inteligencia artificial general este año." Correcto.
- Los agentes serán "promocionados sin fin durante 2025 pero lejos de ser confiables." Correcto, ver toda la primera sección.
- "Las ganancias de los modelos de IA seguirán siendo modestas o inexistentes." Los ingresos explotaron, pero él dijo ganancias, y los laboratorios siguen quemando efectivo. Correcto al pie de la letra.
- Posiblemente ningún salto de consenso de "nivel GPT-5" en 2025. GPT-5 salió; el salto no. Correcto en esencia.
Calificación: A-. El menos se descuenta por lo que la lista no contiene: nada en ella predijo una categoría de herramienta de código de $4B, un oro en la Olimpiada, o que los agentes se volvieran genuinamente útiles en el único dominio donde el resultado es verificable. El mejor pronosticador de 2025 acertó cada fracaso y falló cada éxito.
Y el incómodo hecho de segundo orden: tener razón no le sirvió de casi nada. Los inversionistas que apostaron contra toda su visión del mundo son los que valoraron a Cursor en $60B. La precisión del pronóstico y los rendimientos financieros corren en marcadores separados, y solo uno de ellos se capitaliza.
Las predicciones de capacidad se cumplieron. Las de despliegue no
Divide las 18 predicciones en dos montones y el ruido desaparece.
Las predicciones sobre capacidad, lo que los modelos serían capaces de hacer, envejecieron bien y a veces llegaron antes de tiempo. La duración de las tareas que los agentes pueden terminar se ha duplicado cada cuatro a siete meses aproximadamente, según METR, y la tendencia se mantuvo.
Las predicciones sobre despliegue, lo que las organizaciones dejarían hacer a la IA en realidad, fallaron casi uniformemente. Agentes laborales, plataformas de mil millones de agentes, programadores reemplazados, empleados de IA: todo chocó contra el mismo muro de estándares de calidad, responsabilidad, costo de integración y el hecho terco de que un sistema que completa el 30% de las tareas es una demostración, no una contratación.
Altman dijo que los agentes se unirían a la fuerza laboral. Se unieron al IDE, porque el IDE es el único lugar de trabajo donde una respuesta incorrecta la detecta un compilador en lugar de un cliente.
Así que aquí está la regla de decisión que uso ahora, con mi propio dinero en juego: cuando escuches una predicción de capacidad, tómala en serio, incluso las más extremas, porque las líneas de tendencia siguen ganando. Cuando escuches una predicción de despliegue con una fecha adjunta, duplica el plazo, y luego revisa qué está vendiendo quien lo dice. La misma regla es cómo elijo qué modelo pagar: el benchmark es una afirmación de capacidad, el flujo de trabajo es una afirmación de despliegue.
Cada trimestre desde ahora evaluaré lo que se venza, y la próxima edición abrirá con mis propias predicciones fechadas, para que puedas evaluarme con la misma rúbrica. Evaluar es gratis. Ser evaluado es el precio.
- Evalúa una predicción contra sus propias palabras, en su propio plazo; "eventualmente" no es una calificación
- Toma en serio las predicciones de capacidad, incluso las más extremas; las líneas de tendencia siguen ganando
- Duplica cualquier plazo de despliegue que traiga una fecha
- Revisa qué está vendiendo la persona que hace la predicción
- Escribe tus propias predicciones con fechas para que alguien pueda evaluarte de vuelta
Preguntas frecuentes
¿Tenía razón Dario Amodei en que la IA escribiría el 90% del código?
No en su plazo. Dijo 90% dentro de tres a seis meses desde marzo de 2025 y esencialmente todo el código en doce. Las estimaciones de toda la industria a principios de 2026 se agruparon entre 25% y 41%, con Google en 75% del código nuevo a mediados de 2026 contando cada autocompletado aceptado. La dirección era correcta y los números estaban mal.
¿Se unieron los agentes de IA a la fuerza laboral en 2025?
No fuera del software. El proyecto NANDA del MIT encontró que el 95% de los pilotos empresariales de IA generativa no produjo un impacto medible en resultados, y la prueba de la empresa de agentes de Carnegie Mellon vio al mejor modelo terminar el 30.3% de las tareas de oficina. Los agentes de código dentro de empresas de software fueron la única excepción real.
¿Quién predijo 2025 en IA con más precisión?
Gary Marcus, el escéptico, en las afirmaciones evaluadas aquí: sin AGI, agentes promocionados pero poco confiables, ganancias aún modestas, sin salto de consenso hacia GPT-5. Las cuatro se cumplieron. Su lista también falló en cada éxito del año, desde la categoría de herramienta de código de $4B hasta el oro de la Olimpiada.