Quem constrói IA é péssimo em prever a própria IA

Resposta rápida

Dezoito previsões de IA de 2024 e 2025, avaliadas pelas próprias palavras e pelos próprios prazos de quem as fez. As previsões de capacidade em geral se confirmaram, algumas até antes do prazo. As previsões de adoção, agentes entrando na força de trabalho, um bilhão de agentes do Agentforce, programadores substituídos em um ano, falharam quase todas. O melhor colocado foi o cético Gary Marcus, com A-, e estar certo não lhe rendeu nada.

Ninguém volta para conferir

Em março de 2025, Dario Amodei disse ao Council on Foreign Relations que a IA escreveria 90% do código em três a seis meses, e praticamente todo o código em doze meses. Esse prazo de doze meses venceu em março. Quase ninguém voltou para conferir.

Essa é a etiqueta estranha das previsões de IA. Elas são feitas em alto e bom som, com data e confiança total, e quando o prazo chega todo mundo já foi para a próxima previsão. Não existe placar. Então eu criei um.

Em fevereiro de 2025, planejei fluxos de agentes para o Whizi partindo do princípio de que Altman estava certo sobre 2025. Cancelei o projeto seis semanas depois, ao fazer as contas de quanto custa uma execução de agente com várias etapas frente a uma assinatura mensal fixa. Seis semanas do meu próprio roteiro, gastas na previsão de outra pessoa. Levantei toda previsão datada de 2024 e 2025 que consegui encontrar com fonte primária e prazo já vencido. Dezoito entraram na lista.

A regra de avaliação, para você discordar dela se quiser: uma previsão é avaliada pelo que as próprias palavras prometeram, no próprio prazo. Se você disse 90% até setembro e setembro trouxe 30%, "bem, eventualmente" não é uma nota. É desculpa.

O placar

Quem, quandoA previsãoO que aconteceuNota
Sam Altman, janeiro de 2025Agentes de IA "entram na força de trabalho" em 202595% dos projetos-piloto corporativos não mostraram impacto no lucro; o melhor agente concluiu 30,3% das tarefas de escritórioC-
Marc Benioff, setembro de 2024Um bilhão de agentes Agentforce até o fim de 2025Cerca de 29.000 contratos e $1B em receita recorrente anualF
Klarna, fevereiro de 2024Assistente de IA fazendo o trabalho de 700 atendentesRecontratando humanos desde maio de 2025 por queda de qualidadeC
Dario Amodei, março de 202590% do código em três a seis meses25% a 41% em todo o setor, 75% no Google em meados de 2026C+
Dario Amodei, março de 2025Praticamente todo o código em doze mesesLonge dissoF
Eric Schmidt, abril de 2025A grande maioria dos programadores substituída em um anoProgramadores continuam empregados; cargos de entrada caem cerca de 16%F
Mark Zuckerberg, janeiro de 2025Um engenheiro de IA de nível intermediário, o assistente líder com um bilhão de usuários e o Llama como melhor modelo, tudo em 2025Nenhum dos três; pacotes salariais recordes para engenheiros humanos em vez dissoF
Elon Musk, abril de 2024IA mais inteligente que qualquer humano até o fim de 2025Grok 4 pontuou 25,4% no Humanity's Last ExamF
Mira Murati, junho de 2024Inteligência em nível de doutorado "para tarefas específicas" em cerca de 18 mesesOuro certificado na Olimpíada Internacional de Matemática de 2025B-
Gary Marcus, janeiro de 202525 previsões datadas, quatro avaliadas aquiAs quatro corretas, e nenhum dos sucessos do ano na listaA-

A força de trabalho que nunca bateu o ponto

Sam Altman, janeiro de 2025: "Acreditamos que, em 2025, poderemos ver os primeiros agentes de IA 'entrarem na força de trabalho' e mudar materialmente o resultado das empresas."

O projeto NANDA do MIT constatou em agosto de 2025 que 95% dos projetos-piloto corporativos de IA generativa não produziram impacto mensurável no lucro. A Carnegie Mellon montou uma empresa fictícia inteiramente com agentes de IA e mediu o trabalho de escritório que eles concluíram: o melhor modelo terminou 30,3% das tarefas. Um funcionário de 30% não entra na sua força de trabalho. Ele sai do período de experiência.

Uma ressalva salva isso de um F: dentro de empresas de software, os agentes de programação realmente mudaram os resultados. Nota: C-.

Marc Benioff, setembro de 2024: "Nossa visão é ousada: capacitar um bilhão de agentes com o Agentforce até o fim de 2025."

A Salesforce reportou cerca de 29.000 contratos acumulados do Agentforce no início de 2026 e ultrapassou $1B em receita recorrente anual. Um negócio real, e cerca de 34.000 vezes abaixo da promessa, contando contratos e não agentes. Meu detalhe favorito: a Salesforce agora reporta "unidades de trabalho agêntico atendidas" (3,8 bilhões delas) em vez de uma contagem de agentes. Quando não dá para bater o número, muda-se a unidade. Nota: F.

Klarna, fevereiro de 2024: seu assistente de IA "está fazendo o equivalente ao trabalho de 700 atendentes em tempo integral".

Depois, em maio de 2025, o CEO Sebastian Siemiatkowski mudou de rumo e voltou a contratar humanos: "Focamos demais em eficiência e custo. O resultado foi qualidade mais baixa." A IA ficou com os chamados de rotina. Os humanos voltaram para tudo que importava. Crédito por rodar o experimento em público e admitir o resultado. Nota: C.

O código que de fato foi escrito

Os 90% de Amodei. A direção estava certa e o denominador estava errado. O Google diz que 75% do seu código novo é gerado por IA em meados de 2026, contra 25% no fim de 2024, embora isso conte todo autocompletar aceito e humanos ainda revisem antes de publicar. Estimativas do setor no início de 2026 giraram entre 25% e 41%.

Ou seja: 90% de todo o código em seis meses, não. Praticamente todo o código em doze, longe disso. Uma mudança histórica na forma como o código é escrito, sim, sem dúvida. A previsão descreveu uma revolução real e errou todos os números. Nota: C+ para os 90%, F para "praticamente tudo".

Eric Schmidt, abril de 2025: "no próximo ano, a grande maioria dos programadores será substituída por programadores de IA".

O ano se encerrou. Os programadores continuam empregados quase em todos os lugares onde já estavam. O dano real ao mercado de trabalho é mais estreito e mais cruel do que a previsão: dados de folha de pagamento da Stanford e da ADP mostram queda de cerca de 16% no emprego de pessoas de 22 a 25 anos nas funções mais expostas à IA desde o fim de 2022, e ainda encolhendo. Cargos de entrada é que sofreram o golpe; a grande maioria manteve o emprego e ganhou licenças do Copilot. Nota: F.

E o número que ninguém previu: a Cursor foi de $100M a $4B em receita recorrente anual em cerca de dezessete meses, e em 14 de agosto a SpaceX fechou a aquisição de $60B da empresa, a maior aquisição de startup já registrada. Nenhuma lista de previsões de 2024 que verifiquei tinha "um editor de código vira a maior saída de startup da história".

O ano muito caro da Meta

Mark Zuckerberg, janeiro de 2025, no Joe Rogan: "Provavelmente em 2025, nós na Meta... vamos ter uma IA que pode efetivamente ser uma espécie de engenheiro de nível intermediário que você tem na sua empresa e que consegue escrever código." Na teleconferência de resultados semanas depois, ele acrescentou mais duas para 2025: a Meta AI como principal assistente com um bilhão de usuários, e o Llama como o modelo mais avançado e mais usado.

Nenhuma das três aconteceu. O Llama 4 chegou sem impacto enquanto o Gemini 3 assumiu a liderança em novembro de 2025. E a Meta passou o ano fazendo a aposta oposta com o próprio dinheiro: $14.3B por metade da Scale AI, pacotes salariais de pesquisadores reportados entre $100M e $450M, depois 600 pessoas cortadas do laboratório de superinteligência em outubro e cerca de 8.000 demissões em maio de 2026.

A Meta previu uma IA que programa como um engenheiro de nível intermediário e, em vez disso, passou dezoito meses estabelecendo o recorde mundial de preço de mercado para engenheiros humanos. Nota: F.

Elon Musk, abril de 2024: IA "mais inteligente que qualquer humano provavelmente por volta do fim do ano que vem".

Até o fim de 2025, o modelo principal da xAI era o Grok 4, lançado como "a IA mais inteligente do mundo", pontuando 25,4% em um benchmark literalmente chamado Humanity's Last Exam. A alegação não sobreviveu ao contato com a prova. Nota: F.

Mira Murati, junho de 2024: inteligência em nível de doutorado "para tarefas específicas" em cerca de dezoito meses.

Para matemática, basicamente aconteceu: o Deep Think do Google DeepMind conquistou uma medalha de ouro oficialmente certificada na Olimpíada Internacional de Matemática de 2025, anos antes do que previa a maioria das estimativas de 2024. O qualificador que ela usou, "para tarefas específicas", carrega bastante peso, e é exatamente o qualificador que seus pares mais barulhentos se recusaram a usar. A versão com ressalva se confirmou. A versão sem ressalva, lançada como o marketing "nível de doutorado" do GPT-5 em agosto de 2025, deu tão errado que Altman admitiu que a OpenAI "errou feio" no lançamento. Nota: B-.

O boletim do cético

Gary Marcus publicou 25 previsões datadas em 1º de janeiro de 2025. O setor em geral revira os olhos para ele. Avaliando suas afirmações passíveis de nota:

  • "Não veremos inteligência artificial geral este ano." Correto.
  • Os agentes serão "exaustivamente hipados ao longo de 2025, mas longe de confiáveis". Correto, veja toda a primeira seção.
  • "Os lucros dos modelos de IA continuarão modestos ou inexistentes." A receita explodiu, mas ele falou de lucros, e os laboratórios ainda estão queimando caixa. Correto na letra.
  • Possivelmente nenhum salto de consenso "nível GPT-5" em 2025. O GPT-5 foi lançado; o salto não aconteceu. Correto em espírito.

Nota: A-. O desconto é pelo que a lista não contém: nada nela previu uma categoria de ferramenta de programação de $4B, um ouro na Olimpíada de Matemática ou agentes se tornando genuinamente úteis justamente no domínio em que o resultado é verificável. O melhor previsor de 2025 acertou todo fracasso e errou todo sucesso.

E o fato incômodo de segunda ordem: estar certo não lhe rendeu praticamente nada. Os investidores que apostaram contra toda a visão de mundo dele são os mesmos que avaliaram a Cursor em $60B. Precisão de previsão e retorno financeiro correm em placares separados, e só um deles rende juros compostos.

Previsões de capacidade se confirmaram. Previsões de adoção não

Separe as 18 previsões em duas pilhas e o ruído desaparece.

As previsões sobre capacidade, o que os modelos conseguiriam fazer, envelheceram bem e às vezes vieram antes do prazo. A duração das tarefas que os agentes conseguem concluir vem dobrando a cada quatro a sete meses aproximadamente, segundo a METR, e a tendência se manteve.

As previsões sobre adoção, o que as empresas deixariam a IA realmente fazer, falharam quase todas. Agentes na força de trabalho, plataformas de bilhões de agentes, programadores substituídos, funcionários de IA: tudo esbarrou na mesma parede de padrões de qualidade, responsabilidade legal, custo de integração e o fato teimoso de que um sistema que conclui 30% das tarefas é uma demonstração, não uma contratação.

Altman disse que os agentes entrariam na força de trabalho. Eles entraram no editor de código, porque o editor de código é o único ambiente de trabalho onde uma resposta errada é pega por um compilador em vez de um cliente.

Então aqui está a regra prática que uso agora, com meu próprio dinheiro em jogo: quando você ouvir uma previsão de capacidade, leve a sério, até as mais radicais, porque as tendências continuam se confirmando. Quando você ouvir uma previsão de adoção com uma data anexada, dobre o prazo e depois veja o que a pessoa está vendendo. É a mesma regra que uso para escolher qual modelo pagar: o benchmark é uma alegação de capacidade, o fluxo de trabalho é uma alegação de adoção.

A cada trimestre a partir de agora, avalio o que venceu, e a próxima edição abre com minhas próprias previsões datadas, para você me cobrar pelo mesmo critério. Avaliar é de graça. Ser avaliado é o preço.

Lista de verificação
  • Avalie uma previsão pelas próprias palavras, no próprio prazo; "eventualmente" não é uma nota
  • Leve a sério as previsões de capacidade, até as mais radicais; as tendências continuam se confirmando
  • Dobre qualquer prazo de adoção que venha com data
  • Veja o que a pessoa que faz a previsão está vendendo
  • Anote suas próprias previsões com datas para alguém poder te avaliar de volta

Perguntas frequentes

Dario Amodei estava certo de que a IA escreveria 90% do código?

Não no prazo dele. Ele disse 90% em três a seis meses a partir de março de 2025, e praticamente todo o código em doze. Estimativas do setor no início de 2026 giraram entre 25% e 41%, com o Google em 75% do código novo em meados de 2026 contando todo autocompletar aceito. A direção estava certa e os números estavam errados.

Os agentes de IA entraram na força de trabalho em 2025?

Não fora da área de software. O projeto NANDA do MIT constatou que 95% dos projetos-piloto corporativos de IA generativa não produziram impacto mensurável no lucro, e o teste de empresa de agentes da Carnegie Mellon viu o melhor modelo terminar 30,3% das tarefas de escritório. Os agentes de programação dentro de empresas de software foram a única exceção real.

Quem previu 2025 na IA com mais precisão?

Gary Marcus, o cético, nas afirmações avaliadas aqui: sem AGI, agentes hipados mas não confiáveis, lucros ainda modestos, sem salto de consenso do GPT-5. As quatro se confirmaram. A lista dele também errou todo sucesso do ano, da categoria de ferramenta de programação de $4B ao ouro na Olimpíada de Matemática.