O que é janela de contexto? O limite da IA que explica tudo

Uma explicação em linguagem simples sobre janelas de contexto e tokens, por que a IA esquece coisas no meio da conversa, por que janelas maiores nem sempre são melhores e como trabalhar dentro delas.

A explicação simples

Uma janela de contexto é a quantidade total de texto que um modelo consegue manter à vista de uma só vez. Tudo o que o modelo sabe sobre a conversa atual precisa caber ali dentro: as suas instruções, cada mensagem que vocês dois enviaram, cada arquivo que você anexou e a resposta que ele está prestes a escrever.

Uma imagem mental útil: o modelo não tem memória nenhuma da sua conversa. Cada vez que você envia uma mensagem, a conversa inteira até ali é entregue a ele do zero, ele lê tudo e escreve a próxima resposta. A janela de contexto é o tamanho da mesa em que essa transcrição precisa caber. Quando a mesa lota, alguma coisa tem que sair.

É por isso que uma IA pode parecer afiada por vinte mensagens e depois começar a se contradizer, esquecer uma restrição que você definiu no início ou pedir um arquivo que você já entregou. Ela não ficou confusa. O começo da conversa escorregou para fora da mesa.

Uma distinção para acertar já de cara, porque ela causa muita confusão: a janela de contexto não é a mesma coisa que memória. Produtos como ChatGPT e Claude têm um recurso de memória separado, que guarda fatos sobre você entre conversas e os insere discretamente em conversas novas. Isso é um recurso de produto construído em cima do modelo. A janela de contexto é uma propriedade rígida do próprio modelo, e nenhum recurso de memória a deixa maior.

Tokens, e como estimá-los

As janelas de contexto são medidas em tokens, e não em palavras, porque os modelos não leem palavras. Eles leem pedaços: palavras comuns costumam ser um token, palavras longas ou incomuns se dividem em várias, e pontuação e espaços também contam.

As conversões aproximadas que vale a pena guardar:

  • 1 token equivale a cerca de 4 caracteres em inglês, ou cerca de três quartos de uma palavra.
  • 1.000 tokens são mais ou menos 750 palavras, algo como uma página e meia de prosa normal.
  • Código é mais denso. Espere algo próximo de um token a cada três caracteres, por causa de símbolos, indentação e identificadores incomuns.
  • Outros idiomas são menos eficientes. Texto em idiomas menos representados no tokenizador pode consumir duas ou três vezes mais tokens para o mesmo sentido, o que é bom saber se você paga por token.

Isso dá a você uma forma de visualizar os números que aparecem no material de marketing:

Janela de contextoEquivale mais ou menos a
8.000 tokensUm artigo longo
32.000 tokensUm artigo científico curto com anotações
128.000 tokensUm livro de 300 páginas
200.000 tokensUm manual técnico denso, ou uma base de código de porte médio
1.000.000 de tokensVários livros, ou um ano de transcrições de reuniões

O que essa tabela esconde é o mais importante: o limite cobre a conversa inteira, não cada mensagem. Uma janela de 128.000 tokens não significa que você pode enviar 128.000 tokens repetidamente. Significa que o total acumulado de tudo, incluindo as respostas do próprio modelo, precisa ficar abaixo desse número.

O que realmente enche a sua janela

As pessoas costumam se surpreender com a velocidade com que a janela enche, porque a maior parte do que entra nela é invisível. Em uma sessão de chat típica, o modelo lê tudo isto a cada turno:

  1. O prompt de sistema. Instruções que o produto envia antes de você digitar qualquer coisa: como se comportar, quais ferramentas existem, a data de hoje, regras de segurança. Muitas vezes são milhares de tokens, e você nunca os vê.
  2. As suas instruções personalizadas ou a memória. Qualquer coisa que o produto guardou sobre você e injeta automaticamente.
  3. Cada mensagem anterior, as suas e as do modelo, na íntegra. As respostas longas do modelo também contam, e costumam ser as que mais pesam.
  4. Cada arquivo enviado, ou os trechos extraídos dele. Um PDF de 40 páginas dá mais ou menos 20.000 a 30.000 tokens.
  5. Resultados de ferramentas e buscas. Uma busca na web que puxa cinco páginas pode acrescentar mais do que toda a sua conversa até ali.
  6. A resposta que está sendo gerada. A saída divide o mesmo orçamento com a entrada.

É por isso que uma conversa que pareceu curta pode estar perto do limite. Você mandou oito mensagens curtas, mas o modelo escreveu oito respostas longas, você anexou dois documentos e ele rodou três buscas. A parte visível disso é talvez dez por cento do total.

É também por isso que a solução para uma conversa confusa é tantas vezes "comece um chat novo". Você não está resetando o humor do modelo. Você está limpando a mesa.

Tamanho anunciado versus tamanho útil

Esta é a parte que mais importa e que menos se discute. A qualidade de um modelo não fica estável até o limite para então despencar de uma vez. Ela cai aos poucos, e começa a cair bem antes do limite.

A versão mais bem documentada disso costuma ser chamada de efeito "perdido no meio" (lost in the middle). Coloque um fato específico no começo de um documento longo e o modelo encontra. Coloque no fim e o modelo encontra. Enterre no meio de 200 páginas e a precisão da recuperação cai de forma perceptível. A atenção não se distribui de maneira uniforme por uma entrada longa, e as pontas recebem mais.

Fica mais difícil ainda quando a tarefa exige combinar vários fatos espalhados por uma entrada longa. Achar uma agulha no palheiro é um problema resolvido. Achar quatro agulhas e raciocinar sobre a relação entre elas não é, e é exatamente para isso que as pessoas usam janelas de contexto grandes.

Então trate o número anunciado como capacidade máxima, não como faixa de trabalho confortável. Uma regra prática vinda do uso real: você tem comportamento confiável até mais ou menos metade da janela anunciada, e deve verificar qualquer coisa além disso em vez de confiar. Se um modelo disser que um contrato de 300 páginas não tem cláusula de rescisão, confira, principalmente se a cláusula estiver no meio.

A implicação para comparações é que um modelo com janela de um milhão de tokens não é automaticamente melhor com documentos longos do que um de 200.000. Ele é melhor em aceitá-los. Se ele raciocina bem sobre tudo aquilo é outra questão, e o único jeito de saber é testar com um documento cuja resposta você já conhece.

O que acontece quando a janela acaba

Cada produto lida com o excesso de um jeito, e saber qual deles você está usando explica muito comportamento estranho.

ComportamentoO que você vêOnde acontece
Erro diretoO pedido é recusado com uma mensagem sobre extensãoA maior parte do uso direto de API
Corte silenciosoAs mensagens mais antigas somem sem avisoMuitas interfaces de chat
Resumo contínuoMensagens antigas são comprimidas em um resumoCada vez mais comum em produtos de chat
RecuperaçãoSó as partes relevantes dos seus documentos são buscadas a cada turnoFerramentas de documentos e de base de conhecimento

O corte silencioso é o que causa problema de verdade, porque nada o anuncia. O sintoma é um modelo que de repente ignora uma regra que você definiu no começo, volta a um tom que você corrigiu uma hora atrás ou faz uma pergunta que você já respondeu. Nada deu errado com o modelo. Aquelas instruções simplesmente não estão mais sobre a mesa.

Os resumos contínuos são melhores, mas perdem informação. Um resumo guarda a essência e descarta os detalhes, então a restrição "nunca use a palavra sinergia" sobrevive como "o usuário tem preferências de estilo", o que não ajuda em nada.

Táticas práticas que funcionam de verdade

Elas estão ordenadas pela diferença que fazem em relação ao esforço.

Comece um chat novo quando o assunto mudar. É o hábito de maior valor da lista. Uma conversa longa carrega o custo de tudo que veio antes, incluindo tangentes que já não são relevantes. Conversas longas não são mais bem informadas, elas são mais caras e mais diluídas.

Coloque a sua pergunta depois do material longo, não antes. Se você cola um documento e só então pergunta, a pergunta fica perto de onde a resposta é gerada, o que melhora a precisão de forma mensurável em entradas longas. Primeiro cole, depois pergunte.

Reancore as restrições importantes. Em qualquer conversa que passe de umas quinze trocas, repita as regras que importam na mensagem em que elas importam: "lembrando: português do Brasil, sem bullet points, menos de 400 palavras". Custa uma linha e sobrevive ao corte.

Envie as páginas relevantes, não o livro inteiro. Se você precisa que o modelo confira a cláusula de indenização, dê a ele a cláusula de indenização e as vizinhas. Precisão vence volume: é mais rápido, mais barato e mais preciso.

Resuma e recomece de propósito. Quando uma sessão de trabalho fica longa, peça uma passagem de bastão estruturada: estado atual, decisões tomadas, questões em aberto, restrições. Cole isso em um chat novo. Você mantém a substância e joga fora o ruído, e vai notar que o modelo fica mais afiado na hora.

Use recuperação para tudo que não couber. Se o seu material é genuinamente maior do que qualquer janela, a resposta não é uma janela maior, é buscar os trechos relevantes a cada pergunta. É isso que as ferramentas de documentos fazem por baixo do capô.

Fique atento à degradação, não só aos erros. Se as respostas ficam mais vagas, cheias de ressalvas, ou passam a ignorar instruções de formato, você provavelmente está fundo na janela. Recomece do zero antes de concluir que o modelo piorou.

De quanta janela você precisa de verdade?

Combine a janela com o trabalho, em vez de sair atrás do maior número.

O seu trabalhoO que você precisaPor quê
E-mails, redação, perguntas rápidasQualquer coisa modernaVocê nunca vai chegar perto do limite
Edição de documentos longos100.000 ou maisO documento mais a sua conversa sobre ele
Revisão de contratos e políticas200.000 ou mais, e verifiqueO documento mais o raciocínio sobre ele, com a ressalva acima
Raciocínio sobre uma base de código inteiraA maior disponívelCódigo é denso em tokens e raciocinar entre arquivos exige amplitude
Análise de meses de transcriçõesA maior disponível, ou recuperaçãoMuitas vezes a recuperação serve melhor do que a força bruta
Construir um produto sobre uma APIMenor do que você imagina, mais cachePrompts longos são o principal motor de custo e de latência

Para a maioria das pessoas, a resposta honesta é que a janela de contexto não é o fator decisivo entre assinaturas. Qualidade de escrita, ecossistema e preço pesam mais. Ela vira o fator decisivo em exatamente uma situação: o seu trabalho envolve regularmente alimentar mais material do que uma janela normal comporta. Nesse caso a diferença não é marginal, é a diferença entre possível e impossível.

Se você quiser testar isso por conta própria, o jeito prático é rodar o mesmo documento longo em dois ou três modelos e conferir as respostas contra algo que você já sabe. Um espaço de trabalho como o Whizi facilita isso porque GPT, Claude, Gemini, Grok e DeepSeek ficam atrás de uma assinatura só, e a janela enorme do Gemini está a um clique da síntese cuidadosa do Claude. Veja como comparar modelos lado a lado, ou leia como escolher um modelo de IA para a decisão mais ampla.

Lista de verificação
  • Estime a contagem de tokens com a regra de que 1.000 tokens são cerca de 750 palavras
  • Lembre que prompts de sistema, arquivos, resultados de busca e respostas consomem o mesmo orçamento
  • Trate mais ou menos metade da janela anunciada como a faixa de trabalho confiável
  • Cole o material longo primeiro e faça a sua pergunta depois
  • Repita as restrições críticas em conversas longas para que elas sobrevivam ao corte
  • Comece um chat novo com uma passagem de bastão escrita em vez de esticar um chat longo

Perguntas frequentes

O que é janela de contexto em termos simples?

É a quantidade total de texto que um modelo consegue manter à vista de uma vez, incluindo as suas instruções, toda a conversa até ali, os arquivos enviados e a resposta que está sendo escrita. Quando o total passa do limite, as partes mais antigas caem fora, e é por isso que chats longos começam a esquecer coisas.

Uma janela de contexto maior é sempre melhor?

Não. Uma janela maior deixa o modelo aceitar mais entrada, mas a precisão cai aos poucos conforme a entrada cresce, principalmente para fatos enterrados no meio. Um modelo com janela de um milhão de tokens não é automaticamente melhor com documentos longos do que um de 200.000, então teste com material cuja resposta certa você já conhece.

Quantas palavras são 128.000 tokens?

Mais ou menos 96.000 palavras, ou cerca de um livro de 300 páginas. A conversão geral é que um token equivale a uns quatro caracteres em inglês, então 1.000 tokens dão por volta de 750 palavras. Código e texto fora do inglês consomem mais tokens para o mesmo conteúdo.

Por que o ChatGPT esquece o que eu disse antes?

Porque a conversa passou da janela de contexto e as mensagens mais antigas foram descartadas ou comprimidas para abrir espaço. A maioria das interfaces de chat faz isso em silêncio. Repetir as suas restrições principais, ou começar um chat novo com um resumo curto, resolve na hora.

A janela de contexto é a mesma coisa que a memória da IA?

Não. A janela de contexto é um limite rígido de uma única conversa. A memória é um recurso de produto separado, que salva fatos sobre você entre conversas e os insere em conversas novas. A memória não aumenta a janela, ela usa parte dela.