A resposta curta
O Whizi não mostra erro de limite de contexto. Nenhum texto do produto menciona janela de contexto ou limite de tokens, porque uma conversa que ultrapassa o modelo é reduzida para caber antes de o pedido ser enviado, em vez de recusada. Nada avisa que isso aconteceu. Se o modelo parece ter esquecido o meio de uma conversa longa, é isso que você está vendo.
Quatro coisas de fato recusam o pedido, e cada uma se identifica:
| Mensagem | Código HTTP | Gatilho |
|---|---|---|
This message is {count} characters, over the 100,000 character limit. Attach a shorter file, or ask about one section at a time. | 400 message_too_long | Uma mensagem, incluindo o texto extraído dos seus arquivos, tem mais de 100.000 caracteres |
This conversation has {count} messages, over the 100 message limit. | 400 too_many_messages | Um único pedido carregava um histórico com mais de 100 mensagens |
Request is too large. | 413 request_too_large | O corpo do pedido JSON inteiro ultrapassou o limite de bytes da rota |
That system prompt is missing or over the 32,000 character limit. | 400 invalid_system_prompt | Um prompt de sistema com mais de 32.000 caracteres |
O {count} na mensagem de limite de caracteres é preenchido com o seu número real, formatado com separadores de milhar. O código ao lado de cada mensagem é o que aparece em um registro de rede, mesmo quando a interface só mostra a frase.
Se você viu uma mensagem que cita um comprimento de contexto ou uma contagem de tokens, ela não veio do Whizi. Pule para a última seção.
O orçamento que todo modelo recebe, e o que acontece além dele
Todo modelo do catálogo recebe o mesmo orçamento para um turno: 40.000 tokens de entrada e 20.000 tokens de saída. O agente de CPA canadense é a única exceção, com 55.000 tokens de entrada e 40.000 tokens de saída.
Quando uma conversa ultrapassa esse orçamento, o backend reduz o histórico para caber no orçamento de tokens do modelo silenciosamente, em vez de recusar. Não há toast, não há banner e não há código de erro para isso.
A contagem de tokens usada pelo Whizi para cortar é uma estimativa, não a de um tokenizador real. Ela pode subestimar um tokenizador real em até 1,66 vez em JSON, então uma margem de 1,8 vez é aplicada à entrada para cobrir o pior caso medido.
Trocar para um modelo com contexto maior não envia mais conteúdo
Esse é o erro mais comum de correção. O orçamento de 40.000 tokens de entrada é fixo: é o mesmo em um modelo com janela de um milhão de tokens e em um modelo com janela de 200.000 tokens. Mover uma conversa longa de um modelo de janela grande para outro não muda nada sobre quanto dela é enviado.
O tamanho da janela de contexto só muda o orçamento em uma direção, para baixo. Qualquer modelo cuja janela fique abaixo de 93.000 tokens recebe um orçamento menor e proporcional em vez do fixo, com a saída limitada a 40 por cento da janela e uma margem de segurança de 1.000 tokens reservada. 31 modelos do catálogo são limitados assim, e a menor janela entre eles é de 6.144 tokens.
Então a mudança que de fato ajuda é o oposto do que as pessoas tentam: sair de um modelo pequeno e limitado para um modelo comum. Mover entre dois modelos de janela grande é uma mudança sem efeito no comprimento. Como o comportamento muda ao trocar de modelo no meio da conversa está em trocar de modelo no meio da conversa.
Um detalhe por trás do número 93.000, útil se você está tentando entender por que um modelo recusou algo pequeno: o OpenRouter conta a entrada mais a saída máxima solicitada contra a janela do modelo, não só a entrada.
Um upload longo é cortado, e o Whizi avisa
Uploads costumam ser o motivo de uma única mensagem ultrapassar 100.000 caracteres, porque arquivos PDF, Word e planilhas são extraídos como texto no seu navegador, e esse texto conta para o mesmo limite de qualquer coisa que você digitou.
Quando o texto extraído não cabe, ele é reduzido em vez de recusado, e duas mensagens aparecem. O toast diz Your upload was too large, so only the first part of it was sent. Ask about a smaller section for full coverage. A própria mensagem carrega o marcador [Attachment truncated: the upload was larger than one message can carry, so the content past this point was not included.] no ponto do corte, para que o modelo veja onde a sua cópia termina.
Se a mensagem for recusada em vez de reduzida, você recebe a mensagem message_too_long da primeira tabela. A solução é a que o próprio erro indica: anexe um arquivo menor, ou pergunte sobre uma seção por vez.
Mais um comportamento que parece esquecimento: só os anexos da mensagem mais recente do usuário que carrega anexos são reenviados ao modelo. Uma imagem ou PDF anexado dez turnos atrás não é reenviado a cada turno seguinte. Se precisar que o modelo olhe para ele de novo, anexe-o de novo. O que o Whizi aceita e como funciona a extração está em tipos de arquivo suportados.
Uma observação sobre custo, já que o comprimento muda o valor de um turno. No Auto, uma mensagem com mais de cerca de 6.000 caracteres é roteada para o degrau de formato longo, a 4 créditos, com o raciocínio de que uma mensagem tão longa é um documento colado, não uma pergunta. Uma pergunta curta é roteada para o degrau rápido, a 1 crédito. A escala de créditos está em como funcionam os créditos.
Arquivos fixados do projeto são cobrados no prompt a cada turno
Um arquivo fixado no projeto viaja como texto do prompt em cada turno daquele projeto, em vez de apenas uma vez, e é por isso que imagens são deliberadamente excluídas dos tipos de arquivo fixáveis.
Os limites são próprios: cada arquivo fixado contribui com no máximo 32.000 caracteres de texto extraído, e o bloco inteiro do projeto é limitado a 120.000 caracteres, entre no máximo 10 arquivos fixados. As instruções personalizadas do projeto podem ter até 32.000 caracteres.
Arquivos fixados e instruções são reconstruídos no prompt a cada turno daquele projeto, dentro do mesmo orçamento de entrada da conversa. Se um chat de projeto parece perder o fio mais rápido do que um chat comum, desfixe os arquivos sobre os quais você não está perguntando.
Se você viu um erro de comprimento de contexto
Então ele veio do provedor do modelo, não do Whizi, e chegou até você pelo repasse direto. Qualquer falha do provedor que não seja um limite de taxa é retornada como HTTP 502 com o código provider_error, carregando a mensagem do provedor, cortada em 300 caracteres. Quando o corpo do erro do provedor não pode ser interpretado de forma alguma, você recebe The model provider rejected the request. em vez disso.
Uma recusa do provedor por comprimento vai citar um comprimento de contexto e uma contagem de tokens. Esses números são o provedor contando o seu pedido contra uma janela menor que o orçamento enviado pelo Whizi, e são exatamente o que o suporte precisa ver.
Nenhuma configuração da interface muda isso. Troque de modelo para conseguir sua resposta, e envie ao suporte a mensagem exata, incluindo os números.
Mais duas mensagens que as pessoas confundem com problema de comprimento. Generation failed mid-stream. e The model stream was interrupted. são falhas de conexão no meio de uma resposta, não recusas por comprimento. Tente de novo nesses casos. Too many requests. Please wait and try again. é um limite de taxa de 10 mensagens por minuto, que também nada tem a ver com comprimento.
- O Whizi não tem erro de limite de contexto: ele reduz a conversa silenciosamente
- Todo modelo recebe um orçamento fixo de 40.000 tokens de entrada e 20.000 de saída por turno
- O agente de CPA canadense é a única exceção, com 55.000 de entrada e 40.000 de saída
- Uma janela abaixo de 93.000 tokens reduz esse orçamento, nunca o aumenta
- Uma mensagem é limitada a 100.000 caracteres, incluindo texto extraído de arquivos
- Um pedido carrega no máximo 100 mensagens de histórico
- Só a mensagem com anexo mais recente reenvia seus anexos
- Um arquivo fixado no projeto viaja como texto do prompt em todo turno daquele projeto
- No Auto, uma mensagem com mais de cerca de 6.000 caracteres vai para o degrau de formato longo, a 4 créditos
- Uma mensagem que cita um comprimento de contexto veio do provedor: troque de modelo e avise o suporte
Perguntas frequentes
O Whizi tem erro de limite de contexto?
Não um de contexto. As mensagens de comprimento que o Whizi de fato mostra são contagens, não janelas: 100.000 caracteres em uma mensagem, 100 mensagens em um pedido, 32.000 caracteres em um prompt de sistema, e um 413 Request is too large. no pedido inteiro. Se a mensagem à sua frente cita uma contagem de tokens ou um comprimento de contexto, ela chegou por meio do repasse 502 do provedor e pertence ao provedor do modelo.
Por que o modelo esqueceu algo que eu disse antes na conversa?
Porque isso foi removido do pedido antes de o pedido ser enviado. O backend reduz o histórico para o orçamento de tokens do modelo silenciosamente, em vez de recusar, então não há erro para ler nem configuração que desative isso. Começar uma nova conversa quando o assunto muda é a resposta prática.
Trocar para um modelo com janela de contexto maior vai deixar eu enviar mais?
Não. O orçamento de entrada é fixo em 40.000 tokens em todo modelo do catálogo, então uma janela de um milhão de tokens e uma janela de 200.000 tokens recebem a mesma quantidade da sua conversa.
O que significa "over the 100,000 character limit"?
Uma mensagem ultrapassou o limite por mensagem de 100.000 caracteres e foi recusada com HTTP 400 e o código message_too_long. O texto extraído de um PDF, arquivo Word ou planilha anexado conta para o mesmo limite, então um upload costuma ser a causa, não a digitação. A solução está na própria mensagem: anexe um arquivo menor, ou pergunte sobre uma seção por vez na mesma conversa.
O que significa "over the 100 message limit"?
Um único pedido carregava um histórico com mais de 100 mensagens, e foi recusado com HTTP 400 e o código too_many_messages. É um limite sobre o que um pedido pode carregar, não um limite sobre a duração de um chat. Começar uma nova conversa para o próximo assunto é a resposta prática, e também dá ao modelo uma visão mais clara do que você está perguntando.
Como resumir um documento mais longo que o limite?
Divida o documento e trabalhe seção por seção na mesma conversa, que é o que a própria mensagem message_too_long recomenda. Peça um resumo de cada seção, depois um resumo desses resumos. Se uma única seção ainda ultrapassar 100.000 caracteres depois de o texto do arquivo ser extraído, divida essa seção de novo.
Posso pagar por um orçamento de contexto maior?
Não. O orçamento é uma propriedade do modelo no catálogo, não do seu plano, e não existe nenhuma configuração em lugar nenhum que o aumente. O que um plano superior compra é acesso a mais modelos e uma cota mensal maior, não mais espaço em um único turno. O mapeamento de planos está em a referência de modelos.