Whizi : contexte trop long, la conversation ou le document dépasse le modèle

Réponse rapide

Whizi n'affiche aucune erreur de limite de contexte. Une conversation qui dépasse le modèle est raccourcie pour tenir avant l'envoi de la requête, silencieusement. Quatre limites refusent bel et bien un message : 100,000 caractères dans un seul message, 100 messages dans une seule requête, un corps de requête au-dessus du plafond de la route, et un prompt système de 32,000 caractères.

La réponse courte

Whizi n'affiche pas d'erreur de limite de contexte. Aucune chaîne du produit ne mentionne une fenêtre de contexte ou une limite de tokens, car une conversation qui dépasse le modèle est raccourcie pour tenir avant l'envoi de la requête plutôt que refusée. Rien ne vous indique que cela s'est produit. Si le modèle semble avoir oublié le milieu d'une longue conversation, c'est ce que vous observez.

Quatre choses vous refusent bel et bien, et chacune se nomme :

MessageCode HTTPDéclencheur
This message is {count} characters, over the 100,000 character limit. Attach a shorter file, or ask about one section at a time.400 message_too_longUn message, y compris le texte extrait de vos fichiers, dépasse 100,000 caractères
This conversation has {count} messages, over the 100 message limit.400 too_many_messagesUne seule requête contenait une transcription de plus de 100 messages
Request is too large.413 request_too_largeLe corps JSON entier de la requête dépassait le plafond d'octets de la route
That system prompt is missing or over the 32,000 character limit.400 invalid_system_promptUn prompt système de plus de 32,000 caractères

Le {count} dans la chaîne de la limite de caractères est rempli avec votre vrai nombre, formaté avec des séparateurs de milliers. Le code à côté de chaque chaîne est ce qui s'affiche dans une trace réseau, même quand l'interface ne montre que la phrase.

Si vous avez vu un message qui nomme une longueur de contexte ou un nombre de tokens, il ne vient pas de Whizi. Passez à la dernière section.

Le budget que reçoit chaque modèle, et ce qui se passe au-delà

Chaque modèle du catalogue reçoit le même budget pour un tour : 40,000 tokens en entrée et 20,000 tokens en sortie. L'agent CPA canadien est la seule exception, avec 55,000 tokens en entrée et 40,000 tokens en sortie.

Quand une conversation dépasse ce budget, le backend raccourcit l'historique au budget de tokens du modèle silencieusement plutôt que de refuser. Il n'y a ni toast, ni bannière, ni code d'erreur pour cela.

Le nombre de tokens sur lequel Whizi se base pour raccourcir est une estimation plutôt qu'un vrai tokenizer. Il peut sous-compter par rapport à un vrai tokenizer jusqu'à 1.66 fois sur du JSON, donc une marge de 1.8 fois est appliquée à l'entrée pour couvrir le pire cas mesuré.

Passer à un modèle avec un contexte plus grand n'envoie pas plus

C'est la solution erronée la plus courante. Le budget de 40,000 tokens en entrée est fixe : il est identique sur un modèle avec une fenêtre d'un million de tokens que sur un modèle avec une fenêtre de 200,000 tokens. Déplacer une longue conversation d'un modèle à grande fenêtre vers un autre ne change rien à la quantité envoyée.

La taille de la fenêtre de contexte ne change le budget que dans un sens, vers le bas. Tout modèle dont la fenêtre se situe sous 93,000 tokens reçoit un budget plus petit et proportionnel au lieu du budget fixe, avec une sortie plafonnée à 40 pour cent de la fenêtre et une marge de sécurité de 1,000 tokens retenue. 31 modèles du catalogue sont limités ainsi, et la plus petite fenêtre parmi eux est de 6,144 tokens.

Le changement qui aide vraiment est donc l'opposé de celui que les gens essaient : passer d'un modèle petit et limité à un modèle ordinaire. Passer d'un modèle à grande fenêtre à un autre est un changement sans effet sur la longueur. Le comportement du changement de modèle en cours de conversation est couvert dans le changement de modèle en cours de conversation.

Un détail derrière le chiffre de 93,000, utile à connaître si vous vous demandez pourquoi un modèle a refusé quelque chose de petit : OpenRouter compte l'entrée plus la sortie maximale demandée contre la fenêtre d'un modèle, pas seulement l'entrée.

Un long fichier envoyé est coupé, et cela vous est signalé

Les fichiers envoyés sont la raison habituelle pour laquelle un seul message dépasse 100,000 caractères, car les fichiers PDF, Word et tableurs sont extraits en texte dans votre navigateur, et ce texte compte dans le même plafond que tout ce que vous avez tapé.

Quand le texte extrait ne tient pas, il est raccourci plutôt que refusé, et deux chaînes apparaissent. Le toast indique Your upload was too large, so only the first part of it was sent. Ask about a smaller section for full coverage. Le message lui-même porte le repère [Attachment truncated: the upload was larger than one message can carry, so the content past this point was not included.] à l'endroit de la coupure, pour que le modèle puisse voir où sa copie s'arrête.

Si le message est refusé plutôt que raccourci, vous obtenez la chaîne message_too_long du premier tableau. La solution est celle que l'erreur elle-même nomme : joindre un fichier plus court, ou poser une question sur une section à la fois.

Un autre comportement qui ressemble à de l'oubli : seul le message utilisateur le plus récent portant des pièces jointes voit ses pièces jointes transmises au modèle. Une image ou un PDF que vous avez joint dix tours plus tôt n'est pas renvoyé à chaque tour suivant. Si vous avez besoin que le modèle le revoie, joignez-le à nouveau. Ce que Whizi accepte et comment fonctionne l'extraction est décrit dans les types de fichiers pris en charge.

Une remarque sur le coût, puisque la longueur change la valeur d'un tour. Sur Auto, un message de plus d'environ 6,000 caractères est acheminé vers le palier long à 4 crédits, sur le raisonnement qu'un message aussi long est un document collé plutôt qu'une question. Une question courte est acheminée vers le palier rapide à 1 crédit. L'échelle de crédits est détaillée dans comment fonctionnent les crédits.

Les fichiers épinglés d'un projet sont facturés au prompt à chaque tour

Un fichier de projet épinglé accompagne le prompt en tant que texte à chaque tour de ce projet plutôt qu'une seule fois, ce pourquoi les images sont délibérément exclues des types de fichiers épinglables.

Les plafonds sont propres à chacun : chaque fichier épinglé contribue au maximum 32,000 caractères de texte extrait, et le bloc de projet entier est plafonné à 120,000 caractères, sur au maximum 10 fichiers épinglés. Les instructions personnalisées du projet peuvent aller jusqu'à 32,000 caractères.

Les fichiers épinglés et les instructions sont reconstruits dans le prompt à chaque tour de ce projet, à l'intérieur du même budget d'entrée que la conversation. Si une conversation de projet semble perdre le fil plus vite qu'une conversation ordinaire, désépinglez les fichiers dont vous ne parlez pas.

Si vous avez bien vu une erreur de longueur de contexte

Alors elle vient du fournisseur du modèle, pas de Whizi, et elle vous est parvenue via le relais (passthrough). Tout échec en amont qui n'est pas une limite de débit est renvoyé en HTTP 502 avec le code provider_error, portant le message du fournisseur, tronqué à 300 caractères. Quand le corps de l'erreur du fournisseur ne peut pas être analysé du tout, vous obtenez The model provider rejected the request. à la place.

Un refus du fournisseur pour cause de longueur nommera une longueur de contexte et un nombre de tokens. Ces nombres correspondent au fournisseur qui compte votre requête contre une fenêtre plus petite que le budget envoyé par Whizi, et ce sont exactement les informations dont le support a besoin pour l'examiner.

Aucun réglage de l'interface ne change cela. Passez à un autre modèle pour obtenir votre réponse, et envoyez au support le message exact avec les nombres.

Deux autres chaînes que les gens confondent avec un problème de longueur. Generation failed mid-stream. et The model stream was interrupted. sont des échecs de connexion en cours de réponse, pas des refus de longueur. Réessayez ceux-là. Too many requests. Please wait and try again. est une limite de débit à 10 messages par minute, qui n'a elle aussi rien à voir avec la longueur.

Liste de vérification
  • Whizi n'a pas d'erreur de limite de contexte : il raccourcit la conversation silencieusement
  • Chaque modèle reçoit un budget fixe de 40,000 tokens en entrée et 20,000 en sortie par tour
  • L'agent CPA canadien est la seule exception, avec 55,000 en entrée et 40,000 en sortie
  • Une fenêtre sous 93,000 tokens abaisse ce budget, elle ne l'augmente jamais
  • Un message est plafonné à 100,000 caractères, texte de fichier extrait inclus
  • Une requête porte au maximum 100 messages de transcription
  • Seul le message le plus récent portant une pièce jointe transmet ses pièces jointes
  • Un fichier de projet épinglé accompagne le prompt en tant que texte à chaque tour de ce projet
  • Sur Auto, un message de plus d'environ 6,000 caractères est acheminé vers le palier long à 4 crédits
  • Un message nommant une longueur de contexte vient du fournisseur : changez de modèle et prévenez le support

Questions fréquentes

Whizi a-t-il une erreur de limite de contexte ?

Pas de type contexte. Les messages de longueur que Whizi affiche bien sont des compteurs, pas des fenêtres : 100,000 caractères dans un message, 100 messages dans une requête, 32,000 caractères dans un prompt système, et un 413 Request is too large. sur le corps entier de la requête. Si le message devant vous nomme un nombre de tokens ou une longueur de contexte, il vous est parvenu via le relais 502 du fournisseur et appartient au fournisseur du modèle.

Pourquoi le modèle a-t-il oublié quelque chose que j'ai dit plus tôt dans la conversation ?

Parce que cela a été retiré de la requête avant son envoi. Le backend raccourcit l'historique au budget de tokens du modèle silencieusement plutôt que de refuser, donc il n'y a aucune erreur à lire et aucun réglage pour désactiver cela. Démarrer une nouvelle conversation quand le sujet change est la réponse pratique.

Passer à un modèle avec une fenêtre de contexte plus grande me permettra-t-il d'envoyer plus ?

Non. Le budget d'entrée est fixe à 40,000 tokens sur tous les modèles du catalogue, donc une fenêtre d'un million de tokens et une fenêtre de 200,000 tokens reçoivent la même quantité de votre conversation.

Que signifie "over the 100,000 character limit" ?

Un message a dépassé le plafond de 100,000 caractères par message et a été refusé avec un HTTP 400 et le code message_too_long. Le texte extrait d'un PDF, d'un fichier Word ou d'un tableur joint compte dans le même plafond, donc un fichier envoyé est la cause habituelle plutôt que la frappe. La solution est dans le message lui-même : joindre un fichier plus court, ou poser une question sur une section à la fois dans la même conversation.

Que signifie "over the 100 message limit" ?

Une seule requête portait une transcription de plus de 100 messages, et elle a été refusée avec un HTTP 400 et le code too_many_messages. C'est un plafond sur ce qu'une requête peut porter, pas un plafond sur la durée d'une conversation. Démarrer une nouvelle conversation pour le sujet suivant est la réponse pratique, et cela donne aussi au modèle une vue plus claire de ce que vous demandez.

Comment résumer un document plus long que la limite ?

Découpez-le et travaillez section par section dans une même conversation, ce que la chaîne message_too_long recommande elle-même. Demandez un résumé de chaque section, puis un résumé de ces résumés. Si une seule section dépasse encore 100,000 caractères une fois son texte extrait, découpez à nouveau cette section.

Puis-je payer pour un budget de contexte plus grand ?

Non. Le budget est une propriété du modèle dans le catalogue plutôt que de votre forfait, et aucun réglage nulle part ne l'augmente. Ce qu'un forfait supérieur achète, c'est l'accès à plus de modèles et une allocation mensuelle plus grande, pas plus de place dans un seul tour. La correspondance des forfaits est dans la référence des modèles.