Het korte antwoord
Whizi toont geen foutmelding over een contextlimiet. Geen enkele tekst in het product noemt een contextvenster of een tokenlimiet, want een gesprek dat groter wordt dan het model kan verwerken, wordt ingekort voordat het verzoek wordt verstuurd, in plaats van geweigerd. Er wordt je nergens verteld dat dit gebeurt. Als het model het middenstuk van een lang gesprek lijkt te zijn vergeten, is dit precies wat er is gebeurd.
Vier dingen weigeren je bericht wel regelrecht, en elk noemt zichzelf:
| Bericht | HTTP-code | Aanleiding |
|---|---|---|
This message is {count} characters, over the 100,000 character limit. Attach a shorter file, or ask about one section at a time. | 400 message_too_long | Eén bericht, inclusief tekst die uit je bestanden is gehaald, is meer dan 100,000 tekens |
This conversation has {count} messages, over the 100 message limit. | 400 too_many_messages | Eén verzoek bevatte een transcript van meer dan 100 berichten |
Request is too large. | 413 request_too_large | De hele JSON-body van het verzoek ging over de bytelimiet van de route |
That system prompt is missing or over the 32,000 character limit. | 400 invalid_system_prompt | Een systeemprompt van meer dan 32,000 tekens |
De {count} in de tekenlimietstring wordt vervangen door je eigen aantal, opgemaakt met duizendtalscheidingstekens. De code naast elke string is wat je in een netwerktrace ziet, ook als de interface je alleen de zin zelf toont.
Als je een bericht zag dat een contextlengte of een aantal tokens noemt, kwam dat niet van Whizi. Ga direct naar de laatste sectie.
Het budget dat elk model krijgt, en wat er gebeurt als je eroverheen gaat
Elk model in de catalogus krijgt hetzelfde budget voor één beurt: 40,000 inputtokens en 20,000 outputtokens. De Canadese CPA-agent is de enige uitzondering, met 55,000 inputtokens en 40,000 outputtokens.
Als een gesprek dat budget overschrijdt, kort de backend de geschiedenis stilletjes in tot het tokenbudget van het model, in plaats van het bericht te weigeren. Daar komt geen melding, geen banner en geen foutcode bij kijken.
Het aantal tokens waarop Whizi inkort is een schatting, geen echte tokenizer. Bij JSON kan die schatting tot 1.66 keer lager uitvallen dan een echte tokenizer, dus wordt op de input een marge van 1.8 keer toegepast om het slechtst gemeten geval af te dekken.
Overstappen naar een model met een groter contextvenster verstuurt niet meer
Dit is de meest gemaakte verkeerde oplossing. Het inputbudget van 40,000 tokens is vast: het is hetzelfde bij een model met een venster van één miljoen tokens als bij een model met een venster van 200,000 tokens. Een lang gesprek verplaatsen van het ene grote-venstermodel naar het andere verandert niets aan hoeveel ervan wordt verstuurd.
De grootte van het contextvenster verandert het budget maar in één richting, namelijk omlaag. Elk model waarvan het venster onder de 93,000 tokens ligt, krijgt in plaats van het vaste budget een kleiner, evenredig budget, waarbij de output wordt begrensd op 40 procent van het venster en een veiligheidsmarge van 1,000 tokens wordt achtergehouden. 31 modellen in de catalogus worden op deze manier begrensd, en het kleinste venster daaronder is 6,144 tokens.
De aanpassing die wel helpt is dus het tegenovergestelde van wat mensen meestal proberen: overstappen van een klein, begrensd model naar een gewoon model. Overstappen tussen twee grote-venstermodellen is een verandering zonder enig effect op de lengte. Hoe overstappen midden in een gesprek zich gedraagt, staat beschreven in overstappen van model midden in een gesprek.
Eén detail achter het getal 93,000, goed om te weten als je probeert te begrijpen waarom een model iets kleins weigerde: OpenRouter telt input plus de opgevraagde maximale output mee tegen het venster van een model, niet alleen de input.
Een lange upload wordt afgekapt, en dat wordt gemeld
Uploads zijn meestal de reden dat één bericht over de 100,000 tekens gaat, omdat PDF-, Word- en spreadsheetbestanden in je browser worden omgezet naar tekst, en die tekst telt mee tegen dezelfde limiet als alles wat je zelf typt.
Als de geëxtraheerde tekst niet past, wordt hij ingekort in plaats van geweigerd, en verschijnen er twee teksten. De melding luidt Your upload was too large, so only the first part of it was sent. Ask about a smaller section for full coverage. Het bericht zelf draagt op de plek van de afkapping de markering [Attachment truncated: the upload was larger than one message can carry, so the content past this point was not included.], zodat het model kan zien waar zijn kopie stopt.
Als het bericht wordt geweigerd in plaats van ingekort, krijg je de string message_too_long uit de eerste tabel. De oplossing is precies wat de foutmelding zelf aangeeft: voeg een korter bestand toe, of vraag telkens naar één sectie tegelijk.
Nog een gedrag dat op vergeten lijkt: alleen het meest recente gebruikersbericht met bijlagen krijgt zijn bijlagen doorgestuurd naar het model. Een afbeelding of PDF die je tien beurten geleden toevoegde, wordt niet bij elke volgende beurt opnieuw meegestuurd. Als je wilt dat het model er opnieuw naar kijkt, voeg je hem opnieuw toe. Wat Whizi accepteert en hoe extractie werkt, staat in ondersteunde bestandstypen.
Nog een opmerking over kosten, want lengte bepaalt wat een beurt waard is. Bij Auto wordt een bericht van meer dan ongeveer 6,000 tekens naar de langevormtrede gerouteerd voor 4 credits, vanuit de gedachte dat zo'n lang bericht eerder een geplakt document is dan een vraag. Een korte vraag wordt naar de snelle trede gerouteerd voor 1 credit. De credit-schaal staat in hoe credits werken.
Vastgezette projectbestanden worden bij elke beurt aan de prompt toegevoegd
Een vastgezet projectbestand rijdt bij elke afzonderlijke beurt in dat project mee als prompttekst, in plaats van slechts één keer, en daarom zijn afbeeldingen bewust uitgesloten van de vastzetbare bestandstypen.
Hiervoor gelden eigen limieten: elk vastgezet bestand levert maximaal 32,000 tekens geëxtraheerde tekst, en het hele projectblok is begrensd op 120,000 tekens, verdeeld over maximaal 10 vastgezette bestanden. Aangepaste projectinstructies mogen tot 32,000 tekens lang zijn.
Vastgezette bestanden en instructies worden bij elke beurt in dat project opnieuw in de prompt opgebouwd, binnen hetzelfde inputbudget als het gesprek zelf. Als een projectgesprek de draad sneller lijkt kwijt te raken dan een gewoon gesprek, zet dan de bestanden los waar je niet naar vraagt.
Als je toch een foutmelding over contextlengte zag
Dan kwam die van de modelaanbieder, niet van Whizi, en bereikte hij je via de doorgeefluis. Elke storing bovenstrooms die geen ratelimiet is, wordt teruggegeven als HTTP 502 met de code provider_error, met daarin het bericht van de aanbieder, afgekapt tot 300 tekens. Als de foutmelding van de aanbieder helemaal niet kan worden verwerkt, krijg je in plaats daarvan The model provider rejected the request.
Een weigering van de aanbieder wegens lengte noemt altijd een contextlengte en een aantal tokens. Die getallen zijn de aanbieder die je verzoek afzet tegen een venster dat kleiner is dan het budget dat Whizi verstuurde, en dat is precies wat support nodig heeft om ernaar te kijken.
Geen enkele instelling in de interface verandert hieraan iets. Stap over op een ander model om toch je antwoord te krijgen, en stuur support het exacte bericht inclusief de getallen.
Nog twee teksten die mensen aanzien voor een lengteprobleem. Generation failed mid-stream. en The model stream was interrupted. zijn verbindingsfouten halverwege een antwoord, geen weigeringen wegens lengte. Probeer die opnieuw. Too many requests. Please wait and try again. is een ratelimiet van 10 berichten per minuut, wat ook niets met lengte te maken heeft.
- Whizi heeft geen foutmelding voor een contextlimiet: het gesprek wordt stilletjes ingekort
- Elk model krijgt een vast budget van 40,000 inputtokens en 20,000 outputtokens per beurt
- De Canadese CPA-agent is de enige uitzondering, met 55,000 in en 40,000 uit
- Een venster onder de 93,000 tokens verlaagt dat budget, het verhoogt het nooit
- Eén bericht is begrensd op 100,000 tekens, inclusief geëxtraheerde bestandstekst
- Eén verzoek bevat maximaal 100 berichten aan transcript
- Alleen het meest recente bericht met bijlagen stuurt zijn bijlagen door
- Een vastgezet projectbestand rijdt bij elke beurt in dat project mee als prompttekst
- Bij Auto wordt een bericht van meer dan ongeveer 6,000 tekens gerouteerd naar de langevormtrede voor 4 credits
- Een bericht dat een contextlengte noemt, komt van de aanbieder: stap over op een ander model en meld het bij support
Veelgestelde vragen
Heeft Whizi een foutmelding voor een contextlimiet?
Niet een over context. De lengtemeldingen die Whizi wel toont zijn aantallen, geen vensters: 100,000 tekens in één bericht, 100 berichten in één verzoek, 32,000 tekens in een systeemprompt, en een 413 Request is too large. op het hele verzoek. Als de melding voor je een aantal tokens of een contextlengte noemt, bereikte die je via de 502-doorgeefluis van de aanbieder en hoort hij bij de modelaanbieder.
Waarom is het model iets vergeten dat ik eerder in het gesprek zei?
Omdat het uit het verzoek werd ingekort voordat het verzoek werd verstuurd. De backend kort de geschiedenis stilletjes in tot het tokenbudget van het model, in plaats van het bericht te weigeren, dus er is geen foutmelding om te lezen en geen instelling om dit uit te zetten. Een nieuw gesprek starten zodra het onderwerp verandert, is het praktische antwoord.
Kan ik met een model met een groter contextvenster meer versturen?
Nee. Het inputbudget is bij elk model in de catalogus vast op 40,000 tokens, dus een venster van één miljoen tokens en een venster van 200,000 tokens krijgen evenveel van je gesprek.
Wat betekent "over the 100,000 character limit"?
Eén bericht ging over de limiet van 100,000 tekens per bericht en werd geweigerd met HTTP 400 en de code message_too_long. Tekst die uit een bijgevoegd PDF-, Word- of spreadsheetbestand is gehaald telt mee tegen dezelfde limiet, dus een upload is meestal de oorzaak, niet het typen zelf. De oplossing staat in het bericht zelf: voeg een korter bestand toe, of vraag in hetzelfde gesprek telkens naar één sectie tegelijk.
Wat betekent "over the 100 message limit"?
Eén verzoek bevatte een transcript van meer dan 100 berichten en werd geweigerd met HTTP 400 en de code too_many_messages. Het is een limiet op wat één verzoek mag bevatten, niet op hoe lang een gesprek mag zijn. Een nieuw gesprek starten voor het volgende onderwerp is het praktische antwoord, en dat geeft het model bovendien een helderder beeld van waar je naar vraagt.
Hoe vat ik een document samen dat langer is dan de limiet?
Splits het op en werk sectie voor sectie in één gesprek, precies wat de string message_too_long zelf aanraadt. Vraag om een samenvatting van elke sectie, en daarna om een samenvatting van die samenvattingen. Als één sectie, eenmaal geëxtraheerd, nog steeds over de 100,000 tekens gaat, splits die sectie dan opnieuw.
Kan ik betalen voor een groter contextbudget?
Nee. Het budget is een eigenschap van het model in de catalogus, niet van je abonnement, en er is nergens een instelling die het verhoogt. Wat een hoger abonnement oplevert is toegang tot meer modellen en een grotere maandelijkse toewijzing, niet meer ruimte in één beurt. De koppeling tussen abonnementen en modellen staat in het modeloverzicht.