Det korta svaret
Whizi visar inget felmeddelande för kontextgränsen. Ingen sträng i produkten nämner ett kontextfönster eller en tokengräns, eftersom en konversation som växer förbi modellen trimmas ner tyst innan förfrågan skickas, i stället för att nekas. Ingenting talar om att det hände. Om modellen verkar ha glömt mitten av en lång chatt är det just det du ser.
Fyra saker nekar dig faktiskt, och var och en namnger sig själv:
| Meddelande | HTTP-kod | Utlösare |
|---|---|---|
This message is {count} characters, over the 100,000 character limit. Attach a shorter file, or ask about one section at a time. | 400 message_too_long | Ett meddelande, inklusive text extraherad från dina filer, är över 100 000 tecken |
This conversation has {count} messages, over the 100 message limit. | 400 too_many_messages | En enskild förfrågan innehöll en transkription med fler än 100 meddelanden |
Request is too large. | 413 request_too_large | Hela JSON-förfrågans body gick över routens byte-gräns |
That system prompt is missing or over the 32,000 character limit. | 400 invalid_system_prompt | En systemprompt på över 32 000 tecken |
{count} i teckengränsens sträng fylls i med ditt verkliga antal, formaterat med tusentalsavgränsare. Koden bredvid varje sträng är det som visas i en nätverksspårning, även när gränssnittet bara visar dig meningen.
Om du såg ett meddelande som anger en kontextlängd eller ett antal tokens kom det inte från Whizi. Hoppa till det sista avsnittet.
Budgeten varje modell får, och vad som händer när den överskrids
Varje modell i katalogen får samma budget för en tur: 40 000 input-tokens och 20 000 output-tokens. Den kanadensiska CPA-agenten är det enda undantaget, med 55 000 input-tokens och 40 000 output-tokens.
När en konversation går förbi den budgeten trimmar backend historiken till modellens tokenbudget tyst i stället för att neka. Det finns ingen toast, ingen banner och ingen felkod för det.
Antalet tokens Whizi trimmar mot är en uppskattning snarare än en verklig tokenizer. Den kan underskatta en verklig tokenizer med upp till 1,66 gånger på JSON, så en marginal på 1,8 gånger tillämpas på input för att täcka det värsta uppmätta fallet.
Att byta till en modell med större kontext skickar inte mer
Det här är den vanligaste felaktiga lösningen. Input-budgeten på 40 000 tokens är fast: den är densamma för en modell med ett fönster på en miljon tokens som för en modell med ett fönster på 200 000 tokens. Att flytta en lång konversation från en modell med stort fönster till en annan ändrar ingenting i hur mycket av den som skickas.
Kontextfönstrets storlek ändrar budgeten bara i en riktning, nedåt. Varje modell vars fönster ligger under 93 000 tokens får en mindre, proportionell budget i stället för den fasta, med output begränsad till 40 procent av fönstret och en säkerhetsmarginal på 1 000 tokens som hålls tillbaka. 31 modeller i katalogen är begränsade på detta sätt, och det minsta fönstret bland dem är 6 144 tokens.
Så den ändring som faktiskt hjälper är motsatsen till den folk försöker: att flytta bort från en liten, begränsad modell till en vanlig. Att flytta mellan två modeller med stort fönster är en förändring utan effekt på längden. Hur det fungerar att byta modell mitt i en konversation beskrivs i att byta modell mitt i en konversation.
En detalj bakom siffran 93 000, bra att känna till om du funderar på varför en modell nekade något litet: OpenRouter räknar input plus den begärda maximala outputen mot modellens fönster, inte bara input.
En lång uppladdning klipps av, och du får veta det
Uppladdningar är den vanligaste orsaken till att ett enskilt meddelande går förbi 100 000 tecken, eftersom PDF-, Word- och kalkylbladsfiler extraheras till text i din webbläsare, och den texten räknas mot samma gräns som allt du skriver.
När den extraherade texten inte får plats trimmas den i stället för att nekas, och två strängar visas. Toasten lyder Your upload was too large, so only the first part of it was sent. Ask about a smaller section for full coverage. Meddelandet självt bär markeringen [Attachment truncated: the upload was larger than one message can carry, so the content past this point was not included.] vid avklippningen, så att modellen kan se var dess kopia slutar.
Om meddelandet nekas i stället för att trimmas får du strängen message_too_long från den första tabellen. Lösningen är den felmeddelandet själv anger: bifoga en kortare fil, eller fråga om ett avsnitt i taget.
Ett annat beteende som kan verka som att modellen glömmer: bara det senaste användarmeddelandet som bär bilagor får sina bilagor vidarebefordrade till modellen. En bild eller PDF du bifogade tio turer tidigare skickas inte om igen vid varje efterföljande tur. Om du vill att modellen ska titta på den igen måste du bifoga den igen. Vad Whizi accepterar och hur extraheringen fungerar finns i filtyper som stöds.
En kostnadsanmärkning, eftersom längden ändrar vad en tur är värd. På Auto dirigeras ett meddelande på över cirka 6 000 tecken till den långa nivån för 4 credits, med resonemanget att ett så långt meddelande är ett inklistrat dokument snarare än en fråga. En kort fråga dirigeras till den snabba nivån för 1 credit. Creditskalan finns i hur credits fungerar.
Fastnålade projektfiler räknas in i prompten varje tur
En fastnålad projektfil följer med som promptext vid varje enskild tur i det projektet i stället för bara en gång, vilket är varför bilder medvetet är uteslutna från de filtyper som kan nålas fast.
Gränserna är sina egna: varje fastnålad fil bidrar med högst 32 000 tecken extraherad text, och hela projektblocket är begränsat till 120 000 tecken, fördelat på högst 10 fastnålade filer. Anpassade projektinstruktioner kan vara upp till 32 000 tecken.
Fastnålade filer och instruktioner byggs om till prompten vid varje tur i det projektet, inom samma input-budget som konversationen. Om en projektchatt verkar tappa tråden snabbare än en vanlig chatt, ta bort nålningen på filer du inte frågar om.
Om du faktiskt såg ett fel om kontextlängd
Då kom det från modellens leverantör, inte från Whizi, och det nådde dig genom genomströmningen. Alla uppströmsfel som inte är en hastighetsbegränsning returneras som HTTP 502 med koden provider_error, som bär leverantörens meddelande, avkortat till 300 tecken. När leverantörens felinnehåll inte kan tolkas alls får du i stället The model provider rejected the request.
Ett nekande från leverantören på grund av längd anger en kontextlängd och ett antal tokens. Dessa siffror är leverantören som räknar din förfrågan mot ett fönster som är mindre än den budget Whizi skickade, och det är exakt det supporten behöver för att titta på saken.
Ingen inställning i gränssnittet ändrar detta. Byt till en annan modell för att få ditt svar, och skicka det exakta meddelandet inklusive siffrorna till supporten.
Två till strängar som folk misstar för ett längdproblem. Generation failed mid-stream. och The model stream was interrupted. är anslutningsfel mitt i ett svar, inte längdnekanden. Försök igen med dem. Too many requests. Please wait and try again. är en hastighetsbegränsning på 10 meddelanden per minut, vilket också inte har något att göra med längden.
- Whizi har inget kontextgränsfel: den trimmar konversationen tyst
- Varje modell får en fast budget på 40 000 input-tokens och 20 000 output-tokens per tur
- Den kanadensiska CPA-agenten är det enda undantaget, med 55 000 in och 40 000 ut
- Ett fönster under 93 000 tokens sänker den budgeten, det höjer den aldrig
- Ett meddelande är begränsat till 100 000 tecken, inklusive extraherad filtext
- En förfrågan bär högst 100 meddelanden av transkription
- Bara det senaste meddelandet som bär bilagor vidarebefordrar sina bilagor
- En fastnålad projektfil följer med som promptext vid varje tur i det projektet
- På Auto dirigeras ett meddelande på över cirka 6 000 tecken till den långa nivån för 4 credits
- Ett meddelande som anger en kontextlängd kom från leverantören: byt modell och meddela supporten
Vanliga frågor
Har Whizi ett kontextgränsfel?
Inte ett kontextfel. De längdmeddelanden Whizi faktiskt visar är antal, inte fönster: 100 000 tecken i ett meddelande, 100 meddelanden i en förfrågan, 32 000 tecken i en systemprompt, och ett 413-fel Request is too large. på hela förfrågans body. Om meddelandet framför dig anger ett antal tokens eller en kontextlängd har det nått dig genom 502-genomströmningen från leverantören och tillhör modellens leverantör.
Varför glömde modellen något jag sa tidigare i chatten?
Eftersom det trimmades bort från förfrågan innan förfrågan skickades. Backend trimmar historiken till modellens tokenbudget tyst i stället för att neka, så det finns inget felmeddelande att läsa och ingen inställning som stänger av det. Att starta en ny konversation när ämnet ändras är den praktiska lösningen.
Kan jag skicka mer genom att byta till en modell med större kontextfönster?
Nej. Input-budgeten är fast på 40 000 tokens för varje modell i katalogen, så ett fönster på en miljon tokens och ett fönster på 200 000 tokens får samma mängd av din konversation.
Vad betyder "över gränsen på 100 000 tecken"?
Ett meddelande gick förbi gränsen per meddelande på 100 000 tecken och nekades med HTTP 400 och koden message_too_long. Text extraherad från en bifogad PDF, Word-fil eller kalkylblad räknas mot samma gräns, så en uppladdning är den vanliga orsaken snarare än att skriva. Lösningen finns i meddelandet självt: bifoga en kortare fil, eller fråga om ett avsnitt i taget i samma konversation.
Vad betyder "över gränsen på 100 meddelanden"?
En enskild förfrågan bar en transkription med fler än 100 meddelanden, och den nekades med HTTP 400 och koden too_many_messages. Det är en gräns för vad en förfrågan får bära, inte en gräns för hur lång en chatt får vara. Att starta en ny konversation för nästa ämne är den praktiska lösningen, och det ger också modellen en tydligare bild av vad du frågar om.
Hur sammanfattar jag ett dokument som är längre än gränsen?
Dela upp det och arbeta avsnitt för avsnitt i en konversation, vilket är precis det strängen message_too_long själv rekommenderar. Be om en sammanfattning av varje avsnitt, och sedan en sammanfattning av dessa sammanfattningar. Om ett enskilt avsnitt fortfarande går förbi 100 000 tecken när dess filtext extraherats, dela upp det avsnittet igen.
Kan jag betala för en större kontextbudget?
Nej. Budgeten är en egenskap hos modellen i katalogen snarare än hos din plan, och det finns ingen inställning någonstans som höjer den. Vad en högre plan köper är tillgång till fler modeller och en större månatlig kvot, inte mer utrymme i en enskild tur. Planöversikten finns i modellreferensen.