Chatten er for lang til modellen: samtalen eller dokumentet overskrider grænsen

Kort svar

Whizi viser ingen fejl om kontekstgrænsen. En samtale, der vokser sig større end modellen, tilpasses i stilhed, før anmodningen sendes. Fire grænser afviser derimod en besked direkte: 100,000 tegn i én besked, 100 beskeder i én anmodning, et anmodningsindhold over routens grænse, og en systemprompt på 32,000 tegn.

Det korte svar

Whizi viser ikke en fejl om kontekstgrænsen. Ingen tekst i produktet nævner et kontekstvindue eller en tokengrænse, fordi en samtale, der vokser sig større end modellen kan håndtere, bliver tilpasset til at passe, før anmodningen sendes, i stedet for at blive afvist. Intet fortæller dig, at det er sket. Hvis modellen ser ud til at have glemt midten af en lang chat, er det præcis det, du ser.

Fire ting afviser dig derimod direkte, og hver af dem navngiver sig selv:

BeskedHTTP kodeUdløses af
This message is {count} characters, over the 100,000 character limit. Attach a shorter file, or ask about one section at a time.400 message_too_longÉn besked, inklusive tekst udtrukket fra dine filer, er over 100,000 tegn
This conversation has {count} messages, over the 100 message limit.400 too_many_messagesEn enkelt anmodning bar en transskription på mere end 100 beskeder
Request is too large.413 request_too_largeHele JSON anmodningens indhold gik over routens byte grænse
That system prompt is missing or over the 32,000 character limit.400 invalid_system_promptEn systemprompt over 32,000 tegn

{count} i tegngrænse strengen bliver udfyldt med dit rigtige antal, formateret med tusindtalsseparatorer. Koden ved siden af hver streng er det, der vises i en netværkssporing, selv når brugergrænsefladen kun viser dig sætningen.

Hvis du så en besked, der navngiver en kontekstlængde eller et antal tokens, kom den ikke fra Whizi. Gå til det sidste afsnit.

Budgettet alle modeller får, og hvad der sker, når det overskrides

Hver model i kataloget får det samme budget til én tur: 40,000 input tokens og 20,000 output tokens. Den canadiske CPA agent er den eneste undtagelse, med 55,000 input tokens og 40,000 output tokens.

Når en samtale løber forbi det budget, tilpasser backenden historikken til modellens tokenbudget i stilhed, i stedet for at afvise. Der er ingen besked, ingen banner og ingen fejlkode for det.

Det antal tokens, Whizi tilpasser sig efter, er et estimat snarere end en rigtig tokenizer. Det kan undervurdere en rigtig tokenizer med op til 1.66 gange på JSON, så der lægges en margin på 1.8 gange til inputtet for at dække det værste målte tilfælde.

At skifte til en model med et større kontekstvindue sender ikke mere

Dette er den mest almindelige forkerte løsning. Input budgettet på 40,000 tokens er fladt: det er det samme på en model med et vindue på en million tokens som på en model med et vindue på 200,000 tokens. At flytte en lang samtale fra én model med et stort vindue til en anden ændrer ingenting ved, hvor meget af den der bliver sendt.

Kontekstvinduets størrelse ændrer kun budgettet i én retning, nedad. Enhver model, hvis vindue ligger under 93,000 tokens, får et mindre, proportionalt budget i stedet for det flade, med output begrænset til 40 procent af vinduet og en sikkerhedsmargin på 1,000 tokens holdt tilbage. 31 modeller i kataloget er begrænset på denne måde, og det mindste vindue blandt dem er 6,144 tokens.

Så det skift, der faktisk hjælper, er det modsatte af det, folk prøver: at flytte fra en lille, begrænset model til en almindelig. At flytte mellem to modeller med store vinduer er en ændring uden effekt på længden. Hvordan det fungerer at skifte model midt i en samtale, er beskrevet i at skifte model midt i en samtale.

En detalje bag tallet 93,000, som er værd at kende, hvis du forsøger at forstå, hvorfor en model afviste noget lille: OpenRouter tæller input plus det ønskede maksimale output mod en models vindue, ikke input alene.

En lang upload bliver skåret, og du bliver informeret om det

Uploads er den almindelige grund til, at en enkelt besked løber forbi 100,000 tegn, fordi PDF, Word og regnearksfiler udtrækkes til tekst i din browser, og den tekst tæller mod den samme grænse som alt, du selv skriver.

Når den udtrukne tekst ikke passer, bliver den tilpasset i stedet for afvist, og der vises to strenge. Beskeden lyder Your upload was too large, so only the first part of it was sent. Ask about a smaller section for full coverage. Selve beskeden bærer markøren [Attachment truncated: the upload was larger than one message can carry, so the content past this point was not included.] ved afskæringen, så modellen kan se, hvor dens kopi stopper.

Hvis beskeden bliver afvist i stedet for tilpasset, får du strengen message_too_long fra den første tabel. Løsningen er den, fejlen selv nævner: vedhæft en kortere fil, eller spørg om ét afsnit på et tidspunkt.

En anden adfærd, der kan opleves som glemsomhed: kun den nyeste brugerbesked med vedhæftninger får sine vedhæftninger sendt videre til modellen. Et billede eller en PDF, du vedhæftede ti beskeder tidligere, gensendes ikke ved hver efterfølgende tur. Hvis du vil have modellen til at se på den igen, skal du vedhæfte den igen. Hvad Whizi accepterer, og hvordan udtrækning fungerer, står i understøttede filtyper.

En bemærkning om pris, da længden ændrer, hvad en tur er værd. På Auto sendes en besked over cirka 6,000 tegn til det lange trin til 4 credits, med den tankegang, at en besked af den længde er et indsat dokument snarere end et spørgsmål. Et kort spørgsmål sendes til det hurtige trin til 1 credit. Kreditskalaen står i sådan fungerer credits.

Fastgjorte projektfiler belastes prompten på hver tur

En fastgjort projektfil følger med som prompttekst på hver enkelt tur i det projekt i stedet for kun én gang, hvilket er grunden til, at billeder med vilje er udelukket fra de fastgjorte filtyper.

Grænserne er deres egne: hver fastgjort fil bidrager med højst 32,000 tegn udtrukket tekst, og hele projektblokken er begrænset til 120,000 tegn, fordelt på højst 10 fastgjorte filer. Projektets brugerdefinerede instruktioner kan være op til 32,000 tegn.

Fastgjorte filer og instruktioner bliver genopbygget i prompten på hver tur i det projekt, inden for det samme input budget som samtalen. Hvis en projektchat ser ud til at tabe tråden hurtigere end en almindelig, skal du frigøre de filer, du ikke spørger om.

Hvis du faktisk så en fejl om kontekstlængde

Så kom den fra modeludbyderen, ikke fra Whizi, og den nåede dig gennem passthrough'en. Enhver fejl opstrøms, der ikke er en hastighedsbegrænsning, returneres som HTTP 502 med koden provider_error, som bærer udbyderens besked, afkortet til 300 tegn. Når udbyderens fejlindhold ikke kan aflæses overhovedet, får du i stedet The model provider rejected the request.

En afvisning fra udbyderen på grund af længde vil navngive en kontekstlængde og et antal tokens. De tal er udbyderen, der tæller din anmodning mod et vindue mindre end det budget, Whizi sendte, og det er præcis det, support skal have for at kigge på det.

Ingen indstilling i brugergrænsefladen ændrer dette. Skift til en anden model for at få dit svar, og send support den nøjagtige besked inklusive tallene.

Der er to andre strenge, folk fejlagtigt tror handler om længde. Generation failed mid-stream. og The model stream was interrupted. er forbindelsesfejl midt i et svar, ikke afvisninger på grund af længde. Prøv dem igen. Too many requests. Please wait and try again. er en hastighedsbegrænsning på 10 beskeder per minut, hvilket heller ikke har noget med længden at gøre.

Tjekliste
  • Whizi har ingen fejl om kontekstgrænse: samtalen tilpasses i stilhed
  • Hver model får et fladt budget på 40,000 input og 20,000 output tokens per tur
  • Den canadiske CPA agent er den eneste undtagelse, med 55,000 ind og 40,000 ud
  • Et vindue under 93,000 tokens sænker det budget, det hæver det aldrig
  • En besked er begrænset til 100,000 tegn, inklusive udtrukket filtekst
  • En anmodning bærer højst 100 beskeders transskription
  • Kun den seneste besked med vedhæftninger sender sine vedhæftninger videre
  • En fastgjort projektfil følger med som prompttekst på hver tur i det projekt
  • På Auto sendes en besked over cirka 6,000 tegn til det lange trin til 4 credits
  • En besked, der navngiver en kontekstlængde, kom fra udbyderen: skift model og fortæl support

Ofte stillede spørgsmål

Har Whizi en fejl om kontekstgrænse?

Ikke en om kontekst. De længdebeskeder, Whizi rent faktisk viser, er antal, ikke vinduer: 100,000 tegn i én besked, 100 beskeder i én anmodning, 32,000 tegn i en systemprompt, og en 413 Request is too large. på hele anmodningens indhold. Hvis beskeden foran dig navngiver et antal tokens eller en kontekstlængde, nåede den dig gennem 502 udbyder passthrough'en og hører til modeludbyderen.

Hvorfor glemte modellen noget, jeg sagde tidligere i chatten?

Fordi det blev skåret ud af anmodningen, før anmodningen blev sendt. Backenden tilpasser historikken til modellens tokenbudget i stilhed i stedet for at afvise, så der er ingen fejl at læse og ingen indstilling, der slår det fra. Det praktiske svar er at starte en ny samtale, når emnet skifter.

Kan jeg sende mere, hvis jeg skifter til en model med et større kontekstvindue?

Nej. Input budgettet er fladt på 40,000 tokens på hver model i kataloget, så et vindue på en million tokens og et vindue på 200,000 tokens får den samme mængde af din samtale.

Hvad betyder "over the 100,000 character limit"?

En besked gik forbi grænsen per besked på 100,000 tegn og blev afvist med HTTP 400 og koden message_too_long. Tekst udtrukket fra en vedhæftet PDF, Word fil eller regneark tæller mod den samme grænse, så en upload er den almindelige årsag snarere end at skrive. Løsningen står i selve beskeden: vedhæft en kortere fil, eller spørg om ét afsnit på et tidspunkt i den samme samtale.

Hvad betyder "over the 100 message limit"?

En enkelt anmodning bar en transskription på mere end 100 beskeder, og den blev afvist med HTTP 400 og koden too_many_messages. Det er en grænse for, hvad én anmodning må bære, ikke en grænse for, hvor lang en chat må være. Det praktiske svar er at starte en ny samtale til det næste emne, og det giver også modellen et klarere billede af, hvad du spørger om.

Hvordan opsummerer jeg et dokument, der er længere end grænsen?

Del det op, og arbejd afsnit for afsnit i den samme samtale, hvilket er præcis det, message_too_long strengen selv anbefaler. Bed om en opsummering af hvert afsnit, og derefter en opsummering af de opsummeringer. Hvis et enkelt afsnit stadig løber forbi 100,000 tegn, når dets filtekst er udtrukket, skal du dele det afsnit op igen.

Kan jeg betale for et større kontekstbudget?

Nej. Budgettet er en egenskab ved modellen i kataloget snarere end ved din plan, og der er ingen indstilling nogen steder, der hæver det. Hvad en højere plan giver dig, er adgang til flere modeller og en større månedlig kvote, ikke mere plads i en enkelt tur. Planoversigten står i modeloversigten.