Samtalen eller dokumentet er for langt for modellen

Kort svar

Whizi viser ingen feilmelding om kontekstgrense. En samtale som blir for stor for modellen, blir tilpasset før forespørselen sendes, uten varsel. Fire grenser avviser derimot en melding helt: 100 000 tegn i én melding, 100 meldinger i én forespørsel, en forespørsel som overskrider rutens grense, og en systemprompt på over 32 000 tegn.

Det korte svaret

Whizi viser ingen feilmelding om kontekstgrense. Ingen tekst i produktet nevner et kontekstvindu eller en tokengrense, fordi en samtale som blir for stor for modellen tilpasses før forespørselen sendes, i stedet for å bli avvist. Ingenting forteller deg at det har skjedd. Hvis modellen ser ut til å ha glemt midten av en lang chat, er det dette du ser.

Fire ting avviser deg derimot helt, og hver av dem oppgir seg selv:

MeldingHTTP-kodeUtløser
This message is {count} characters, over the 100,000 character limit. Attach a shorter file, or ask about one section at a time.400 message_too_longÉn melding, inkludert tekst hentet fra filene dine, er over 100 000 tegn
This conversation has {count} messages, over the 100 message limit.400 too_many_messagesEn enkelt forespørsel inneholdt et transkript på mer enn 100 meldinger
Request is too large.413 request_too_largeHele JSON-forespørselen overskred rutens byte-grense
That system prompt is missing or over the 32,000 character limit.400 invalid_system_promptEn systemprompt på over 32 000 tegn

{count} i tegnegrensestrengen fylles inn med ditt faktiske tall, formatert med tusenskilletegn. Koden ved siden av hver streng er det som vises i en nettverkssporing, selv når grensesnittet bare viser deg selve setningen.

Hvis du så en melding som nevner en kontekstlengde eller et tokenantall, kom den ikke fra Whizi. Gå direkte til den siste seksjonen.

Budsjettet hver modell får, og hva som skjer forbi det

Hver modell i katalogen får samme budsjett per svar: 40 000 inndatatokens og 20 000 utdatatokens. Den kanadiske CPA-agenten er det ene unntaket, med 55 000 inndatatokens og 40 000 utdatatokens.

Når en samtale blir større enn dette budsjettet, tilpasser backend historikken til modellens tokenbudsjett i det stille, i stedet for å avvise den. Det finnes ingen varsling, ingen banner og ingen feilkode for dette.

Tokenantallet Whizi tilpasser mot er et anslag, ikke en reell tokenizer. Det kan undertelle en reell tokenizer med opptil 1,66 ganger på JSON, så en margin på 1,8 ganger legges til inndata for å dekke det verste målte tilfellet.

Å bytte til en modell med større kontekstvindu sender ikke mer

Dette er den vanligste feilaktige løsningen. Inndatabudsjettet på 40 000 tokens er fast: det er det samme på en modell med et kontekstvindu på en million tokens som på en modell med et vindu på 200 000 tokens. Å flytte en lang samtale fra én stor-vindu-modell til en annen endrer ingenting med hvor mye av den som sendes.

Størrelsen på kontekstvinduet endrer bare budsjettet i én retning, nedover. Enhver modell med et vindu under 93 000 tokens får et mindre, proporsjonalt budsjett i stedet for det faste, med utdata begrenset til 40 prosent av vinduet og en sikkerhetsmargin på 1 000 tokens holdt tilbake. 31 modeller i katalogen er begrenset på denne måten, og det minste vinduet blant dem er 6 144 tokens.

Så endringen som faktisk hjelper er det motsatte av det folk prøver: å flytte fra en liten, begrenset modell til en vanlig en. Å flytte mellom to stor-vindu-modeller er en endring uten effekt på lengde. Hvordan bytte midt i en samtale fungerer, er dekket i bytte modell midt i en samtale.

Én detalj bak tallet 93 000, verdt å vite hvis du lurer på hvorfor en modell avviste noe lite: OpenRouter teller inndata pluss ønsket maksimal utdata mot et modellvindu, ikke inndata alene.

En lang opplasting blir kuttet, og den forteller deg det

Opplastinger er den vanligste grunnen til at en enkelt melding overskrider 100 000 tegn, fordi PDF-, Word- og regnearkfiler hentes ut som tekst i nettleseren din, og den teksten telles mot samme grense som alt du skriver.

Når den uthentede teksten ikke passer, tilpasses den i stedet for å bli avvist, og to strenger vises. Varslingen sier Your upload was too large, so only the first part of it was sent. Ask about a smaller section for full coverage. Selve meldingen bærer markøren [Attachment truncated: the upload was larger than one message can carry, so the content past this point was not included.] ved kuttet, slik at modellen kan se hvor kopien slutter.

Hvis meldingen blir avvist i stedet for tilpasset, får du message_too_long-strengen fra den første tabellen. Løsningen er den feilen selv oppgir: legg til en kortere fil, eller spør om ett avsnitt om gangen.

Én ting til som fremstår som glemsel: bare den nyeste brukermeldingen med vedlegg får sine vedlegg videresendt til modellen. Et bilde eller en PDF du la til ti svar tidligere, blir ikke sendt på nytt på hvert påfølgende svar. Hvis du vil at modellen skal se på det igjen, legg det til på nytt. Hva Whizi godtar og hvordan uthenting fungerer, står i støttede filtyper.

Én kostnadsnotis, siden lengde endrer hva et svar er verdt. På Auto ruter en melding over cirka 6 000 tegn til det langformede nivået på 4 kreditter, med resonnementet at en melding så lang er et innlimt dokument snarere enn et spørsmål. Et kort spørsmål ruter til det raske nivået på 1 kreditt. Kredittskalaen står i hvordan kreditter fungerer.

Fastnålede prosjektfiler belastes prompten på hvert svar

En fastnålet prosjektfil følger med som prompttekst på hvert enkelt svar i det prosjektet, i stedet for bare én gang, og det er grunnen til at bilder er utelukket med vilje fra de fastnålede filtypene.

Grensene er egne: hver fastnålede fil bidrar med maks 32 000 tegn med uthentet tekst, og hele prosjektblokken er begrenset til 120 000 tegn, over maks 10 fastnålede filer. Egendefinerte prosjektinstruksjoner kan være opptil 32 000 tegn.

Fastnålede filer og instruksjoner bygges på nytt inn i prompten på hvert svar i det prosjektet, innenfor samme inndatabudsjett som samtalen. Hvis en prosjektchat ser ut til å tape tråden raskere enn en vanlig, fjern nålen fra filer du ikke spør om.

Hvis du faktisk så en feilmelding om kontekstlengde

Da kom den fra modellleverandøren, ikke fra Whizi, og den nådde deg gjennom passthrough. Enhver oppstrømsfeil som ikke er en hastighetsgrense, returneres som HTTP 502 med koden provider_error, som bærer leverandørens melding, avkortet til 300 tegn. Når leverandørens feilrespons ikke kan tolkes i det hele tatt, får du The model provider rejected the request. i stedet.

En leverandøravvisning på lengde vil nevne en kontekstlengde og et tokenantall. Disse tallene er leverandøren som teller forespørselen din mot et vindu mindre enn budsjettet Whizi sendte, og de er nøyaktig det support trenger for å se på det.

Ingen innstilling i grensesnittet endrer dette. Bytt til en annen modell for å få svaret ditt, og send support den nøyaktige meldingen inkludert tallene.

To flere strenger folk forveksler med et lengdeproblem. Generation failed mid-stream. og The model stream was interrupted. er tilkoblingsfeil midt i et svar, ikke lengdeavvisninger. Prøv disse på nytt. Too many requests. Please wait and try again. er en hastighetsgrense på 10 meldinger per minutt, som heller ikke har noe med lengde å gjøre.

Sjekkliste
  • Whizi har ingen feilmelding om kontekstgrense: den tilpasser samtalen i det stille
  • Hver modell får et fast budsjett på 40 000 inndata- og 20 000 utdatatokens per svar
  • Den kanadiske CPA-agenten er det ene unntaket, med 55 000 inn og 40 000 ut
  • Et vindu under 93 000 tokens senker det budsjettet, det øker det aldri
  • Én melding er begrenset til 100 000 tegn, uthentet filtekst inkludert
  • En forespørsel bærer maks 100 meldinger med transkript
  • Bare den nyeste meldingen med vedlegg videresender sine vedlegg
  • En fastnålet prosjektfil følger med som prompttekst på hvert svar i det prosjektet
  • På Auto ruter en melding over cirka 6 000 tegn til det langformede nivået på 4 kreditter
  • En melding som nevner en kontekstlengde kom fra leverandøren: bytt modell og fortell support

Vanlige spørsmål

Har Whizi en feilmelding om kontekstgrense?

Ikke en om kontekst. Lengdemeldingene Whizi faktisk viser er antall, ikke vinduer: 100 000 tegn i én melding, 100 meldinger i én forespørsel, 32 000 tegn i en systemprompt, og en 413 Request is too large. på hele forespørselen. Hvis meldingen du ser nevner et tokenantall eller en kontekstlengde, nådde den deg gjennom 502-passthrough og hører til modellleverandøren.

Hvorfor glemte modellen noe jeg sa tidligere i chatten?

Fordi det ble tilpasset ut av forespørselen før den ble sendt. Backend tilpasser historikken til modellens tokenbudsjett i det stille, i stedet for å avvise, så det finnes ingen feilmelding å lese og ingen innstilling som slår det av. Å starte en ny samtale når temaet endres er det praktiske svaret.

Vil det å bytte til en modell med et større kontekstvindu la meg sende mer?

Nei. Inndatabudsjettet er et fast 40 000 tokens på hver modell i katalogen, så et vindu på en million tokens og et vindu på 200 000 tokens får samme mengde av samtalen din.

Hva betyr "over the 100,000 character limit"?

En melding gikk forbi grensen på 100 000 tegn per melding og ble avvist med HTTP 400 og koden message_too_long. Tekst hentet fra en vedlagt PDF, Word-fil eller regneark telles mot samme grense, så en opplasting er den vanlige årsaken snarere enn skriving. Løsningen ligger i selve meldingen: legg til en kortere fil, eller spør om ett avsnitt om gangen i samme samtale.

Hva betyr "over the 100 message limit"?

En enkelt forespørsel bar et transkript på mer enn 100 meldinger, og den ble avvist med HTTP 400 og koden too_many_messages. Det er en grense på hva én forespørsel kan bære, ikke en grense på hvor lang en chat kan være. Å starte en ny samtale for det neste temaet er det praktiske svaret, og det gir også modellen et klarere bilde av hva du spør om.

Hvordan oppsummerer jeg et dokument som er lengre enn grensen?

Del det opp og arbeid avsnitt for avsnitt i én samtale, som er det message_too_long-strengen selv anbefaler. Be om et sammendrag av hvert avsnitt, deretter et sammendrag av disse sammendragene. Hvis et enkelt avsnitt fortsatt overskrider 100 000 tegn når filteksten er hentet ut, del opp det avsnittet igjen.

Kan jeg betale for et større kontekstbudsjett?

Nei. Budsjettet er en egenskap ved modellen i katalogen snarere enn ved abonnementet ditt, og det finnes ingen innstilling noe sted som øker det. Hva en høyere plan gir deg er tilgang til flere modeller og en større månedlig kvote, ikke mer plass i ett enkelt svar. Plankartleggingen står i modellreferansen.