Das Gespräch oder Dokument ist zu lang für das Modell

Kurzantwort

Whizi zeigt keinen Fehler wegen einer Kontextgrenze. Ein Gespräch, das den Rahmen des Modells sprengt, wird vor dem Senden der Anfrage stillschweigend gekürzt, damit es passt. Vier Grenzen weisen eine Nachricht jedoch tatsächlich ab: 100.000 Zeichen in einer Nachricht, 100 Nachrichten in einer Anfrage, ein Anfragekörper über der Routengrenze und ein Systemprompt mit mehr als 32.000 Zeichen.

Die kurze Antwort

Whizi zeigt keinen Fehler wegen einer Kontextgrenze. Kein Text im Produkt erwähnt ein Kontextfenster oder ein Token Limit, weil ein Gespräch, das den Rahmen des Modells sprengt, vor dem Senden der Anfrage gekürzt wird, statt abgelehnt zu werden. Nichts sagt dir, dass es passiert ist. Wenn das Modell die Mitte eines langen Chats vergessen zu haben scheint, ist genau das der Grund.

Vier Dinge lehnen dich tatsächlich rundheraus ab, und jedes benennt sich selbst:

MeldungHTTP CodeAuslöser
Diese Nachricht hat {count} Zeichen, über dem Limit von 100.000 Zeichen. Hänge eine kürzere Datei an, oder frage nach einem Abschnitt nach dem anderen.400 message_too_longEine Nachricht, einschließlich aus deinen Dateien extrahiertem Text, überschreitet 100.000 Zeichen
Dieses Gespräch hat {count} Nachrichten, über dem Limit von 100 Nachrichten.400 too_many_messagesEine einzelne Anfrage enthielt ein Protokoll von mehr als 100 Nachrichten
Die Anfrage ist zu groß.413 request_too_largeDer gesamte JSON Anfragekörper überschritt die Byte Grenze der Route
Dieser Systemprompt fehlt oder überschreitet das Limit von 32.000 Zeichen.400 invalid_system_promptEin Systemprompt mit mehr als 32.000 Zeichen

Das {count} in der Zeichen Limit Meldung wird mit deiner tatsächlichen Zahl gefüllt, formatiert mit Tausendertrennzeichen. Der Code neben jeder Meldung ist das, was in einer Netzwerkanalyse erscheint, selbst wenn die Oberfläche dir nur den Satz zeigt.

Wenn du eine Meldung gesehen hast, die eine Kontextlänge oder eine Token Anzahl nennt, kam sie nicht von Whizi. Spring zum letzten Abschnitt.

Das Budget, das jedes Modell erhält, und was jenseits davon passiert

Jedes Modell im Katalog erhält dasselbe Budget für einen Zug: 40.000 Eingabe Token und 20.000 Ausgabe Token. Der kanadische CPA Agent ist die einzige Ausnahme, mit 55.000 Eingabe Token und 40.000 Ausgabe Token.

Wenn ein Gespräch dieses Budget überschreitet, kürzt das Backend den Verlauf stillschweigend auf das Token Budget des Modells, statt abzulehnen. Es gibt dafür keinen Toast, kein Banner und keinen Fehlercode.

Die Token Anzahl, gegen die Whizi kürzt, ist eine Schätzung und kein echter Tokenizer. Sie kann einen echten Tokenizer bei JSON um bis zu das 1,66 fache unterzählen, daher wird auf die Eingabe ein Zuschlag von 1,8 angewendet, um den schlechtesten gemessenen Fall abzudecken.

Der Wechsel zu einem Modell mit größerem Kontext sendet nicht mehr

Das ist die häufigste falsche Lösung. Das Eingabe Budget von 40.000 Token ist fest: Es ist bei einem Modell mit einem Fenster von einer Million Token dasselbe wie bei einem Modell mit einem Fenster von 200.000 Token. Ein langes Gespräch von einem großen Fenster Modell zu einem anderen zu verschieben, ändert nichts daran, wie viel davon gesendet wird.

Die Größe des Kontextfensters ändert das Budget nur in eine Richtung, nach unten. Jedes Modell, dessen Fenster unter 93.000 Token liegt, erhält statt des festen Budgets ein kleineres, proportionales, wobei die Ausgabe auf 40 Prozent des Fensters gedeckelt ist und eine Sicherheitsmarge von 1.000 Token zurückgehalten wird. 31 Modelle im Katalog sind so gedeckelt, und das kleinste Fenster darunter hat 6.144 Token.

Der Wechsel, der wirklich hilft, ist also das Gegenteil dessen, was die meisten versuchen: weg von einem kleinen, gedeckelten Modell hin zu einem gewöhnlichen. Zwischen zwei großen Fenster Modellen zu wechseln, ist eine Änderung ohne Wirkung auf die Länge. Wie sich ein Modellwechsel mitten im Gespräch verhält, steht in Modelle mitten im Gespräch wechseln.

Ein Detail hinter der Zahl 93.000, gut zu wissen, wenn du dir überlegst, warum ein Modell etwas Kleines abgelehnt hat: OpenRouter zählt Eingabe plus die angeforderte maximale Ausgabe gegen ein Modellfenster, nicht die Eingabe allein.

Ein langer Upload wird gekürzt, und es sagt dir Bescheid

Uploads sind der übliche Grund, warum eine einzelne Nachricht über 100.000 Zeichen hinausgeht, weil PDF-, Word- und Tabellendateien in deinem Browser zu Text extrahiert werden und dieser Text gegen dieselbe Grenze zählt wie alles, was du getippt hast.

Wenn der extrahierte Text nicht passt, wird er gekürzt statt abgelehnt, und zwei Meldungen erscheinen. Der Toast lautet Dein Upload war zu groß, daher wurde nur der erste Teil davon gesendet. Frage nach einem kleineren Abschnitt für vollständige Abdeckung. Die Nachricht selbst trägt an der Schnittstelle die Markierung [Anhang gekürzt: Der Upload war größer, als eine Nachricht tragen kann, daher wurde der Inhalt ab diesem Punkt nicht einbezogen.], damit das Modell sehen kann, wo seine Kopie endet.

Wenn die Nachricht statt gekürzt abgelehnt wird, erhältst du die message_too_long Meldung aus der ersten Tabelle. Die Lösung ist die, die der Fehler selbst nennt: hänge eine kürzere Datei an, oder frage nach einem Abschnitt nach dem anderen.

Noch ein Verhalten, das wie Vergessen wirkt: Nur die neueste Nutzernachricht mit Anhängen leitet ihre Anhänge an das Modell weiter. Ein Bild oder PDF, das du vor zehn Zügen angehängt hast, wird nicht bei jedem folgenden Zug erneut gesendet. Wenn das Modell es sich noch einmal ansehen soll, hänge es erneut an. Was Whizi akzeptiert und wie die Extraktion funktioniert, steht in unterstützte Dateitypen.

Ein Hinweis zu den Kosten, da die Länge beeinflusst, was ein Zug wert ist. Bei Auto führt eine Nachricht über etwa 6.000 Zeichen zur Langform Stufe mit 4 Credits, mit der Überlegung, dass eine so lange Nachricht eher ein eingefügtes Dokument als eine Frage ist. Eine kurze Frage führt zur schnellen Stufe mit 1 Credit. Die Credit Skala steht in wie Credits funktionieren.

Angepinnte Projektdateien werden bei jedem Zug dem Prompt berechnet

Eine angepinnte Projektdatei fährt bei jedem einzelnen Zug in diesem Projekt als Prompt Text mit, statt nur einmal, weshalb Bilder bewusst von den angepinnten Dateitypen ausgeschlossen sind.

Die Grenzen sind eigenständig: Jede angepinnte Datei trägt höchstens 32.000 Zeichen extrahierten Text bei, und der gesamte Projektblock ist auf 120.000 Zeichen gedeckelt, über höchstens 10 angepinnte Dateien. Projekteigene Anweisungen können bis zu 32.000 Zeichen umfassen.

Angepinnte Dateien und Anweisungen werden bei jedem Zug in diesem Projekt neu in den Prompt eingebaut, innerhalb desselben Eingabe Budgets wie das Gespräch. Wenn ein Projektchat schneller als ein gewöhnlicher den Faden zu verlieren scheint, löse das Anpinnen der Dateien, nach denen du nicht fragst.

Wenn du tatsächlich einen Kontextlängen Fehler gesehen hast

Dann kam er vom Modellanbieter, nicht von Whizi, und erreichte dich über die Durchleitung. Jeder vorgelagerte Fehler, der kein Ratenlimit ist, wird als HTTP 502 mit dem Code provider_error zurückgegeben und trägt die Anbieter Meldung, gekürzt auf 300 Zeichen. Wenn der Fehlertext des Anbieters überhaupt nicht geparst werden kann, erhältst du stattdessen Der Modellanbieter hat die Anfrage abgelehnt.

Eine Ablehnung des Anbieters wegen der Länge nennt eine Kontextlänge und eine Token Anzahl. Diese Zahlen sind der Anbieter, der deine Anfrage gegen ein Fenster zählt, das kleiner ist als das Budget, das Whizi gesendet hat, und genau das braucht der Support, um sich die Sache anzusehen.

Keine Einstellung in der Oberfläche ändert das. Wechsle zu einem anderen Modell, um deine Antwort zu bekommen, und sende dem Support die genaue Nachricht samt den Zahlen.

Zwei weitere Meldungen, die man für ein Längenproblem hält. Die Generierung ist mitten im Stream fehlgeschlagen. und Der Modell Stream wurde unterbrochen. sind Verbindungsfehler mitten in einer Antwort, keine Längenablehnungen. Versuche es damit noch einmal. Zu viele Anfragen. Bitte warte und versuche es erneut. ist ein Ratenlimit von 10 Nachrichten pro Minute, das ebenfalls nichts mit der Länge zu tun hat.

Checkliste
  • Whizi hat keinen Fehler wegen einer Kontextgrenze: Es kürzt das Gespräch stillschweigend
  • Jedes Modell erhält ein festes Budget von 40.000 Eingabe und 20.000 Ausgabe Token pro Zug
  • Der kanadische CPA Agent ist die eine Ausnahme, mit 55.000 Eingabe und 40.000 Ausgabe
  • Ein Fenster unter 93.000 Token senkt dieses Budget, es hebt es nie an
  • Eine Nachricht ist auf 100.000 Zeichen gedeckelt, extrahierter Dateitext eingeschlossen
  • Eine Anfrage trägt höchstens 100 Nachrichten Protokoll
  • Nur die Nachricht mit dem neuesten Anhang leitet ihre Anhänge weiter
  • Eine angepinnte Projektdatei fährt bei jedem Zug in diesem Projekt als Prompt Text mit
  • Bei Auto führt eine Nachricht über etwa 6.000 Zeichen zur Langform Stufe mit 4 Credits
  • Eine Meldung, die eine Kontextlänge nennt, kam vom Anbieter: Modell wechseln und Support informieren

Häufige Fragen

Hat Whizi einen Fehler wegen einer Kontextgrenze?

Keinen wegen des Kontexts. Die Längenmeldungen, die Whizi tatsächlich zeigt, sind Zählungen, keine Fenster: 100.000 Zeichen in einer Nachricht, 100 Nachrichten in einer Anfrage, 32.000 Zeichen in einem Systemprompt, und ein 413 Die Anfrage ist zu groß. für den gesamten Anfragekörper. Wenn die Meldung vor dir eine Token Anzahl oder eine Kontextlänge nennt, erreichte sie dich über die 502 Anbieter Durchleitung und gehört zum Modellanbieter.

Warum hat das Modell etwas vergessen, das ich früher im Chat gesagt habe?

Weil es vor dem Senden der Anfrage aus ihr herausgekürzt wurde. Das Backend kürzt den Verlauf stillschweigend auf das Token Budget des Modells, statt abzulehnen, daher gibt es keinen Fehler zu lesen und keine Einstellung, die es abschaltet. Ein neues Gespräch zu beginnen, wenn das Thema wechselt, ist die praktische Antwort.

Kann ich mit einem Modell mit größerem Kontextfenster mehr senden?

Nein. Das Eingabe Budget ist bei jedem Modell im Katalog ein festes von 40.000 Token, daher erhalten ein Fenster von einer Million Token und ein Fenster von 200.000 Token dieselbe Menge deines Gesprächs.

Was bedeutet "über dem Limit von 100.000 Zeichen"?

Eine Nachricht überschritt die Grenze von 100.000 Zeichen pro Nachricht und wurde mit HTTP 400 und dem Code message_too_long abgelehnt. Aus einem angehängten PDF, einer Word Datei oder einer Tabelle extrahierter Text zählt gegen dieselbe Grenze, daher ist ein Upload meist die Ursache und nicht das Tippen. Die Lösung steht in der Meldung selbst: hänge eine kürzere Datei an, oder frage im selben Gespräch nach einem Abschnitt nach dem anderen.

Was bedeutet "über dem Limit von 100 Nachrichten"?

Eine einzelne Anfrage enthielt ein Protokoll von mehr als 100 Nachrichten und wurde mit HTTP 400 und dem Code too_many_messages abgelehnt. Es ist eine Grenze für das, was eine Anfrage tragen darf, nicht für die Länge eines Chats. Ein neues Gespräch für das nächste Thema zu beginnen ist die praktische Antwort, und es gibt dem Modell zudem einen klareren Blick darauf, wonach du fragst.

Wie fasse ich ein Dokument zusammen, das länger als das Limit ist?

Teile es auf und arbeite in einem Gespräch Abschnitt für Abschnitt, genau das empfiehlt die Meldung message_too_long selbst. Bitte um eine Zusammenfassung jedes Abschnitts, dann um eine Zusammenfassung dieser Zusammenfassungen. Wenn ein einzelner Abschnitt nach der Textextraktion immer noch über 100.000 Zeichen liegt, teile diesen Abschnitt erneut.

Kann ich für ein größeres Kontextbudget bezahlen?

Nein. Das Budget ist eine Eigenschaft des Modells im Katalog, nicht deines Plans, und es gibt nirgendwo eine Einstellung, die es anhebt. Was ein höherer Plan kauft, ist Zugang zu mehr Modellen und ein größeres monatliches Kontingent, nicht mehr Platz in einem einzelnen Zug. Die Zuordnung nach Plan steht in der Modellübersicht.