Krótka odpowiedź
Whizi nie pokazuje błędu limitu kontekstu. Żaden komunikat w produkcie nie wspomina o oknie kontekstu ani limicie tokenów, bo rozmowa, która przerasta model, jest przycinana do właściwego rozmiaru przed wysłaniem żądania, a nie odrzucana. Nic nie informuje, że to się wydarzyło. Jeśli model wygląda, jakby zapomniał środek długiego czatu, to właśnie to jest przyczyną.
Cztery rzeczy rzeczywiście odrzucają wiadomość wprost i każda z nich nazywa samą siebie:
| Komunikat | Kod HTTP | Wyzwalacz |
|---|---|---|
This message is {count} characters, over the 100,000 character limit. Attach a shorter file, or ask about one section at a time. | 400 message_too_long | Jedna wiadomość, wliczając tekst wyciągnięty z plików, przekracza 100 000 znaków |
This conversation has {count} messages, over the 100 message limit. | 400 too_many_messages | Jedno żądanie zawierało zapis rozmowy dłuższy niż 100 wiadomości |
Request is too large. | 413 request_too_large | Cała treść żądania JSON przekroczyła limit bajtów dla trasy |
That system prompt is missing or over the 32,000 character limit. | 400 invalid_system_prompt | System prompt dłuższy niż 32 000 znaków |
{count} w komunikacie o limicie znaków jest uzupełniane rzeczywistą liczbą, sformatowaną z separatorami tysięcy. Kod obok każdego komunikatu widać w podglądzie sieciowym, nawet jeśli interfejs pokazuje tylko samo zdanie.
Jeśli widziałeś komunikat, który nazywa długość kontekstu albo liczbę tokenów, to nie pochodzi od Whizi. Przejdź do ostatniej sekcji.
Budżet każdego modelu i co dzieje się po jego przekroczeniu
Każdy model w katalogu dostaje ten sam budżet na jedną turę: 40 000 tokenów wejściowych i 20 000 tokenów wyjściowych. Jedynym wyjątkiem jest kanadyjski agent CPA, z 55 000 tokenów wejściowych i 40 000 tokenów wyjściowych.
Gdy rozmowa przekracza ten budżet, backend po cichu przycina historię do budżetu tokenów danego modelu, zamiast odrzucać żądanie. Nie pojawia się przy tym żadne powiadomienie, żaden baner ani żaden kod błędu.
Liczba tokenów, do której Whizi przycina, jest szacunkiem, a nie wynikiem prawdziwego tokenizera. Może niedoszacować rzeczywisty tokenizer nawet 1,66 raza w przypadku JSON, więc do wejścia stosowany jest margines 1,8 raza, żeby pokryć najgorszy zmierzony przypadek.
Przełączenie na model z większym oknem kontekstu nie wysyła więcej danych
To najczęstsza błędna próba naprawy. Budżet 40 000 tokenów wejściowych jest stały: taki sam w modelu z oknem na milion tokenów, jak w modelu z oknem na 200 000 tokenów. Przeniesienie długiej rozmowy z jednego modelu o dużym oknie na inny nie zmienia niczego w tym, jaka część rozmowy zostaje wysłana.
Rozmiar okna kontekstu zmienia ten budżet tylko w jedną stronę, w dół. Każdy model, którego okno wynosi mniej niż 93 000 tokenów, dostaje mniejszy, proporcjonalny budżet zamiast stałego, z wyjściem ograniczonym do 40 procent okna i zapasem bezpieczeństwa 1000 tokenów odłożonym na bok. 31 modeli w katalogu jest w ten sposób ograniczonych, a najmniejsze okno wśród nich to 6144 tokeny.
Więc przełączenie, które faktycznie pomaga, jest odwrotnością tego, czego ludzie próbują: przejście z małego, ograniczonego modelu na zwykły. Przełączanie się między dwoma modelami o dużym oknie to zmiana bez wpływu na długość. To, jak zachowuje się przełączanie modeli w trakcie rozmowy, opisuje przełączanie modeli w trakcie rozmowy.
Jeden szczegół stojący za liczbą 93 000, warty poznania, jeśli zastanawiasz się, dlaczego model odmówił czegoś małego: OpenRouter liczy wejście plus żądaną maksymalną liczbę tokenów wyjściowych względem okna modelu, a nie samo wejście.
Długi upload zostaje przycięty i mówi ci o tym
Uploady są zwykłą przyczyną, dla której jedna wiadomość przekracza 100 000 znaków, bo pliki PDF, Word i arkusze kalkulacyjne są wyciągane do tekstu w przeglądarce, a ten tekst liczy się do tego samego limitu co wszystko, co wpisałeś.
Gdy wyciągnięty tekst się nie mieści, jest przycinany, a nie odrzucany, i pojawiają się dwa komunikaty. Powiadomienie brzmi: Your upload was too large, so only the first part of it was sent. Ask about a smaller section for full coverage. Sama wiadomość niesie znacznik [Attachment truncated: the upload was larger than one message can carry, so the content past this point was not included.] w miejscu cięcia, żeby model widział, gdzie kończy się jego kopia.
Jeśli wiadomość jest odrzucona zamiast przycięta, dostajesz komunikat message_too_long z pierwszej tabeli. Naprawa jest tą, którą sam błąd nazywa: dołącz krótszy plik albo pytaj o jedną sekcję na raz.
Jeszcze jedno zachowanie, które wygląda jak zapominanie: tylko najnowsza wiadomość użytkownika niosąca załączniki ma swoje załączniki przekazane do modelu. Obraz albo PDF dołączony dziesięć tur wcześniej nie jest wysyłany ponownie przy każdej kolejnej turze. Jeśli chcesz, żeby model spojrzał na niego jeszcze raz, dołącz go ponownie. To, co Whizi akceptuje i jak działa wyciąganie tekstu, opisuje obsługiwane typy plików.
Jedna uwaga o koszcie, bo długość zmienia wartość tury. W trybie Auto wiadomość dłuższa niż około 6000 znaków trafia na poziom dla długich treści za 4 kredyty, z założeniem, że tak długa wiadomość to raczej wklejony dokument niż pytanie. Krótkie pytanie trafia na szybki poziom za 1 kredyt. Skala kredytów jest opisana w jak działają kredyty.
Przypięte pliki projektu są liczone do promptu przy każdej turze
Przypięty plik projektu jedzie jako tekst promptu przy każdej pojedynczej turze w tym projekcie, a nie tylko raz, dlatego obrazy są celowo wykluczone z typów plików, które można przypiąć.
Limity są osobne: każdy przypięty plik wnosi co najwyżej 32 000 znaków wyciągniętego tekstu, a cały blok projektu jest ograniczony do 120 000 znaków, przy maksymalnie 10 przypiętych plikach. Niestandardowe instrukcje projektu mogą mieć do 32 000 znaków.
Przypięte pliki i instrukcje są odtwarzane w promptcie przy każdej turze w tym projekcie, w ramach tego samego budżetu wejściowego co reszta rozmowy. Jeśli czat projektu wydaje się gubić wątek szybciej niż zwykły, odepnij pliki, o które akurat nie pytasz.
Jeśli widziałeś błąd długości kontekstu
To pochodził od dostawcy modelu, nie od Whizi, i dotarł do ciebie przez przekazanie w locie (passthrough). Każda awaria po stronie dostawcy, która nie jest limitem częstotliwości, jest zwracana jako HTTP 502 z kodem provider_error, niosąc komunikat dostawcy przycięty do 300 znaków. Gdy treść błędu dostawcy w ogóle nie da się rozebrać, dostajesz zamiast tego The model provider rejected the request.
Odmowa dostawcy z powodu długości nazwie długość kontekstu i liczbę tokenów. Te liczby to dostawca liczący twoje żądanie względem okna mniejszego niż budżet, który wysłało Whizi, i to dokładnie to, na co musi spojrzeć wsparcie.
Żadne ustawienie interfejsu tego nie zmienia. Przełącz się na inny model, żeby dostać odpowiedź, i wyślij wsparciu dokładną wiadomość razem z liczbami.
Jeszcze dwa komunikaty, które ludzie mylą z problemem długości. Generation failed mid-stream. i The model stream was interrupted. to awarie połączenia w trakcie odpowiedzi, nie odmowy z powodu długości. Spróbuj ponownie. Too many requests. Please wait and try again. to limit częstotliwości na poziomie 10 wiadomości na minutę, który też nie ma nic wspólnego z długością.
- Whizi nie ma błędu limitu kontekstu: po cichu przycina rozmowę
- Każdy model dostaje stały budżet 40 000 tokenów wejściowych i 20 000 wyjściowych na turę
- Kanadyjski agent CPA jest jedynym wyjątkiem, z 55 000 wejściowych i 40 000 wyjściowych
- Okno poniżej 93 000 tokenów obniża ten budżet, nigdy go nie podnosi
- Jedna wiadomość jest ograniczona do 100 000 znaków, wliczając wyciągnięty tekst z plików
- Jedno żądanie niesie co najwyżej 100 wiadomości zapisu rozmowy
- Tylko najnowsza wiadomość z załącznikiem przekazuje swoje załączniki dalej
- Przypięty plik projektu jedzie jako tekst promptu przy każdej turze w tym projekcie
- W trybie Auto wiadomość dłuższa niż około 6000 znaków trafia na poziom dla długich treści za 4 kredyty
- Komunikat nazywający długość kontekstu pochodzi od dostawcy: zmień model i powiedz o tym wsparciu
Najczęstsze pytania
Czy Whizi ma błąd limitu kontekstu?
Nie w sensie kontekstu. Komunikaty o długości, które Whizi rzeczywiście pokazuje, to liczby, nie okna: 100 000 znaków w jednej wiadomości, 100 wiadomości w jednym żądaniu, 32 000 znaków w system promptcie i 413 Request is too large. dla całego żądania. Jeśli komunikat przed tobą nazywa liczbę tokenów albo długość kontekstu, dotarł do ciebie przez przekazanie 502 od dostawcy i należy do dostawcy modelu.
Dlaczego model zapomniał coś, co powiedziałem wcześniej w czacie?
Bo zostało wycięte z żądania, zanim żądanie zostało wysłane. Backend po cichu przycina historię do budżetu tokenów modelu, zamiast odmawiać, więc nie ma błędu do przeczytania ani ustawienia, które to wyłącza. Zaczęcie nowej rozmowy, gdy zmienia się temat, jest praktycznym rozwiązaniem.
Czy przełączenie na model z większym oknem kontekstu pozwoli mi wysłać więcej?
Nie. Budżet wejściowy to stałe 40 000 tokenów w każdym modelu w katalogu, więc okno na milion tokenów i okno na 200 000 tokenów dostają tę samą ilość twojej rozmowy.
Co znaczy "over the 100,000 character limit"?
Jedna wiadomość przekroczyła limit na wiadomość wynoszący 100 000 znaków i została odrzucona z kodem HTTP 400 i kodem message_too_long. Tekst wyciągnięty z dołączonego PDF, pliku Word albo arkusza kalkulacyjnego liczy się do tego samego limitu, więc upload jest zwykłą przyczyną, a nie samo pisanie. Naprawa jest w samej wiadomości: dołącz krótszy plik albo pytaj o jedną sekcję na raz w tej samej rozmowie.
Co znaczy "over the 100 message limit"?
Jedno żądanie niosło zapis rozmowy dłuższy niż 100 wiadomości i zostało odrzucone z kodem HTTP 400 i kodem too_many_messages. To limit tego, co może nieść jedno żądanie, a nie limit tego, jak długi może być czat. Rozpoczęcie nowej rozmowy dla kolejnego tematu jest praktycznym rozwiązaniem, a dodatkowo daje modelowi czytelniejszy obraz tego, o co pytasz.
Jak podsumować dokument dłuższy niż limit?
Podziel go i pracuj sekcja po sekcji w jednej rozmowie, co zresztą zaleca sam komunikat message_too_long. Poproś o podsumowanie każdej sekcji, potem podsumowanie tych podsumowań. Jeśli pojedyncza sekcja nadal przekracza 100 000 znaków po wyciągnięciu tekstu z pliku, podziel tę sekcję jeszcze raz.
Czy mogę zapłacić za większy budżet kontekstu?
Nie. Budżet jest właściwością modelu w katalogu, a nie twojego planu, i nie ma nigdzie ustawienia, które go podnosi. To, co kupuje wyższy plan, to dostęp do większej liczby modeli i większy miesięczny limit, a nie więcej miejsca w pojedynczej turze. Mapowanie planów jest w opisie modeli.