Stručná odpověď
Whizi nezobrazuje chybu limitu kontextu. Žádný text v produktu nezmiňuje kontextové okno ani limit tokenů, protože konverzace, která přerostla model, se před odeslením požadavku tiše zkrátí tak, aby se do něj vešla, místo aby byla odmítnuta. Nikde se nedozvíte, že se to stalo. Pokud se zdá, že model zapomněl střední část dlouhé konverzace, přesně o tohle jde.
Čtyři věci zprávu skutečně odmítnou, a každá z nich se sama pojmenuje:
| Zpráva | HTTP kód | Spouštěč |
|---|---|---|
This message is {count} characters, over the 100,000 character limit. Attach a shorter file, or ask about one section at a time. | 400 message_too_long | Jedna zpráva, včetně textu extrahovaného z vašich souborů, má více než 100 000 znaků |
This conversation has {count} messages, over the 100 message limit. | 400 too_many_messages | Jeden požadavek nesl přenos více než 100 zpráv |
Request is too large. | 413 request_too_large | Celé tělo JSON požadavku překročilo limit bajtů dané trasy |
That system prompt is missing or over the 32,000 character limit. | 400 invalid_system_prompt | Systémový prompt nad 32 000 znaků |
{count} v textu o limitu znaků se doplní vaším skutečným číslem, formátovaným s oddělovači tisíců. Kód vedle každého textu je to, co se zobrazí v síťové stopě, i když rozhraní vám ukáže jen samotnou větu.
Pokud jste viděli zprávu, která jmenuje délku kontextu nebo počet tokenů, nepochází z Whizi. Přeskočte na poslední sekci.
Rozpočet každého modelu a co se stane po jeho vyčerpání
Každý model v katalogu má na jedno kolo stejný rozpočet: 40 000 vstupních tokenů a 20 000 výstupních tokenů. Jedinou výjimkou je kanadský agent CPA, s 55 000 vstupními tokeny a 40 000 výstupními tokeny.
Když konverzace tento rozpočet přesáhne, backend historii tiše zkrátí na tokenový rozpočet modelu, místo aby ji odmítl. Nezobrazí se žádné upozornění, žádný banner ani chybový kód.
Počet tokenů, proti kterému Whizi zkracuje, je odhad, nikoli skutečný tokenizér. U JSON může podhodnotit skutečný tokenizér až 1,66krát, proto se na vstup uplatňuje rezerva 1,8krát, aby pokryla nejhorší naměřený případ.
Přepnutí na model s větším kontextem neposílá víc
Toto je nejčastější chybná oprava. Vstupní rozpočet 40 000 tokenů je pevný: je stejný u modelu s milionovým oknem jako u modelu s oknem 200 000 tokenů. Přesun dlouhé konverzace z jednoho modelu s velkým oknem na jiný nezmění nic na tom, jak velká část se odešle.
Velikost kontextového okna mění rozpočet jen jedním směrem, dolů. Každý model, jehož okno je pod 93 000 tokenů, dostane menší, poměrný rozpočet místo pevného, s výstupem omezeným na 40 procent okna a rezervou 1 000 tokenů. Tímto způsobem je v katalogu omezeno 31 modelů a nejmenší okno mezi nimi má 6 144 tokenů.
Přepínač, který skutečně pomůže, je tedy opak toho, co lidé zkoušejí: přejít z malého, omezeného modelu na běžný. Přechod mezi dvěma modely s velkým oknem je změna bez vlivu na délku. Jak se chová přepnutí uprostřed konverzace, popisuje přepínání modelů uprostřed konverzace.
Jeden detail za číslem 93 000, dobré ho znát, pokud přemýšlíte, proč model odmítl něco malého: OpenRouter počítá proti oknu modelu vstup plus požadovaný maximální výstup, nikoli jen vstup.
Dlouhý nahraný soubor se zkrátí, a dá vám to vědět
Nahrané soubory jsou obvyklý důvod, proč jedna zpráva přesáhne 100 000 znaků, protože soubory PDF, Word a tabulky se ve vašem prohlížeči extrahují na text, a ten text se počítá proti stejnému limitu jako cokoli, co jste napsali.
Když se extrahovaný text nevejde, zkrátí se místo odmítnutí a zobrazí se dva texty. Upozornění (toast) zní Your upload was too large, so only the first part of it was sent. Ask about a smaller section for full coverage. Samotná zpráva nese v místě zkrácení značku [Attachment truncated: the upload was larger than one message can carry, so the content past this point was not included.], aby model viděl, kde jeho kopie končí.
Pokud je zpráva odmítnuta místo zkrácena, dostanete text message_too_long z první tabulky. Oprava je ta, kterou jmenuje sama chyba: přiložte kratší soubor, nebo se ptejte po jedné sekci najednou.
Ještě jedno chování, které vypadá jako zapomínání: přílohy se modelu předávají jen z nejnovější uživatelské zprávy, která přílohy nese. Obrázek nebo PDF, které jste přiložili před deseti koly, se znovu neposílá při každém dalším kole. Pokud chcete, aby se na něj model podíval znovu, přiložte ho znovu. Co Whizi přijímá a jak funguje extrakce, popisuje podporované typy souborů.
Ještě poznámka k cenně, protože délka mění hodnotu kola. V režimu Auto se zpráva nad zhruba 6 000 znaků směruje na dlouhoformátový stupeň za 4 kredity, s úvahou, že tak dlouhá zpráva je vložený dokument, ne otázka. Krátká otázka se směruje na rychlý stupeň za 1 kredit. Škála kreditů je popsána v jak fungují kredity.
Připnuté soubory projektu se účtují k promptu při každém kole
Připnutý soubor projektu jede jako text promptu při každém jednotlivém kole v daném projektu, nikoli jednou, a proto jsou obrázky z připnutých typů souborů vědomě vyloučeny.
Limity jsou vlastní: každý připnutý soubor přispívá nejvýše 32 000 znaky extrahovaného textu a celý blok projektu je omezen na 120 000 znaků, napříč nejvýše 10 připnutými soubory. Vlastní instrukce projektu mohou mít až 32 000 znaků.
Připnuté soubory a instrukce se znovu sestaví do promptu při každém kole v daném projektu, uvnitř stejného vstupního rozpočtu jako konverzace. Pokud se zdá, že projektový chat ztrácí nit rychleji než běžný, odepněte soubory, na které se právě neptáte.
Pokud jste přece jen viděli chybu délky kontextu
Pak pochází od poskytovatele modelu, ne od Whizi, a dostala se k vám přes průchod. Jakékoli selhání na straně poskytovatele, které není omezením frekvence, se vrací jako HTTP 502 s kódem provider_error, které nese zprávu poskytovatele zkrácenou na 300 znaků. Když se tělo chyby poskytovatele nedá vůbec zpracovat, dostanete místo toho The model provider rejected the request.
Odmítnutí poskytovatele kvůli délce jmenuje délku kontextu a počet tokenů. Tato čísla jsou poskytovatel, který počítá váš požadavek proti oknu menšímu, než je rozpočet, který Whizi odeslala, a jsou přesně to, co potřebuje podpora k prošetření.
Žádné nastavení rozhraní to nezmění. Přepněte na jiný model, abyste dostali odpověď, a podpoře pošlete přesnou zprávu včetně čísel.
Ještě dva texty, které si lidé pletou s problémem délky. Generation failed mid-stream. a The model stream was interrupted. jsou výpadky spojení uprostřed odpovědi, ne odmítnutí kvůli délce. Ty zkuste znovu. Too many requests. Please wait and try again. je omezení frekvence na 10 zpráv za minutu, které s délkou také nemá nic společného.
- Whizi nemá chybu limitu kontextu: konverzaci tiše zkracuje
- Každý model má pevný rozpočet 40 000 vstupních a 20 000 výstupních tokenů na kolo
- Kanadský agent CPA je jedinou výjimkou, s 55 000 na vstupu a 40 000 na výstupu
- Okno pod 93 000 tokenů tento rozpočet snižuje, nikdy ho nezvyšuje
- Jedna zpráva je omezena na 100 000 znaků, včetně extrahovaného textu ze souborů
- Jeden požadavek nese nejvýše 100 zpráv přenosu
- Přílohy předává jen nejnovější zpráva, která přílohy nese
- Připnutý soubor projektu jede jako text promptu při každém kole v daném projektu
- V režimu Auto se zpráva nad zhruba 6 000 znaků směruje na dlouhoformátový stupeň za 4 kredity
- Zpráva jmenující délku kontextu přišla od poskytovatele: přepněte model a napište podpoře
Časté dotazy
Má Whizi chybu limitu kontextu?
Ne kontextovou. Texty o délce, které Whizi zobrazuje, jsou počty, ne okna: 100 000 znaků v jedné zprávě, 100 zpráv v jednom požadavku, 32 000 znaků v systémovém promptu a 413 Request is too large. u celého těla požadavku. Pokud zpráva před vámi jmenuje počet tokenů nebo délku kontextu, dostala se k vám přes průchod chyby 502 poskytovatele a patří poskytovateli modelu.
Proč model zapomněl něco, co jsem napsal dříve v chatu?
Protože to bylo z požadavku odstraněno ještě před jeho odeslením. Backend historii tiše zkracuje na tokenový rozpočet modelu, místo aby ji odmítl, takže není žádná chyba, kterou si přečtete, ani nastavení, které by to vypnulo. Praktickou odpovědí je začít novou konverzaci, když se téma změní.
Umožní mi přechod na model s větším kontextovým oknem poslat víc?
Ne. Vstupní rozpočet je pevných 40 000 tokenů u každého modelu v katalogu, takže okno o milionu tokenů a okno o 200 000 tokenech dostanou stejnou část vaší konverzace.
Co znamená "over the 100,000 character limit"?
Jedna zpráva přesáhla limit na zprávu 100 000 znaků a byla odmítnuta s HTTP 400 a kódem message_too_long. Text extrahovaný z přiloženého PDF, Wordu nebo tabulky se počítá proti stejnému limitu, takže obvyklou příčinou je nahraný soubor, ne psaní. Oprava je v samotné zprávě: přiložte kratší soubor, nebo se ve stejné konverzaci ptejte po jedné sekci najednou.
Co znamená "over the 100 message limit"?
Jeden požadavek nesl přenos více než 100 zpráv a byl odmítnut s HTTP 400 a kódem too_many_messages. Je to limit na to, co může nést jeden požadavek, ne limit na to, jak dlouhý může být chat. Praktickou odpovědí je začít novou konverzaci pro další téma, což modelu navíc dá jasnější přehled o tom, na co se ptáte.
Jak shrnu dokument, který je delší než limit?
Rozdělte ho a pracujte po sekcích v jedné konverzaci, což ostatně doporučuje sám text message_too_long. Požádejte o shrnutí každé sekce, pak o shrnutí těchto shrnutí. Pokud jedna sekce po extrakci textu ze souboru stále přesahuje 100 000 znaků, rozdělte ji znovu.
Můžu si připlatit za větší rozpočet kontextu?
Ne. Rozpočet je vlastnost modelu v katalogu, ne vašeho plánu, a nikde není nastavení, které by ho zvýšilo. Vyšší plán kupuje přístup k více modelům a větší měsíční příděl, ne víc místa v jednom kole. Mapování plánů je v přehledu modelů.