Kontextové okno je celá pracovní paměť modelu
Kontextové okno je celkové množství textu, které model dokáže mít najednou v zorném poli. Vše, co model ví o vaší aktuální konverzaci, se do něj musí vejít: vaše pokyny, každá zpráva, kterou kdokoli z vás poslal, každý nahraný soubor a odpověď, kterou se chystá napsat.
Užitečná pomůcka: model si vaši konverzaci vůbec nepamatuje. Pokaždé, když pošlete zprávu, dostane celý dosavadní přepis konverzace znovu od začátku, přečte si ho celý a napíše další odpověď. Kontextové okno je velikost stolu, na který se ten přepis musí vejít. Když je stůl plný, něco z něj musí sletět.
Proto se AI může dvacet zpráv jevit jako bystrá a pak si najednou začne protiřečit, zapomene omezení, které jste zadali na začátku, nebo si vyžádá soubor, který jste jí už dali. Začátek konverzace sklouzl ze stolu.
Jedna věc, kterou je dobré pochopit hned na začátku, protože jinak vzniká spousta zmatku: kontextové okno není totéž co paměť. Produkty jako ChatGPT a Claude mají samostatnou funkci paměti, která si mezi konverzacemi ukládá fakta o vás a tiše je vkládá do nových konverzací. To je funkce produktu postavená nad modelem. Kontextové okno je pevná vlastnost samotného modelu a žádná funkce paměti ho nezvětší.
Jeden token jsou tak tři čtvrtiny slova
Kontextová okna se měří v tokenech, ne ve slovech, protože model slova ve skutečnosti nečte. Token je jedním ze slov, které glosář AI definuje ve větě spolu s dalšími padesáti pojmy kolem něj. Modely čtou po kouscích: běžná slova jsou obvykle jeden token, delší nebo neobvyklá slova se rozdělí na několik a interpunkce a mezery se počítají také.
Hrubé převody, které se vyplatí zapamatovat:
- 1 token má zhruba 4 znaky angličtiny, tedy asi tři čtvrtiny slova. Co jsou tokeny v AI probíhá k tématu podrobně.
- 1 000 tokenů je zhruba 750 slov, tedy asi jedna a půl stránky běžného textu.
- Kód je hustší. Počítejte spíš s jedním tokenem na tři znaky kvůli symbolům, odsazení a neobvyklým názvům.
- Jiné jazyky jsou méně efektivní. Text v jazycích, které jsou v tokenizéru méně zastoupené, může na stejný význam spotřebovat dvakrát až třikrát více tokenů, což se hodí vědět, pokud platíte za token.
To dává představu, jak si udělat obrázek z čísel, která vídáte v marketingových materiálech:
| Kontextové okno | Zhruba odpovídá |
|---|---|
| 8 000 tokenů | Dlouhému článku |
| 32 000 tokenů | Krátké výzkumné práci s poznámkami |
| 128 000 tokenů | Knize o 300 stranách |
| 200 000 tokenů | Hustému technickému manuálu nebo středně velké kódové základně |
| 1 000 000 tokenů | Několika knihám nebo roku přepisů schůzek |
Důležitá věc, kterou tato tabulka skrývá: limit pokrývá celou konverzaci, ne každou jednotlivou zprávu. Okno o 128 000 tokenech neznamená, že můžete opakovaně posílat 128 000 tokenů. Znamená to, že běžící součet všeho, včetně vlastních odpovědí modelu, musí zůstat pod tímto číslem.
Co vlastně zaplní vaše okno?
Lidi obvykle překvapí, jak rychle se okno zaplní, protože většina toho, co do něj jde, je neviditelná. V typickém chatu model při každém tahu čte úplně všechno z tohoto seznamu:
- Systémový prompt. Pokyny, které produkt posílá dřív, než cokoli napíšete: jak se chovat, jaké nástroje existují, dnešní datum, bezpečnostní pravidla. Často tisíce tokenů, které nikdy neuvidíte.
- Vaše vlastní pokyny nebo paměť. Cokoli, co má produkt o vás uloženo a automaticky to vkládá.
- Každou předchozí zprávu, vaši i modelu, v plném znění. Dlouhé odpovědi modelu se počítají také a bývají obvykle největším přispěvatelem.
- Každý nahraný soubor, nebo alespoň jeho extrahované části. 40stránkové PDF má zhruba 20 000 až 30 000 tokenů.
- Výsledky nástrojů a vyhledávání. Vyhledávání na webu, které stáhne pět stránek, může přidat víc než celá vaše dosavadní konverzace.
- Generovaná odpověď. Výstup sdílí stejný rozpočet jako vstup.
Proto může konverzace, která působila krátce, být blízko svého limitu. Poslali jste osm krátkých zpráv, ale model napsal osm dlouhých odpovědí, přiložili jste dva dokumenty a proběhla tři vyhledávání. Viditelná část z toho je možná deset procent celku.
Proto také tak často funguje řešení zmatené konverzace ve tvaru "založ nový chat". Neresetujete tím náladu modelu. Uklízíte stůl.
Kvalita klesá dřív, než dosáhnete inzerovaného limitu
Tohle je část, na které nejvíc záleží a o které se mluví nejméně. Kvalita modelu nezůstává stálá až téměř k limitu a pak nespadne z útesu. Zhoršuje se postupně a začíná se zhoršovat dávno předtím, než limit dosáhnete.
Nejlépe zdokumentovanou verzí tohoto jevu je takzvaný efekt lost in the middle (ztraceno uprostřed). Umístíte konkrétní fakt na začátek dlouhého dokumentu a model ho najde. Umístíte ho na konec a model ho najde také. Schováte ho doprostřed a přesnost klesá: v původních experimentech Lost in the Middle (Liu et al., 2023, odkaz níže) stálo přesunutí klíčového dokumentu z okrajů vstupu doprostřed modely přibližně 20 bodů přesnosti. Pozornost není napříč dlouhým vstupem rozložena rovnoměrně a okraje jí dostávají víc.
Ještě obtížnější je to, když úkol vyžaduje spojit několik faktů roztroušených v dlouhém vstupu. Najít jednu jehlu v kupce sena je vyřešený problém. Najít čtyři jehly a uvažovat o vztahu mezi nimi vyřešené není, a přesně na to lidé velká kontextová okna používají.
Berte tedy inzerované číslo jako maximální kapacitu, ne jako pohodlný pracovní rozsah. Praktické pravidlo z reálného použití: spolehlivé chování dostanete zhruba do poloviny inzerovaného okna a cokoli za touto hranicí byste měli ověřit, ne mu jen věřit. Pokud vám model tvrdí, že smlouva o 300 stranách neobsahuje výpovědní klauzuli, ověřte si to, obzvlášť pokud by klauzule mohla ležet uprostřed.
Důsledek pro srovnávání: okno o velikosti milion tokenů zaručuje, že model přijme delší dokument než okno o 200 000 tokenech, a nezaručuje nic dalšího. Zda nad celým dokumentem dobře uvažuje, je samostatná otázka a jediný způsob, jak to zjistit, je otestovat to na dokumentu, jehož odpověď už znáte.
Co se stane, když vám dojde místo
Různé produkty řeší přetečení různě a vědět, který typ zrovna používáte, vysvětlí spoustu podivného chování.
| Chování | Co uvidíte | Kde se to děje |
|---|---|---|
| Tvrdá chyba | Požadavek je odmítnut se zprávou o délce | Většina přímého použití API |
| Tiché zkrácení | Nejstarší zprávy se odstraní, aniž by vás to upozornilo | Řada chatových rozhraní |
| Průběžné shrnutí | Staré zprávy se komprimují do shrnutí | Čím dál běžnější u chatových produktů |
| Vyhledávání (retrieval) | Z vašich dokumentů se u každého tahu načtou jen relevantní části | Nástroje pro dokumenty a znalostní báze |
Tiché zkrácení je ten typ, který způsobuje skutečné problémy, protože nic ho neoznámí. Příznakem je model, který najednou ignoruje pravidlo zadané na začátku, vrátí se k tónu, který jste opravili před hodinou, nebo se zeptá na něco, na co jste už odpověděli. Tyto pokyny už prostě nejsou na stole.
Průběžná shrnutí jsou lepší, ale ztrátová. Shrnutí si udrží podstatu a upustí konkrétní detaily, takže omezení "nikdy nepoužívej slovo synergie" přežije jako "uživatel má stylové preference", což vám vůbec nepomůže.
Sedm taktik, které skutečně fungují
Seřazeno podle toho, jak velký rozdíl přinášejí vzhledem k námaze.
Založte nový chat, když se změní téma. Nejcennější zvyk ze všech. Dlouhá konverzace nese náklad všeho, co jí předcházelo, včetně odboček, které už nejsou relevantní, a každá odbočka stále ležící na stole ředí kvalitu další odpovědi.
Dejte otázku až za dlouhý materiál, ne před něj. Když nejdřív vložíte dokument a pak se zeptáte, je otázka blízko místu, kde se generuje odpověď, což měřitelně zlepšuje přesnost u dlouhých vstupů. Nejdřív vložte, pak se ptejte.
Znovu ukotvěte důležitá omezení. V jakékoli konverzaci delší než zhruba patnáct výměn zopakujte pravidla, na kterých záleží, přímo ve zprávě, kde jsou důležitá: "pro připomenutí, britská angličtina, žádné odrážky, do 400 slov." Stojí vás to jeden řádek a přežije to i zkrácení.
Pošlete relevantní stránky, ne celou knihu. Pokud potřebujete, aby model zkontroloval klauzuli o odškodnění, dejte mu klauzuli o odškodnění a její okolí. Přesnost porazí objem: cílený výňatek se levněji posílá a model ho čte přesněji než celou knihu.
Shrňte a záměrně restartujte. Když se pracovní relace protáhne, požádejte o strukturované předání: aktuální stav, přijatá rozhodnutí, otevřené otázky, omezení. Vložte to do nového chatu. Zachováte podstatu a zbavíte se šumu, a hned si všimnete, že model je bystřejší.
Pro vše, co se nevejde, použijte vyhledávání (retrieval). Pokud je váš materiál opravdu větší než jakékoli okno, řešením je retrieval: u každé otázky načíst jen relevantní úseky, místo hledání většího okna. Přesně to dělají nástroje pro dokumenty pod kapotou.
Sledujte zhoršování, ne jen chyby. Pokud odpovědi zvágnějí, začnou se víc vykrucovat nebo ignorují pokyny k formátu, jste pravděpodobně hluboko v okně. Než usoudíte, že se model zhoršil, začněte znovu.
Kolik okna vlastně potřebujete?
Přizpůsobte okno práci, místo abyste hledali co nejvyšší číslo. Aktuální hodnotu pro konkrétní model najdete v tabulce srovnání kontextových oken, která uvádí celý katalog v tokenech i stránkách.
| Vaše práce | Co potřebujete | Proč |
|---|---|---|
| E-maily, psaní, rychlé dotazy | Cokoli moderního | K limitu se ani nepřiblížíte |
| Editace dlouhých dokumentů | 100 000 a víc | Dokument plus vaše konverzace o něm |
| Kontrola smluv a zásad | 200 000 a víc, a ověřovat | Dokument plus úvahy o něm, s výhradou uvedenou výše |
| Uvažování napříč celou kódovou základnou | Co největší dostupné | Kód je hustý na tokeny a mezisouborové uvažování potřebuje šíři |
| Analýza měsíců přepisů | Co největší dostupné, nebo retrieval | Často lépe poslouží retrieval než hrubá síla |
| Stavba produktu na API | Menší, než si myslíte, plus cachování | Dlouhé prompty jsou hlavní hnací silou nákladů i latence |
Pro většinu lidí je poctivá odpověď taková, že kontextové okno není rozhodujícím faktorem mezi předplatnými. Víc záleží na kvalitě psaní, ekosystému a ceně. Rozhodujícím faktorem se stává přesně v jedné situaci: vaše práce pravidelně vyžaduje vkládat víc materiálu, než pojme běžné okno, a v takovém případě velikost okna rozhoduje, jestli je úkol vůbec proveditelný.
Pokud si to chcete otestovat sami, praktický přístup je pustit stejný dlouhý dokument přes dva nebo tři modely a porovnat odpovědi s něčím, co už znáte. Pracovní prostor jako Whizi to usnadňuje, protože GPT, Claude, Gemini, Grok a DeepSeek jsou dostupné v rámci jednoho předplatného a od obřího okna Geminu k pečlivé syntéze Claude je to jen jedno kliknutí. Podívejte se na srovnání modelů vedle sebe, nebo si přečtěte jak vybrat AI model pro širší rozhodování.
- Odhadněte počet tokenů podle pravidla, že 1 000 tokenů je zhruba 750 slov
- Pamatujte, že systémové prompty, soubory, výsledky vyhledávání i odpovědi spotřebovávají stejný rozpočet
- Berte zhruba polovinu inzerovaného okna jako spolehlivý pracovní rozsah
- Nejdřív vložte dlouhý materiál a otázku položte až potom
- V dlouhých konverzacích zopakujte klíčová omezení, aby přežila zkrácení
- Místo prodlužování dlouhé konverzace založte nový chat s napsaným shrnutím
Časté dotazy
Co je kontextové okno jednoduše řečeno?
Je to celkové množství textu, které model dokáže mít najednou v zorném poli, včetně vašich pokynů, celé dosavadní konverzace, nahraných souborů a odpovědi, kterou právě píše. Když součet přesáhne limit, nejstarší části vypadnou, a proto dlouhé chaty začínají zapomínat.
Je větší kontextové okno vždy lepší?
Ne. Větší okno umožní modelu přijmout víc vstupu, ale přesnost se s rostoucím vstupem postupně zhoršuje, zejména u faktů schovaných uprostřed. Model s oknem o milionu tokenů není automaticky lepší na dlouhé dokumenty než model s 200 000, takže testujte na materiálu, jehož správnou odpověď znáte.
Kolik slov je 128 000 tokenů?
Zhruba 96 000 slov, tedy přibližně kniha o 300 stranách. Obecný převod je, že jeden token má asi čtyři znaky angličtiny, takže 1 000 tokenů je kolem 750 slov. Kód a text v jiných jazycích než angličtina spotřebují na stejný obsah víc tokenů.
Proč ChatGPT zapomíná, co jsem řekl dřív?
Protože konverzace přerostla kontextové okno a nejstarší zprávy se odstranily nebo zkomprimovaly, aby se uvolnilo místo. Většina chatových rozhraní to dělá potichu. Zopakování klíčových omezení nebo založení nového chatu s krátkým shrnutím to okamžitě vyřeší.
Je kontextové okno totéž co paměť AI?
Ne. Kontextové okno je pevný limit jedné konverzace. Paměť je samostatná funkce produktu, která ukládá fakta o vás mezi konverzacemi a vkládá je do nových. Paměť kapacitu nezvětšuje, uložená fakta, která vkládá, naopak část okna spotřebují.