Просте пояснення
Контекстне вікно, це загальний обсяг тексту, який модель може тримати перед очима одночасно. Усе, що модель знає про вашу поточну розмову, має вміститися всередині: ваші інструкції, кожне повідомлення, надіслане будь-ким із вас, кожен завантажений файл і та відповідь, яку вона щойно збирається написати.
Корисний уявний образ: жодної пам'яті про вашу розмову модель не має взагалі. Щоразу, коли ви надсилаєте повідомлення, їй наново передають усю розмову від початку, вона прочитує все це і пише наступну репліку. Контекстне вікно, це розмір столу, на якому має вміститися цей запис.
Ось чому ШІ може здаватися кмітливим двадцять повідомлень поспіль, а потім починає суперечити сам собі, забувати обмеження, яке ви поставили на початку, або просити файл, який ви вже дали. Він не заплутався. Рання частина розмови просто зісковзнула зі столу.
Одну річ варто розрізнити одразу, бо вона спричиняє багато плутанини: контекстне вікно, це не те саме, що пам'ять. Продукти на кшталт ChatGPT і Claude мають окрему функцію пам'яті, яка зберігає факти про вас між розмовами і тихо вставляє їх у нові. Це функція продукту, надбудована над моделлю. Контекстне вікно, це жорстка властивість самої моделі, і жодна функція пам'яті не робить його більшим.
Токени і як їх приблизно рахувати
Контекстні вікна вимірюють у токенах, а не в словах, бо моделі не читають слова. Вони читають шматки: поширені слова, це зазвичай один токен, довші або незвичні слова розпадаються на кілька, а розділові знаки й пробіли теж рахуються.
Приблизні співвідношення, які варто запам'ятати:
- 1 токен, це приблизно 4 символи англійського тексту, або приблизно три чверті слова.
- 1 000 токенів, це приблизно 750 слів, десь півтори сторінки звичайної прози.
- Код щільніший. Очікуйте ближче до одного токена на три символи через спецсимволи, відступи й незвичні назви змінних.
- Інші мови менш ефективні. Текст мовами, які слабше представлені в токенізаторі, може займати вдвічі або втричі більше токенів за той самий зміст, і це варто знати, якщо ви платите за токени.
Це дає вам спосіб уявити числа, які ви бачите в маркетингових матеріалах:
| Контекстне вікно | Приблизно дорівнює |
|---|---|
| 8 000 токенів | Довга стаття |
| 32 000 токенів | Невелика наукова праця з нотатками |
| 128 000 токенів | Книжка на 300 сторінок |
| 200 000 токенів | Щільний технічний посібник або середня кодова база |
| 1 000 000 токенів | Кілька книжок або рік стенограм зустрічей |
Ось що ця таблиця приховує: ліміт покриває всю розмову, а не кожне повідомлення окремо. Вікно на 128 000 токенів не означає, що ви можете надсилати по 128 000 токенів раз за разом. Воно означає, що загальна сума всього, включно з власними відповідями моделі, має залишатися нижче цього числа.
Що насправді заповнює ваше вікно
Людей зазвичай дивує, як швидко вікно заповнюється, бо більша частина того, що туди потрапляє, невидима. У типовій сесії чату модель на кожному кроці читає все перелічене нижче:
- Системний промпт. Інструкції, які продукт надсилає ще до того, як ви щось надрукували: як поводитися, які є інструменти, яка сьогодні дата, правила безпеки. Часто це тисячі токенів, і ви їх ніколи не бачите.
- Ваші власні інструкції або пам'ять. Усе, що продукт зберіг про вас і підставляє автоматично.
- Кожне попереднє повідомлення, ваше і моделі, повністю. Довгі відповіді моделі теж рахуються, і зазвичай саме вони роблять найбільший внесок.
- Кожен завантажений файл або витягнуті з нього частини. PDF на 40 сторінок, це приблизно від 20 000 до 30 000 токенів.
- Результати інструментів і пошуку. Вебпошук, який витягує п'ять сторінок, може додати більше, ніж уся ваша розмова до цього моменту.
- Відповідь, яка зараз генерується. Вивід ділить той самий бюджет, що й ввід.
Ось чому розмова, яка здавалася короткою, може бути вже близько до свого ліміту. Ви надіслали вісім коротких повідомлень, але модель написала вісім довгих відповідей, ви прикріпили два документи, а вона зробила три пошуки. Видима частина цього, це, може, десять відсотків від загального обсягу.
І саме тому ліками від заплутаної розмови так часто буває «почніть новий чат». Ви не скидаєте моделі настрій. Ви прибираєте зі столу.
Заявлений розмір проти корисного
Це та частина, яка важить найбільше і обговорюється найменше. Якість моделі не тримається рівно аж до самого ліміту, щоб потім різко обвалитися. Вона погіршується поступово, і починає погіршуватися задовго до ліміту.
Найкраще задокументований вияв цього часто називають ефектом загубленого посередині. Покладіть конкретний факт на початок довгого документа, і модель його знайде. Покладіть у кінець, і модель його знайде. Заховайте його посередині 200 сторінок, і точність пошуку помітно впаде. Увага розподілена по довгому вводу нерівномірно, і краям її дістається більше.
Ще важче стає, коли завдання вимагає поєднати кілька фактів, розкиданих по довгому вводу. Знайти одну голку в копиці сіна, це вже розв'язана задача. Знайти чотири голки й міркувати про зв'язок між ними, ще ні, а саме для цього люди й беруть великі контекстні вікна.
Тож сприймайте заявлене число як максимальну місткість, а не як зручний робочий діапазон. Практичне правило з реального користування: надійна поведінка тримається приблизно до половини заявленого вікна, а все, що поза цим, варто перевіряти, а не приймати на віру. Якщо модель каже вам, що в договорі на 300 сторінок немає пункту про розірвання, перевірте, особливо якщо цей пункт мав би бути десь посередині.
Наслідок для порівнянь такий: модель із вікном на мільйон токенів не є автоматично кращою на довгих документах за модель із 200 000. Вона краще їх приймає. Чи добре вона міркує по всьому цьому обсягу, це окреме питання, і єдиний спосіб дізнатися, це перевірити на документі, відповідь для якого ви вже знаєте.
Що стається, коли вікно закінчується
Різні продукти по-різному обробляють переповнення, і знання того, з яким саме варіантом ви маєте справу, пояснює багато дивної поведінки.
| Поведінка | Що ви бачите | Де трапляється |
|---|---|---|
| Жорстка помилка | Запит відхиляють із повідомленням про довжину | Пряма робота з API |
| Тихе обрізання | Найстаріші повідомлення зникають без попередження | Багато чат-інтерфейсів |
| Скочуване резюме | Старі повідомлення стискають у підсумок | Дедалі частіше в чат-продуктах |
| Пошук по джерелах | На кожен крок дістають лише потрібні частини документів | Інструменти для документів і баз знань |
Тихе обрізання, це те, що спричиняє справжні проблеми, бо про нього ніщо не сповіщає. Симптом такий: модель раптом ігнорує правило, яке ви поставили на початку, повертається до тону, який ви виправили годину тому, або питає те, на що ви вже відповіли. З моделлю нічого не сталося. Ті інструкції просто більше не лежать на столі.
Скочувані резюме кращі, але втрачають деталі. Підсумок зберігає загальну суть і викидає конкретику, тож обмеження «ніколи не вживай слово синергія» виживає у вигляді «користувач має стильові вподобання», що вам не допомагає взагалі.
Практичні прийоми, які справді працюють
Вони впорядковані за тим, скільки різниці дають відносно витрачених зусиль.
Починайте новий чат, коли змінюється тема. Найцінніша окрема звичка. Довга розмова тягне за собою вартість усього, що було до неї, включно з відступами від теми, які вже не мають значення. Довгі розмови не поінформованіші, вони дорожчі й розмитіші.
Ставте своє запитання після довгого матеріалу, а не перед ним. Якщо ви вставляєте документ, а тоді питаєте, запитання опиняється близько до того місця, де генерується відповідь, і це вимірно покращує точність на довгих вводах. Спочатку вставили, потім запитали.
Повторно закріплюйте важливі обмеження. У будь-якій розмові, довшій за півтора десятка обмінів, повторіть правила, які мають значення, у тому повідомленні, де вони мають значення: «нагадую: британська англійська, без списків, менше ніж 400 слів». Це коштує вам одного рядка і переживає обрізання.
Надсилайте потрібні сторінки, а не всю книжку. Якщо вам треба, щоб модель перевірила пункт про відшкодування збитків, дайте їй цей пункт і його сусідів. Точність перемагає обсяг: так швидше, дешевше й правильніше.
Підсумовуйте й перезапускайтеся свідомо. Коли робоча сесія затягується, попросіть структуровану передачу справ: поточний стан, ухвалені рішення, відкриті питання, обмеження. Вставте це в новий чат. Ви зберігаєте суть і викидаєте шум, і одразу помітите, що модель стала гострішою.
Використовуйте пошук по джерелах для всього, що не влазить. Якщо ваш матеріал справді більший за будь-яке вікно, відповідь не в більшому вікні, а в тому, щоб діставати потрібні фрагменти під кожне запитання. Саме це роблять під капотом інструменти для роботи з документами.
Стежте за погіршенням, а не лише за помилками. Якщо відповіді стають розпливчастішими, більше уникають прямоти або починають ігнорувати вказівки щодо формату, ви, найімовірніше, вже глибоко у вікні. Почніть спочатку, перш ніж вирішувати, що модель зіпсувалася.
Скільки вікна вам насправді потрібно?
Підбирайте вікно під роботу, а не полюйте на найбільше число.
| Ваша робота | Що вам потрібно | Чому |
|---|---|---|
| Листи, чернетки, швидкі запитання | Будь-що сучасне | Ви ніколи навіть не наблизитеся до ліміту |
| Редагування довгих документів | Від 100 000 | Документ плюс ваша розмова про нього |
| Перевірка договорів і політик | Від 200 000, з перевіркою | Документ плюс міркування, із застереженням вище |
| Міркування по всій кодовій базі | Найбільше доступне | Код щільний за токенами, а зв'язки між файлами потребують ширини |
| Аналіз стенограм за місяці | Найбільше доступне або пошук по джерелах | Часто пошук тут кращий за грубу силу |
| Продукт на базі API | Менше, ніж вам здається, плюс кешування | Довгі промпти, це головна причина і вартості, і затримок |
Для більшості людей чесна відповідь така: контекстне вікно не є вирішальним чинником при виборі підписки. Якість письма, екосистема й ціна важать більше. Вирішальним воно стає рівно в одній ситуації: ваша робота регулярно передбачає завантаження більшого обсягу матеріалу, ніж вміщає звичайне вікно, і тоді різниця не маргінальна, це різниця між можливим і неможливим.
Якщо хочете перевірити це самі, практичний підхід такий: прогнати один і той самий довгий документ через дві чи три моделі й звірити відповіді з тим, що ви вже знаєте. Робочий простір на кшталт Whizi робить це легким, бо GPT, Claude, Gemini, Grok і DeepSeek живуть за однією підпискою, а дуже велике вікно Gemini лежить за один клік від ретельного синтезу Claude. Дивіться порівняння моделей поруч або прочитайте як обрати модель ШІ для ширшого рішення.
- Оцінюйте кількість токенів за правилом: 1 000 токенів, це приблизно 750 слів
- Пам'ятайте, що системні промпти, файли, результати пошуку й відповіді витрачають той самий бюджет
- Вважайте надійним робочим діапазоном приблизно половину заявленого вікна
- Спочатку вставляйте довгий матеріал, а запитання ставте після нього
- Повторюйте критичні обмеження в довгих розмовах, щоб вони пережили обрізання
- Починайте свіжий чат із письмовою передачею справ замість того, щоб тягнути далі довгий
Поширені запитання
Що таке контекстне вікно простими словами?
Це загальний обсяг тексту, який модель може тримати перед очима одночасно: ваші інструкції, уся розмова від початку, будь-які завантажені файли і відповідь, яку вона зараз пише. Коли сума перевищує ліміт, найстаріші частини випадають, і саме тому довгі чати починають щось забувати.
Чи завжди більше контекстне вікно краще?
Ні. Більше вікно дозволяє моделі прийняти більше матеріалу, але точність поступово падає зі зростанням вводу, особливо для фактів, захованих посередині. Модель із вікном на мільйон токенів не є автоматично кращою на довгих документах за модель із 200 000, тож перевіряйте на матеріалі, де ви знаєте правильну відповідь.
Скільки слів у 128 000 токенів?
Приблизно 96 000 слів, або десь книжка на 300 сторінок. Загальне співвідношення таке: один токен, це приблизно чотири символи англійського тексту, тож 1 000 токенів, це близько 750 слів. Код і неанглійський текст витрачають більше токенів на той самий зміст.
Чому ChatGPT забуває те, що я казав раніше?
Бо розмова переросла контекстне вікно, і найстаріші повідомлення відкинули або стиснули, щоб звільнити місце. Більшість чат-інтерфейсів роблять це мовчки. Повторення ключових обмежень або новий чат із коротким підсумком виправляють це одразу.
Контекстне вікно, це те саме, що пам'ять ШІ?
Ні. Контекстне вікно, це жорсткий ліміт однієї розмови. Пам'ять, це окрема функція продукту, яка зберігає факти про вас між розмовами і вставляє їх у нові. Пам'ять не збільшує вікно, вона займає його частину.