Что такое контекстное окно: лимит ИИ, который объясняет всё

Простое объяснение контекстных окон и токенов: почему ИИ забывает сказанное посреди разговора, почему большое окно не всегда лучше и как работать в его пределах.

Объяснение простыми словами

Контекстное окно, это общий объём текста, который модель способна удерживать перед глазами одновременно. Всё, что модель знает о вашем текущем разговоре, должно поместиться внутрь: ваши инструкции, каждое сообщение с обеих сторон, каждый загруженный файл и ответ, который она собирается написать.

Полезная картинка в голове: у модели вообще нет памяти о вашем разговоре. Каждый раз, когда вы отправляете сообщение, ей заново передают всю переписку целиком, она читает её и пишет следующий ответ. Контекстное окно, это размер стола, на котором эта расшифровка должна уместиться. Когда стол заполнен, что-то приходится с него убрать.

Вот почему ИИ может двадцать сообщений подряд быть острым, а потом начать противоречить себе, забывать ограничение, которое вы задали в самом начале, или просить файл, который вы уже дали. Он не запутался. Начало разговора просто соскользнуло со стола.

Одно различие стоит усвоить сразу, потому что оно порождает массу путаницы: контекстное окно, это не то же самое, что память. У продуктов вроде ChatGPT и Claude есть отдельная функция памяти, которая хранит факты о вас между разговорами и незаметно подставляет их в новые. Это функция продукта, надстроенная над моделью. Контекстное окно, это жёсткое свойство самой модели, и никакая функция памяти его не увеличивает.

Токены и как их прикинуть

Контекстные окна измеряют в токенах, а не в словах, потому что модели не читают слова. Они читают куски: частые слова обычно занимают один токен, длинные или редкие разбиваются на несколько, а знаки препинания и пробелы тоже считаются.

Грубые пересчёты, которые стоит запомнить:

  • 1 токен, это примерно 4 символа английского текста, или около трёх четвертей слова.
  • 1 000 токенов, это примерно 750 слов, около полутора страниц обычной прозы.
  • Код плотнее. Ожидайте ближе к одному токену на три символа из-за знаков, отступов и необычных идентификаторов.
  • Другие языки менее экономны. Текст на языках, которые слабее представлены в токенизаторе, может занимать в два-три раза больше токенов при том же смысле, и это стоит учитывать, если вы платите за токены. Русский относится как раз к таким языкам.

Это даёт способ представить те цифры, которые вы видите в маркетинговых материалах:

Контекстное окноПримерно равно
8 000 токеновДлинная статья
32 000 токеновНебольшая научная статья с заметками
128 000 токеновКнига на 300 страниц
200 000 токеновПлотное техническое руководство или кодовая база среднего размера
1 000 000 токеновНесколько книг или год расшифровок встреч

Важное, что эта таблица скрывает: лимит покрывает весь разговор, а не каждое сообщение по отдельности. Окно в 128 000 токенов не значит, что вы можете отправлять по 128 000 токенов раз за разом. Оно значит, что нарастающий итог всего, включая собственные ответы модели, должен оставаться ниже этого числа.

Что на самом деле заполняет ваше окно

Люди обычно удивляются тому, как быстро окно заполняется, потому что большая часть попадающего туда не видна. В типичной чат-сессии модель на каждом ходу читает вот это всё:

  1. Системный промпт. Инструкции, которые продукт отправляет ещё до того, как вы что-то напечатали: как себя вести, какие есть инструменты, сегодняшняя дата, правила безопасности. Часто это тысячи токенов, и вы их никогда не видите.
  2. Ваши пользовательские инструкции или память. Всё, что продукт сохранил о вас и подставляет автоматически.
  3. Каждое предыдущее сообщение, ваше и модели, целиком. Длинные ответы модели тоже считаются, и обычно именно они вносят самый большой вклад.
  4. Каждый загруженный файл или извлечённые из него фрагменты. PDF на 40 страниц, это примерно от 20 000 до 30 000 токенов.
  5. Результаты инструментов и поиска. Веб-поиск, который вытянул пять страниц, может добавить больше, чем весь ваш разговор до этого момента.
  6. Генерируемый ответ. Вывод делит тот же бюджет, что и ввод.

Вот почему разговор, который казался коротким, может быть у самого лимита. Вы отправили восемь коротких сообщений, но модель написала восемь длинных ответов, вы приложили два документа, а она сделала три поиска. Видимая часть от общего объёма, это процентов десять.

По той же причине лекарством от запутавшегося разговора так часто оказывается «начните новый чат». Вы не сбрасываете модели настроение. Вы освобождаете стол.

Заявленный размер против полезного

Это самая важная часть, и обсуждают её меньше всего. Качество модели не держится ровно до самого лимита, чтобы потом рухнуть с обрыва. Оно снижается постепенно и начинает снижаться задолго до лимита.

Лучше всего задокументированная версия этого эффекта называется потерей в середине (lost in the middle). Положите конкретный факт в начало длинного документа, и модель его найдёт. Положите в конец, и модель его найдёт. Закопайте его в середину 200 страниц, и точность извлечения заметно падает. Внимание распределяется по длинному вводу неравномерно, и краям достаётся больше.

Ещё труднее становится, когда задача требует соединить несколько фактов, разбросанных по длинному вводу. Найти одну иголку в стоге сена, это решённая задача. Найти четыре иголки и рассуждать о связи между ними, нет, а именно для этого люди и используют большие контекстные окна.

Так что относитесь к заявленному числу как к максимальной вместимости, а не как к комфортному рабочему диапазону. Практическое правило из реальной работы: надёжное поведение вы получаете примерно до половины заявленного окна, а всё, что дальше, стоит проверять, а не принимать на веру. Если модель говорит, что в договоре на 300 страниц нет пункта о расторжении, проверьте сами, особенно если такой пункт был бы в середине.

Вывод для сравнений: модель с окном в миллион токенов не становится автоматически лучше на длинных документах, чем модель с 200 000. Она лучше их принимает. Насколько хорошо она рассуждает по всему объёму, это отдельный вопрос, и единственный способ узнать, это протестировать на документе, ответ по которому вы уже знаете.

Что происходит, когда окно кончается

Разные продукты обрабатывают переполнение по-разному, и понимание того, с каким вариантом вы имеете дело, объясняет много странного поведения.

ПоведениеЧто вы видитеГде встречается
Жёсткая ошибкаЗапрос отклоняется с сообщением о длинеЧаще всего при прямой работе с API
Тихое обрезаниеСамые старые сообщения выбрасываются без предупрежденияМногие чат-интерфейсы
Скользящее резюмеСтарые сообщения сжимаются в краткое изложениеВсё чаще в чат-продуктах
ИзвлечениеНа каждом ходу подтягиваются только нужные части ваших документовИнструменты для документов и баз знаний

Тихое обрезание, вот что создаёт настоящие проблемы, потому что о нём никто не сообщает. Симптом, это модель, которая вдруг игнорирует правило, заданное в начале, возвращается к тону, который вы исправили час назад, или задаёт вопрос, на который вы уже ответили. С моделью ничего не случилось. Просто этих инструкций больше нет на столе.

Скользящие резюме лучше, но теряют детали. Резюме сохраняет суть и выбрасывает конкретику, поэтому ограничение «никогда не используй слово синергия» выживает как «у пользователя есть стилевые предпочтения», что не помогает вам вообще ничем.

Приёмы, которые действительно работают

Они упорядочены по тому, сколько дают относительно затраченных усилий.

Начинайте новый чат, когда меняется тема. Самая ценная привычка из всех. Длинный разговор тащит на себе стоимость всего, что было до него, включая отступления, которые уже не важны. Длинные разговоры не более осведомлённые, они более дорогие и более разбавленные.

Ставьте вопрос после длинного материала, а не перед ним. Если вы вставляете документ, а потом спрашиваете, вопрос оказывается близко к тому месту, где генерируется ответ, и это измеримо повышает точность на длинных вводах. Сначала вставили, потом спросили.

Заново закрепляйте важные ограничения. В любом разговоре длиннее примерно пятнадцати реплик повторяйте значимые правила в том сообщении, где они важны: «напоминаю: британский английский, без списков, до 400 слов». Это стоит вам одной строки и переживает обрезание.

Отправляйте нужные страницы, а не всю книгу. Если вам нужно, чтобы модель проверила пункт о возмещении убытков, дайте ей этот пункт и соседние. Точность бьёт объём: так быстрее, дешевле и точнее.

Подводите итог и перезапускайтесь осознанно. Когда рабочая сессия затягивается, попросите структурированную передачу дел: текущее состояние, принятые решения, открытые вопросы, ограничения. Вставьте это в новый чат. Вы сохраняете суть и выбрасываете шум, и заметите, что модель сразу становится острее.

Используйте извлечение для всего, что не помещается. Если вашего материала действительно больше, чем вмещает любое окно, ответ не в окне побольше, а в том, чтобы подтягивать нужные куски под каждый вопрос. Именно это делают под капотом инструменты для работы с документами.

Следите за деградацией, а не только за ошибками. Если ответы становятся расплывчатее, чаще оговариваются или начинают игнорировать требования к формату, вы, скорее всего, уже глубоко в окне. Начните заново, прежде чем решить, что модель стала хуже.

Сколько окна вам на самом деле нужно?

Подбирайте окно под работу, а не гоняйтесь за самым большим числом.

Ваша работаЧто нужноПочему
Письма, черновики, быстрые вопросыЛюбая современная модельВы даже близко не подойдёте к лимиту
Редактирование длинных документовОт 100 000Документ плюс ваш разговор о нём
Ревью договоров и политикОт 200 000, и проверяйтеДокумент плюс рассуждение о нём, с оговоркой выше
Рассуждение по всей кодовой базеМаксимально доступноеКод плотный по токенам, а рассуждение между файлами требует широты
Анализ расшифровок за месяцыМаксимально доступное или извлечениеЧасто извлечение работает лучше грубой силы
Разработка продукта на APIМеньше, чем вы думаете, плюс кешированиеДлинные промпты, это главный драйвер и цены, и задержки

Для большинства людей честный ответ такой: контекстное окно, это не решающий фактор при выборе подписки. Качество текста, экосистема и цена важнее. Решающим оно становится ровно в одной ситуации: ваша работа регулярно требует загружать больше материала, чем вмещает обычное окно. И тогда разница не косметическая, это разница между возможно и невозможно.

Если хотите проверить это сами, практичный подход, это прогнать один и тот же длинный документ через две-три модели и сверить ответы с тем, что вы уже знаете. Рабочее пространство вроде Whizi упрощает задачу, потому что GPT, Claude, Gemini, Grok и DeepSeek доступны по одной подписке, и очень большое окно Gemini в одном клике от аккуратного синтеза Claude. Смотрите сравнение моделей бок о бок или прочитайте как выбрать модель ИИ для более широкого решения.

Чек-лист
  • Оценивайте объём в токенах по правилу: 1 000 токенов, это примерно 750 слов
  • Помните, что системные промпты, файлы, результаты поиска и ответы тратят один и тот же бюджет
  • Считайте надёжным рабочим диапазоном примерно половину заявленного окна
  • Сначала вставляйте длинный материал, вопрос задавайте после
  • Повторяйте критичные ограничения в длинных разговорах, чтобы они пережили обрезание
  • Начинайте свежий чат с письменной передачей дел вместо того, чтобы тянуть длинный

Частые вопросы

Что такое контекстное окно простыми словами?

Это общий объём текста, который модель может удерживать перед глазами одновременно: ваши инструкции, весь разговор до этого момента, загруженные файлы и ответ, который сейчас пишется. Когда общий объём превышает лимит, самые старые части выпадают, поэтому длинные чаты начинают всё забывать.

Всегда ли большое контекстное окно лучше?

Нет. Большое окно позволяет модели принять больше ввода, но точность постепенно падает по мере роста ввода, особенно для фактов, закопанных в середине. Модель с окном в миллион токенов не становится автоматически лучше на длинных документах, чем модель с 200 000, поэтому тестируйте на материале, где вы знаете правильный ответ.

Сколько слов в 128 000 токенов?

Примерно 96 000 слов, или книга страниц на 300. Общий пересчёт такой: один токен, это около четырёх символов английского текста, поэтому 1 000 токенов, это примерно 750 слов. Код и текст не на английском тратят на то же содержание больше токенов.

Почему ChatGPT забывает, что я писал раньше?

Потому что разговор вырос за пределы контекстного окна, а самые старые сообщения были выброшены или сжаты, чтобы освободить место. Большинство чат-интерфейсов делают это молча. Повторение ключевых ограничений или новый чат с коротким резюме решают проблему сразу.

Контекстное окно, это то же самое, что память ИИ?

Нет. Контекстное окно, это жёсткий лимит на один разговор. Память, это отдельная функция продукта, которая сохраняет факты о вас между разговорами и подставляет их в новые. Память не увеличивает окно, она занимает его часть.