Розмова або документ занадто довгі для моделі

Коротка відповідь

Whizi не показує помилку про перевищення ліміту контексту. Розмова, яка переростає можливості моделі, мовчки обрізається до потрібного розміру перед надсиланням запиту. Але чотири ліміти дійсно відхиляють повідомлення напряму: 100,000 символів в одному повідомленні, 100 повідомлень в одному запиті, розмір тіла запиту понад ліміт маршруту та системний промпт довше 32,000 символів.

Коротка відповідь

Whizi не показує помилку про перевищення ліміту контексту. Жоден рядок у продукті не згадує вікно контексту чи ліміт токенів, бо розмова, яка переростає можливості моделі, мовчки обрізається до потрібного розміру перед надсиланням запиту, а не відхиляється. Ніщо не повідомляє вам, що це сталося. Якщо здається, що модель забула середину довгої розмови, ось що насправді відбувається.

Чотири речі дійсно відхиляють запит напряму, і кожна називає сама себе:

ПовідомленняКод HTTPПричина
This message is {count} characters, over the 100,000 character limit. Attach a shorter file, or ask about one section at a time.400 message_too_longОдне повідомлення, включно з текстом, витягнутим із ваших файлів, перевищує 100,000 символів
This conversation has {count} messages, over the 100 message limit.400 too_many_messagesОдин запит містив історію більш ніж на 100 повідомлень
Request is too large.413 request_too_largeУсе тіло JSON-запиту перевищило байтовий ліміт маршруту
That system prompt is missing or over the 32,000 character limit.400 invalid_system_promptСистемний промпт довший за 32,000 символів

{count} у рядку про ліміт символів заповнюється вашим реальним числом, відформатованим з розділювачами тисяч. Код поруч із кожним рядком це те, що видно в мережевому трасуванні, навіть коли інтерфейс показує лише речення.

Якщо ви бачили повідомлення, що називає довжину контексту або кількість токенів, воно надійшло не від Whizi. Перегляньте останній розділ.

Бюджет, який отримує кожна модель, і що відбувається, коли його перевищено

Кожна модель у каталозі отримує однаковий бюджет на один хід: 40,000 вхідних токенів і 20,000 вихідних токенів. Канадський агент CPA це єдиний виняток: 55,000 вхідних токенів і 40,000 вихідних токенів.

Коли розмова виходить за межі цього бюджету, бекенд мовчки обрізає історію до бюджету токенів моделі, а не відхиляє запит. Немає ані тосту, ані банера, ані коду помилки для цього.

Підрахунок токенів, за яким Whizi обрізає текст, є оцінкою, а не реальним токенізатором. Він може недооцінювати реальний токенізатор до 1.8 раза на JSON, тому до вхідних даних застосовується запас у 1.8 раза, щоб покрити найгірший виміряний випадок.

Перехід на модель з більшим вікном контексту не надсилає більше даних

Це найпоширеніша неправильна дія. Вхідний бюджет у 40,000 токенів фіксований: він однаковий і для моделі з вікном на мільйон токенів, і для моделі з вікном на 200,000 токенів. Перенесення довгої розмови з однієї моделі з великим вікном на іншу нічого не змінює в тому, скільки саме буде надіслано.

Розмір вікна контексту змінює бюджет лише в один бік, у бік зменшення. Будь-яка модель із вікном менше за 93,000 токенів отримує менший, пропорційний бюджет замість фіксованого, з виходом, обмеженим 40 відсотками вікна, і резервом у 1,000 токенів. У каталозі так обмежено 31 модель, і найменше вікно серед них становить 6,144 токени.

Тож перемикач, який справді допомагає, це протилежність того, що зазвичай пробують: перехід з малої, обмеженої моделі на звичайну. Перехід між двома моделями з великим вікном не впливає на довжину. Про те, як поводиться перемикання посеред розмови, читайте в перемиканні моделей посеред розмови.

Одна деталь щодо цифри 93,000, корисна для розуміння, чому модель відхилила щось невелике: OpenRouter враховує вхідні дані плюс запитуваний максимальний вихід у рахунок вікна моделі, а не лише вхідні дані.

Довге завантаження обрізається, і про це повідомляється

Завантаження зазвичай є причиною того, що одне повідомлення перевищує 100,000 символів, бо файли PDF, Word і таблиці витягуються у текст у вашому браузері, і цей текст враховується в той самий ліміт, що й усе введене вами вручну.

Коли витягнутий текст не вміщується, він обрізається, а не відхиляється, і з'являються два рядки. Тост говорить: Your upload was too large, so only the first part of it was sent. Ask about a smaller section for full coverage. Саме повідомлення містить позначку [Attachment truncated: the upload was larger than one message can carry, so the content past this point was not included.] у місці обрізання, щоб модель бачила, де закінчується її копія.

Якщо повідомлення відхиляється замість обрізання, ви отримуєте рядок message_too_long з першої таблиці. Виправлення саме те, що названо в самій помилці: додайте коротший файл або запитуйте про один розділ за раз.

Ще одна поведінка, яка сприймається як забудькуватість: лише останнє повідомлення користувача з вкладеннями пересилає свої вкладення моделі. Зображення чи PDF, які ви додали десять ходів тому, не надсилаються повторно на кожному наступному ході. Якщо потрібно, щоб модель знову подивилась на файл, додайте його ще раз. Що приймає Whizi і як працює вилучення тексту, описано в підтримуваних типах файлів.

Ще одна примітка щодо вартості, бо довжина впливає на те, скільки коштує хід. У режимі Auto повідомлення довше приблизно за 6,000 символів маршрутизується на довгий тариф за 4 кредити, з міркування, що таке довге повідомлення це вставлений документ, а не питання. Коротке питання маршрутизується на швидкий тариф за 1 кредит. Шкала кредитів описана в як працюють кредити.

Закріплені файли проєкту враховуються в промпті щоразу

Закріплений файл проєкту їде разом як текст промпту на кожному ході в цьому проєкті, а не лише один раз, тому зображення свідомо виключені з типів файлів, які можна закріпити.

Ліміти окремі: кожен закріплений файл додає щонайбільше 32,000 символів витягнутого тексту, а весь блок проєкту обмежений 120,000 символами на щонайбільше 10 закріплених файлів. Власні інструкції проєкту можуть бути до 32,000 символів.

Закріплені файли та інструкції перебудовуються в промпт на кожному ході в цьому проєкті, у межах того самого вхідного бюджету, що й розмова. Якщо чат проєкту, здається, губить нитку швидше за звичайний, відкріпіть файли, про які ви зараз не питаєте.

Якщо ви все ж побачили помилку про довжину контексту

Тоді вона надійшла від постачальника моделі, а не від Whizi, і дісталася вам через прохідний канал. Будь-яка помилка вище за рівнем, що не є обмеженням частоти, повертається як HTTP 502 з кодом provider_error, разом із повідомленням постачальника, обрізаним до 300 символів. Коли тіло помилки постачальника взагалі не вдається розпарсити, ви отримуєте The model provider rejected the request. замість цього.

Відмова постачальника через довжину назве довжину контексту й кількість токенів. Ці числа це підрахунок вашого запиту постачальником у межах вікна, меншого за бюджет, надісланий Whizi, і саме на них має дивитися підтримка.

Жодне налаштування в інтерфейсі цього не змінює. Перемкніться на іншу модель, щоб отримати відповідь, і надішліть підтримці точне повідомлення разом із числами.

Ще два рядки, які люди помилково приймають за проблему з довжиною. Generation failed mid-stream. і The model stream was interrupted. це збої з'єднання посеред відповіді, а не відмови через довжину. Їх варто повторити. Too many requests. Please wait and try again. це обмеження частоти на рівні 10 повідомлень за хвилину, яке також не має нічого спільного з довжиною.

Контрольний список
  • У Whizi немає помилки про перевищення ліміту контексту: розмова мовчки обрізається
  • Кожна модель отримує фіксований бюджет 40,000 вхідних і 20,000 вихідних токенів на хід
  • Канадський агент CPA це єдиний виняток, із 55,000 на вхід і 40,000 на вихід
  • Вікно менше за 93,000 токенів зменшує цей бюджет, ніколи не збільшує його
  • Одне повідомлення обмежене 100,000 символами, включно з текстом із файлів
  • Один запит містить щонайбільше 100 повідомлень історії
  • Лише останнє повідомлення з вкладеннями пересилає свої вкладення
  • Закріплений файл проєкту їде разом як текст промпту на кожному ході в цьому проєкті
  • У режимі Auto повідомлення довше приблизно за 6,000 символів маршрутизується на довгий тариф за 4 кредити
  • Повідомлення, що називає довжину контексту, надійшло від постачальника: перемкніть модель і напишіть підтримці

Поширені запитання

Чи є у Whizi помилка про перевищення ліміту контексту?

Не про контекст. Повідомлення про довжину, які показує Whizi, це підрахунки, а не вікна: 100,000 символів в одному повідомленні, 100 повідомлень в одному запиті, 32,000 символів у системному промпті та 413 Request is too large. для всього тіла запиту. Якщо повідомлення перед вами називає кількість токенів або довжину контексту, воно дісталося вам через прохідний канал 502 від постачальника моделі.

Чому модель забула щось, що я сказав раніше в розмові?

Тому що це було обрізано із запиту ще до його надсилання. Бекенд мовчки обрізає історію до бюджету токенів моделі, а не відхиляє запит, тож немає ані помилки, яку можна прочитати, ані налаштування, яке це вимикає. Практична відповідь, це почати нову розмову, коли тема змінюється.

Чи дозволить перехід на модель із більшим вікном контексту надсилати більше?

Ні. Вхідний бюджет фіксований на рівні 40,000 токенів для кожної моделі в каталозі, тож вікно на мільйон токенів і вікно на 200,000 токенів отримують однакову частину вашої розмови.

Що означає "понад ліміт 100,000 символів"?

Одне повідомлення перевищило ліміт на повідомлення в 100,000 символів і було відхилене з кодом HTTP 400 і кодом message_too_long. Текст, витягнутий із доданого PDF, файлу Word чи таблиці, враховується в той самий ліміт, тому зазвичай причина у завантаженні, а не в написаному тексті. Виправлення описано в самому повідомленні: додайте коротший файл або запитуйте про один розділ за раз у тій самій розмові.

Що означає "понад ліміт 100 повідомлень"?

Один запит містив історію більш ніж на 100 повідомлень і був відхилений із кодом HTTP 400 і кодом too_many_messages. Це ліміт на те, що може містити один запит, а не ліміт на те, якою довгою може бути розмова. Практична відповідь, це почати нову розмову для наступної теми, що також дає моделі чіткіше бачення того, про що ви питаєте.

Як підсумувати документ, довший за ліміт?

Розбийте його й працюйте розділ за розділом в одній розмові, саме це радить сам рядок message_too_long. Попросіть підсумок кожного розділу, а потім підсумок цих підсумків. Якщо один розділ усе одно перевищує 100,000 символів після вилучення тексту з файлу, розбийте цей розділ ще раз.

Чи можу я заплатити за більший бюджет контексту?

Ні. Бюджет це властивість моделі в каталозі, а не вашого плану, і немає жодного налаштування, яке б його підвищувало. Вищий план купує доступ до більшої кількості моделей і більший місячний ліміт, а не більше місця в одному ході. Відповідність планів описано в довіднику моделей.