گفتگو یا سند برای مدل خیلی طولانی است

پاسخ سریع

Whizi هیچ خطای محدودیت context نشان نمی‌دهد. گفتگویی که از ظرفیت مدل فراتر رود، پیش از ارسال درخواست، بی‌سروصدا کوتاه می‌شود تا جا بگیرد. چهار سقف هستند که پیام را کاملاً رد می‌کنند: 100,000 کاراکتر در یک پیام، 100 پیام در یک درخواست، حجم بدنهٔ درخواست بیش از سقف مسیر، و یک system prompt با بیش از 32,000 کاراکتر.

پاسخ کوتاه

Whizi خطای محدودیت context نشان نمی‌دهد. هیچ متنی در محصول به context window یا سقف token اشاره نمی‌کند، چون گفتگویی که از ظرفیت مدل فراتر رود، پیش از ارسال درخواست کوتاه می‌شود، نه اینکه رد شود. چیزی به شما اطلاع نمی‌دهد که این اتفاق افتاده. اگر به نظر می‌رسد مدل میانهٔ یک گفتگوی طولانی را فراموش کرده، دقیقاً همین اتفاق افتاده است.

چهار چیز هست که واقعاً شما را رد می‌کنند و هر کدام خودشان را معرفی می‌کنند:

پیامکد HTTPعلت
This message is {count} characters, over the 100,000 character limit. Attach a shorter file, or ask about one section at a time.400 message_too_longیک پیام، شامل متن استخراج‌شده از فایل‌های شما، بیش از 100,000 کاراکتر است
This conversation has {count} messages, over the 100 message limit.400 too_many_messagesیک درخواست حاوی رونوشتی با بیش از 100 پیام بوده
Request is too large.413 request_too_largeکل بدنهٔ JSON درخواست از سقف بایتی مسیر فراتر رفته
That system prompt is missing or over the 32,000 character limit.400 invalid_system_promptیک system prompt با بیش از 32,000 کاراکتر

{count} در رشتهٔ سقف کاراکتری با عدد واقعی شما پر می‌شود، با جداکننده‌های هزارگان. کد کنار هر رشته چیزی است که در ردیابی شبکه دیده می‌شود، حتی وقتی رابط کاربری فقط همان جمله را نشان می‌دهد.

اگر پیامی دیدید که از یک context length یا شمار token نام می‌برد، از Whizi نیامده. به بخش آخر بروید.

بودجه‌ای که هر مدل می‌گیرد، و بعد از آن چه اتفاقی می‌افتد

هر مدل در کاتالوگ برای یک نوبت همان بودجه را می‌گیرد: 40,000 token ورودی و 20,000 token خروجی. عامل CPA کانادایی تنها استثناست، با 55,000 token ورودی و 40,000 token خروجی.

وقتی گفتگویی از این بودجه فراتر رود، backend تاریخچه را به‌جای رد کردن، بی‌سروصدا تا بودجهٔ token مدل کوتاه می‌کند. هیچ toast، بنر یا کد خطایی برای آن وجود ندارد.

شماری که Whizi بر اساس آن کوتاه می‌کند، یک تخمین است نه یک tokenizer واقعی. می‌تواند تا 1.66 برابر روی JSON کمتر از یک tokenizer واقعی بشمارد، بنابراین برای ورودی یک ضریب اطمینان 1.8 برابر اعمال می‌شود تا بدترین حالت اندازه‌گیری‌شده را پوشش دهد.

جابه‌جا شدن به مدلی با context بزرگ‌تر چیز بیشتری ارسال نمی‌کند

این رایج‌ترین راه‌حل اشتباه است. بودجهٔ ورودی 40,000 token ثابت است: روی مدلی با پنجرهٔ یک میلیون token همان قدر است که روی مدلی با پنجرهٔ 200,000 token. جابه‌جا کردن یک گفتگوی طولانی از یک مدل با پنجرهٔ بزرگ به مدل دیگری از همین نوع، هیچ چیز را دربارهٔ میزان ارسالی تغییر نمی‌دهد.

اندازهٔ context window بودجه را فقط در یک جهت تغییر می‌دهد، به سمت پایین. هر مدلی که پنجره‌اش زیر 93,000 token باشد، به‌جای بودجهٔ ثابت، بودجه‌ای کوچک‌تر و متناسب می‌گیرد، با خروجی محدود به 40 درصد پنجره و 1,000 token حاشیهٔ ایمنی نگه‌داشته‌شده. 31 مدل در کاتالوگ به همین شکل محدود شده‌اند، و کوچک‌ترین پنجره در میان آن‌ها 6,144 token است.

پس تغییری که واقعاً کمک می‌کند برعکس چیزی است که مردم امتحان می‌کنند: جابه‌جا شدن از یک مدل کوچک و محدودشده به یک مدل معمولی. جابه‌جا شدن میان دو مدل با پنجرهٔ بزرگ تغییری بدون اثر روی طول است. رفتار جابه‌جایی مدل در میانهٔ گفتگو در جابه‌جایی مدل‌ها در میانهٔ گفتگو توضیح داده شده.

یک جزئیات پشت رقم 93,000، اگر دربارهٔ اینکه چرا یک مدل چیز کوچکی را رد کرده فکر می‌کنید، ارزش دانستن دارد: OpenRouter ورودی به‌علاوهٔ حداکثر خروجی درخواستی را در برابر پنجرهٔ مدل می‌شمارد، نه فقط ورودی را.

آپلود طولانی کوتاه می‌شود، و به شما می‌گوید

آپلودها معمول‌ترین دلیلی هستند که یک پیام از 100,000 کاراکتر فراتر می‌رود، چون فایل‌های PDF، Word و صفحه‌گسترده در مرورگر شما به متن استخراج می‌شوند و آن متن در برابر همان سقفی حساب می‌شود که هر چیزی که تایپ کرده‌اید.

وقتی متن استخراج‌شده جا نمی‌گیرد، به‌جای رد شدن کوتاه می‌شود، و دو رشته ظاهر می‌شود. متن toast این است: Your upload was too large, so only the first part of it was sent. Ask about a smaller section for full coverage. خود پیام هم نشانگر [Attachment truncated: the upload was larger than one message can carry, so the content past this point was not included.] را در نقطهٔ برش حمل می‌کند، تا مدل بداند رونوشتش کجا متوقف می‌شود.

اگر پیام به‌جای کوتاه شدن رد شود، همان رشتهٔ message_too_long از جدول اول را می‌بینید. راه‌حل همان چیزی است که خود خطا نام می‌برد: فایلی کوتاه‌تر پیوست کنید، یا دربارهٔ یک بخش در هر بار بپرسید.

یک رفتار دیگر که شبیه فراموشی به نظر می‌رسد: تنها آخرین پیام کاربر که پیوست دارد، پیوست‌هایش به مدل فرستاده می‌شود. تصویر یا PDFی که ده نوبت پیش پیوست کرده‌اید، در هر نوبت بعدی دوباره ارسال نمی‌شود. اگر می‌خواهید مدل دوباره به آن نگاه کند، دوباره پیوستش کنید. اینکه Whizi چه چیزی می‌پذیرد و استخراج چگونه کار می‌کند در انواع فایل پشتیبانی‌شده آمده.

یک نکتهٔ هزینه‌ای، چون طول تعیین می‌کند یک نوبت چقدر می‌ارزد. در Auto، پیامی بیش از حدود 6,000 کاراکتر به ردهٔ متن بلند با 4 credit مسیر می‌شود، به این دلیل که پیامی به این طولانی بیشتر یک سند کپی‌شده است تا یک پرسش. یک پرسش کوتاه به ردهٔ سریع با 1 credit مسیر می‌شود. جدول credit در credit چگونه کار می‌کند آمده.

فایل‌های pin‌شدهٔ پروژه در هر نوبت به prompt هزینه می‌شوند

یک فایل pinشدهٔ پروژه در هر نوبت آن پروژه به‌عنوان متن prompt همراه می‌شود، نه یک‌بار، به همین دلیل تصاویر عمداً از انواع فایل قابل pin کردن کنار گذاشته شده‌اند.

سقف‌ها جداگانه هستند: هر فایل pinشده حداکثر 32,000 کاراکتر متن استخراج‌شده وارد می‌کند، و کل بلوک پروژه به 120,000 کاراکتر محدود است، در حداکثر 10 فایل pinشده. دستورالعمل‌های سفارشی پروژه می‌توانند تا 32,000 کاراکتر باشند.

فایل‌های pinشده و دستورالعمل‌ها در هر نوبت آن پروژه دوباره در prompt ساخته می‌شوند، درون همان بودجهٔ ورودی گفتگو. اگر یک چت پروژه به نظر می‌رسد رشتهٔ موضوع را سریع‌تر از یک چت معمولی گم می‌کند، فایل‌هایی را که دربارهٔ آن‌ها نمی‌پرسید unpin کنید.

اگر واقعاً یک خطای context length دیدید

پس آن از ارائه‌دهندهٔ مدل آمده، نه از Whizi، و از مسیر passthrough به شما رسیده. هر خرابی بالادستی که سقف نرخ نباشد، با HTTP 502 و کد provider_error برگردانده می‌شود، حامل پیام ارائه‌دهنده، کوتاه‌شده به 300 کاراکتر. وقتی بدنهٔ خطای ارائه‌دهنده اصلاً قابل تجزیه نباشد، به‌جایش The model provider rejected the request. را می‌گیرید.

یک رد ارائه‌دهنده روی طول، یک context length و یک شمار token نام خواهد برد. آن اعداد نتیجهٔ شمردن درخواست شما توسط ارائه‌دهنده در برابر پنجره‌ای کوچک‌تر از بودجه‌ای است که Whizi فرستاده، و دقیقاً همان چیزی هستند که پشتیبانی باید ببیند.

هیچ تنظیمی در رابط کاربری این را تغییر نمی‌دهد. برای گرفتن پاسخ به مدل دیگری بروید، و پیام دقیق را همراه اعدادش برای پشتیبانی بفرستید.

دو رشتهٔ دیگر که مردم آن‌ها را با مشکل طول اشتباه می‌گیرند. Generation failed mid-stream. و The model stream was interrupted. خرابی‌های اتصال در میانهٔ یک پاسخ هستند، نه ردهای طولی. آن‌ها را دوباره امتحان کنید. Too many requests. Please wait and try again. یک سقف نرخ در 10 پیام در دقیقه است که آن هم هیچ ربطی به طول ندارد.

فهرست بررسی
  • Whizi هیچ خطای محدودیت context ندارد: گفتگو را بی‌سروصدا کوتاه می‌کند
  • هر مدل بودجهٔ ثابت 40,000 token ورودی و 20,000 token خروجی در هر نوبت می‌گیرد
  • عامل CPA کانادایی تنها استثناست، با 55,000 ورودی و 40,000 خروجی
  • پنجره‌ای زیر 93,000 token آن بودجه را پایین می‌آورد، هرگز بالا نمی‌برد
  • یک پیام به 100,000 کاراکتر محدود است، شامل متن فایل استخراج‌شده
  • یک درخواست حداکثر 100 پیام رونوشت حمل می‌کند
  • فقط آخرین پیام حاوی پیوست، پیوست‌های خودش را ارسال می‌کند
  • یک فایل pinشدهٔ پروژه در هر نوبت آن پروژه همراه متن prompt می‌شود
  • در Auto، پیامی بیش از حدود 6,000 کاراکتر به ردهٔ متن بلند با 4 credit مسیر می‌شود
  • پیامی که یک context length نام می‌برد از ارائه‌دهنده آمده: مدل را عوض کنید و به پشتیبانی بگویید

پرسش‌های متداول

آیا Whizi خطای محدودیت context دارد؟

نه از نوع context. پیام‌های طولی که Whizi واقعاً نشان می‌دهد شمارش هستند، نه پنجره: 100,000 کاراکتر در یک پیام، 100 پیام در یک درخواست، 32,000 کاراکتر در یک system prompt، و یک 413 با Request is too large. روی کل بدنهٔ درخواست. اگر پیامی که جلوی شماست از شمار token یا context length نام می‌برد، از مسیر passthrough 502 به شما رسیده و متعلق به ارائه‌دهندهٔ مدل است.

چرا مدل چیزی را که قبل‌تر در چت گفته بودم فراموش کرد؟

چون پیش از ارسال درخواست از آن حذف شده بود. backend تاریخچه را بی‌سروصدا تا بودجهٔ token مدل کوتاه می‌کند، نه اینکه رد کند، پس هیچ خطایی برای خواندن و هیچ تنظیمی برای خاموش کردنش نیست. شروع یک گفتگوی جدید وقتی موضوع عوض می‌شود، پاسخ عملی است.

آیا جابه‌جا شدن به مدلی با context window بزرگ‌تر اجازه می‌دهد چیز بیشتری بفرستم؟

نه. بودجهٔ ورودی روی هر مدل در کاتالوگ ثابت و 40,000 token است، پس پنجرهٔ یک میلیون token و پنجرهٔ 200,000 token همان مقدار از گفتگوی شما را می‌گیرند.

معنی «عبور از سقف 100,000 کاراکتر» چیست؟

یک پیام از سقف 100,000 کاراکتری هر پیام فراتر رفته و با HTTP 400 و کد message_too_long رد شده. متن استخراج‌شده از یک PDF، فایل Word یا صفحه‌گسترده پیوست‌شده در همان سقف حساب می‌شود، پس آپلود معمول‌ترین علت است نه تایپ کردن. راه‌حل در خود پیام آمده: فایلی کوتاه‌تر پیوست کنید، یا دربارهٔ یک بخش در همان گفتگو در هر بار بپرسید.

معنی «عبور از سقف 100 پیام» چیست؟

یک درخواست حاوی رونوشتی با بیش از 100 پیام بوده، و با HTTP 400 و کد too_many_messages رد شده. این سقفی روی چیزی است که یک درخواست می‌تواند حمل کند، نه سقفی روی طول یک چت. شروع یک گفتگوی جدید برای موضوع بعدی پاسخ عملی است، و همچنین دیدی تمیزتر از آنچه می‌پرسید به مدل می‌دهد.

چطور سندی طولانی‌تر از سقف را خلاصه کنم؟

آن را تکه‌تکه کنید و در یک گفتگو بخش‌به‌بخش کار کنید، همان چیزی که خود رشتهٔ message_too_long توصیه می‌کند. برای هر بخش خلاصه بخواهید، سپس خلاصه‌ای از آن خلاصه‌ها. اگر یک بخش هنوز پس از استخراج متن فایلش از 100,000 کاراکتر فراتر رود، آن بخش را دوباره تقسیم کنید.

آیا می‌توانم برای بودجهٔ context بزرگ‌تر پول بدهم؟

نه. بودجه ویژگی مدل در کاتالوگ است نه ویژگی پلن شما، و هیچ تنظیمی در هیچ‌جا آن را بالا نمی‌برد. چیزی که یک پلن بالاتر می‌خرد دسترسی به مدل‌های بیشتر و سهمیهٔ ماهانهٔ بزرگ‌تر است، نه جای بیشتر در یک نوبت. نگاشت پلن‌ها در مرجع مدل‌ها آمده.