Percakapan atau dokumen terlalu panjang untuk model

Jawaban singkat

Whizi tidak menampilkan error batas konteks. Percakapan yang melampaui kapasitas model dipangkas agar pas sebelum permintaan dikirim, secara diam diam. Ada empat batas yang benar benar menolak pesan secara langsung: 100.000 karakter dalam satu pesan, 100 pesan dalam satu permintaan, isi permintaan yang melebihi batas rute, dan system prompt sebesar 32.000 karakter.

Jawaban singkatnya

Whizi tidak menampilkan error batas konteks. Tidak ada satu pun teks di produk ini yang menyebut context window atau batas token, karena percakapan yang melampaui kapasitas model dipangkas agar pas sebelum permintaan dikirim, bukan ditolak. Tidak ada pemberitahuan apa pun saat itu terjadi. Kalau model tampak lupa bagian tengah percakapan panjang, itulah yang sebenarnya terjadi.

Ada empat hal yang benar benar menolak Anda secara langsung, dan masing masing menyebutkan namanya sendiri:

PesanKode HTTPPemicu
This message is {count} characters, over the 100,000 character limit. Attach a shorter file, or ask about one section at a time.400 message_too_longSatu pesan, termasuk teks yang diekstrak dari file Anda, melebihi 100.000 karakter
This conversation has {count} messages, over the 100 message limit.400 too_many_messagesSatu permintaan membawa transkrip lebih dari 100 pesan
Request is too large.413 request_too_largeSeluruh isi permintaan JSON melebihi batas byte rute
That system prompt is missing or over the 32,000 character limit.400 invalid_system_promptSystem prompt lebih dari 32.000 karakter

{count} dalam teks batas karakter diisi dengan angka Anda yang sebenarnya, diformat dengan pemisah ribuan. Kode di samping setiap teks itulah yang muncul di network trace, bahkan saat antarmuka hanya menampilkan kalimatnya saja.

Kalau Anda melihat pesan yang menyebutkan context length atau jumlah token, itu bukan berasal dari Whizi. Langsung lompat ke bagian terakhir.

Jatah yang didapat setiap model, dan yang terjadi setelah melewatinya

Setiap model dalam katalog mendapat jatah yang sama untuk satu giliran: 40.000 token input dan 20.000 token output. Agen CPA Kanada adalah satu satunya pengecualian, dengan 55.000 token input dan 40.000 token output.

Ketika percakapan melewati jatah itu, backend memangkas riwayat hingga sesuai jatah token model secara diam diam, bukan menolaknya. Tidak ada toast, tidak ada banner, dan tidak ada kode error untuk itu.

Hitungan token yang jadi acuan pemangkasan Whizi adalah perkiraan, bukan tokenizer sungguhan. Perkiraan ini bisa menghitung lebih sedikit hingga 1,66 kali dari tokenizer sungguhan pada JSON, sehingga kelonggaran 1,8 kali diterapkan pada input untuk menutup kasus terburuk yang pernah terukur.

Beralih ke model dengan context window lebih besar tidak mengirim lebih banyak

Ini perbaikan keliru yang paling sering dicoba. Jatah input 40.000 token bersifat tetap: sama saja pada model dengan window satu juta token maupun model dengan window 200.000 token. Memindahkan percakapan panjang dari satu model berwindow besar ke model berwindow besar lainnya tidak mengubah apa pun soal berapa banyak yang terkirim.

Ukuran context window hanya mengubah jatah ke satu arah, yaitu turun. Model mana pun yang windownya berada di bawah 93.000 token mendapat jatah yang lebih kecil dan proporsional, bukan jatah tetap, dengan output dibatasi 40 persen dari window dan margin aman 1.000 token yang ditahan. 31 model dalam katalog dibatasi dengan cara ini, dan window terkecil di antaranya adalah 6.144 token.

Jadi perubahan yang benar benar membantu justru kebalikan dari yang biasa dicoba orang: berpindah dari model kecil yang dibatasi ke model biasa. Berpindah antar dua model berwindow besar adalah perubahan yang tidak berpengaruh pada panjang. Cara kerja berpindah model di tengah percakapan dibahas di berpindah model di tengah percakapan.

Satu detail di balik angka 93.000, penting diketahui kalau Anda bertanya tanya kenapa model menolak sesuatu yang kecil: OpenRouter menghitung input ditambah output maksimum yang diminta terhadap window model, bukan input saja.

Unggahan panjang dipotong, dan itu diberitahukan

Unggahan adalah penyebab umum satu pesan melewati 100.000 karakter, karena file PDF, Word, dan spreadsheet diekstrak menjadi teks di browser Anda, dan teks itu ikut terhitung dalam batas yang sama seperti apa pun yang Anda ketik.

Ketika teks hasil ekstraksi tidak muat, teks itu dipangkas, bukan ditolak, dan dua teks berikut muncul. Toastnya berbunyi Your upload was too large, so only the first part of it was sent. Ask about a smaller section for full coverage. Pesannya sendiri membawa penanda [Attachment truncated: the upload was larger than one message can carry, so the content past this point was not included.] di titik potongnya, sehingga model bisa melihat sampai mana salinannya berhenti.

Kalau pesan ditolak, bukan dipangkas, Anda mendapat teks message_too_long dari tabel pertama. Perbaikannya sama seperti yang disebutkan error itu sendiri: lampirkan file yang lebih pendek, atau tanyakan satu bagian dalam satu waktu.

Satu perilaku lagi yang terasa seperti lupa: hanya pesan pengguna terbaru yang membawa lampiran yang lampirannya diteruskan ke model. Gambar atau PDF yang Anda lampirkan sepuluh giliran lalu tidak dikirim ulang pada setiap giliran berikutnya. Kalau Anda ingin model melihatnya lagi, lampirkan lagi. Apa yang diterima Whizi dan cara ekstraksi bekerja ada di jenis file yang didukung.

Satu catatan biaya, karena panjang mengubah nilai satu giliran. Pada Auto, pesan di atas sekitar 6.000 karakter dialihkan ke jenjang panjang seharga 4 kredit, dengan alasan pesan sepanjang itu lebih mirip dokumen tempel daripada pertanyaan. Pertanyaan pendek dialihkan ke jenjang cepat seharga 1 kredit. Skala kreditnya ada di cara kerja kredit.

File proyek yang disematkan dikenai biaya pada prompt di setiap giliran

File proyek yang disematkan ikut sebagai teks prompt pada setiap giliran di proyek itu, bukan hanya sekali, itulah sebabnya gambar sengaja dikecualikan dari jenis file yang bisa disematkan.

Batasnya tersendiri: setiap file yang disematkan menyumbang paling banyak 32.000 karakter teks hasil ekstraksi, dan seluruh blok proyek dibatasi 120.000 karakter, untuk paling banyak 10 file yang disematkan. Instruksi khusus proyek bisa mencapai 32.000 karakter.

File dan instruksi yang disematkan dibangun ulang ke dalam prompt pada setiap giliran di proyek itu, dalam jatah input yang sama dengan percakapan. Kalau obrolan proyek terasa kehilangan konteks lebih cepat daripada obrolan biasa, lepas sematan file yang tidak sedang Anda tanyakan.

Kalau Anda memang melihat error context length

Maka itu berasal dari penyedia model, bukan dari Whizi, dan sampai ke Anda lewat passthrough. Kegagalan hulu apa pun yang bukan rate limit dikembalikan sebagai HTTP 502 dengan kode provider_error, membawa pesan dari penyedia, terpotong hingga 300 karakter. Ketika isi error dari penyedia sama sekali tidak bisa diurai, Anda mendapat The model provider rejected the request. sebagai gantinya.

Penolakan dari penyedia karena panjang akan menyebutkan context length dan jumlah token. Angka angka itu adalah hasil hitungan penyedia terhadap permintaan Anda dibandingkan window yang lebih kecil dari jatah yang dikirim Whizi, dan itu justru yang dibutuhkan support untuk menindaklanjutinya.

Tidak ada pengaturan di antarmuka yang mengubah ini. Beralihlah ke model lain untuk mendapatkan jawaban Anda, dan kirimkan ke support pesan persisnya lengkap dengan angka angkanya.

Dua teks lagi yang sering dikira masalah panjang. Generation failed mid-stream. dan The model stream was interrupted. adalah kegagalan koneksi di tengah jawaban, bukan penolakan karena panjang. Coba ulang keduanya. Too many requests. Please wait and try again. adalah rate limit pada 10 pesan per menit, yang juga tidak ada hubungannya dengan panjang.

Daftar Periksa
  • Whizi tidak punya error batas konteks: percakapan dipangkas secara diam diam
  • Setiap model mendapat jatah tetap 40.000 token input dan 20.000 token output per giliran
  • Agen CPA Kanada adalah satu satunya pengecualian, dengan 55.000 masuk dan 40.000 keluar
  • Window di bawah 93.000 token menurunkan jatah itu, tidak pernah menaikkannya
  • Satu pesan dibatasi 100.000 karakter, termasuk teks file yang diekstrak
  • Satu permintaan membawa paling banyak 100 pesan transkrip
  • Hanya pesan pembawa lampiran paling baru yang meneruskan lampirannya
  • File proyek yang disematkan ikut sebagai teks prompt pada setiap giliran di proyek itu
  • Pada Auto, pesan di atas sekitar 6.000 karakter dialihkan ke jenjang panjang seharga 4 kredit
  • Pesan yang menyebutkan context length berasal dari penyedia: beralih model dan beri tahu support

Pertanyaan Umum

Apakah Whizi punya error batas konteks?

Bukan yang soal konteks. Pesan panjang yang memang ditampilkan Whizi adalah soal hitungan, bukan window: 100.000 karakter dalam satu pesan, 100 pesan dalam satu permintaan, 32.000 karakter dalam system prompt, dan 413 Request is too large. untuk seluruh isi permintaan. Kalau pesan di depan Anda menyebutkan jumlah token atau context length, itu sampai ke Anda lewat passthrough 502 dari penyedia model dan menjadi urusan penyedia.

Kenapa model lupa sesuatu yang saya sebutkan sebelumnya di obrolan?

Karena itu dipangkas dari permintaan sebelum permintaan dikirim. Backend memangkas riwayat hingga sesuai jatah token model secara diam diam, bukan menolaknya, jadi tidak ada error yang bisa dibaca dan tidak ada pengaturan yang bisa mematikannya. Memulai percakapan baru saat topik berganti adalah jawaban praktisnya.

Apakah beralih ke model dengan context window lebih besar memungkinkan saya mengirim lebih banyak?

Tidak. Jatah input bersifat tetap 40.000 token pada setiap model dalam katalog, jadi window satu juta token dan window 200.000 token mendapat porsi percakapan Anda yang sama.

Apa arti "over the 100,000 character limit"?

Satu pesan melewati batas per pesan sebesar 100.000 karakter dan ditolak dengan HTTP 400 dan kode message_too_long. Teks yang diekstrak dari file PDF, Word, atau spreadsheet yang dilampirkan ikut terhitung dalam batas yang sama, jadi unggahan adalah penyebab umumnya, bukan mengetik. Perbaikannya ada di pesan itu sendiri: lampirkan file yang lebih pendek, atau tanyakan satu bagian dalam satu waktu di percakapan yang sama.

Apa arti "over the 100 message limit"?

Satu permintaan membawa transkrip lebih dari 100 pesan, dan ditolak dengan HTTP 400 dan kode too_many_messages. Ini batas untuk apa yang boleh dibawa satu permintaan, bukan batas untuk seberapa panjang sebuah obrolan boleh berlangsung. Memulai percakapan baru untuk topik berikutnya adalah jawaban praktisnya, dan itu juga memberi model gambaran yang lebih jelas soal apa yang Anda tanyakan.

Bagaimana cara meringkas dokumen yang lebih panjang dari batasnya?

Pecah dokumen itu dan kerjakan bagian demi bagian dalam satu percakapan, yang memang direkomendasikan oleh teks message_too_long itu sendiri. Minta ringkasan tiap bagian, lalu ringkasan dari ringkasan ringkasan itu. Kalau satu bagian saja masih melewati 100.000 karakter setelah teks filenya diekstrak, pecah lagi bagian itu.

Bisakah saya membayar untuk jatah konteks yang lebih besar?

Tidak. Jatah itu adalah properti model dalam katalog, bukan properti paket Anda, dan tidak ada pengaturan mana pun yang menaikkannya. Yang didapat dari paket yang lebih tinggi adalah akses ke lebih banyak model dan jatah bulanan yang lebih besar, bukan ruang lebih di satu giliran. Pemetaan paketnya ada di referensi model.