Perbualan atau dokumen terlalu panjang untuk model

Jawapan Ringkas

Whizi tidak menunjukkan sebarang ralat had konteks. Perbualan yang melebihi keupayaan model dipotong secara senyap agar muat sebelum permintaan dihantar. Empat had akan menolak mesej secara terus: 100,000 aksara dalam satu mesej, 100 mesej dalam satu permintaan, badan permintaan yang melebihi had laluan, dan prompt sistem sebanyak 32,000 aksara.

Jawapan ringkas

Whizi tidak menunjukkan ralat had konteks. Tiada mana-mana teks dalam produk ini menyebut tentang tetingkap konteks atau had token, kerana perbualan yang melebihi keupayaan model dipotong agar muat sebelum permintaan dihantar, bukannya ditolak. Tiada apa-apa memberitahu anda bahawa ini berlaku. Jika model itu seolah-olah terlupa bahagian tengah perbualan yang panjang, itulah puncanya.

Empat perkara benar-benar menolak anda secara terus, dan setiap satu menamakan dirinya:

MesejKod HTTPPencetus
This message is {count} characters, over the 100,000 character limit. Attach a shorter file, or ask about one section at a time.400 message_too_longSatu mesej, termasuk teks yang diekstrak daripada fail anda, melebihi 100,000 aksara
This conversation has {count} messages, over the 100 message limit.400 too_many_messagesSatu permintaan tunggal membawa transkrip lebih daripada 100 mesej
Request is too large.413 request_too_largeKeseluruhan badan permintaan JSON melebihi had bait laluan
That system prompt is missing or over the 32,000 character limit.400 invalid_system_promptPrompt sistem melebihi 32,000 aksara

{count} dalam rentetan had aksara diisi dengan nombor sebenar anda, diformat dengan pemisah ribuan. Kod di sebelah setiap rentetan itulah yang dipaparkan dalam jejak rangkaian, walaupun antara muka hanya menunjukkan ayat itu kepada anda.

Jika anda melihat mesej yang menamakan panjang konteks atau kiraan token, ia tidak datang daripada Whizi. Langkau ke bahagian terakhir.

Bajet yang diperoleh setiap model, dan apa yang berlaku selepas ia dilampaui

Setiap model dalam katalog mendapat bajet yang sama untuk satu giliran: 40,000 token input dan 20,000 token output. Ejen CPA Kanada ialah satu-satunya pengecualian, dengan 55,000 token input dan 40,000 token output.

Apabila perbualan melebihi bajet itu, bahagian belakang (backend) memotong sejarah kepada bajet token model secara senyap dan bukannya menolaknya. Tiada mesej toast, tiada sepanduk dan tiada kod ralat untuk perkara ini.

Kiraan token yang digunakan Whizi untuk memotong adalah anggaran, bukan tokenizer sebenar. Ia boleh mengira terlalu rendah berbanding tokenizer sebenar sehingga 1.66 kali ganda pada JSON, jadi kelonggaran 1.8 kali ganda digunakan pada input untuk menampung kes terburuk yang diukur.

Bertukar kepada model dengan konteks lebih besar tidak menghantar lebih banyak

Ini ialah pembaikan salah yang paling biasa dilakukan. Bajet input 40,000 token adalah tetap: ia sama pada model dengan tetingkap sejuta token seperti pada model dengan tetingkap 200,000 token. Memindahkan perbualan panjang daripada satu model bertetingkap besar ke model lain tidak mengubah sebarang jumlah yang dihantar.

Saiz tetingkap konteks hanya mengubah bajet dalam satu arah, iaitu ke bawah. Mana-mana model yang tetingkapnya berada di bawah 93,000 token mendapat bajet yang lebih kecil dan berkadar, bukannya bajet tetap tadi, dengan output dihadkan pada 40 peratus tetingkap dan margin keselamatan 1,000 token ditahan. 31 model dalam katalog dihadkan dengan cara ini, dan tetingkap terkecil antaranya ialah 6,144 token.

Jadi perubahan yang benar-benar membantu ialah kebalikan daripada yang orang cuba: berpindah daripada model kecil yang dihadkan kepada model biasa. Berpindah antara dua model bertetingkap besar ialah perubahan yang tiada kesan pada panjang. Cara peralihan pertengahan perbualan berfungsi diterangkan dalam peralihan model pertengahan perbualan.

Satu perincian di sebalik angka 93,000, berguna untuk diketahui jika anda cuba memahami sebab model menolak sesuatu yang kecil: OpenRouter mengira input ditambah output maksimum yang diminta terhadap tetingkap model, bukan input sahaja.

Muat naik yang panjang akan dipotong, dan ia memberitahu anda

Muat naik biasanya menjadi punca satu mesej melebihi 100,000 aksara, kerana fail PDF, Word dan hamparan diekstrak menjadi teks dalam pelayar anda, dan teks itu dikira terhadap had yang sama seperti apa-apa yang anda taip.

Apabila teks yang diekstrak tidak muat, ia dipotong dan bukannya ditolak, dan dua rentetan akan muncul. Mesej toast berbunyi Your upload was too large, so only the first part of it was sent. Ask about a smaller section for full coverage. Mesej itu sendiri membawa penanda [Attachment truncated: the upload was larger than one message can carry, so the content past this point was not included.] di titik potongan, supaya model dapat melihat di mana salinannya berhenti.

Jika mesej ditolak dan bukannya dipotong, anda akan mendapat rentetan message_too_long daripada jadual pertama. Penyelesaiannya ialah yang dinyatakan oleh ralat itu sendiri: lampirkan fail yang lebih pendek, atau tanya tentang satu bahagian pada satu masa.

Satu lagi tingkah laku yang seolah-olah lupaan: hanya mesej pengguna paling terkini yang membawa lampiran akan menghantar lampirannya kepada model. Imej atau PDF yang anda lampirkan sepuluh giliran lalu tidak dihantar semula pada setiap giliran seterusnya. Jika anda perlukan model melihatnya semula, lampirkan semula. Apa yang diterima Whizi dan cara pengekstrakan berfungsi ada dalam jenis fail yang disokong.

Satu nota kos, memandangkan panjang mengubah nilai sesuatu giliran. Pada Auto, mesej melebihi kira-kira 6,000 aksara dilencongkan ke tahap bentuk panjang pada 4 kredit, atas dasar bahawa mesej sepanjang itu ialah dokumen yang ditampal dan bukannya soalan. Soalan pendek dilencongkan ke tahap pantas pada 1 kredit. Skala kredit ada dalam cara kredit berfungsi.

Fail projek yang disemat dikenakan caj kepada prompt pada setiap giliran

Fail projek yang disemat turut serta sebagai teks prompt pada setiap giliran dalam projek itu, bukannya sekali sahaja, itulah sebabnya imej sengaja dikecualikan daripada jenis fail yang boleh disemat.

Had-had ini berdiri sendiri: setiap fail yang disemat menyumbang paling banyak 32,000 aksara teks yang diekstrak, dan keseluruhan blok projek dihadkan pada 120,000 aksara, merentasi paling banyak 10 fail yang disemat. Arahan tersuai projek boleh sehingga 32,000 aksara.

Fail dan arahan yang disemat dibina semula ke dalam prompt pada setiap giliran dalam projek itu, dalam bajet input yang sama seperti perbualan. Jika sembang projek seolah-olah kehilangan konteks lebih cepat daripada sembang biasa, nyahsemat fail yang tidak sedang anda tanyakan.

Jika anda benar-benar melihat ralat panjang konteks

Maka ia datang daripada penyedia model, bukan daripada Whizi, dan ia sampai kepada anda melalui laluan terus (passthrough). Sebarang kegagalan huluan yang bukan had kadar dikembalikan sebagai HTTP 502 dengan kod provider_error, membawa mesej penyedia, dipotong kepada 300 aksara. Apabila badan ralat penyedia langsung tidak dapat dihuraikan, anda akan mendapat The model provider rejected the request. sebagai gantinya.

Penolakan penyedia berkaitan panjang akan menamakan panjang konteks dan kiraan token. Nombor-nombor itu adalah penyedia mengira permintaan anda terhadap tetingkap yang lebih kecil daripada bajet yang dihantar oleh Whizi, dan itulah tepatnya yang diperlukan oleh sokongan untuk menyiasatnya.

Tiada tetapan antara muka yang mengubah perkara ini. Tukar kepada model lain untuk mendapatkan jawapan anda, dan hantar mesej tepat itu kepada sokongan termasuk nombor-nombornya.

Dua lagi rentetan yang sering disalah anggap sebagai masalah panjang. Generation failed mid-stream. dan The model stream was interrupted. ialah kegagalan sambungan di pertengahan jawapan, bukan penolakan akibat panjang. Cuba semula rentetan-rentetan itu. Too many requests. Please wait and try again. ialah had kadar pada 10 mesej seminit, yang juga tiada kaitan dengan panjang.

Senarai Semak
  • Whizi tiada ralat had konteks: ia memotong perbualan secara senyap
  • Setiap model mendapat bajet tetap 40,000 token input dan 20,000 token output setiap giliran
  • Ejen CPA Kanada ialah satu-satunya pengecualian, pada 55,000 masuk dan 40,000 keluar
  • Tetingkap di bawah 93,000 token menurunkan bajet itu, ia tidak pernah menaikkannya
  • Satu mesej dihadkan pada 100,000 aksara, termasuk teks fail yang diekstrak
  • Satu permintaan membawa paling banyak 100 mesej transkrip
  • Hanya mesej terkini yang membawa lampiran menghantar lampirannya
  • Fail projek yang disemat turut serta sebagai teks prompt pada setiap giliran dalam projek itu
  • Pada Auto, mesej melebihi kira-kira 6,000 aksara dilencongkan ke tahap bentuk panjang pada 4 kredit
  • Mesej yang menamakan panjang konteks datang daripada penyedia: tukar model dan beritahu sokongan

Soalan Lazim

Adakah Whizi mempunyai ralat had konteks?

Bukan yang berkaitan konteks. Mesej panjang yang ditunjukkan Whizi adalah kiraan, bukan tetingkap: 100,000 aksara dalam satu mesej, 100 mesej dalam satu permintaan, 32,000 aksara dalam prompt sistem, dan 413 Request is too large. pada keseluruhan badan permintaan. Jika mesej di hadapan anda menamakan kiraan token atau panjang konteks, ia sampai kepada anda melalui laluan terus 502 penyedia dan ia milik penyedia model.

Mengapa model terlupa sesuatu yang saya sebut lebih awal dalam sembang?

Kerana ia telah dipotong daripada permintaan sebelum permintaan itu dihantar. Bahagian belakang memotong sejarah kepada bajet token model secara senyap dan bukannya menolaknya, jadi tiada ralat untuk dibaca dan tiada tetapan yang boleh mematikannya. Memulakan perbualan baharu apabila subjek berubah ialah jawapan praktikal.

Adakah bertukar kepada model dengan tetingkap konteks lebih besar membenarkan saya menghantar lebih banyak?

Tidak. Bajet input adalah tetap pada 40,000 token pada setiap model dalam katalog, jadi tetingkap sejuta token dan tetingkap 200,000 token mendapat jumlah perbualan anda yang sama.

Apakah maksud "melebihi had 100,000 aksara"?

Satu mesej melebihi had setiap mesej sebanyak 100,000 aksara dan ditolak dengan HTTP 400 serta kod message_too_long. Teks yang diekstrak daripada fail PDF, Word atau hamparan yang dilampirkan turut dikira dalam had yang sama, jadi muat naik biasanya menjadi punca berbanding menaip. Penyelesaiannya ada dalam mesej itu sendiri: lampirkan fail yang lebih pendek, atau tanya tentang satu bahagian pada satu masa dalam perbualan yang sama.

Apakah maksud "melebihi had 100 mesej"?

Satu permintaan tunggal membawa transkrip lebih daripada 100 mesej, dan ia ditolak dengan HTTP 400 serta kod too_many_messages. Ia adalah had pada apa yang boleh dibawa oleh satu permintaan, bukan had pada berapa panjang sesuatu sembang boleh berlangsung. Memulakan perbualan baharu untuk subjek seterusnya ialah jawapan praktikal, dan ia juga memberikan model gambaran yang lebih jelas tentang apa yang anda tanyakan.

Bagaimana saya boleh meringkaskan dokumen yang lebih panjang daripada had?

Pecahkan dokumen itu dan kerjakan bahagian demi bahagian dalam satu perbualan, seperti yang disyorkan sendiri oleh rentetan message_too_long. Minta ringkasan bagi setiap bahagian, kemudian ringkasan bagi ringkasan-ringkasan itu. Jika satu bahagian masih melebihi 100,000 aksara selepas teks failnya diekstrak, pecahkan bahagian itu sekali lagi.

Bolehkah saya membayar untuk bajet konteks yang lebih besar?

Tidak. Bajet itu adalah ciri model dalam katalog dan bukannya ciri pelan anda, dan tiada tetapan di mana-mana yang boleh menaikkannya. Apa yang dibeli oleh pelan yang lebih tinggi ialah akses kepada lebih banyak model dan peruntukan bulanan yang lebih besar, bukan ruang tambahan dalam satu giliran. Pemetaan pelan ada dalam rujukan model.