La conversazione o il documento è troppo lungo per il modello

Risposta rapida

Whizi non mostra alcun errore di limite di contesto. Una conversazione che supera il modello viene ridotta per adattarsi prima che la richiesta venga inviata, in silenzio. Quattro limiti rifiutano invece un messaggio a priori: 100,000 caratteri in un unico messaggio, 100 messaggi in un'unica richiesta, un corpo della richiesta oltre il limite della route, e un prompt di sistema di 32,000 caratteri.

La risposta breve

Whizi non mostra alcun errore di limite di contesto. Nessuna stringa del prodotto menziona una finestra di contesto o un limite di token, perché una conversazione che supera il modello viene ridotta per adattarsi prima che la richiesta venga inviata, invece di essere rifiutata. Nulla ti avvisa che sia successo. Se il modello sembra aver dimenticato la parte centrale di una chat lunga, è proprio questo il motivo.

Quattro cose invece ti rifiutano a priori, e ognuna si identifica da sola:

MessaggioCodice HTTPFattore scatenante
This message is {count} characters, over the 100,000 character limit. Attach a shorter file, or ask about one section at a time.400 message_too_longUn messaggio, incluso il testo estratto dai tuoi file, supera i 100,000 caratteri
This conversation has {count} messages, over the 100 message limit.400 too_many_messagesUna singola richiesta conteneva una trascrizione di più di 100 messaggi
Request is too large.413 request_too_largeL'intero corpo della richiesta JSON ha superato il limite di byte della route
That system prompt is missing or over the 32,000 character limit.400 invalid_system_promptUn prompt di sistema oltre i 32,000 caratteri

Il valore {count} nella stringa del limite di caratteri viene sostituito con il tuo numero reale, formattato con i separatori delle migliaia. Il codice accanto a ogni stringa è ciò che compare in una traccia di rete, anche quando l'interfaccia ti mostra solo la frase.

Se hai visto un messaggio che indica una lunghezza di contesto o un conteggio di token, non proveniva da Whizi. Vai direttamente all'ultima sezione.

Il budget che ogni modello riceve, e cosa succede quando viene superato

Ogni modello del catalogo riceve lo stesso budget per un turno: 40,000 token in ingresso e 20,000 token in uscita. L'agente CPA canadese è l'unica eccezione, con 55,000 token in ingresso e 40,000 token in uscita.

Quando una conversazione supera quel budget, il backend riduce la cronologia al budget di token del modello in silenzio, invece di rifiutarla. Non c'è nessun toast, nessun banner e nessun codice di errore per questo.

Il conteggio di token su cui Whizi si basa per la riduzione è una stima e non un tokenizzatore reale. Può sottostimare un tokenizzatore reale fino a 1.66 volte sul JSON, quindi all'input viene applicato un margine di 1.8 volte per coprire il caso peggiore misurato.

Passare a un modello con contesto più grande non invia più contenuto

Questa è la soluzione sbagliata più comune. Il budget di 40,000 token in ingresso è fisso: è lo stesso su un modello con una finestra di un milione di token e su un modello con una finestra di 200,000 token. Spostare una conversazione lunga da un modello a finestra ampia a un altro non cambia nulla di quanto viene effettivamente inviato.

La dimensione della finestra di contesto modifica il budget in una sola direzione, verso il basso. Ogni modello la cui finestra è inferiore a 93,000 token riceve un budget più piccolo e proporzionale invece di quello fisso, con l'output limitato al 40 percento della finestra e un margine di sicurezza di 1,000 token trattenuto. 31 modelli del catalogo sono limitati in questo modo, e la finestra più piccola tra questi è di 6,144 token.

Quindi il cambio che aiuta davvero è l'opposto di quello che le persone di solito provano: passare da un modello piccolo e limitato a uno normale. Passare tra due modelli a finestra ampia è un cambiamento che non ha alcun effetto sulla lunghezza. Come si comporta il cambio di modello a metà conversazione è trattato in cambiare modello a metà conversazione.

Un dettaglio dietro il numero 93,000, utile da sapere se ti stai chiedendo perché un modello abbia rifiutato qualcosa di piccolo: OpenRouter conteggia l'input più l'output massimo richiesto rispetto alla finestra del modello, non l'input da solo.

Un caricamento lungo viene tagliato, e te lo dice

I caricamenti sono di solito il motivo per cui un singolo messaggio supera i 100,000 caratteri, perché i file PDF, Word e i fogli di calcolo vengono estratti in testo nel tuo browser, e quel testo conta ai fini dello stesso limite di qualsiasi cosa tu abbia digitato.

Quando il testo estratto non entra nel limite, viene ridotto invece di essere rifiutato, e compaiono due stringhe. Il toast recita Your upload was too large, so only the first part of it was sent. Ask about a smaller section for full coverage. Il messaggio stesso porta il marcatore [Attachment truncated: the upload was larger than one message can carry, so the content past this point was not included.] nel punto del taglio, così il modello può vedere dove si ferma la sua copia.

Se il messaggio viene rifiutato invece di essere ridotto, ottieni la stringa message_too_long della prima tabella. La soluzione è quella indicata dall'errore stesso: allega un file più corto, oppure chiedi di una sezione alla volta.

Un altro comportamento che sembra dimenticanza: solo l'allegato del messaggio utente più recente che ne contiene viene inoltrato al modello. Un'immagine o un PDF che hai allegato dieci turni fa non viene reinviato a ogni turno successivo. Se hai bisogno che il modello lo riveda, allegalo di nuovo. Cosa accetta Whizi e come funziona l'estrazione è spiegato in tipi di file supportati.

Una nota sui costi, dato che la lunghezza cambia il valore di un turno. Su Auto, un messaggio oltre circa 6,000 caratteri viene instradato al livello long-form a 4 crediti, partendo dal ragionamento che un messaggio così lungo è un documento incollato piuttosto che una domanda. Una domanda breve viene instradata al livello rapido a 1 credito. La scala dei crediti è spiegata in come funzionano i crediti.

I file fissati nel progetto vengono addebitati al prompt a ogni turno

Un file fissato in un progetto viaggia come testo del prompt a ogni singolo turno di quel progetto, e non una sola volta, ed è per questo che le immagini sono deliberatamente escluse dai tipi di file fissabili.

I limiti sono a sé stanti: ogni file fissato contribuisce al massimo con 32,000 caratteri di testo estratto, e l'intero blocco del progetto è limitato a 120,000 caratteri, distribuiti su al massimo 10 file fissati. Le istruzioni personalizzate del progetto possono arrivare fino a 32,000 caratteri.

I file fissati e le istruzioni vengono ricostruiti nel prompt a ogni turno di quel progetto, all'interno dello stesso budget di input della conversazione. Se una chat di progetto sembra perdere il filo più in fretta di una normale, rimuovi il fissaggio dei file su cui non stai facendo domande.

Se hai visto davvero un errore di lunghezza di contesto

Allora proviene dal fornitore del modello, non da Whizi, e ti è arrivato attraverso il passthrough. Qualsiasi errore a monte che non sia un rate limit viene restituito come HTTP 502 con il codice provider_error, che riporta il messaggio del fornitore, troncato a 300 caratteri. Quando il corpo dell'errore del fornitore non può essere analizzato affatto, ottieni invece The model provider rejected the request.

Un rifiuto del fornitore per lunghezza indicherà una lunghezza di contesto e un conteggio di token. Quei numeri corrispondono al fornitore che conteggia la tua richiesta rispetto a una finestra più piccola del budget inviato da Whizi, e sono esattamente ciò di cui il supporto ha bisogno per esaminarlo.

Nessuna impostazione dell'interfaccia cambia questo. Passa a un altro modello per ottenere la tua risposta, e invia al supporto il messaggio esatto, numeri inclusi.

Altre due stringhe che vengono scambiate per un problema di lunghezza. Generation failed mid-stream. e The model stream was interrupted. sono errori di connessione a metà di una risposta, non rifiuti di lunghezza. Riprova in questi casi. Too many requests. Please wait and try again. è un rate limit di 10 messaggi al minuto, che anch'esso non ha nulla a che fare con la lunghezza.

Lista di controllo
  • Whizi non ha alcun errore di limite di contesto: riduce la conversazione in silenzio
  • Ogni modello riceve un budget fisso di 40,000 token in ingresso e 20,000 in uscita per turno
  • L'agente CPA canadese è l'unica eccezione, con 55,000 in ingresso e 40,000 in uscita
  • Una finestra sotto i 93,000 token abbassa quel budget, non lo alza mai
  • Un messaggio è limitato a 100,000 caratteri, testo estratto dai file incluso
  • Una richiesta trasporta al massimo 100 messaggi di trascrizione
  • Solo il messaggio più recente con allegati inoltra i propri allegati
  • Un file fissato in un progetto viaggia come testo del prompt a ogni turno di quel progetto
  • Su Auto, un messaggio oltre circa 6,000 caratteri viene instradato al livello long-form a 4 crediti
  • Un messaggio che indica una lunghezza di contesto proviene dal fornitore: cambia modello e avvisa il supporto

Domande frequenti

Whizi ha un errore di limite di contesto?

Non uno di contesto. I messaggi di lunghezza che Whizi mostra sono conteggi, non finestre: 100,000 caratteri in un messaggio, 100 messaggi in una richiesta, 32,000 caratteri in un prompt di sistema, e un 413 Request is too large. sull'intero corpo della richiesta. Se il messaggio che hai davanti indica un conteggio di token o una lunghezza di contesto, ti è arrivato tramite il passthrough 502 del fornitore ed è di sua competenza.

Perché il modello ha dimenticato qualcosa che ho detto prima nella chat?

Perché è stato eliminato dalla richiesta prima che venisse inviata. Il backend riduce la cronologia al budget di token del modello in silenzio invece di rifiutarla, quindi non c'è nessun errore da leggere e nessuna impostazione che lo disattivi. Iniziare una nuova conversazione quando cambia l'argomento è la risposta pratica.

Passare a un modello con una finestra di contesto più grande mi permette di inviare di più?

No. Il budget di input è fisso a 40,000 token su ogni modello del catalogo, quindi una finestra da un milione di token e una da 200,000 token ricevono la stessa quantità della tua conversazione.

Cosa significa "oltre il limite di 100,000 caratteri"?

Un messaggio ha superato il limite per messaggio di 100,000 caratteri ed è stato rifiutato con HTTP 400 e il codice message_too_long. Il testo estratto da un PDF, un file Word o un foglio di calcolo allegato conta ai fini dello stesso limite, quindi un caricamento è la causa più comune, non la digitazione. La soluzione è nel messaggio stesso: allega un file più corto, oppure chiedi di una sezione alla volta nella stessa conversazione.

Cosa significa "oltre il limite di 100 messaggi"?

Una singola richiesta conteneva una trascrizione di più di 100 messaggi, ed è stata rifiutata con HTTP 400 e il codice too_many_messages. È un limite su ciò che una richiesta può trasportare, non un limite su quanto possa durare una chat. Iniziare una nuova conversazione per l'argomento successivo è la risposta pratica, e offre anche al modello una visione più chiara di cosa stai chiedendo.

Come faccio a riassumere un documento più lungo del limite?

Dividilo e lavora sezione per sezione all'interno di un'unica conversazione, che è esattamente quanto raccomanda la stringa message_too_long. Chiedi un riassunto di ogni sezione, poi un riassunto di quei riassunti. Se una singola sezione supera comunque i 100,000 caratteri una volta estratto il testo del file, dividi di nuovo quella sezione.

Posso pagare per avere un budget di contesto più grande?

No. Il budget è una proprietà del modello nel catalogo, non del tuo piano, e non c'è nessuna impostazione da nessuna parte che lo aumenti. Ciò che un piano superiore acquista è l'accesso a più modelli e un'allowance mensile più ampia, non più spazio in un singolo turno. La mappatura dei piani si trova in la guida di riferimento ai modelli.