La conversación o el documento son demasiado largos para el modelo

Respuesta rápida

Whizi no muestra ningún error de límite de contexto. Una conversación que supera la capacidad del modelo se recorta para que quepa antes de enviar la solicitud, en silencio. Cuatro límites sí rechazan un mensaje directamente: 100.000 caracteres en un solo mensaje, 100 mensajes en una sola solicitud, un cuerpo de solicitud que supera el límite de la ruta, y un prompt de sistema de 32.000 caracteres.

La respuesta corta

Whizi no muestra ningún error de límite de contexto. Ninguna cadena de texto del producto menciona una ventana de contexto o un límite de tokens, porque una conversación que supera la capacidad del modelo se recorta para que quepa antes de enviar la solicitud, en lugar de rechazarse. Nada te avisa de que ocurrió. Si el modelo parece haber olvidado la parte intermedia de un chat largo, eso es justo lo que está pasando.

Cuatro cosas sí te rechazan directamente, y cada una se identifica a sí misma:

MensajeCódigo HTTPMotivo
This message is {count} characters, over the 100,000 character limit. Attach a shorter file, or ask about one section at a time.400 message_too_longUn mensaje, incluido el texto extraído de tus archivos, supera los 100.000 caracteres
This conversation has {count} messages, over the 100 message limit.400 too_many_messagesUna sola solicitud llevaba una transcripción de más de 100 mensajes
Request is too large.413 request_too_largeTodo el cuerpo de la solicitud JSON superó el límite de bytes de la ruta
That system prompt is missing or over the 32,000 character limit.400 invalid_system_promptUn prompt de sistema de más de 32.000 caracteres

El {count} de la cadena del límite de caracteres se rellena con tu número real, con separadores de miles. El código junto a cada cadena es lo que aparece en una traza de red, incluso cuando la interfaz solo te muestra la frase.

Si viste un mensaje que nombra una longitud de contexto o un recuento de tokens, no vino de Whizi. Salta a la última sección.

El presupuesto que recibe cada modelo, y qué pasa al superarlo

Todos los modelos del catálogo reciben el mismo presupuesto para un turno: 40.000 tokens de entrada y 20.000 tokens de salida. El agente de CPA canadiense es la única excepción, con 55.000 tokens de entrada y 40.000 de salida.

Cuando una conversación supera ese presupuesto, el backend recorta el historial hasta el presupuesto de tokens del modelo en silencio, en lugar de rechazarla. No hay ningún aviso, ni banner, ni código de error para esto.

El recuento de tokens con el que Whizi recorta es una estimación, no un tokenizador real. Puede quedarse corto frente a un tokenizador real hasta 1,66 veces en JSON, así que se aplica un margen de 1,8 veces a la entrada para cubrir el peor caso medido.

Cambiar a un modelo con más contexto no envía más

Esta es la solución equivocada más habitual. El presupuesto de 40.000 tokens de entrada es fijo: es el mismo en un modelo con una ventana de un millón de tokens que en uno con una ventana de 200.000 tokens. Mover una conversación larga de un modelo de ventana grande a otro no cambia nada de cuánto se envía.

El tamaño de la ventana de contexto solo cambia el presupuesto en una dirección, hacia abajo. Cualquier modelo cuya ventana quede por debajo de 93.000 tokens recibe un presupuesto menor y proporcional en lugar del fijo, con la salida limitada al 40 por ciento de la ventana y un margen de seguridad de 1.000 tokens reservado. 31 modelos del catálogo están limitados así, y la ventana más pequeña entre ellos es de 6.144 tokens.

Así que el cambio que sí ayuda es el contrario al que la gente prueba: pasar de un modelo pequeño y limitado a uno normal. Cambiar entre dos modelos de ventana grande no tiene ningún efecto en la longitud. Cómo se comporta el cambio a mitad de conversación está explicado en cambiar de modelo a mitad de conversación.

Un detalle detrás de la cifra de 93.000, útil si estás analizando por qué un modelo rechazó algo pequeño: OpenRouter cuenta la entrada más la salida máxima solicitada contra la ventana de un modelo, no solo la entrada.

Una carga larga se recorta, y te avisa

Las cargas de archivos son el motivo habitual de que un solo mensaje supere los 100.000 caracteres, porque los archivos PDF, Word y de hoja de cálculo se extraen a texto en tu navegador, y ese texto cuenta contra el mismo límite que cualquier cosa que escribas.

Cuando el texto extraído no cabe, se recorta en lugar de rechazarse, y aparecen dos cadenas de texto. El aviso dice Your upload was too large, so only the first part of it was sent. Ask about a smaller section for full coverage. El propio mensaje lleva el marcador [Attachment truncated: the upload was larger than one message can carry, so the content past this point was not included.] en el punto de corte, para que el modelo vea dónde termina su copia.

Si el mensaje se rechaza en lugar de recortarse, obtienes la cadena message_too_long de la primera tabla. La solución es la que nombra el propio error: adjunta un archivo más corto, o pregunta por una sección a la vez.

Otro comportamiento que parece un olvido: solo el mensaje más reciente del usuario que lleve adjuntos reenvía sus adjuntos al modelo. Una imagen o un PDF que adjuntaste hace diez turnos no se reenvía en cada turno posterior. Si necesitas que el modelo lo vuelva a ver, adjúntalo de nuevo. Lo que Whizi acepta y cómo funciona la extracción está en tipos de archivo admitidos.

Una nota sobre el coste, ya que la longitud cambia lo que vale un turno. En Auto, un mensaje de más de unos 6.000 caracteres se dirige al nivel de formato largo por 4 créditos, con el razonamiento de que un mensaje tan largo es un documento pegado más que una pregunta. Una pregunta corta se dirige al nivel rápido por 1 crédito. La escala de créditos está en cómo funcionan los créditos.

Los archivos fijados del proyecto se cobran en el prompt en cada turno

Un archivo fijado en un proyecto viaja como texto de prompt en cada turno de ese proyecto en lugar de una sola vez, por lo que las imágenes se excluyen a propósito de los tipos de archivo que se pueden fijar.

Los límites son propios: cada archivo fijado aporta como máximo 32.000 caracteres de texto extraído, y todo el bloque del proyecto está limitado a 120.000 caracteres, entre un máximo de 10 archivos fijados. Las instrucciones personalizadas del proyecto pueden llegar a 32.000 caracteres.

Los archivos fijados y las instrucciones se reconstruyen dentro del prompt en cada turno de ese proyecto, dentro del mismo presupuesto de entrada que la conversación. Si un chat de proyecto parece perder el hilo antes que uno normal, desfija los archivos que no estás consultando.

Si sí viste un error de longitud de contexto

Entonces vino del proveedor del modelo, no de Whizi, y te llegó a través del passthrough. Cualquier fallo del proveedor que no sea un límite de frecuencia se devuelve como HTTP 502 con el código provider_error, con el mensaje del proveedor, recortado a 300 caracteres. Cuando el cuerpo del error del proveedor no se puede interpretar en absoluto, recibes en su lugar The model provider rejected the request.

Un rechazo del proveedor por longitud nombrará una longitud de contexto y un recuento de tokens. Esos números son el proveedor contando tu solicitud contra una ventana más pequeña que el presupuesto que envió Whizi, y son justo lo que soporte necesita para revisarlo.

Ningún ajuste de la interfaz cambia esto. Cambia a otro modelo para obtener tu respuesta, y envía a soporte el mensaje exacto incluyendo los números.

Dos cadenas más que la gente confunde con un problema de longitud. Generation failed mid-stream. y The model stream was interrupted. son fallos de conexión a mitad de una respuesta, no rechazos por longitud. Reinténtalo. Too many requests. Please wait and try again. es un límite de frecuencia de 10 mensajes por minuto, que tampoco tiene nada que ver con la longitud.

Lista de comprobación
  • Whizi no tiene error de límite de contexto: recorta la conversación en silencio
  • Cada modelo recibe un presupuesto fijo de 40.000 tokens de entrada y 20.000 de salida por turno
  • El agente de CPA canadiense es la única excepción, con 55.000 de entrada y 40.000 de salida
  • Una ventana por debajo de 93.000 tokens reduce ese presupuesto, nunca lo aumenta
  • Un mensaje está limitado a 100.000 caracteres, incluido el texto extraído de archivos
  • Una solicitud lleva como máximo 100 mensajes de transcripción
  • Solo el mensaje más reciente que lleve un adjunto reenvía sus adjuntos
  • Un archivo fijado en un proyecto viaja como texto de prompt en cada turno de ese proyecto
  • En Auto, un mensaje de más de unos 6.000 caracteres se dirige al nivel de formato largo por 4 créditos
  • Un mensaje que nombra una longitud de contexto vino del proveedor: cambia de modelo y avisa a soporte

Preguntas frecuentes

¿Whizi tiene un error de límite de contexto?

Uno de contexto, no. Los mensajes de longitud que sí muestra Whizi son recuentos, no ventanas: 100.000 caracteres en un mensaje, 100 mensajes en una solicitud, 32.000 caracteres en un prompt de sistema, y un 413 Request is too large. en todo el cuerpo de la solicitud. Si el mensaje que tienes delante nombra un recuento de tokens o una longitud de contexto, te llegó a través del passthrough del proveedor con código 502 y pertenece al proveedor del modelo.

¿Por qué el modelo olvidó algo que dije antes en el chat?

Porque se recortó de la solicitud antes de enviarla. El backend recorta el historial hasta el presupuesto de tokens del modelo en silencio, en lugar de rechazarlo, así que no hay ningún error que leer ni ningún ajuste que lo desactive. Empezar una conversación nueva cuando cambia el tema es la solución práctica.

¿Cambiar a un modelo con una ventana de contexto más grande me permitirá enviar más?

No. El presupuesto de entrada es un fijo de 40.000 tokens en todos los modelos del catálogo, así que una ventana de un millón de tokens y una de 200.000 reciben la misma cantidad de tu conversación.

¿Qué significa "over the 100,000 character limit"?

Un mensaje superó el límite por mensaje de 100.000 caracteres y se rechazó con HTTP 400 y el código message_too_long. El texto extraído de un PDF, un archivo de Word o una hoja de cálculo adjuntos cuenta contra el mismo límite, así que una carga de archivo suele ser la causa, más que escribir. La solución está en el propio mensaje: adjunta un archivo más corto, o pregunta por una sección a la vez en la misma conversación.

¿Qué significa "over the 100 message limit"?

Una sola solicitud llevaba una transcripción de más de 100 mensajes, y se rechazó con HTTP 400 y el código too_many_messages. Es un límite sobre lo que puede llevar una solicitud, no un límite de cuánto puede durar un chat. Empezar una conversación nueva para el siguiente tema es la solución práctica, y además le da al modelo una visión más clara de lo que estás preguntando.

¿Cómo resumo un documento más largo que el límite?

Divídelo y trabaja sección por sección en una misma conversación, que es justo lo que recomienda la propia cadena message_too_long. Pide un resumen de cada sección, y luego un resumen de esos resúmenes. Si una sola sección aún supera los 100.000 caracteres una vez extraído su texto, divide esa sección de nuevo.

¿Puedo pagar por un presupuesto de contexto más grande?

No. El presupuesto es una propiedad del modelo del catálogo, no de tu plan, y no hay ningún ajuste en ningún sitio que lo aumente. Lo que compra un plan superior es acceso a más modelos y una asignación mensual mayor, no más espacio en un solo turno. La correspondencia de planes está en la referencia de modelos.