¿Qué es la ventana de contexto? El límite de la IA que lo explica todo

Una explicación en lenguaje claro de la ventana de contexto y los tokens: por qué la IA olvida cosas a mitad de la conversación, por qué más grande no siempre es mejor y cómo trabajar dentro del límite.

La explicación en lenguaje claro

La ventana de contexto es la cantidad total de texto que un modelo puede tener a la vista al mismo tiempo. Todo lo que el modelo sabe sobre tu conversación actual tiene que caber ahí dentro: tus instrucciones, cada mensaje que ha enviado cualquiera de los dos, cada archivo que subiste y la respuesta que está a punto de escribir.

Una imagen mental útil: el modelo no recuerda absolutamente nada de tu conversación. Cada vez que envías un mensaje, se le entrega de nuevo la conversación entera desde el principio, la lee completa y escribe la siguiente respuesta. La ventana de contexto es el tamaño del escritorio donde tiene que caber esa transcripción. Cuando el escritorio se llena, algo tiene que salir.

Por eso una IA puede parecer brillante durante veinte mensajes y luego empezar a contradecirse, olvidar una restricción que fijaste al principio o pedirte un archivo que ya le diste. No se confundió. La primera parte de la conversación se cayó del escritorio.

Hay una distinción que conviene tener clara desde el primer momento, porque causa mucha confusión: la ventana de contexto no es lo mismo que la memoria. Productos como ChatGPT y Claude tienen una función de memoria aparte que guarda datos sobre ti entre conversaciones y los inserta discretamente en las nuevas. Eso es una función del producto, construida encima del modelo. La ventana de contexto es una propiedad fija del modelo en sí, y ninguna función de memoria la hace más grande.

Los tokens y cómo estimarlos

Las ventanas de contexto se miden en tokens y no en palabras, porque los modelos no leen palabras. Leen fragmentos: una palabra frecuente suele ser un token, las palabras largas o poco habituales se parten en varios, y los signos de puntuación y los espacios también cuentan.

Las equivalencias aproximadas que vale la pena memorizar:

  • 1 token son unos 4 caracteres de texto en inglés, más o menos tres cuartos de palabra.
  • 1.000 tokens son unas 750 palabras, alrededor de página y media de texto normal.
  • El código es más denso. Cuenta con algo cercano a un token por cada tres caracteres, por los símbolos, la indentación y los identificadores poco comunes.
  • Otros idiomas rinden peor. El texto en idiomas menos representados en el tokenizador puede consumir dos o tres veces más tokens para decir lo mismo, algo que conviene saber si pagas por token.

Con eso ya puedes ponerle imagen a las cifras que ves en el material de marketing:

Ventana de contextoEquivale más o menos a
8.000 tokensUn artículo largo
32.000 tokensUn artículo científico corto con notas
128.000 tokensUn libro de 300 páginas
200.000 tokensUn manual técnico denso, o un proyecto de código mediano
1.000.000 de tokensVarios libros, o un año de transcripciones de reuniones

Lo importante que esta tabla esconde: el límite cubre la conversación entera, no cada mensaje. Una ventana de 128.000 tokens no significa que puedas enviar 128.000 tokens una y otra vez. Significa que el total acumulado de todo, incluidas las propias respuestas del modelo, tiene que quedarse por debajo de esa cifra.

Qué llena de verdad tu ventana

A casi todo el mundo le sorprende lo rápido que se llena la ventana, porque la mayor parte de lo que entra en ella es invisible. En una sesión de chat normal, el modelo lee todo lo siguiente en cada turno:

  1. El prompt del sistema. Instrucciones que el producto envía antes de que escribas nada: cómo comportarse, qué herramientas existen, la fecha de hoy, reglas de seguridad. Suelen ser miles de tokens, y nunca los ves.
  2. Tus instrucciones personalizadas o tu memoria. Todo lo que el producto haya guardado sobre ti e inyecte automáticamente.
  3. Todos los mensajes anteriores, los tuyos y los del modelo, completos. Las respuestas largas del modelo también cuentan, y suelen ser lo que más pesa.
  4. Cada archivo subido, o las partes que se extraen de él. Un PDF de 40 páginas son entre 20.000 y 30.000 tokens.
  5. Los resultados de herramientas y búsquedas. Una búsqueda web que trae cinco páginas puede añadir más que toda tu conversación hasta ese momento.
  6. La respuesta que se está generando. La salida comparte presupuesto con la entrada.

Por eso una conversación que se siente corta puede estar cerca de su límite. Tú enviaste ocho mensajes breves, pero el modelo escribió ocho respuestas largas, adjuntaste dos documentos y él hizo tres búsquedas. La parte visible de todo eso es quizá el diez por ciento del total.

También es la razón por la que la solución a una conversación confusa es tantas veces "abre un chat nuevo". No estás reseteando el humor del modelo. Estás despejando el escritorio.

Tamaño anunciado frente a tamaño útil

Esta es la parte que más importa y de la que menos se habla. La calidad de un modelo no se mantiene intacta hasta el límite para después caer en picado. Se degrada de forma gradual, y empieza a degradarse mucho antes del límite.

La versión mejor documentada de este fenómeno se conoce como el efecto lost in the middle, perderse en el medio. Pon un dato concreto al principio de un documento largo y el modelo lo encuentra. Ponlo al final y también lo encuentra. Entiérralo en mitad de 200 páginas y la precisión al recuperarlo cae de forma notable. La atención no se reparte por igual a lo largo de una entrada larga, y los extremos se llevan más.

Se complica todavía más cuando la tarea exige combinar varios datos repartidos por una entrada larga. Encontrar una aguja en un pajar es un problema resuelto. Encontrar cuatro agujas y razonar sobre la relación entre ellas no lo es, y esa es justo la tarea para la que la gente usa las ventanas de contexto grandes.

Así que trata la cifra anunciada como capacidad máxima, no como zona cómoda de trabajo. Una regla práctica salida del uso real: el comportamiento es fiable hasta más o menos la mitad de la ventana anunciada, y todo lo que pase de ahí conviene verificarlo en vez de creerlo. Si un modelo te dice que un contrato de 300 páginas no tiene cláusula de rescisión, compruébalo, sobre todo si esa cláusula estaría en el medio.

La consecuencia a la hora de comparar es que un modelo con ventana de un millón de tokens no es automáticamente mejor con documentos largos que uno de 200.000. Es mejor aceptándolos. Si razona bien sobre todo ese material es otra pregunta distinta, y la única forma de saberlo es probar con un documento cuya respuesta ya conoces.

Qué pasa cuando te quedas sin espacio

Cada producto gestiona el desbordamiento a su manera, y saber cuál estás usando explica muchos comportamientos raros.

ComportamientoLo que vesDónde ocurre
Error directoLa petición se rechaza con un mensaje sobre la longitudCasi todo el uso directo de la API
Truncamiento silenciosoLos mensajes más antiguos se descartan sin avisarteMuchas interfaces de chat
Resumen continuoLos mensajes antiguos se comprimen en un resumenCada vez más común en productos de chat
RecuperaciónSolo se traen las partes relevantes de tus documentos en cada turnoHerramientas de documentos y bases de conocimiento

El truncamiento silencioso es el que causa problemas de verdad, porque nada lo anuncia. El síntoma es un modelo que de pronto ignora una regla que fijaste al principio, vuelve a un tono que corregiste hace una hora o pregunta algo que ya respondiste. Al modelo no le pasa nada. Esas instrucciones simplemente ya no están en el escritorio.

Los resúmenes continuos son mejores, pero pierden información por el camino. Un resumen se queda con la idea general y tira los detalles, así que la restricción "no uses nunca la palabra sinergia" sobrevive como "el usuario tiene preferencias de estilo", lo cual no te sirve de nada.

Tácticas prácticas que sí funcionan

Están ordenadas por la diferencia que marcan en relación con el esfuerzo que cuestan.

Abre un chat nuevo cuando cambie el tema. El hábito con más retorno de todos. Una conversación larga arrastra el costo de todo lo anterior, incluidos los desvíos que ya no vienen al caso. Las conversaciones largas no están mejor informadas, son más caras y están más diluidas.

Pon tu pregunta después del material largo, no antes. Si pegas un documento y luego preguntas, la pregunta queda cerca del punto donde se genera la respuesta, y eso mejora de forma medible la precisión en entradas largas. Primero pegas, después preguntas.

Vuelve a anclar las restricciones importantes. En cualquier conversación que pase de unos quince intercambios, repite las reglas que importan en el mensaje donde importan: "recuerda: tono formal, sin viñetas, menos de 400 palabras". Te cuesta una línea y sobrevive al truncamiento.

Envía las páginas relevantes, no el libro entero. Si necesitas que el modelo revise la cláusula de indemnización, dale esa cláusula y las de alrededor. La precisión gana al volumen: es más rápido, más barato y más exacto.

Resume y reinicia a propósito. Cuando una sesión de trabajo se alarga, pide un traspaso estructurado: estado actual, decisiones tomadas, preguntas abiertas y restricciones. Pega eso en un chat nuevo. Conservas la sustancia y te deshaces del ruido, y vas a notar que el modelo se vuelve más agudo de inmediato.

Usa recuperación para todo lo que no quepa. Si tu material es de verdad más grande que cualquier ventana, la solución no es una ventana mayor, es traer solo los fragmentos relevantes para cada pregunta. Es lo que hacen por dentro las herramientas de documentos.

Vigila la degradación, no solo los errores. Si las respuestas se vuelven más vagas, se llenan de matices o empiezan a ignorar el formato que pediste, seguramente estás muy metido en la ventana. Empieza de cero antes de dar por hecho que el modelo ha empeorado.

¿Cuánta ventana necesitas en realidad?

Ajusta la ventana al trabajo en lugar de salir a comprar la cifra más grande.

Tu trabajoLo que necesitasPor qué
Correos, redacción, preguntas rápidasCualquier modelo actualNunca te vas a acercar al límite
Editar documentos largos100.000 o másEl documento más toda tu conversación sobre él
Revisar contratos y políticas200.000 o más, y verificarEl documento más el razonamiento sobre él, con la salvedad de arriba
Razonar sobre un proyecto de código enteroLa mayor disponibleEl código es denso en tokens y razonar entre archivos exige amplitud
Analizar meses de transcripcionesLa mayor disponible, o recuperaciónMuchas veces la recuperación funciona mejor que la fuerza bruta
Construir un producto sobre una APIMás pequeña de lo que crees, más cachéLos prompts largos son el principal motor del costo y de la latencia

Para la mayoría de la gente, la respuesta honesta es que la ventana de contexto no es el factor que decide entre una suscripción y otra. Pesan más la calidad de escritura, el ecosistema y el precio. Se vuelve el factor decisivo en exactamente una situación: tu trabajo implica de forma habitual meter más material del que cabe en una ventana normal, y en ese caso la diferencia no es marginal, es la diferencia entre poder y no poder.

Si quieres comprobarlo por tu cuenta, lo práctico es pasar el mismo documento largo por dos o tres modelos y contrastar las respuestas con algo que ya sabes. Un espacio de trabajo como Whizi te lo pone fácil porque GPT, Claude, Gemini, Grok y DeepSeek están detrás de una sola suscripción, y la ventana enorme de Gemini queda a un clic de la síntesis cuidadosa de Claude. Mira cómo comparar modelos lado a lado, o lee cómo elegir un modelo de IA para la decisión completa.

Lista de comprobación
  • Estima los tokens con la regla de que 1.000 tokens son unas 750 palabras
  • Recuerda que el prompt del sistema, los archivos, los resultados de búsqueda y las respuestas consumen el mismo presupuesto
  • Trata más o menos la mitad de la ventana anunciada como el rango fiable de trabajo
  • Pega primero el material largo y haz tu pregunta después
  • Repite las restricciones críticas en las conversaciones largas para que sobrevivan al truncamiento
  • Abre un chat nuevo con un traspaso escrito en lugar de alargar uno viejo

Preguntas frecuentes

¿Qué es la ventana de contexto en palabras sencillas?

Es la cantidad total de texto que un modelo puede tener a la vista a la vez: tus instrucciones, toda la conversación hasta ese punto, los archivos que subiste y la respuesta que está escribiendo. Cuando el total supera el límite, las partes más antiguas se caen, y por eso los chats largos empiezan a olvidar cosas.

¿Una ventana de contexto más grande siempre es mejor?

No. Una ventana mayor permite al modelo aceptar más entrada, pero la precisión se degrada de forma gradual a medida que la entrada crece, sobre todo con los datos enterrados en el medio. Un modelo con ventana de un millón de tokens no es automáticamente mejor con documentos largos que uno de 200.000, así que pruébalo con material cuya respuesta correcta ya conoces.

¿Cuántas palabras son 128.000 tokens?

Unas 96.000 palabras, más o menos un libro de 300 páginas. La conversión general es que un token son unos cuatro caracteres de texto en inglés, así que 1.000 tokens rondan las 750 palabras. El código y el texto que no está en inglés gastan más tokens para el mismo contenido.

¿Por qué ChatGPT olvida lo que le dije antes?

Porque la conversación creció más allá de la ventana de contexto y los mensajes más antiguos se descartaron o se comprimieron para hacer sitio. La mayoría de las interfaces de chat lo hacen en silencio. Repetir tus restricciones clave, o abrir un chat nuevo con un resumen corto, lo arregla al instante.

¿La ventana de contexto es lo mismo que la memoria de la IA?

No. La ventana de contexto es un límite fijo de una sola conversación. La memoria es una función de producto aparte que guarda datos sobre ti entre conversaciones y los inserta en las nuevas. La memoria no agranda la ventana, consume una parte de ella.