¿Qué modelo de IA tiene la ventana de contexto más grande?
La ventana de contexto más grande del catálogo de agosto de 2026 es 1M tokens, de DeepSeek V4 Flash 0731, de DeepSeek. Como intuición física aproximada, un token equivale a unas tres cuartas partes de una palabra en inglés, y una página de manuscrito tiene unas 400 palabras, así que la tabla de abajo traduce cada ventana a páginas.
Una fila por cada proveedor principal, mostrando su modelo de mayor contexto:
| Proveedor | Modelo con mayor contexto | Ventana de contexto | Cabe aproximadamente |
|---|---|---|---|
| DeepSeek | DeepSeek V4 Flash 0731 | 1M tokens | unas 2.500 páginas |
| OpenAI | GPT-5.4 | 1M tokens | unas 2.000 páginas |
| Gemini 2.5 Flash | 1M tokens | unas 2.000 páginas | |
| Meta | Llama 4 Maverick | 1M tokens | unas 2.000 páginas |
| Qwen | Qwen3.8 2.4T A95B | 1M tokens | unas 2.000 páginas |
| Moonshot | Kimi K3 | 1M tokens | unas 2.000 páginas |
| Z.ai | GLM 5.2 | 1M tokens | unas 2.000 páginas |
| MiniMax | MiniMax M3 | 1M tokens | unas 2.000 páginas |
| Anthropic | Claude Fable 5 | 1M tokens | unas 1.900 páginas |
| xAI | Grok 4.3 | 1M tokens | unas 1.900 páginas |
| Mistral | Mistral Large 3 2512 | 262K tokens | unas 492 páginas |
Si la pregunta detrás de tu búsqueda es "qué es una ventana de contexto en primer lugar", empieza con la explicación en lenguaje sencillo en ¿Qué es una ventana de contexto? y vuelve aquí por las cifras.
¿Cómo se clasifican los 100 modelos según su ventana de contexto?
El catálogo completo, ordenado por ventana de contexto. Los datos vienen de la misma fuente que el Índice de Costos por Modelo de IA y se consultaron el 2026-08-20; es una instantánea de esa fecha y no una fuente en vivo, así que revisa la fecha antes de citar una cifra. La columna de créditos muestra lo que cuesta cada modelo por mensaje dentro de Whizi, donde un plan lo incluye.
| Modelo | Proveedor | Ventana de contexto | Cabe aproximadamente | Créditos en Whizi |
|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | DeepSeek | 1M | unas 2.500 páginas | 1 |
| GPT-5.4 | OpenAI | 1M | unas 2.000 páginas | 15 |
| GPT-5.5 | OpenAI | 1M | unas 2.000 páginas | 20 |
| GPT-5.6 Luna | OpenAI | 1M | unas 2.000 páginas | 1 |
| GPT-5.6 Luna Pro | OpenAI | 1M | unas 2.000 páginas | No medido |
| GPT-5.6 Sol | OpenAI | 1M | unas 2.000 páginas | 20 |
| GPT-5.6 Sol Pro | OpenAI | 1M | unas 2.000 páginas | No medido |
| GPT-5.6 Terra | OpenAI | 1M | unas 2.000 páginas | 4 |
| GPT-5.6 Terra Pro | OpenAI | 1M | unas 2.000 páginas | No medido |
| LongCat 2.0 | Meituan | 1M | unas 2.000 páginas | 1 |
| DeepSeek V4 Pro 0813 | DeepSeek | 1M | unas 2.000 páginas | 2 |
| Gemini 2.5 Flash | 1M | unas 2.000 páginas | 2 | |
| Gemini 2.5 Flash Lite | 1M | unas 2.000 páginas | 1 | |
| Gemini 3.1 Flash Lite | 1M | unas 2.000 páginas | 1 | |
| Gemini 3.1 Pro Preview | 1M | unas 2.000 páginas | 10 | |
| Gemini 3.5 Flash | 1M | unas 2.000 páginas | 8 | |
| Gemini 3.5 Flash Lite | 1M | unas 2.000 páginas | 2 | |
| Gemini 3.6 Flash | 1M | unas 2.000 páginas | 3 | |
| Gemini 3.7 Flash | 1M | unas 2.000 páginas | 2 | |
| GLM 5.2 | Z.ai | 1M | unas 2.000 páginas | 3 |
| GLM 5.3 | Z.ai | 1M | unas 2.000 páginas | 5 |
| Inkling | Thinkingmachines | 1M | unas 2.000 páginas | 4 |
| Kimi K3 | Moonshot | 1M | unas 2.000 páginas | 10 |
| Laguna S 2.1 | Poolside | 1M | unas 2.000 páginas | 1 |
| Llama 4 Maverick | Meta | 1M | unas 2.000 páginas | 1 |
| MiniMax M3 | MiniMax | 1M | unas 2.000 páginas | 1 |
| Muse Spark 1.1 | Meta | 1M | unas 2.000 páginas | 5 |
| Muse Spark 1.2 | Meta | 1M | unas 2.000 páginas | 5 |
| Qwen3.8 2.4T A95B | Qwen | 1M | unas 2.000 páginas | 8 |
| Claude Fable 5 | Anthropic | 1M | unas 1.900 páginas | 50 |
| Claude Opus 4.7 (Fast) | Anthropic | 1M | unas 1.900 páginas | No medido |
| Claude Opus 4.8 | Anthropic | 1M | unas 1.900 páginas | 20 |
| Claude Opus 4.8 (Fast) | Anthropic | 1M | unas 1.900 páginas | No medido |
| Claude Opus 5 | Anthropic | 1M | unas 1.900 páginas | 20 |
| Claude Opus 5 (Fast) | Anthropic | 1M | unas 1.900 páginas | No medido |
| Claude Sonnet 4.5 | Anthropic | 1M | unas 1.900 páginas | 10 |
| Claude Sonnet 4.6 | Anthropic | 1M | unas 1.900 páginas | 10 |
| Claude Sonnet 5 | Anthropic | 1M | unas 1.900 páginas | 10 |
| Fugu Ultra | Sakana | 1M | unas 1.900 páginas | 25 |
| Grok 4.3 | xAI | 1M | unas 1.900 páginas | 4 |
| Qwen3.5 Plus 2026-04-20 | Qwen | 1M | unas 1.900 páginas | 1 |
| Qwen3.6 Flash | Qwen | 1M | unas 1.900 páginas | 1 |
| Qwen3.7 Flash | Qwen | 1M | unas 1.900 páginas | 1 |
| Qwen3.7 Max | Qwen | 1M | unas 1.900 páginas | 5 |
| Qwen3.7 Plus | Qwen | 1M | unas 1.900 páginas | 1 |
| Qwen3.8 27B | Qwen | 1M | unas 1.900 páginas | 3 |
| Qwen3.8 Max | Qwen | 1M | unas 1.900 páginas | 6 |
| Inkling Small | Thinkingmachines | 524K | unas 983 páginas | 1 |
| Solar Pro 4 | Upstage | 524K | unas 983 páginas | 1 |
| Nemotron 3 Ultra | NVIDIA | 512K | unas 961 páginas | 3 |
| Grok 4.5 | xAI | 500K | unas 938 páginas | 6 |
| Grok 4.6 | xAI | 500K | unas 938 páginas | 6 |
| GPT Chat Latest | OpenAI | 400K | unas 750 páginas | 25 |
| GPT-5.4 Mini | OpenAI | 400K | unas 750 páginas | 4 |
| GPT-5.4 Nano | OpenAI | 400K | unas 750 páginas | 2 |
| Nova Pro 1.0 | Amazon | 300K | unas 563 páginas | 3 |
| Hy3 | Tencent | 262K | unas 492 páginas | 1 |
| Kimi K2 Thinking | Moonshot | 262K | unas 492 páginas | 10 |
| Kimi K2.7 Code | Moonshot | 262K | unas 492 páginas | 10 |
| Laguna XS 2.1 | Poolside | 262K | unas 492 páginas | 1 |
| Ling-3.0-flash | inclusionAI | 262K | unas 492 páginas | 1 |
| Mistral Large 3 2512 | Mistral | 262K | unas 492 páginas | 2 |
| Mistral Medium 3.5 | Mistral | 262K | unas 492 páginas | 6 |
| Nemotron 3.5 Lightning | NVIDIA | 262K | unas 492 páginas | 1 |
| Nex-N2-Mini | Nex Agi | 262K | unas 492 páginas | 1 |
| Nex-N2-Pro | Nex Agi | 262K | unas 492 páginas | 1 |
| Qwen3 Coder Next | Qwen | 262K | unas 492 páginas | 1 |
| Qwen3.6 35B A3B | Qwen | 262K | unas 492 páginas | 1 |
| Ring-2.6-1T | inclusionAI | 262K | unas 492 páginas | 1 |
| Sakana Namazu | Sakana | 262K | unas 492 páginas | 4 |
| Seed 2.1 Turbo | Bytedance Seed | 262K | unas 492 páginas | 2 |
| Seed-2.0-Code | Bytedance Seed | 262K | unas 492 páginas | 3 |
| Step 3.7 Flash | Stepfun | 262K | unas 492 páginas | 1 |
| Codestral 2508 | Mistral | 256K | unas 480 páginas | 1 |
| Command A | Cohere | 256K | unas 480 páginas | 10 |
| Grok Build 0.1 | xAI | 256K | unas 480 páginas | 3 |
| KAT-Coder-Air V2.5 | Kwaipilot | 256K | unas 480 páginas | 1 |
| KAT-Coder-Pro V2.5 | Kwaipilot | 256K | unas 480 páginas | 3 |
| GLM 4.6 | Z.ai | 205K | unas 384 páginas | 1 |
| GLM 4.7 | Z.ai | 205K | unas 384 páginas | 2 |
| GLM 5 | Z.ai | 205K | unas 384 páginas | 2 |
| MiniMax M2 | MiniMax | 205K | unas 384 páginas | 1 |
| Claude Haiku 4.5 | Anthropic | 200K | unas 375 páginas | 4 |
| DeepSeek V3.1 | DeepSeek | 164K | unas 307 páginas | 1 |
| DeepSeek V3.2 | DeepSeek | 164K | unas 307 páginas | 1 |
| Aion-3.0 | Aion Labs | 131K | unas 246 páginas | 10 |
| Aion-3.0-Mini | Aion Labs | 131K | unas 246 páginas | 2 |
| Granite 4.1 8B | Ibm Granite | 131K | unas 246 páginas | 1 |
| Kimi K2 0711 | Moonshot | 131K | unas 246 páginas | 10 |
| Llama 3.3 70B Instruct | Meta | 131K | unas 246 páginas | 1 |
| Mistral Medium 3.1 | Mistral | 131K | unas 246 páginas | 2 |
| Muse Glimmer 30B | Meta | 131K | unas 246 páginas | 2 |
| Nano Banana 2 (Gemini 3.1 Flash Image) | 131K | unas 246 páginas | No medido | |
| Nano Banana Pro (Gemini 3 Pro Image) | 131K | unas 246 páginas | No medido | |
| Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image) | 66K | unas 123 páginas | No medido | |
| R1 | DeepSeek | 64K | unas 120 páginas | 2 |
| Perceptron Mk1 | Perceptron | 33K | unas 61 páginas | 1 |
| Phi 4 | Microsoft | 16K | unas 31 páginas | 1 |
| Hy-MT2-1.8B | Tencent | 8K | unas 15 páginas | No medido |
| Hy-MT2-30B-A3B | Tencent | 8K | unas 15 páginas | No medido |
Cómo leer estas cifras con honestidad
La ventana es compartida. Todo cuenta contra ella a la vez: tu prompt, cada mensaje anterior de la conversación, cualquier documento que hayas adjuntado y la respuesta que se está escribiendo. Un modelo con una ventana de 128K que ya ha leído un contrato de 100K tokens no tiene 128K libres para la conversación; tiene 28K.
Lo anunciado no es lo efectivo. La investigación sobre contexto largo sigue encontrando el mismo patrón: los modelos recuerdan mejor el principio y el final de un contexto enorme que el medio. En los experimentos Lost in the Middle (Liu et al., 2023), mover el documento clave de los bordes de la entrada al medio le costó a los modelos unos 20 puntos de precisión, así que un modelo puede aceptar un millón de tokens y aun así pasar por alto la cláusula enterrada en el token 400,000. Para trabajo de alto riesgo sobre documentos largos, pregunta específicamente por las secciones del medio, o entrega el documento en partes etiquetadas.
Más grande no es automáticamente mejor. Las ventanas grandes cuestan más de ejecutar y pueden diluir la atención entre texto irrelevante. Si tu trabajo son correos y borradores cortos, el tamaño de la ventana nunca será algo que notes. Empieza a importar en contratos enteros, bases de código, transcripciones y libros.
Los tokens no son palabras. La regla de las tres cuartas partes es un buen promedio para el inglés, pero el código, los números y los idiomas que no son el inglés a menudo se tokenizan de forma menos eficiente, así que las estimaciones de páginas en la tabla son deliberadamente aproximadas.
Ajusta la ventana al trabajo
La conclusión práctica de la tabla es que la ventana de contexto es una elección por tarea, no por suscripción. El modelo con la ventana más grande rara vez es el mejor escritor, y el mejor escritor rara vez es la forma más barata de resumir 800 páginas.
Ese es el argumento a favor de tener el catálogo en un solo espacio de trabajo. En Whizi puedes darle el PDF de 200 páginas a un modelo de contexto largo, y luego cambiar a Claude o GPT en la misma conversación para redactar a partir de lo que encontró, sin que el documento salga del hilo. El contraargumento honesto: si todo lo que le das a un modelo cabe cómodamente en una ventana de 128K, que cubre la mayoría del correo, la redacción y el trabajo con documentos cortos, toda esta tabla es irrelevante y una suscripción de un solo proveedor es la compra más simple. La guía cómo elegir un modelo de IA cubre la misma decisión para calidad y costo.
Para citar esta página: la URL sin ancla es estable, la fecha de los datos está impresa encima de la tabla completa, y las cifras de tokens vienen del catálogo del proveedor, no de páginas de marketing.
- Resta tus documentos y tu historial de la ventana antes de fiarte de la cifra del titular
- Para documentos largos, prueba el recuerdo desde el medio, no solo desde el principio
- Traduce los tokens a páginas con la regla de las tres cuartas partes antes de decidir nada
- Elige la ventana por tarea en lugar de por suscripción
- Revisa la fecha de los datos encima de la tabla completa cuando cites una cifra
Preguntas frecuentes
¿Qué modelo de IA tiene la ventana de contexto más grande?
En el catálogo de agosto de 2026 es DeepSeek V4 Flash 0731, de DeepSeek, con 1M tokens. La tabla completa de arriba enumera los 100 modelos ordenados por tamaño de ventana, con la fecha de los datos impresa encima.
¿Cuál es la ventana de contexto más grande de Claude?
La ventana de contexto de Claude más grande del índice es 1M tokens (Claude Fable 5), que caben en unas 1.900 páginas de texto. Las variantes más pequeñas de Claude están en la tabla completa de arriba.
¿Cuál es la ventana de contexto más grande de GPT?
La ventana de contexto de GPT más grande del índice es 1M tokens (GPT-5.4), que caben en unas 2.000 páginas de texto. Las variantes más pequeñas de GPT están en la tabla completa de arriba.
¿Cuál es la ventana de contexto más grande de Gemini?
La ventana de contexto de Gemini más grande del índice es 1M tokens (Gemini 2.5 Flash), que caben en unas 2.000 páginas de texto. Las variantes más pequeñas de Gemini están en la tabla completa de arriba.
¿Cuál es la ventana de contexto más grande de Grok?
La ventana de contexto de Grok más grande del índice es 1M tokens (Grok 4.3), que caben en unas 1.900 páginas de texto. Las variantes más pequeñas de Grok están en la tabla completa de arriba.
¿Es siempre mejor una ventana de contexto más grande?
No. Las ventanas más grandes cuestan más, y el recuerdo se degrada hacia el medio de un contexto muy grande. El tamaño grande es decisivo para libros enteros, bases de código y transcripciones largas, e irrelevante para el chat de todos los días. Ajusta la ventana a la tarea en lugar de pagar por el número más grande.
¿Cuántas páginas caben en una ventana de contexto?
Divide el número de tokens entre unos 530 para obtener páginas de manuscrito: un token equivale a unas tres cuartas partes de una palabra en inglés, y una página tiene unas 400 palabras. Así que 128K tokens son unas 240 páginas, y un millón de tokens son unas 1.900 páginas. El código y el texto que no está en inglés suelen caber en menos.