L'explication en clair
Une fenêtre de contexte, c'est la quantité totale de texte qu'un modèle peut garder sous les yeux en même temps. Tout ce que le modèle sait de votre conversation en cours doit y tenir : vos instructions, chaque message envoyé de part et d'autre, chaque fichier que vous avez importé, et la réponse qu'il s'apprête à écrire.
Une image mentale utile : le modèle n'a aucun souvenir de votre conversation. Chaque fois que vous envoyez un message, toute la conversation lui est remise à neuf, il la relit en entier, puis il écrit la réponse suivante. La fenêtre de contexte, c'est la taille du bureau sur lequel cette transcription doit tenir. Quand le bureau est plein, il faut enlever quelque chose.
C'est pour cela qu'une IA peut sembler très juste pendant vingt messages, puis se contredire, oublier une contrainte que vous aviez posée au début, ou redemander un fichier que vous lui avez déjà donné. Elle ne s'est pas embrouillée. Le début de la conversation a glissé du bureau.
Une distinction à poser tout de suite, parce qu'elle crée beaucoup de confusion : la fenêtre de contexte n'est pas la mémoire. Des produits comme ChatGPT et Claude ont une fonction mémoire distincte, qui retient des faits sur vous d'une conversation à l'autre et les glisse discrètement dans les nouvelles. C'est une fonctionnalité produit construite par-dessus le modèle. La fenêtre de contexte, elle, est une propriété fixe du modèle lui-même, et aucune fonction mémoire ne l'agrandit.
Les tokens, et comment les estimer
Les fenêtres de contexte se mesurent en tokens plutôt qu'en mots, parce que les modèles ne lisent pas des mots. Ils lisent des morceaux : un mot courant vaut en général un token, un mot long ou rare se découpe en plusieurs, et la ponctuation et les espaces comptent aussi.
Les conversions approximatives à retenir :
- 1 token vaut environ 4 caractères en anglais, soit à peu près trois quarts de mot.
- 1 000 tokens font environ 750 mots, à peu près une page et demie de prose normale.
- Le code est plus dense. Comptez plutôt un token pour trois caractères, à cause des symboles, de l'indentation et des identifiants inhabituels.
- Les autres langues sont moins efficaces. Un texte rédigé dans une langue peu représentée dans le tokenizer peut demander deux à trois fois plus de tokens pour le même sens, ce qui compte si vous payez au token.
Cela permet de se représenter les chiffres qu'on voit passer dans les argumentaires marketing :
| Fenêtre de contexte | Équivaut à peu près à |
|---|---|
| 8 000 tokens | Un long article |
| 32 000 tokens | Un court article de recherche avec ses notes |
| 128 000 tokens | Un livre de 300 pages |
| 200 000 tokens | Un manuel technique dense, ou une base de code de taille moyenne |
| 1 000 000 de tokens | Plusieurs livres, ou un an de comptes rendus de réunion |
Ce que ce tableau cache d'important : la limite couvre toute la conversation, pas chaque message. Une fenêtre de 128 000 tokens ne veut pas dire que vous pouvez envoyer 128 000 tokens en boucle. Elle veut dire que le total cumulé de tout, y compris les réponses du modèle lui-même, doit rester sous ce chiffre.
Ce qui remplit vraiment votre fenêtre
On est en général surpris par la vitesse à laquelle la fenêtre se remplit, parce que l'essentiel de ce qui y entre est invisible. Dans une session de chat classique, le modèle relit tout ce qui suit à chaque tour de parole :
- Le prompt système. Les instructions que le produit envoie avant même que vous tapiez quoi que ce soit : comment se comporter, quels outils existent, la date du jour, les règles de sécurité. Souvent plusieurs milliers de tokens, et vous ne le voyez jamais.
- Vos instructions personnalisées ou votre mémoire. Tout ce que le produit a retenu sur vous et injecte automatiquement.
- Chaque message précédent, les vôtres comme ceux du modèle, en entier. Les longues réponses du modèle comptent aussi, et ce sont en général les plus gros contributeurs.
- Chaque fichier importé, ou les extraits qui en sont tirés. Un PDF de 40 pages représente environ 20 000 à 30 000 tokens.
- Les résultats d'outils et de recherche. Une recherche web qui remonte cinq pages peut ajouter plus que toute votre conversation jusque-là.
- La réponse en cours de génération. La sortie puise dans le même budget que l'entrée.
C'est pour cela qu'une conversation qui semblait courte peut être proche de sa limite. Vous avez envoyé huit messages brefs, mais le modèle a écrit huit longues réponses, vous avez joint deux documents et il a lancé trois recherches. La partie visible, c'est peut-être dix pour cent du total.
C'est aussi pour cela que le remède à une conversation qui déraille est si souvent « ouvrez une nouvelle conversation ». Vous ne réinitialisez pas l'humeur du modèle. Vous débarrassez le bureau.
Taille annoncée contre taille utile
C'est la partie qui compte le plus et dont on parle le moins. La qualité d'un modèle ne reste pas stable jusqu'à sa limite pour s'effondrer d'un coup. Elle se dégrade progressivement, et elle commence à se dégrader bien avant la limite.
La version la mieux documentée de ce phénomène s'appelle souvent l'effet « perdu au milieu » (lost in the middle). Placez un fait précis au début d'un long document et le modèle le trouve. Placez-le à la fin et le modèle le trouve. Enterrez-le au milieu de 200 pages et la précision de récupération baisse nettement. L'attention n'est pas répartie uniformément sur une longue entrée, et les bords en reçoivent davantage.
C'est encore plus dur quand la tâche demande de combiner plusieurs faits dispersés dans une longue entrée. Trouver une aiguille dans une botte de foin est un problème résolu. Trouver quatre aiguilles et raisonner sur ce qui les relie ne l'est pas, et c'est exactement ce pour quoi les gens utilisent les grandes fenêtres de contexte.
Traitez donc le chiffre annoncé comme une capacité maximale, pas comme une plage de travail confortable. Une règle empirique issue de l'usage réel : vous obtenez un comportement fiable jusqu'à environ la moitié de la fenêtre annoncée, et au-delà, il faut vérifier au lieu de faire confiance. Si un modèle vous affirme qu'un contrat de 300 pages ne contient aucune clause de résiliation, vérifiez, surtout si la clause se trouverait au milieu.
Ce que cela implique pour les comparaisons : un modèle doté d'une fenêtre d'un million de tokens n'est pas automatiquement meilleur sur les longs documents qu'un modèle à 200 000. Il est meilleur pour les accepter. Savoir s'il raisonne bien sur l'ensemble est une autre question, et le seul moyen de le savoir est de tester avec un document dont vous connaissez déjà la réponse.
Ce qui se passe quand la fenêtre est saturée
Les produits gèrent le débordement différemment, et savoir lequel vous utilisez explique beaucoup de comportements étranges.
| Comportement | Ce que vous voyez | Où cela arrive |
|---|---|---|
| Erreur franche | La requête est rejetée avec un message sur la longueur | La plupart des usages directs de l'API |
| Troncature silencieuse | Les messages les plus anciens sont supprimés sans vous prévenir | Beaucoup d'interfaces de chat |
| Résumé glissant | Les anciens messages sont compressés en un résumé | De plus en plus courant dans les produits de chat |
| Récupération ciblée | Seules les parties utiles de vos documents sont chargées à chaque tour | Outils documentaires et bases de connaissances |
La troncature silencieuse est celle qui pose de vrais problèmes, parce que rien ne l'annonce. Le symptôme : un modèle qui ignore soudain une règle posée au début, revient à un ton que vous aviez corrigé une heure plus tôt, ou pose une question à laquelle vous avez déjà répondu. Rien ne s'est cassé dans le modèle. Ces instructions ne sont simplement plus sur le bureau.
Les résumés glissants valent mieux, mais ils perdent de l'information. Un résumé garde l'idée générale et abandonne les détails : la contrainte « n'utilise jamais le mot synergie » survit sous la forme « l'utilisateur a des préférences de style », ce qui ne vous sert plus à rien.
Les tactiques qui marchent vraiment
Elles sont classées selon le rapport entre le gain obtenu et l'effort demandé.
Ouvrez une nouvelle conversation quand le sujet change. L'habitude la plus rentable, et de loin. Une longue conversation traîne le coût de tout ce qui l'a précédée, y compris des digressions devenues inutiles. Les longues conversations ne sont pas mieux informées, elles sont plus chères et plus diluées.
Mettez votre question après le long matériau, pas avant. Si vous collez un document puis posez la question, celle-ci se retrouve tout près de l'endroit où la réponse est générée, ce qui améliore mesurablement l'exactitude sur les longues entrées. Collez d'abord, demandez ensuite.
Réancrez les contraintes importantes. Dans toute conversation qui dépasse une quinzaine d'échanges, redites les règles qui comptent dans le message où elles comptent : « rappel : ton formel, pas de listes à puces, moins de 400 mots ». Cela vous coûte une ligne et cela survit à la troncature.
Envoyez les pages utiles, pas le livre entier. Si vous voulez faire vérifier la clause d'indemnisation, donnez la clause d'indemnisation et ce qui l'entoure. La précision bat le volume : c'est plus rapide, moins cher et plus exact.
Résumez et redémarrez volontairement. Quand une session de travail s'allonge, demandez une passation structurée : état actuel, décisions prises, questions ouvertes, contraintes. Collez cela dans une nouvelle conversation. Vous gardez le fond et vous jetez le bruit, et vous verrez le modèle redevenir net immédiatement.
Utilisez la récupération pour tout ce qui ne rentre pas. Si votre matériau est vraiment plus gros que n'importe quelle fenêtre, la réponse n'est pas une fenêtre plus grande, c'est d'aller chercher les morceaux utiles à chaque question. C'est ce que font les outils documentaires en coulisses.
Surveillez la dégradation, pas seulement les erreurs. Si les réponses deviennent plus vagues, plus prudentes, ou commencent à ignorer vos consignes de format, vous êtes sans doute au fond de la fenêtre. Repartez sur une conversation neuve avant de conclure que le modèle s'est dégradé.
De quelle fenêtre avez-vous réellement besoin ?
Adaptez la fenêtre au travail au lieu de courir après le plus gros chiffre.
| Votre travail | Ce qu'il vous faut | Pourquoi |
|---|---|---|
| E-mails, rédaction, questions rapides | N'importe quel modèle récent | Vous n'approcherez jamais la limite |
| Édition de longs documents | 100 000 et plus | Le document, plus la conversation à son sujet |
| Revue de contrats et de politiques internes | 200 000 et plus, et vérifiez | Le document, plus le raisonnement, avec la réserve ci-dessus |
| Raisonner sur toute une base de code | La plus grande disponible | Le code est dense en tokens et le raisonnement entre fichiers demande de la largeur |
| Analyser des mois de transcriptions | La plus grande disponible, ou la récupération | Souvent mieux servi par la récupération que par la force brute |
| Construire un produit sur une API | Plus petite que vous ne croyez, plus le cache | Les prompts longs sont le premier moteur du coût comme de la latence |
Pour la plupart des gens, la réponse honnête est que la fenêtre de contexte n'est pas le critère qui départage deux abonnements. La qualité d'écriture, l'écosystème et le prix comptent davantage. Elle devient décisive dans exactement un cas : votre travail consiste régulièrement à fournir plus de matière qu'une fenêtre normale ne peut contenir. Là, la différence n'est pas marginale, c'est la différence entre possible et impossible.
Si vous voulez le vérifier vous-même, la démarche pratique consiste à passer le même long document dans deux ou trois modèles et à confronter les réponses à ce que vous savez déjà. Un espace de travail comme Whizi rend cela facile, parce que GPT, Claude, Gemini, Grok et DeepSeek tiennent dans un seul abonnement, et la très grande fenêtre de Gemini est à un clic de la synthèse soignée de Claude. Voyez comparer les modèles côte à côte, ou lisez comment choisir un modèle d'IA pour la décision d'ensemble.
- Estimez le nombre de tokens avec la règle : 1 000 tokens font environ 750 mots
- Rappelez-vous que le prompt système, les fichiers, les résultats de recherche et les réponses puisent dans le même budget
- Considérez environ la moitié de la fenêtre annoncée comme la plage de travail fiable
- Collez le long matériau d'abord et posez votre question ensuite
- Redites les contraintes critiques dans les longues conversations pour qu'elles survivent à la troncature
- Ouvrez une nouvelle conversation avec une passation écrite plutôt que de prolonger une conversation trop longue
Questions fréquentes
Qu'est-ce qu'une fenêtre de contexte, en termes simples ?
C'est la quantité totale de texte qu'un modèle peut garder sous les yeux en même temps : vos instructions, toute la conversation en cours, les fichiers importés et la réponse en train de s'écrire. Quand le total dépasse la limite, les parties les plus anciennes disparaissent, et c'est pour cela que les longues conversations se mettent à oublier des choses.
Une fenêtre de contexte plus grande est-elle toujours meilleure ?
Non. Une fenêtre plus grande permet au modèle d'accepter plus de matière, mais l'exactitude se dégrade progressivement à mesure que l'entrée grossit, surtout pour les faits enfouis au milieu. Un modèle doté d'une fenêtre d'un million de tokens n'est pas automatiquement meilleur sur les longs documents qu'un modèle à 200 000, alors testez avec un document dont vous connaissez la bonne réponse.
Combien de mots font 128 000 tokens ?
Environ 96 000 mots, soit à peu près un livre de 300 pages. La conversion générale : un token vaut environ quatre caractères en anglais, donc 1 000 tokens font autour de 750 mots. Le code et les textes qui ne sont pas en anglais consomment plus de tokens pour le même contenu.
Pourquoi ChatGPT oublie-t-il ce que j'ai dit plus tôt ?
Parce que la conversation a dépassé la fenêtre de contexte et que les messages les plus anciens ont été supprimés ou compressés pour faire de la place. La plupart des interfaces de chat le font en silence. Redire vos contraintes clés, ou ouvrir une nouvelle conversation avec un court résumé, règle le problème immédiatement.
La fenêtre de contexte, est-ce la même chose que la mémoire de l'IA ?
Non. La fenêtre de contexte est une limite stricte qui ne vaut que pour une conversation. La mémoire est une fonctionnalité produit distincte, qui enregistre des faits sur vous d'une conversation à l'autre et les insère dans les nouvelles. La mémoire n'agrandit pas la fenêtre, elle en consomme une partie.