Glossaire de l'IA : 55 termes expliqués simplement

Réponse rapide

Ce glossaire de l'IA définit 55 termes expliqués simplement, chaque entrée commençant par une définition en une phrase que vous pouvez citer, suivie du détail. Il est organisé par ce que vous faites plutôt que par ordre alphabétique, et couvre les bases, le dialogue avec un modèle, la fabrication des modèles, les défauts, la recherche documentaire, le travail au-delà du texte et l'écosystème plus large.

Les bases

Voici la version de référence : 55 termes, définition d'abord, détail ensuite. Si vous voulez la visite plus douce des seuls mots qui comptent la première semaine, lisez plutôt Le vocabulaire de l'IA expliqué et revenez ici quand un terme vous y renvoie.

Intelligence artificielle

L'intelligence artificielle est un logiciel qui exécute des tâches qui demandent normalement un jugement humain, comme écrire, raisonner ou reconnaître ce qu'il y a dans une image.

Dans l'usage courant de 2026, « IA » désigne presque toujours les assistants de chat construits sur de grands modèles de langage plutôt que le champ académique plus large.

Machine learning

Le machine learning est la technique qui consiste à apprendre à un logiciel en lui montrant des exemples plutôt qu'en le programmant avec des règles.

Tout assistant d'IA moderne est construit ainsi : le comportement vient des schémas présents dans les données d'entraînement, ce qui explique qu'un même modèle puisse être brillant sur des tâches courantes et fragile sur des tâches rares.

Modèle

Un modèle est un système d'IA entraîné précis, l'objet auquel un prompt est réellement envoyé.

GPT, Claude et Gemini sont des familles de modèles ; une famille contient des modèles individuels de tailles, de vitesses et de prix différents. Choisir entre eux selon la tâche est la compétence centrale pour bien utiliser l'IA.

LLM (grand modèle de langage)

Un LLM, ou grand modèle de langage, est un modèle entraîné sur d'énormes quantités de texte pour prédire quel texte doit venir ensuite.

Ce seul tour de passe-passe, appliqué à grande échelle, produit les réponses, les brouillons, le code et les résumés. Le mot « grand » renvoie à la fois aux données d'entraînement et au nombre de paramètres.

Chatbot

Un chatbot est l'interface conversationnelle qui enveloppe un modèle, la chose avec la zone de message.

Cette distinction compte quand on compare des produits : deux chatbots peuvent envelopper le même modèle et sembler différents, et un chatbot peut proposer plusieurs modèles, ce qui est le fonctionnement de Whizi.

Prompt

Un prompt est tout ce que vous envoyez au modèle : la question, les instructions et tout texte ou fichier que vous joignez.

La qualité de la réponse suit de près la qualité du prompt. Le contexte, les contraintes et le format de sortie voulu sont les trois éléments que les débutants oublient le plus souvent.

Token

Un token est le petit morceau de texte qu'un modèle lit et écrit réellement, environ trois quarts d'un mot anglais en moyenne.

La tarification, la vitesse et les fenêtres de contexte se mesurent toutes en tokens, ce qui explique pourquoi ce mot apparaît sur chaque page de tarifs de l'IA. Un document de 1 000 mots fait environ 1 300 tokens.

Fenêtre de contexte

Une fenêtre de contexte est la quantité maximale de texte, mesurée en tokens, qu'un modèle peut prendre en compte à la fois.

Votre prompt, la conversation jusqu'ici, les documents joints et la réponse la partagent tous. Le tableau comparatif des fenêtres de contexte donne le chiffre actuel pour chaque grand modèle, et l'explication détaille pourquoi elle explique la plupart des plaintes du type « l'IA a oublié ».

Paramètres

Les paramètres sont les nombres internes qu'un modèle a appris pendant l'entraînement, et la mesure habituelle de sa taille.

Comptés en milliards, plus de paramètres signifie en général plus de capacité et plus de coût. C'est un mauvais critère d'achat pris seul ; les benchmarks et vos propres tests l'emportent sur le nombre de paramètres.

Réponse

Une réponse est la sortie du modèle pour un prompt, aussi appelée une complétion.

Les réponses sont générées à neuf à chaque fois, ce qui explique pourquoi régénérer le même prompt donne une formulation différente et parfois une réponse différente.

Parler à un modèle

Prompt système

Un prompt système est l'instruction permanente qu'un modèle reçoit avant votre message, qui fixe son rôle, son ton et ses règles.

Chaque produit en a un même quand vous ne le voyez pas. Quand un chatbot « a une personnalité », c'est en général là que ça se joue.

Prompt engineering

Le prompt engineering est la pratique consistant à écrire des prompts de façon délibérée pour obtenir des résultats meilleurs de façon fiable.

Malgré son grand nom, il s'agit surtout de clarté ordinaire : énoncez l'objectif, donnez du contexte, montrez un exemple, nommez le format. Le guide pour débutants couvre les techniques qui changent vraiment les résultats.

Zero-shot

Zero-shot signifie demander à un modèle d'accomplir une tâche sans lui donner aucun exemple.

Les modèles modernes gèrent la plupart des tâches courantes en zero-shot. Le terme survit surtout comme contraste avec le prompting few-shot.

Few-shot

Few-shot signifie inclure une poignée d'exemples travaillés dans le prompt pour que le modèle copie le schéma.

C'est la mise à niveau de fiabilité la moins chère qui existe pour un travail sensible au format : deux ou trois exemples d'entrée et de sortie voulue battent un paragraphe de description.

Chaîne de raisonnement

La chaîne de raisonnement, c'est un modèle qui traverse des étapes intermédiaires avant de donner sa réponse finale.

Demander à un modèle de raisonner étape par étape améliore mesurablement les problèmes difficiles, et les modèles de raisonnement en font désormais une version en interne par défaut.

Température

La température est le réglage qui contrôle la part d'aléatoire qu'un modèle ajoute en choisissant chaque token suivant.

Une température basse donne une sortie cohérente et prudente ; une température haute donne de la variété et parfois du non-sens. Les produits de chat choisissent en général une valeur moyenne pour vous.

Streaming

Le streaming, c'est le modèle qui envoie sa réponse token par token pendant qu'il la génère, plutôt que d'un coup une fois terminé.

C'est pour cela que les réponses semblent s'écrire toutes seules, et pourquoi une mauvaise réponse peut être arrêtée tôt plutôt que subie jusqu'au bout.

Régénérer

Régénérer signifie demander une réponse fraîche au même prompt.

Comme la génération est probabiliste, une régénération est un tirage vraiment nouveau, pas une nouvelle tentative du même calcul. Comparer deux tirages, ou le même prompt sur deux modèles, est un contrôle de qualité rapide.

Comment les modèles sont fabriqués

Entraînement

L'entraînement est le processus qui ajuste les paramètres d'un modèle contre des données jusqu'à ce que ses prédictions deviennent bonnes.

Cela se passe avant que vous rencontriez jamais le modèle et coûte au fournisseur un calcul énorme. Rien de ce que vous tapez dans un chat ne réentraîne le modèle sur le moment, même si les fournisseurs peuvent utiliser les conversations pour entraîner les futures versions selon leur politique.

Données d'entraînement

Les données d'entraînement sont le texte et les autres contenus dont un modèle a appris.

Leur étendue explique ce qu'un modèle sait, leurs lacunes expliquent des angles morts systématiques, et leur plage de dates fixe la date limite de connaissance.

Pré-entraînement

Le pré-entraînement est la première et la plus grande phase de l'entraînement, où un modèle apprend la langue et la connaissance du monde à partir d'un texte en masse.

Le résultat est capable mais brut. Tout ce qui fait qu'un modèle se comporte comme un assistant utile vient après.

Fine-tuning

Le fine-tuning est un entraînement supplémentaire sur un ensemble de données plus étroit, pour spécialiser ou façonner un modèle pré-entraîné.

Les fournisseurs font du fine-tuning pour l'utilité et la sécurité ; les entreprises en font pour des tâches spécialisées. Pour la plupart des utilisateurs, un bon prompt associé à un modèle généraliste capable bat le fait de payer pour un fine-tune.

RLHF

Le RLHF, apprentissage par renforcement à partir de retours humains, consiste à entraîner un modèle contre des évaluations humaines de ses réponses.

C'est une grande partie de la raison pour laquelle les assistants modernes sont polis, structurés et prudents. Poussé trop loin, cela produit aussi les précautions excessives qui font que certains modèles refusent ou tergiversent.

Alignement

L'alignement est le travail qui consiste à faire correspondre le comportement d'un modèle à l'intention et aux valeurs humaines.

En pratique, cela couvre tout, du refus des demandes nuisibles au simple fait de suivre les instructions avec précision. Quand un modèle fait quelque chose de techniquement impressionnant mais non désiré, c'est une lacune d'alignement.

Inférence

L'inférence, c'est faire tourner un modèle entraîné pour produire une réponse, par opposition à l'entraîner.

Chaque message que vous envoyez déclenche une inférence, et le coût de l'inférence est ce que mesure la tarification au token. Des modèles peu coûteux à faire tourner peuvent être remarquablement capables ; l'indice de coût des modèles d'IA montre un écart de prix de 2 000 fois.

Transformer

Le transformer est l'architecture de réseau de neurones derrière pratiquement tous les modèles de langage modernes.

Son mécanisme clé, l'attention, permet au modèle de pondérer chaque partie de l'entrée par rapport à chaque autre partie. Vous n'avez jamais besoin des détails, mais le mot est partout dans les écrits sur l'IA.

Quand les choses tournent mal

Hallucination

Une hallucination est un modèle qui énonce quelque chose de faux avec une confiance totale.

Ce n'est pas un bug qu'un correctif réglera dans la prochaine version ; cela découle de la façon même dont fonctionne la génération. La fréquence varie beaucoup selon le modèle et la tâche. Traitez tout fait, chiffre ou citation précis comme non vérifié tant que vous ne l'avez pas contrôlé. Pourquoi l'IA se trompe détaille le mécanisme.

Ancrage

L'ancrage consiste à donner à un modèle un contenu de référence pour répondre, au lieu de le laisser se fier à sa mémoire.

Coller le contrat, joindre le rapport ou activer la recherche web sont tous des formes d'ancrage. C'est la défense quotidienne la plus efficace contre l'hallucination.

Biais

Un biais, c'est un modèle qui déforme systématiquement ses sorties de façons héritées des données d'entraînement.

Cela se manifeste par des présupposés sur les personnes, les lieux et les valeurs par défaut. Pour les décisions à conséquences, relisez la sortie de l'IA comme vous relisiez le travail d'un stagiaire intelligent mais non vérifié.

Garde-fous

Les garde-fous sont les restrictions qu'un fournisseur construit autour d'un modèle pour bloquer une sortie nuisible ou hors politique.

Des fournisseurs différents tracent les lignes différemment, ce qui est une vraie différence de produit : la même demande peut être satisfaite par un modèle et refusée par un autre.

Jailbreak

Un jailbreak est un prompt conçu pour piéger un modèle afin qu'il ignore ses garde-fous.

Les fournisseurs les corrigent en continu. Pour les utilisateurs ordinaires, le terme compte surtout comme concept de sécurité : tout ce qu'on peut convaincre un modèle de faire, quelqu'un essaiera de l'en convaincre.

Red teaming

Le red teaming consiste à attaquer délibérément un modèle avant sa sortie pour trouver des modes de défaillance nuisibles.

Les fournisseurs font tourner des équipes rouges internes et externes, et les fiches de modèle publiées résument souvent ce qu'elles ont trouvé. C'est l'équivalent, pour l'IA, du test d'intrusion.

Date limite de connaissance

Une date limite de connaissance est la date après laquelle les données d'entraînement d'un modèle s'arrêtent.

Demandez quelque chose de plus récent et le modèle admet son ignorance, parcourt le web s'il le peut, ou hallucine. Connaître la date limite du modèle que vous utilisez évite toute une catégorie d'erreurs.

Recherche documentaire et vos données

RAG (génération augmentée par la recherche)

Le RAG, génération augmentée par la recherche, consiste à récupérer d'abord des documents pertinents puis à faire répondre le modèle à partir d'eux.

C'est ainsi que fonctionnent en coulisses les produits « discutez avec votre base de connaissances », et pourquoi ils peuvent citer leurs sources. Le RAG réduit l'hallucination mais hérite de la qualité de ce qu'il récupère.

Embedding

Un embedding est une liste de nombres qui représente le sens d'un morceau de texte.

Les textes de sens similaire reçoivent des nombres proches, ce qui permet à un logiciel de trouver des passages liés de façon mathématique. Les embeddings sont la mécanique derrière la recherche sémantique et le RAG.

Base de données vectorielle

Une base de données vectorielle est une base de données construite pour stocker des embeddings et trouver les plus proches rapidement.

Si un produit dit avoir « indexé » vos documents pour la recherche par IA, un embedding pour chaque morceau attend dans l'une d'elles.

Recherche sémantique

La recherche sémantique consiste à trouver du texte par le sens plutôt qu'en faisant correspondre des mots-clés.

Chercher « problèmes d'argent » peut faire remonter un passage sur des tensions de trésorerie même si aucun mot ne correspond. C'est la mise au travail des embeddings.

Chunking

Le chunking consiste à découper de longs documents en morceaux assez petits pour être bien encodés et récupérés.

Cela ressemble à de la plomberie, et c'en est, mais un mauvais chunking est une raison fréquente pour laquelle les outils de discussion avec des documents répondent à partir du mauvais passage d'un fichier.

Recherche web (en IA)

La recherche web en IA signifie que le modèle va chercher des pages actuelles avant de répondre, au lieu de se fier à sa mémoire d'entraînement.

Elle échange de la vitesse contre de la fraîcheur et permet aux réponses de porter des citations que vous pouvez ouvrir. Pour tout ce qui vient après la date limite de connaissance du modèle, c'est la différence entre une réponse et une supposition.

Base de connaissances

Une base de connaissances est l'ensemble sélectionné de documents qu'une entreprise donne à son IA pour répondre.

Qualité en entrée, qualité en sortie : un assistant ancré sur un wiki obsolète sert avec assurance des réponses obsolètes, citations à l'appui.

Trois termes de ce glossaire désignent des réponses concurrentes à la même question, comment rendre un modèle meilleur sur votre tâche, et les confondre est l'erreur de jargon la plus commune dans les réunions produit. Côte à côte :

ApprocheCe qui changeCoût et vitesseQuand elle gagne
Meilleur prompting (zero-shot, few-shot)Seulement le texte que vous envoyezGratuit, prend quelques minutesPresque toujours le premier réflexe ; deux ou trois exemples travaillés règlent la plupart des problèmes de format
RAGCe que le modèle lit avant de répondreModéré à construire, pas de réentraînementLes réponses qui doivent rester à jour ou citer vos propres documents
Fine-tuningLes propres paramètres du modèleLent et coûteux, puis figéDes exigences de style et de format stables à grande échelle, presque jamais pour un particulier

Au-delà du texte

Multimodal

Multimodal signifie un modèle qui fonctionne à travers plus d'un support, comme le texte plus les images, l'audio ou la vidéo.

C'est pour cela que vous pouvez capturer un message d'erreur et demander ce qui ne va pas. Le guide de l'IA multimodale couvre ce qui fonctionne vraiment aujourd'hui.

Modèle de vision

Un modèle de vision est un modèle capable d'interpréter des images : photos, captures d'écran, graphiques et documents.

Lire n'est pas la même chose que générer ; un modèle peut décrire votre schéma parfaitement et rester incapable d'en dessiner un.

Génération d'images

La génération d'images consiste à produire de nouvelles images à partir d'une description textuelle.

La qualité, l'éventail de styles et le rendu du texte à l'intérieur des images varient fortement d'un générateur à l'autre, ce qui explique pourquoi les utilisateurs sérieux en comparent plusieurs. Le comparatif des générateurs d'images reste à jour sur le domaine.

Modèle de diffusion

Un modèle de diffusion génère des images en partant de bruit et en l'affinant étape par étape vers la description.

C'est la technique dominante derrière les générateurs d'images modernes. Le mot compte surtout pour que « diffusion » dans un nom de produit vous dise ce que fait le produit.

Reconnaissance vocale

La reconnaissance vocale consiste à transcrire de l'audio parlé en mots écrits.

La transcription moderne est assez précise pour rendre les réunions, les notes vocales et les entretiens consultables, et c'est ainsi que fonctionne la saisie vocale dans les applications de chat.

Synthèse vocale

La synthèse vocale consiste à générer de l'audio parlé à partir de mots écrits.

Les systèmes actuels produisent des voix naturelles et expressives, ce qui alimente les fonctions de lecture à voix haute et les conversations vocales avec l'IA.

L'écosystème

API

Une API est la porte programmatique que les développeurs utilisent pour envoyer des prompts à un modèle depuis leur propre logiciel.

La tarification de l'API est au token, ce qui est la source ultime de l'économie par réponse de chaque produit d'IA.

Poids ouverts

Poids ouverts signifie que les paramètres entraînés d'un modèle sont publiés pour que tout le monde puisse les télécharger et les faire tourner.

Cela permet l'auto-hébergement et laisse d'autres fournisseurs servir le modèle sur leur propre infrastructure. DeepSeek et Llama en sont les exemples célèbres.

Modèle open source

Un modèle open source est, en gros, un modèle publié pour un usage et une modification publics, bien que les licences varient beaucoup.

Les questions pratiques sont toujours les deux mêmes : pouvez-vous l'utiliser commercialement, et qui l'héberge pour vous. L'écosystème des poids ouverts compte le plus quand la confidentialité ou le coût exclut les modèles phares hébergés.

Benchmark

Un benchmark est un test standard utilisé pour noter et comparer des modèles.

Utile pour un premier tri, régulièrement surajusté dans le marketing. Un modèle qui domine un benchmark peut quand même perdre sur votre travail réel, ce qui explique pourquoi lancer votre propre comparaison sur trois tâches bat la lecture de graphiques.

Agent

Un agent est un système d'IA qui prend des actions par étapes vers un objectif, plutôt que de simplement répondre une fois.

Réserver, chercher, coder et déposer des tickets sont le territoire des agents. La capacité est réelle et s'améliore vite ; le besoin de vérifier ce qu'un agent a fait avant que cela compte aussi.

Utilisation d'outils

L'utilisation d'outils, ou function calling, c'est un modèle qui invoque des capacités externes comme la recherche, une calculatrice, du code ou votre calendrier.

C'est ainsi que les assistants de chat agissent sur le monde au lieu de seulement le décrire, et c'est le mécanisme sous les agents.

Modèle de raisonnement

Un modèle de raisonnement est un modèle qui dépense du calcul supplémentaire pour réfléchir à un problème en interne avant de répondre.

L'échange, c'est du temps et du coût contre de la précision sur les problèmes difficiles. Pour les questions simples, la réflexion supplémentaire n'apporte rien, ce qui est un argument de plus pour changer de modèle selon la tâche.

Latence

La latence, c'est le temps que vous attendez entre l'envoi d'un prompt et l'arrivée ou le début du flux de la réponse.

Elle varie selon la taille du modèle, la charge, et si le modèle est un modèle de raisonnement. Pour un travail interactif, un modèle rapide et suffisamment bon bat souvent un modèle lent et brillant.

Limite de débit

Une limite de débit est le plafond qu'un fournisseur impose sur le nombre de requêtes ou de tokens que vous pouvez utiliser dans une fenêtre de temps.

En atteindre une est la raison habituelle pour laquelle un produit de chat vous dit d'attendre ou de passer à un niveau supérieur. Les plafonds de messages sur les forfaits d'abonnement sont des limites de débit avec un habillage plus sympathique.

Garder ce glossaire utile

Les termes vieillissent vite dans ce domaine. Cette page est maintenue comme une référence : les entrées sont réécrites quand l'usage évolue, et les guides approfondis liés portent le détail qui ne tient pas dans une définition.

Si un terme que vous croisez dans la nature manque ici, le chemin le plus rapide est de coller la phrase où vous l'avez trouvé dans un modèle capable et de demander la définition en contexte. Dans Whizi, vous pouvez interroger deux modèles à la fois et remarquer quand ils sont en désaccord, ce qui pour un jargon nouveau arrive étonnamment souvent.

Liste de vérification
  • Citez la définition en une phrase ; lisez le détail avant de vous y fier
  • Quand deux sources définissent un terme différemment, l'usage le plus récent l'emporte en général en IA
  • Apprenez token, fenêtre de contexte et hallucination en premier ; la plupart des autres termes en découlent
  • Testez les affirmations inconnues sur un modèle avec votre propre comparaison sur trois tâches
  • Utilisez d'abord le glossaire pour débutants si cette page ressemble à un manuel de référence, parce que c'en est un

Questions fréquentes

Quelle est la différence entre l'IA, le machine learning et un LLM ?

L'IA est l'objectif large d'un logiciel qui accomplit des tâches demandant un jugement humain. Le machine learning est la technique qui consiste à apprendre à un logiciel à partir d'exemples, et c'est ainsi que presque toute l'IA moderne est construite. Un LLM est un type de modèle appris par machine, entraîné sur du texte, et c'est le type derrière ChatGPT, Claude et Gemini.

Que veut dire RAG en IA ?

RAG signifie génération augmentée par la recherche : le système récupère d'abord des documents pertinents, puis fait répondre le modèle à partir d'eux plutôt que de sa mémoire. C'est la technique standard derrière les produits qui discutent avec vos fichiers ou votre base de connaissances, et c'est pourquoi ces produits peuvent citer leurs sources.

Quelle est la différence entre le fine-tuning et le RAG ?

Le fine-tuning change le modèle lui-même avec un entraînement supplémentaire, ce qui est lent et figé. Le RAG laisse le modèle tranquille et lui donne les bons documents au moment de la question, ce qui est flexible et à jour. Pour garder un assistant à jour avec une information qui change, le RAG est presque toujours le bon outil ; le fine-tuning convient à des exigences de style et de format stables.

Qu'est-ce qu'un token en IA ?

Un token est l'unité de texte qu'un modèle lit et écrit, environ trois quarts d'un mot anglais. Tout se mesure en tokens : la tarification, la vitesse et la fenêtre de contexte. Un document de 1 000 mots fait environ 1 300 tokens.

Combien de ces termes ai-je vraiment besoin de connaître ?

Pour un usage quotidien, environ cinq : modèle, prompt, token, fenêtre de contexte et hallucination. La version pour débutants de ce glossaire les couvre avec plus de patience. Le reste de cette page existe pour le moment où une page produit ou un article vous lance un terme.