Comment analyser des tableurs avec l'IA dans Whizi

Réponse rapide

Pour analyser un tableur avec l'IA, importez le fichier CSV ou Excel et profilez le avant de poser la moindre question : nombre de lignes, valeurs manquantes, doublons et valeurs distinctes par colonne. Posez ensuite votre vraie question et exigez la méthode à côté de chaque chiffre. Lancez l'analyse dans GPT, puis vérifiez en contrôlant un groupe à la main et en recoupant avec Claude.

Profilez les données avant de leur poser une question

L'erreur la plus fréquente dans l'analyse de tableurs n'a rien à voir avec l'IA. Le fichier contient 14 lignes avec un espace en trop dans le nom de la région, deux formats de date, une ligne de sous-total oubliée au milieu, et 300 cellules vides dans la colonne que vous vous apprêtez à moyenner. Posez votre question en premier, et vous obtiendrez une réponse assurée calculée sur des données corrompues.

Le premier prompt est donc toujours le même, quel que soit le fichier.

Prompt : le profil

Profile ce fichier avant qu'on analyse quoi que ce soit. Retourne : le nombre de lignes, les noms de colonnes avec le type déduit, le nombre et le pourcentage de valeurs manquantes par colonne, le nombre de lignes exactement dupliquées, les valeurs distinctes pour chaque colonne comportant moins de 25 valeurs distinctes, le minimum et le maximum de chaque colonne numérique et de date, et toute colonne où les valeurs semblent incohérentes (formats mélangés, espaces en trop, unités mélangées, formats de date mélangés). N'analyse ni n'interprète encore rien. Dis moi juste ce qu'il y a dans le fichier et ce qui semble problématique.

Ce seul prompt attrape la plupart de ce qui aurait sinon ruiné l'analyse. La liste des valeurs distinctes est en particulier l'endroit où l'on découvre que « UK », « U.K. » et « United Kingdom » sont trois régions distinctes dans vos données.

Prompt : corriger ce qui a été trouvé

Uniformise les problèmes identifiés : supprime les espaces en trop, unifie [colonne] en un seul format, et regroupe ces variantes : [liste les]. Montre moi la correspondance appliquée sous forme de tableau avant de l'appliquer. Ne supprime aucune ligne sans me dire lesquelles et pourquoi.

Posez des questions qui produisent des réponses vérifiables

Les questions vagues donnent des réponses vagues. Les prompts qui fonctionnent nomment la colonne, l'opération et le format de sortie, et demandent le raisonnement.

Prompt : agrégation avec le raisonnement affiché

Regroupe par [colonne] et calcule [métrique]. Retourne un tableau Markdown avec le groupe, le nombre de lignes qu'il contient, et la métrique. Sous le tableau, explique exactement comment tu as calculé la métrique, quelles lignes tu as exclues et pourquoi, et comment tu as géré les cellules vides. Trie par ordre décroissant sur [colonne].

Prompt : la question de cohorte

Pour chaque [dimension de cohorte, par exemple mois d'inscription], calcule [métrique] à [intervalle]. Montre la taille de la cohorte à côté de chaque chiffre. Signale toute cohorte de moins de [n] lignes comme trop petite pour être interprétée plutôt que de donner un pourcentage pour elle.

Cette dernière instruction évite le résultat le plus trompeur de l'analyse de tableurs : une cohorte de quatre utilisateurs présentée comme « 75 % de rétention » et assise dans un tableau à côté d'une cohorte de neuf mille.

Prompt : chasse aux anomalies

Qu'est-ce qui est suspect dans ces données ? Cherche : des valeurs hors d'une plage plausible, des ruptures soudaines dans une série temporelle, des colonnes où la distribution change en cours de route, des lignes exactement ou presque dupliquées, des valeurs qui semblent trop rondes, et tout ce qui suggère un changement dans la façon dont les données ont été collectées. Pour chacune, cite les lignes concernées.

C'est le prompt à plus forte valeur ajoutée de cette page, et il n'a pas d'équivalent dans un flux de travail classique avec un tableur. Il repère régulièrement le jour où le suivi s'est cassé, le fournisseur qui a commencé à déclarer dans une autre devise, et l'import en double qui a gonflé un trimestre.

Prompt : la spécification du graphique

Recommande le bon graphique pour cette question et cette forme de données, et explique pourquoi l'alternative évidente est ici moins bonne. Donne moi ensuite la spécification : type de graphique, x, y, série, agrégation, ordre de tri, et traitement des axes. N'utilise pas de double axe. Ne tronque pas l'axe d'un graphique à barres.

Où le calcul se trompe réellement

Cela mérite une réponse franche, car « l'IA est mauvaise en calcul » est à la fois vrai et peu précis.

Un modèle de langage qui raisonne sur des nombres dans du texte fait de la complétion de motifs, pas du calcul. Il est fiable pour décrire une structure, catégoriser des lignes et identifier quel calcul il faut faire. Il est beaucoup moins fiable pour exécuter une longue chaîne de calculs arithmétiques sur des centaines de lignes, et il échoue silencieusement : le résultat est un tableau bien formaté de chiffres faux, sans aucun signal d'alerte.

Les règles pratiques :

  • Demandez la méthode, pas seulement le résultat. « Explique exactement comment tu as calculé cela et ce que tu as exclu » rend l'erreur visible s'il y en a une.
  • Contrôlez un groupe à la main. Choisissez le plus petit groupe du tableau de résultats et vérifiez le dans le tableur réel. S'il correspond, la méthode est probablement correcte ; sinon, rien dans le tableau ne peut être fiable.
  • Recoupez tout ce qui est important avec un second modèle. Deux modèles indépendants arrivant au même chiffre constituent une preuve nettement meilleure qu'un seul modèle qui se répète. La vue côte à côte de Whizi existe exactement pour ça.
  • Surveillez les doubles comptages. Les lignes de sous-total laissées dans le fichier et les jointures un-à-plusieurs sont les deux coupables habituels, et le modèle ne saura pas qu'elles posent problème.
  • Pour tout ce qui doit être exact, demandez la formule ou le code. Donne moi la formule Excel ou donne moi le code pandas place le calcul dans un moteur déterministe, et vous gardez le modèle pour ce qu'il fait bien : savoir quel calcul lancer.

Ce dernier point est la vraie réponse pour le travail financier ou de reporting. Utilisez le modèle pour concevoir l'analyse, utilisez votre tableur ou un script pour l'exécuter.

Quel modèle lit quel fichier, et à partir de quelle taille est-ce trop gros ?

CSV et Excel s'importent tous les deux directement, et les trois modèles se répartissent le travail nettement.

ModèleFenêtre de contexteCrédits par messageÀ utiliser pour
GPT-5.6 Terra1M tokens4Formats stricts : tableaux propres, JSON, correspondances de colonnes exactes
Claude Sonnet 51M tokens10La passe de vérification croisée sur une agrégation multi étapes
Gemini 3.5 Flash1M tokens, environ 1 900 pages manuscrites8Les plus gros fichiers, ou un tableur plus un PDF dans le même fil

Les chiffres de contexte et de crédits proviennent de l'indice des coûts de modèles de Whizi, tarifs affichés relevés le 20/08/2026.

Quelques remarques pratiques :

  • Donnez lui un rectangle propre. Une seule ligne d'en tête, pas de cellules fusionnées, pas de lignes d'espacement vides, pas de notes dans la colonne K. Les rapports à en têtes multiples perturbent l'extraction bien plus que n'importe quelle limite de taille de fichier.
  • Envoyez la feuille brute, pas la feuille de présentation. La version avec la mise en forme et les sous-totaux est celle qui produit des doubles comptages.
  • Les fichiers très larges bénéficient d'une liste de colonnes en premier. Demandez ce que signifie chaque colonne avant d'analyser si les noms sont cryptiques, et dites au modèle ce qu'il a mal compris.
  • Pour les très gros fichiers, utilisez Gemini 3.5 Flash, qui lit la même fenêtre de contexte de 1M tokens que Claude Sonnet 5 et GPT-5.6 Terra au coût par réponse le plus bas des trois. Au delà, échantillonnez délibérément : analyse un échantillon aléatoire de 5000 lignes et dis moi l'erreur d'échantillonnage à laquelle je dois m'attendre sur chaque chiffre vaut mieux qu'une troncature silencieuse.
  • Supprimez d'abord les données personnelles. Noms, e-mails et identifiants ne sont presque jamais nécessaires à l'analyse, et les retirer est plus rapide que de débattre si vous aviez le droit de les importer.

La mécanique des imports est détaillée dans l'import de documents.

La séquence complète en huit étapes sur un fichier réel

L'ensemble du flux de travail sur un fichier réel, dans l'ordre :

  1. Importer. Lancer le prompt de profilage. Lire attentivement les valeurs distinctes et le nombre de valeurs manquantes.
  2. Corriger ce qui a été trouvé, en relisant le tableau de correspondance avant qu'il soit appliqué.
  3. Demander un résumé de ce dont parlent les données et les trois questions qu'il pense que vous devriez poser. Cette étape est rapide et recadre souvent l'analyse.
  4. Poser votre vraie question, en exigeant la méthode et les exclusions dans la réponse.
  5. Lancer le prompt d'anomalies, systématiquement. C'est là que se trouvent les surprises.
  6. Contrôler à la main le plus petit groupe.
  7. Recouper le chiffre principal avec un second modèle.
  8. Demander la spécification du graphique, ou la formule si le chiffre doit être exact et reproductible.

Les étapes 1, 5 et 6 sont celles que l'on saute, et ce sont celles qui séparent une analyse défendable d'une estimation joliment mise en forme.

Liste de vérification
  • Profiler le fichier avant de poser la moindre question analytique
  • Lire la liste des valeurs distinctes pour repérer les variantes orthographiques et les formats mélangés
  • Exiger la méthode et les exclusions à côté de chaque chiffre
  • Signaler les petits groupes comme trop petits plutôt que de donner un pourcentage pour eux
  • Toujours lancer le prompt « qu'est-ce qui est suspect dans ces données »
  • Contrôler à la main le plus petit groupe avant de faire confiance au tableau
  • Recouper les chiffres importants avec un second modèle
  • Demander la formule ou le code quand le chiffre doit être exactement correct

Questions fréquentes

Quelle taille mon tableur peut il faire ?

Cela dépend du plan et du modèle, et la limite pratique est la fenêtre de contexte du modèle plutôt qu'un plafond de taille de fichier. Claude Sonnet 5, GPT-5.6 Terra et Gemini 3.5 Flash lisent tous une fenêtre de contexte de 1M tokens dans Whizi, environ 1 900 pages manuscrites de données. Au delà, échantillonnez délibérément et demandez au modèle d'indiquer l'erreur d'échantillonnage plutôt que de laisser le fichier être tronqué silencieusement, ce qui est le mode d'échec produisant des réponses assurées sur une fraction de vos données.

L'IA peut elle repérer les erreurs de mon tableur ?

Oui, et c'est l'un des prompts à plus fort effet de levier disponibles. Demander ce qui est suspect dans les données fait remonter de façon fiable les imports en double, le jour où le suivi s'est cassé, les unités ou devises mélangées, les lignes de sous-total restées dans les données, et les distributions qui changent en cours de fichier. Demandez lui de citer les lignes concernées pour pouvoir vérifier chaque constat plutôt que de prendre la liste pour argent comptant.

Puis je faire confiance aux chiffres qu'il me donne ?

Faites confiance à la structure, vérifiez le calcul. Les modèles de langage sont forts pour identifier quel calcul est nécessaire et décrire le contenu d'un jeu de données, et plus faibles sur les longues chaînes de calcul à travers de nombreuses lignes, où ils échouent silencieusement avec une réponse fausse bien formatée. Contrôlez à la main le plus petit groupe, recoupez les chiffres principaux avec un second modèle, et pour tout ce qui doit être exact, demandez la formule Excel ou le code Python et exécutez le vous même.

Quel modèle est le meilleur pour le travail sur tableurs ?

GPT pour le raisonnement structuré, les formats de sortie stricts, et les tableaux ou JSON propres. Claude comme vérification croisée sur l'agrégation multi étapes, car il a tendance à faire des erreurs différentes plutôt que les mêmes. Gemini quand le fichier est très volumineux ou quand vous voulez analyser un tableur en même temps qu'un PDF ou un rapport dans la même conversation.

Cela fonctionne t il avec les formules Excel et plusieurs feuilles ?

Il lit les valeurs plutôt que d'exécuter votre classeur, donc les résultats de formules passent mais la logique de formule vivante non. Pour les classeurs multi feuilles, précisez de quelle feuille vous parlez et décrivez comment les feuilles sont liées, ou exportez la feuille qui vous intéresse en CSV. Les fichiers conçus pour la présentation, avec cellules fusionnées et sous-totaux dans les données, causent bien plus de problèmes que les gros fichiers.