Spreadsheets analyseren met AI in Whizi

Kort antwoord

Om een spreadsheet met AI te analyseren, upload je het CSV- of Excel-bestand en profileer je het voordat je iets vraagt: aantal rijen, ontbrekende waarden, duplicaten en unieke waarden per kolom. Stel daarna je echte vraag en eis dat de methode bij elk cijfer wordt vermeld. Voer de analyse uit in GPT en verifieer door één groep steekproefsgewijs te controleren en te kruiscontroleren met Claude.

Profileer de data voordat je iets vraagt

De meest voorkomende manier waarop spreadsheetanalyse misgaat heeft niets met AI te maken. Het is dat het bestand 14 rijen bevat met een spatie achter de regionaam, twee datumnotaties, een subtotaalregel die iemand er middenin heeft laten staan, en 300 lege cellen in de kolom die je net wilt middelen. Stel je vraag eerst en je krijgt een zelfverzekerd antwoord berekend over rommel.

Dus de eerste prompt is bij elk bestand hetzelfde.

Prompt: het profiel

Profileer dit bestand voordat we iets analyseren. Geef terug: het aantal rijen, de kolomnamen met afgeleid type, het aantal en percentage ontbrekende waarden per kolom, het aantal exacte dubbele rijen, de unieke waarden voor elke kolom met minder dan 25 unieke waarden, het minimum en maximum van elke numerieke kolom en datumkolom, en elke kolom waar de waarden inconsistent lijken (gemengde notaties, spaties aan het begin of einde, gemengde eenheden, gemengde datumnotaties). Analyseer of interpreteer nog niets. Vertel me alleen wat er in het bestand staat en wat eraan lijkt te schorten.

Die ene prompt vangt het meeste op wat anders de analyse zou verpesten. Vooral de lijst met unieke waarden is waar je ontdekt dat "UK", "U.K." en "United Kingdom" drie aparte regio's zijn in je data.

Prompt: los op wat er is gevonden

Standaardiseer de problemen die je hebt gevonden: verwijder overtollige spaties, breng [column] naar één uniforme notatie, en voeg deze varianten samen: [list them]. Laat de mapping die je hebt toegepast eerst als tabel zien voordat je deze toepast. Verwijder geen rijen zonder te vertellen welke en waarom.

Stel vragen die controleerbare antwoorden opleveren

Vage vragen krijgen vage antwoorden. De prompts die werken noemen de kolom, de bewerking en het uitvoerformaat, en ze vragen om de onderbouwing.

Prompt: aggregatie met zichtbare onderbouwing

Groepeer op [column] en bereken [metric]. Geef een Markdown-tabel met de groep, het aantal rijen erin, en de metriek. Vermeld onder de tabel precies hoe je de metriek hebt berekend, welke rijen je hebt uitgesloten en waarom, en hoe je met lege waarden bent omgegaan. Sorteer aflopend op [column].

Prompt: de cohortvraag

Bereken voor elke [cohort dimension, bijvoorbeeld aanmeldmaand] [metric] per [interval]. Toon de cohortgrootte naast elk cijfer. Markeer elk cohort met minder dan [n] rijen als te klein om te interpreteren in plaats van er een percentage voor te rapporteren.

Die laatste instructie voorkomt de meest misleidende uitkomst in spreadsheetanalyse: een cohort van vier gebruikers gerapporteerd als "75% retentie", naast een cohort van negenduizend in dezelfde tabel.

Prompt: op zoek naar anomalieën

Wat is verdacht aan deze data? Kijk naar: waarden buiten een plausibel bereik, plotselinge discontinuïteiten in een tijdreeks, kolommen waarin de verdeling halverwege verandert, rijen die exacte of bijna-exacte duplicaten zijn, waarden die te rond lijken, en alles wat wijst op een verandering in hoe de data is verzameld. Citeer bij elk punt de specifieke rijen.

Dat is de meest waardevolle prompt op deze pagina en heeft geen equivalent in een gewone spreadsheetworkflow. Hij vindt regelmatig de dag waarop de tracking stukging, de leverancier die in een andere valuta begon te rapporteren, en de dubbele import die een kwartaal opblies.

Prompt: de grafiekspecificatie

Beveel de juiste grafiek aan voor deze vraag en deze datavorm, en leg uit waarom het voor de hand liggende alternatief hier slechter is. Geef me daarna de specificatie: grafiektype, x, y, reeks, aggregatie, sorteervolgorde en asbehandeling. Gebruik geen dubbele as. Knip de as van een staafdiagram niet af.

Waar het rekenwerk echt misgaat

Dit verdient een eerlijk antwoord, want "AI is slecht in rekenen" is zowel waar als onbevredigend vaag.

Een taalmodel dat over cijfers in tekst redeneert, doet aan patroonherkenning, niet aan berekening. Het is betrouwbaar in het beschrijven van structuur, het categoriseren van rijen en het bepalen welke berekening je nodig hebt. Het is veel minder betrouwbaar in het uitvoeren van een lange reeks berekeningen over honderden rijen, en het faalt stil: de uitkomst is een keurig opgemaakte tabel met verkeerde cijfers, zonder enig alarmsignaal.

De praktische regels:

  • Vraag om de methode, niet alleen het resultaat. "Vermeld precies hoe je dit hebt berekend en wat je hebt uitgesloten" maakt de fout zichtbaar als die er is.
  • Controleer één groep handmatig. Kies de kleinste groep in de uitvoertabel en verifieer deze in het echte spreadsheet. Klopt het, dan is de methode waarschijnlijk juist; klopt het niet, dan kun je niets in de tabel vertrouwen.
  • Kruiscontroleer alles wat ertoe doet met een tweede model. Twee onafhankelijke modellen die tot hetzelfde cijfer komen, is aanzienlijk beter bewijs dan één model dat zichzelf herhaalt. Whizi's naast-elkaar-weergave bestaat precies hiervoor.
  • Let op dubbeltellingen. Subtotaalregels die in het bestand zijn blijven staan en één-op-veel-koppelingen zijn de twee gebruikelijke boosdoeners, en het model zal niet weten dat ze fout zijn.
  • Vraag voor alles wat exact moet kloppen om de formule of de code. Geef me de Excel-formule of geef me de pandas-code brengt het rekenwerk in een deterministische engine, zodat je het model gebruikt voor het onderdeel waar het goed in is: weten welke berekening moet worden uitgevoerd.

Dat laatste punt is het echte antwoord voor financieel werk of rapportagewerk. Gebruik het model om de analyse te ontwerpen, gebruik je spreadsheet of een script om die uit te voeren.

Welk model leest welk bestand, en hoe groot is te groot?

CSV en Excel kunnen beide direct worden geüpload, en de drie modellen verdelen het werk netjes.

ModelContextvensterCredits per berichtGebruik het voor
GPT-5.6 Terra1M tokens4Strikte formats: nette tabellen, JSON, exacte kolomtoewijzingen
Claude Sonnet 51M tokens10De kruiscontrole bij meerstaps-aggregatie
Gemini 3.5 Flash1M tokens, ongeveer 1.900 manuscriptpagina's8De grootste bestanden, of een spreadsheet plus een PDF in één gesprek

Context- en creditcijfers komen uit Whizi's model cost index, lijstprijzen opgehaald op 2026-08-20.

Een paar praktische tips:

  • Geef het een schone rechthoek. Eén koprij, geen samengevoegde cellen, geen lege scheidingsrijen, geen notities in kolom K. Rapporten met meerdere koppen in de opmaak verwarren extractie meer dan welke bestandsgrootte dan ook.
  • Stuur het ruwe blad, niet het presentatieblad. De versie met de opmaak en de subtotalen is degene die dubbeltellingen veroorzaakt.
  • Zeer brede bestanden hebben baat bij eerst een kolomlijst. Vraag wat elke kolom betekent voordat je analyseert als de namen cryptisch zijn, en vertel het model wat het fout had.
  • Gebruik voor zeer grote bestanden Gemini 3.5 Flash, dat hetzelfde contextvenster van 1M tokens leest als Claude Sonnet 5 en GPT-5.6 Terra, tegen de laagste kosten per antwoord van de drie. Bemonster daarboven doelbewust: analyseer een willekeurige steekproef van 5000 rijen en vertel me welke steekproeffout ik bij elk cijfer moet verwachten is beter dan stilzwijgend afkappen.
  • Verwijder eerst persoonsgegevens. Namen, e-mailadressen en identificatoren zijn vrijwel nooit nodig voor de analyse, en ze verwijderen gaat sneller dan discussiëren of je ze wel mocht uploaden.

De mechaniek van uploads staat beschreven in documenten uploaden.

De volledige achtstappenreeks op een echt bestand

De hele workflow op een echt bestand, in volgorde:

  1. Upload. Voer de profielprompt uit. Lees de unieke waarden en de ontbrekende aantallen zorgvuldig.
  2. Los op wat er is gevonden, en controleer de mappingtabel voordat deze wordt toegepast.
  3. Vraag om een samenvatting van waar de data over gaat en de drie vragen die het model vindt dat je zou moeten stellen. Deze stap is snel en herkadert vaak de analyse.
  4. Stel je echte vraag, waarbij de methode en uitsluitingen verplicht zijn in het antwoord.
  5. Voer altijd de anomalieprompt uit. Hier zitten de verrassingen.
  6. Controleer de kleinste groep handmatig.
  7. Kruiscontroleer het belangrijkste cijfer met een tweede model.
  8. Vraag om de grafiekspecificatie, of de formule als het cijfer exact en reproduceerbaar moet zijn.

Stappen 1, 5 en 6 zijn degene die mensen overslaan, en het zijn precies de stappen die een analyse die je kunt verdedigen onderscheiden van een netjes opgemaakte gok.

Checklist
  • Profileer het bestand voordat je ook maar één analytische vraag stelt
  • Lees de lijst met unieke waarden om varianten in spelling en gemengde notaties op te sporen
  • Vereis de methode en de uitsluitingen bij elk cijfer
  • Markeer kleine groepen als te klein in plaats van er een percentage voor te rapporteren
  • Voer altijd de prompt "wat is verdacht aan deze data" uit
  • Controleer de kleinste groep handmatig voordat je de tabel vertrouwt
  • Kruiscontroleer belangrijke cijfers met een tweede model
  • Vraag om de formule of code wanneer het cijfer exact moet kloppen

Veelgestelde vragen

Hoe groot mag mijn spreadsheet zijn?

Dat hangt af van het abonnement en het model, en de praktische limiet is het contextvenster van het model in plaats van een bestandsgroottelimiet. Claude Sonnet 5, GPT-5.6 Terra en Gemini 3.5 Flash lezen allemaal een contextvenster van 1M tokens in Whizi, ongeveer 1.900 manuscriptpagina's aan data. Bemonster daarboven doelbewust en vraag het model om de steekproeffout te vermelden in plaats van het bestand stilzwijgend af te laten kappen, want dat is het faalscenario dat zelfverzekerde antwoorden oplevert over een fractie van je data.

Kan AI mijn spreadsheetfouten opsporen?

Ja, en het is een van de meest waardevolle prompts die er zijn. Vragen wat verdacht is aan de data legt betrouwbaar dubbele imports bloot, de dag waarop de tracking stukging, gemengde eenheden of valuta's, subtotaalregels die binnen de data zijn blijven staan, en verdelingen die halverwege het bestand verschuiven. Vraag het model om de specifieke rijen te citeren, zodat je elke bevinding kunt verifiëren in plaats van de lijst zomaar te vertrouwen.

Kan ik de cijfers die het geeft vertrouwen?

Vertrouw de structuur, verifieer het rekenwerk. Taalmodellen zijn sterk in het bepalen welke berekening nodig is en het beschrijven van wat er in een dataset zit, en zwakker in lange rekenreeksen over veel rijen, waar ze stil falen met een keurig opgemaakt fout antwoord. Controleer de kleinste groep handmatig, kruiscontroleer belangrijke cijfers met een tweede model, en vraag voor alles wat exact moet kloppen om de Excel-formule of Python-code en voer die zelf uit.

Welk model is het beste voor spreadsheetwerk?

GPT voor gestructureerd redeneren, strikte uitvoerformats en nette tabellen of JSON. Claude als kruiscontrole bij meerstaps-aggregatie, omdat het meestal andere fouten maakt in plaats van dezelfde. Gemini wanneer het bestand zeer groot is of wanneer je een spreadsheet naast een PDF of rapport in hetzelfde gesprek wilt analyseren.

Werkt het met Excel-formules en meerdere werkbladen?

Het leest de waarden in plaats van je werkmap uit te voeren, dus formuleresultaten komen door, maar de actieve formulelogica niet. Geef bij werkmappen met meerdere bladen aan welk blad je bedoelt en beschrijf hoe de bladen zich tot elkaar verhouden, of exporteer het blad waar het om gaat als CSV. Bestanden die zijn gebouwd voor presentatie, met samengevoegde cellen en subtotalen in de data, veroorzaken veel meer problemen dan grote bestanden.