Profilér dataene, før du spørger om noget
Den mest almindelige måde regnearksanalyse går skævt på, har intet at gøre med AI. Det er, at filen indeholder 14 rækker med et mellemrum efter regionsnavnet, to datoformater, en subtotal-række, nogen har ladt stå midt i filen, og 300 tomme felter i den kolonne, du er ved at beregne et gennemsnit for. Stiller du dit spørgsmål først, får du et sikkert svar beregnet på baggrund af skrammel.
Derfor er den første prompt den samme for enhver fil.
Prompt: profilen
Profilér denne fil, før vi analyserer noget som helst. Returnér: antal rækker, kolonnenavne med udledt type, antal og procentdel af manglende værdier pr. kolonne, antal eksakte duplikatrækker, de unikke værdier for hver kolonne med færre end 25 unikke værdier, min og max for hver numerisk kolonne og datokolonne, og enhver kolonne, hvor værdierne ser inkonsistente ud (blandede formater, mellemrum i kanten, blandede enheder, blandede datoformater). Analysér eller tolk ikke endnu. Bare fortæl mig, hvad der er i filen, og hvad der ser forkert ud.
Denne ene prompt fanger det meste af det, der ellers ville ødelægge analysen. Listen over unikke værdier er især der, hvor du opdager, at "UK", "U.K." og "United Kingdom" er tre separate regioner i dine data.
Prompt: ret det, den fandt
Standardisér de problemer, du identificerede: trim mellemrum, samle [kolonne] til et enkelt format, og konsolider disse varianter: [angiv dem]. Vis mig den mapping, du anvendte, som en tabel, før du anvender den. Fjern ikke rækker uden at fortælle mig hvilke og hvorfor.
Stil spørgsmål, der giver kontrollerbare svar
Vage spørgsmål giver vage svar. De prompts, der virker, navngiver kolonnen, operationen og outputformatet, og de spørger om, hvordan resultatet er nået frem til.
Prompt: aggregering med beregningen vist
Gruppér efter [kolonne], og beregn [metrik]. Returnér en Markdown-tabel med gruppen, antallet af rækker i den, og metrikken. Under tabellen skal du angive nøjagtigt, hvordan du beregnede metrikken, hvilke rækker du udelukkede og hvorfor, og hvordan du håndterede tomme felter. Sortér faldende efter [kolonne].
Prompt: kohortespørgsmålet
For hver [kohortedimension, for eksempel tilmeldingsmåned], beregn [metrik] ved [interval]. Vis kohortestørrelsen sammen med hver enkelt figur. Markér enhver kohorte med færre end [n] rækker som for lille til at tolke, i stedet for at rapportere en procentdel for den.
Den sidste instruktion forhindrer det mest vildledende output i regnearksanalyse: en kohorte på fire brugere rapporteret som "75 % retention" og placeret i en tabel lige ved siden af en kohorte på ni tusind.
Prompt: jagt på anomalier
Hvad er mistænkeligt ved disse data? Se efter: værdier uden for et plausibelt interval, pludselige diskontinuiteter i en tidsserie, kolonner hvor fordelingen ændrer sig undervejs, rækker der er eksakte eller nærved duplikater, værdier der virker for runde, og alt, der antyder en ændring i, hvordan dataene er indsamlet. Citer de specifikke rækker for hvert punkt.
Det er den prompt med den højeste værdi på denne side, og den har ingen pendant i en normal regnearksarbejdsgang. Den finder rutinemæssigt den dag, hvor sporingen gik i stykker, leverandøren, der begyndte at rapportere i en anden valuta, og den dublerede import, der pustede et kvartal op.
Prompt: diagramspecifikationen
Anbefal det rigtige diagram til dette spørgsmål og denne dataform, og forklar hvorfor det oplagte alternativ er værre her. Giv mig derefter specifikationen: diagramtype, x, y, serie, aggregering, sorteringsorden og akse-behandling. Brug ikke en dobbelt akse. Afkort ikke en søjlediagram-akse.
Hvor regnestykket egentlig går galt
Det fortjener et lige svar, fordi "AI er dårlig til matematik" både er sandt og uhjælpsomt vagt.
En sprogmodel, der ræsonnerer over tal i tekst, laver mønstergenkendelse, ikke beregning. Den er pålidelig til at beskrive struktur, kategorisere rækker og identificere, hvilken beregning du har brug for. Den er langt mindre pålidelig til at udføre en lang kæde af aritmetik over hundreder af rækker, og den fejler stille: outputtet er en flot formateret tabel med forkerte tal og ingen alarmklokke.
De praktiske regler:
- Bed om metoden, ikke bare resultatet. "Angiv nøjagtigt, hvordan du beregnede dette, og hvad du udelukkede" gør fejlen synlig, når der er en.
- Tjek en gruppe manuelt. Vælg den mindste gruppe i outputtabellen, og kontrollér den i det faktiske regneark. Hvis det matcher, er metoden nok rigtig; hvis ikke, kan intet i tabellen tillades tiltro.
- Krydstjek alt, der har konsekvenser, med en anden model. To uafhængige modeller, der lander på samme tal, er markant bedre bevis end en model, der gentager sig selv. Whizis side-by-side-visning findes til netop dette.
- Vær opmærksom på dobbelttælling. Subtotal-rækker, der er blevet i filen, og en-til-mange-joins er de to sædvanlige syndere, og modellen vil ikke vide, at de er forkerte.
- Bed om formlen eller koden for alt, der skal være eksakt.
Giv mig Excel-formlenellergiv mig pandas-kodenlægger aritmetikken i en deterministisk motor, og du bruger modellen til den del, den er god til, nemlig at vide, hvilken beregning der skal køres.
Det sidste punkt er det egentlige svar for finansielt arbejde eller rapportering. Brug modellen til at designe analysen, brug dit regneark eller et script til at udføre den.
Hvilken model læser hvilken fil, og hvor stor er for stor?
CSV og Excel uploades begge direkte, og de tre modeller deler arbejdet klart.
| Model | Kontekstvindue | Credits pr. besked | Brug den til |
|---|---|---|---|
| GPT-5.6 Terra | 1M tokens | 4 | Strikte formater: rene tabeller, JSON, eksakte kolonne-mappings |
| Claude Sonnet 5 | 1M tokens | 10 | Krydstjekket på multi-trins aggregering |
| Gemini 3.5 Flash | 1M tokens, cirka 1.900 manuskriptsider | 8 | De største filer, eller et regneark plus en PDF i én tråd |
Kontekst- og credit-tallene kommer fra Whizis model cost index, listepriser hentet 2026-08-20.
Et par praktiske noter:
- Giv den et rent rektangel. En header-række, ingen sammenlagte celler, ingen tomme mellemrums-rækker, ingen noter i kolonne K. Rapporter formateret med flere headere forvirrer udtrækningen mere end nogen filstørrelsesgrænse.
- Send det rå ark, ikke præsentationsarket. Versionen med formatering og subtotaler er den, der giver dobbelttælling.
- Meget brede filer har gavn af en kolonneliste først. Spørg, hvad hver kolonne betyder, før du analyserer, hvis navnene er kryptiske, og fortæl modellen, hvad den fik forkert.
- Brug Gemini 3.5 Flash til meget store filer, som læser samme 1M token-kontekst som Claude Sonnet 5 og GPT-5.6 Terra til den laveste pris pr. svar af de tre. Derudover, sampl bevidst:
analysér en tilfældig stikprøve på 5000 rækker, og fortæl mig den samplingfejl, jeg bør forvente på hver figur, er bedre end at lade filen blive stille afkortet. - Fjern personlige data først. Navne, e-mails og identifikatorer er næsten aldrig nødvendige for analysen, og at fjerne dem er hurtigere end at diskutere, om du havde tilladelse til at uploade dem.
Mekanikken bag uploads er dækket i upload af dokumenter.
Hele forløbet i otte trin på en rigtig fil
Hele arbejdsgangen på en rigtig fil, i rækkefølge:
- Upload. Kør profil-prompten. Læs de unikke værdier og de manglende antal omhyggeligt.
- Ret det, den fandt, og gennemgå mapping-tabellen, før den anvendes.
- Bed om et resumé af, hvad dataene handler om, og de tre spørgsmål, den mener, du bør stille. Dette trin er hurtigt og omformer ofte analysen.
- Stil dit egentlige spørgsmål, med metoden og udelukkelserne krævet i svaret.
- Kør anomali-prompten, altid. Det er her overraskelserne er.
- Tjek den mindste gruppe manuelt.
- Krydstjek hovedtallet med en anden model.
- Bed om diagramspecifikationen, eller formlen, hvis tallet skal være eksakt og reproducerbart.
Trin 1, 5 og 6 er de trin, folk springer over, og de er de trin, der skiller en analyse, du kan forsvare, fra et flot formateret gæt.
- Profilér filen, før du stiller et enkelt analytisk spørgsmål
- Læs listen over unikke værdier for at fange varianter i stavning og blandede formater
- Kræv metoden og udelukkelserne sammen med hvert tal
- Markér små grupper som for små i stedet for at rapportere en procentdel for dem
- Kør altid prompten "hvad er mistænkeligt ved disse data"
- Tjek den mindste gruppe manuelt, før du tror på tabellen
- Krydstjek figurer med konsekvenser med en anden model
- Bed om formlen eller koden, når tallet skal være helt korrekt
Ofte stillede spørgsmål
Hvor stort kan mit regneark være?
Det afhænger af planen og modellen, og den praktiske grænse er modellens kontekstvindue snarere end en filstørrelsesgrænse. Claude Sonnet 5, GPT-5.6 Terra og Gemini 3.5 Flash læser alle en kontekst på 1M tokens i Whizi, cirka 1.900 manuskriptsider data. Derudover, sampl bevidst, og bed modellen om at angive samplingfejlen, i stedet for at lade filen blive stille afkortet, hvilket er den fejltilstand, der giver sikre svar om en brøkdel af dine data.
Kan AI fange fejl i mit regneark?
Ja, og det er en af de prompts med den højeste værdi, der findes. At spørge, hvad der er mistænkeligt ved dataene, afdækker konsekvent dublerede imports, den dag sporingen gik i stykker, blandede enheder eller valutaer, subtotal-rækker der er blevet inde i dataene, og fordelinger der skifter undervejs i filen. Bed den om at citere de specifikke rækker, så du kan verificere hvert fund i stedet for at tage listen for gode varer.
Kan jeg tro på de tal, den giver mig?
Tro på strukturen, verificér aritmetikken. Sprogmodeller er stærke til at identificere, hvilken beregning der er brug for, og til at beskrive, hvad der er i et datasæt, og svagere til lange aritmetikkæder over mange rækker, hvor de fejler stille med et flot formateret forkert svar. Tjek den mindste gruppe manuelt, krydstjek hovedtal med en anden model, og bed for alt, der skal være eksakt, om Excel-formlen eller Python-koden, og kør den selv.
Hvilken model er bedst til regnearksarbejde?
GPT til struktureret ræsonnement, strikte outputformater og rene tabeller eller JSON. Claude som krydstjekket på multi-trins aggregering, fordi den har en tendens til at lave andre fejl end de samme. Gemini når filen er meget stor, eller når du vil analysere et regneark sammen med en PDF eller rapport i samme samtale.
Fungerer det med Excel-formler og flere ark?
Den læser værdierne i stedet for at eksekvere din arbejdsbog, så formelresultater kommer med, men den levende formellogik gør ikke. For arbejdsbøger med flere ark skal du angive, hvilket ark du mener, og beskrive, hvordan arkene hænger sammen, eller eksportere det ark, du er interesseret i, som CSV. Filer bygget til præsentation, med sammenlagte celler og subtotaler inde i dataene, giver langt flere problemer end store filer gør.