Jak analyzovat tabulky pomocí AI ve Whizi

Krátká odpověď

Chcete-li analyzovat tabulku pomocí AI, nahrajte soubor CSV nebo Excel a nejprve ho profilujte, než se na cokoli zeptáte: počet řádků, chybějící hodnoty, duplicity a unikátní hodnoty v každém sloupci. Poté položte svou skutečnou otázku a u každého čísla vyžadujte i postup výpočtu. Analýzu spusťte v ChatGPT, výsledek ověřte ručním kontrolním výpočtem jedné skupiny a porovnejte ho s Claude.

Než se na data zeptáte na cokoli, profilujte je

Nejčastější způsob, jak se analýza tabulky zvrtne, nemá s AI nic společného. Jde o to, že soubor obsahuje 14 řádků s koncovou mezerou v názvu regionu, dva formáty dat, řádek s mezisoučtem zapomenutý uprostřed a 300 prázdných buněk ve sloupci, který se chystáte zprůměrovat. Zeptáte se na svou otázku hned a dostanete sebevědomou odpověď spočítanou z odpadu.

Proto je první prompt na každém souboru stejný.

Prompt: profil

Než cokoli analyzujeme, profiluj tento soubor. Vrať: počet řádků, názvy sloupců s odhadnutým typem, počet a procento chybějících hodnot v každém sloupci, počet přesně shodných duplicitních řádků, unikátní hodnoty pro každý sloupec s méně než 25 unikátními hodnotami, minimum a maximum každého číselného sloupce a sloupce s datem a jakýkoli sloupec, kde hodnoty vypadají nekonzistentně (smíchané formáty, koncové mezery, smíchané jednotky, smíchané formáty data). Zatím nic neanalyzuj ani neinterpretuj. Jen mi řekni, co je v souboru a co na něm vypadá špatně.

Tento jediný prompt zachytí většinu z toho, co by jinak analýzu zničilo. Právě seznam unikátních hodnot je místo, kde zjistíte, že "UK", "U.K." a "United Kingdom" jsou ve vašich datech tři samostatné regiony.

Prompt: oprav, co se našlo

Standardizuj identifikované problémy: odstraň mezery, sjednoť [sloupec] do jednoho formátu a slouč tyto varianty: [uveď je]. Před samotnou aplikací mi ukaž mapování ve formě tabulky. Neodstraňuj žádné řádky, aniž bys mi řekl, které a proč.

Ptejte se tak, aby odpovědi šly ověřit

Vágní otázky vedou k vágním odpovědím. Fungují prompty, které jmenují sloupec, operaci i výstupní formát a zároveň žádají o postup.

Prompt: agregace s ukázaným postupem

Seskup podle [sloupec] a spočítej [metrika]. Vrať tabulku v Markdownu se skupinou, počtem řádků v ní a hodnotou metriky. Pod tabulkou přesně popiš, jak jsi metriku vypočítal, které řádky jsi vyloučil a proč a jak jsi zacházel s prázdnými hodnotami. Seřaď sestupně podle [sloupec].

Prompt: kohortová otázka

Pro každou [kohortová dimenze, například měsíc registrace] spočítej [metrika] v intervalu [interval]. U každé hodnoty uveď i velikost kohorty. U kohort s méně než [n] řádky namísto procenta uveď, že jsou příliš malé na interpretaci.

Tato poslední instrukce zabraňuje nejzavádějšímu výstupu v analýze tabulek: kohortě čtyř uživatelů uvedené jako "75% retence" v tabulce hned vedle kohorty devíti tisíc.

Prompt: hledání anomálií

Co je na těchto datech podezřelé? Hledej: hodnoty mimo reálný rozsah, náhlé zlomy v časové řadě, sloupce, kde se rozdělení mění v polovině dat, řádky, které jsou přesnými nebo téměř přesnými duplicitami, hodnoty, které vypadají příliš zakulaceně, a cokoli, co naznačuje změnu ve způsobu sběru dat. U každého nálezu ocituj konkrétní řádky.

Toto je nejcennější prompt na této stránce a v běžném tabulkovém workflow nemá obdobu. Pravidelně odhalí den, kdy se rozbil tracking, dodavatele, který začal reportovat v jiné měně, i duplicitní import, který nafoukl čtvrtletí.

Prompt: specifikace grafu

Doporuč vhodný typ grafu pro tuto otázku a tvar dat a vysvětli, proč je zjevná alternativa v tomto případě horší. Poté mi dej specifikaci: typ grafu, x, y, řady, agregaci, pořadí řazení a ošetření os. Nepoužívej duální osu. Nekrátí osu sloupcového grafu.

Kde se aritmetika skutečně kazí

Tohle si zaslouží přímou odpověď, protože "AI je špatná na matematiku" je pravda i zavádějící vágnost zároveň.

Jazykový model uvažující nad čísly v textu provádí doplňování vzorů, ne výpočet. Je spolehlivý v popisu struktury, kategorizaci řádků a identifikaci toho, jaký výpočet potřebujete. Je mnohem méně spolehlivý v provedení dlouhého řetězce aritmetických operací přes stovky řádků a chybuje tiše: výstupem je krásně naformátovaná tabulka špatných čísel bez jakéhokoli varovného signálu.

Praktická pravidla:

  • Žádej o postup, ne jen výsledek. "Přesně popiš, jak jsi to vypočítal a co jsi vyloučil" zviditelní chybu, pokud nějaká je.
  • Ručně zkontrolujte jednu skupinu. Vyberte nejmenší skupinu ve výstupní tabulce a ověřte ji přímo v tabulce se zdrojovými daty. Pokud sedí, metoda je pravděpodobně správná; pokud ne, ničemu v tabulce se věřit nedá.
  • Vše důležité ověřte druhým modelem. Dva nezávislé modely, které dojdou ke stejnému číslu, jsou podstatně lepší důkaz než jeden model opakující se sám. Přesně pro tohle existuje ve Whizi zobrazení vedle sebe.
  • Dávejte si pozor na dvojité počítání. Řádky s mezisoučty zapomenuté v souboru a vztahy typu jeden k mnoha jsou dva obvyklí viníci a model nepozná, že jsou chybné.
  • Pro vše, co musí být přesné, žádejte vzorec nebo kód. Dej mi vzorec pro Excel nebo dej mi kód v pandas přesune aritmetiku do deterministického nástroje a model si nechte na to, v čem je dobrý: poznat, jaký výpočet je potřeba.

Tento poslední bod je skutečná odpověď pro finanční nebo reportovací práci. Model použijte na návrh analýzy, tabulku nebo skript na její provedení.

Který model čte který soubor a jak velký je příliš velký?

CSV i Excel se nahrávají přímo a tři modely si práci přehledně rozdělí.

ModelKontextové oknoKredity za zprávuPoužijte ho na
GPT-5.6 Terra1M tokenů4Striktní formáty: čisté tabulky, JSON, přesné mapování sloupců
Claude Sonnet 51M tokenů10Ověřovací průchod u vícekrokové agregace
Gemini 3.5 Flash1M tokenů, zhruba 1 900 stran rukopisu8Největší soubory nebo tabulka plus PDF v jednom vlákně

Údaje o kontextu a kreditech pocházejí z indexu nákladů na modely Whizi, ceníkové sazby načteny 2026-08-20.

Několik praktických poznámek:

  • Dejte mu čistý obdélník. Jeden řádek záhlaví, žádné sloučené buňky, žádné prázdné mezerové řádky, žádné poznámky ve sloupci K. Vícehlavičkové formátované reporty matou extrakci víc než jakýkoli limit velikosti souboru.
  • Pošlete surový list, ne prezentační list. Verze s formátováním a mezisoučty je ta, která vyvolává dvojité počítání.
  • Velmi široké soubory ocení nejprve seznam sloupců. Zeptejte se, co znamená každý sloupec, než začnete analyzovat, pokud jsou názvy nejasné, a řekněte modelu, kde se spletl.
  • Pro velmi velké soubory použijte Gemini 3.5 Flash, který čte stejný 1M tokenový kontext jako Claude Sonnet 5 a GPT-5.6 Terra za nejnižší cenu za odpověď ze všech tří. Nad tímto rozsahem vzorkujte cíleně: analyzuj náhodný vzorek 5000 řádků a řekni mi, jakou chybu vzorkování mám čekat u každého čísla je lepší než tiché zkrácení dat.
  • Nejprve odstraňte osobní údaje. Jména, e-maily a identifikátory jsou pro analýzu skoro nikdy potřeba a jejich odstranění je rychlejší než hádat se, zda jste je vůbec směli nahrát.

Mechanika nahrávání je popsána v nahrávání dokumentů.

Celá osmikroková sekvence na reálném souboru

Celý workflow na reálném souboru, v pořadí:

  1. Nahrajte soubor. Spusťte profilovací prompt. Pečlivě si přečtěte unikátní hodnoty a počty chybějících hodnot.
  2. Opravte, co se našlo, a před aplikací zkontrolujte mapovací tabulku.
  3. Požádejte o shrnutí toho, o čem data jsou, a tři otázky, které by se podle modelu měly ptát. Tento krok je rychlý a často analýzu nasměruje jinak.
  4. Položte svou skutečnou otázku a v odpovědi vyžadujte postup i vyloučené položky.
  5. Vždy spusťte prompt na anomálie. Tady se skrývají překvapení.
  6. Ručně zkontrolujte nejmenší skupinu.
  7. Klíčové číslo ověřte druhým modelem.
  8. Vyžádejte si specifikaci grafu, nebo vzorec, pokud číslo musí být přesné a opakovatelné.

Kroky 1, 5 a 6 jsou ty, které lidé vynechávají, a jsou to právě ty, které odlišují analýzu, kterou lze obhájit, od hezky naformátovaného odhadu.

Kontrolní seznam
  • Profilujte soubor dřív, než položíte jedinou analytickou otázku
  • Přečtěte si seznam unikátních hodnot, ať zachytíte odlišné pravopisy a smíchané formáty
  • U každého čísla vyžadujte postup výpočtu i vyloučené položky
  • Malé skupiny označte jako příliš malé, místo abyste u nich uváděli procento
  • Vždy spusťte prompt "co je na těchto datech podezřelé"
  • Před tím, než tabulce uvěříte, ručně zkontrolujte nejmenší skupinu
  • Důležitá čísla ověřte druhým modelem
  • Když číslo musí být přesně správné, žádejte vzorec nebo kód

Časté dotazy

Jak velká může být moje tabulka?

Záleží na tarifu a modelu a praktickým limitem je kontextové okno modelu, ne limit velikosti souboru. Claude Sonnet 5, GPT-5.6 Terra i Gemini 3.5 Flash ve Whizi čtou 1M tokenový kontext, což je zhruba 1 900 stran rukopisu dat. Nad tento rozsah vzorkujte cíleně a žádejte model, aby uvedl chybu vzorkování, místo abyste soubor tiše necali zkrátit, což je selhání, které produkuje sebevědomé odpovědi jen o zlomku vašich dat.

Odhalí AI chyby v mé tabulce?

Ano, a jde o jeden z nejúčinnějších promptů, které máte k dispozici. Otázka, co je na datech podezřelé, spolehlivě odhalí duplicitní importy, den, kdy se rozbil tracking, smíchané jednotky nebo měny, mezisoučtové řádky zapomenuté uvnitř dat i rozdělení, která se v polovině souboru změní. Žádejte, aby model citoval konkrétní řádky, ať si každé zjištění ověříte sami, ne aby vám prostě věřili na slovo.

Mohu věřit číslům, která mi dá?

Věřte struktuře, aritmetiku ověřte. Jazykové modely jsou silné v rozpoznání, jaký výpočet je potřeba, a v popisu toho, co je v datové sadě, a slabší v dlouhých aritmetických řetězcích přes mnoho řádků, kde tiše chybují krásně naformátovanou špatnou odpovědí. Ručně zkontrolujte nejmenší skupinu, klíčová čísla ověřte druhým modelem a pro vše, co musí být přesné, žádejte vzorec pro Excel nebo kód v Pythonu a spusťte si ho sami.

Který model je nejlepší na práci s tabulkami?

GPT na strukturované uvažování, striktní výstupní formáty a čisté tabulky nebo JSON. Claude jako ověřovací model u vícekrokové agregace, protože má tendenci dělat jiné chyby než ty stejné. Gemini, když je soubor velmi velký nebo chcete analyzovat tabulku vedle PDF nebo reportu v téže konverzaci.

Funguje to s excelovými vzorci a více listy?

Model čte hodnoty, ne živý sešit, takže výsledky vzorců se přenesou, ale živá logika vzorců ne. U vícelistových sešitů uveďte, který list máte na mysli, a popište, jak listy souvisí, nebo exportujte list, na kterém vám záleží, jako CSV. Soubory připravené pro prezentaci, se sloučenými buňkami a mezisoučty uvnitř dat, způsobují mnohem víc problémů než velké soubory.