Profilează datele înainte de a le întreba orice
Cel mai frecvent mod în care analiza unei foi de calcul eșuează nu are nicio legătură cu IA. Fișierul conține 14 rânduri cu spațiu la finalul numelui regiunii, două formate de dată, un rând de subtotal rămas la mijloc și 300 de câmpuri goale în coloana pe care tocmai vrei să o mediezi. Pui întrebarea prima dată și primești un răspuns sigur pe sine, calculat pe baza unor date murdare.
Așa că primul prompt este mereu același, pe orice fișier.
Prompt: profilul
Profilează acest fișier înainte să analizăm ceva. Returnează: numărul de rânduri, numele coloanelor cu tipul dedus, numărul și procentul de valori lipsă pe coloană, numărul de rânduri exact duplicate, valorile distincte pentru fiecare coloană cu mai puțin de 25 de valori distincte, minimul și maximul pentru fiecare coloană numerică și de dată, și orice coloană în care valorile par inconsistente (formate mixte, spații parazite, unități mixte, formate de dată mixte). Nu analiza și nu interpreta încă. Spune-mi doar ce se află în fișier și ce pare greșit.
Acest singur prompt prinde majoritatea lucrurilor care altfel ar strica analiza. Lista valorilor distincte este locul unde descoperi în special că "UK", "U.K." și "United Kingdom" sunt trei regiuni separate în datele tale.
Prompt: repară ce a găsit
Standardizează problemele identificate: elimină spațiile parazite, unifică [coloana] la un singur format și consolidează aceste variante: [enumeră-le]. Arată-mi maparea aplicată sub formă de tabel înainte de a o aplica. Nu elimina niciun rând fără să-mi spui care și de ce.
Pune întrebări care produc răspunsuri verificabile
Întrebările vagi primesc răspunsuri vagi. Prompturile care funcționează numesc coloana, operația și formatul de ieșire, și cer să vadă modul de lucru.
Prompt: agregare cu modul de lucru arătat
Grupează după [coloana] și calculează [metrica]. Returnează un tabel Markdown cu grupul, numărul de rânduri din el și metrica. Sub tabel, precizează exact cum ai calculat metrica, ce rânduri ai exclus și de ce, și cum ai tratat câmpurile goale. Sortează descrescător după [coloana].
Prompt: întrebarea despre cohorte
Pentru fiecare [dimensiune de cohortă, de exemplu luna de înregistrare], calculează [metrica] la [interval]. Arată dimensiunea cohortei alături de fiecare cifră. Marchează orice cohortă cu mai puțin de [n] rânduri ca fiind prea mică pentru a fi interpretată, în loc să raportezi un procent pentru ea.
Ultima instrucțiune previne cel mai înșelător rezultat din analiza foilor de calcul: o cohortă de patru utilizatori raportată drept "retenție de 75%" și așezată într-un tabel lângă o cohortă de nouă mii.
Prompt: vânătoarea de anomalii
Ce e suspect la aceste date? Caută: valori în afara unui interval plauzibil, discontinuități bruște într-o serie temporală, coloane unde distribuția se schimbă pe parcurs, rânduri care sunt duplicate exacte sau aproape identice, valori care par prea rotunde și orice indiciu de schimbare în modul de colectare a datelor. Pentru fiecare, citează rândurile concrete.
Acesta este prompt-ul cu cea mai mare valoare de pe această pagină și nu are echivalent într-un flux obișnuit de lucru cu foi de calcul. Găsește frecvent ziua în care s-a stricat urmărirea, furnizorul care a început să raporteze într-o altă monedă și importul duplicat care a umflat un trimestru.
Prompt: specificația graficului
Recomandă graficul potrivit pentru această întrebare și această formă de date și explică de ce alternativa evidentă este mai slabă aici. Apoi dă-mi specificația: tip de grafic, x, y, serie, agregare, ordine de sortare și tratamentul axelor. Nu folosi o axă duală. Nu trunchia axa unui grafic cu bare.
Unde greșește de fapt aritmetica
Acest lucru merită un răspuns direct, pentru că "IA e slabă la matematică" este atât adevărat, cât și nefolositor de vag.
Un model de limbaj care raționează pe numere în text face completare de tipare, nu calcul. Este de încredere când descrie structura, categorisește rândurile și identifică ce calcul e necesar. Este mult mai puțin de încredere când execută un lanț lung de operații aritmetice pe sute de rânduri, și eșuează tăcut: rezultatul e un tabel bine formatat cu numere greșite, fără niciun semnal de alarmă.
Regulile practice:
- Cere metoda, nu doar rezultatul. "Precizează exact cum ai calculat asta și ce ai exclus" face vizibilă eroarea, dacă există una.
- Verifică manual un grup, prin sondaj. Alege cel mai mic grup din tabelul de rezultate și verifică-l în foaia de calcul reală. Dacă se potrivește, metoda e probabil corectă; dacă nu, nimic din tabel nu poate fi de încredere.
- Verifică încrucișat orice e important cu un al doilea model. Două modele independente care ajung la același număr reprezintă o dovadă semnificativ mai bună decât un singur model care se repetă. Vizualizarea alăturată a Whizi există exact pentru asta.
- Fii atent la numărarea dublă. Rândurile de subtotal rămase în fișier și legăturile de tip unu-la-mai-mulți sunt cei doi vinovați obișnuiți, iar modelul nu va ști că sunt greșite.
- Pentru orice trebuie să fie exact, cere formula sau codul.
Dă-mi formula Excelsaudă-mi codul pandasmută aritmetica într-un motor determinist, și păstrezi modelul pentru partea la care se pricepe, adică să știe ce calcul trebuie rulat.
Ultimul punct este răspunsul real pentru lucrul financiar sau de raportare. Folosește modelul pentru a proiecta analiza, folosește foaia de calcul sau un script pentru a o executa.
Ce model citește ce fișier și cât de mare e prea mare?
CSV și Excel se încarcă direct amândouă, iar cele trei modele își împart munca clar.
| Model | Fereastră de context | Credite pe mesaj | Folosește-l pentru |
|---|---|---|---|
| GPT-5.6 Terra | 1M tokeni | 4 | Formate stricte: tabele curate, JSON, mapări exacte de coloane |
| Claude Sonnet 5 | 1M tokeni | 10 | Verificarea încrucișată a agregărilor cu mai mulți pași |
| Gemini 3.5 Flash | 1M tokeni, aproximativ 1.900 de pagini de manuscris | 8 | Cele mai mari fișiere, sau o foaie de calcul plus un PDF în același fir |
Cifrele privind contextul și creditele provin din indexul de cost al modelelor Whizi, tarife de listă preluate la 2026-08-20.
Câteva note practice:
- Dă-i un dreptunghi curat. Un singur rând de antet, fără celule îmbinate, fără rânduri goale de spațiere, fără note în coloana K. Rapoartele formatate cu antete multiple derutează extragerea mai mult decât orice limită de dimensiune a fișierului.
- Trimite foaia brută, nu foaia de prezentare. Versiunea cu formatare și subtotaluri este cea care produce numărare dublă.
- Fișierele foarte late beneficiază de o listă de coloane la început. Întreabă ce înseamnă fiecare coloană înainte de a analiza, dacă numele sunt criptice, și spune modelului ce a greșit.
- Pentru fișierele foarte mari, folosește Gemini 3.5 Flash, care citește aceeași fereastră de context de 1M tokeni ca Claude Sonnet 5 și GPT-5.6 Terra la cel mai mic cost pe răspuns dintre cele trei. Dincolo de atât, eșantionează deliberat:
analizează un eșantion aleator de 5000 de rânduri și spune-mi eroarea de eșantionare la care ar trebui să mă aștept pentru fiecare cifrăeste mai bine decât o trunchiere silențioasă. - Elimină mai întâi datele personale. Numele, e-mailurile și identificatorii aproape că nu sunt necesari pentru analiză, iar eliminarea lor e mai rapidă decât o discuție despre dacă aveai voie să le încarci.
Mecanismele încărcării sunt descrise în încărcarea documentelor.
Secvența completă în opt pași pe un fișier real
Întregul flux de lucru pe un fișier real, în ordine:
- Încarcă. Rulează promptul de profilare. Citește cu atenție valorile distincte și numărul de valori lipsă.
- Repară ce a găsit, revizuind tabelul de mapare înainte ca acesta să fie aplicat.
- Cere un rezumat despre ce sunt datele și cele trei întrebări pe care crede că ar trebui să le pui. Acest pas e rapid și adesea reformulează analiza.
- Pune-ți întrebarea reală, cu metoda și excluderile cerute în răspuns.
- Rulează promptul de anomalii, întotdeauna. Aici se ascund surprizele.
- Verifică manual, prin sondaj, cel mai mic grup.
- Verifică încrucișat cifra principală cu un al doilea model.
- Cere specificația graficului, sau formula, dacă numărul trebuie să fie exact și reproductibil.
Pașii 1, 5 și 6 sunt cei pe care oamenii îi sar, și tocmai ei separă o analiză pe care o poți apăra de o presupunere frumos formatată.
- Profilează fișierul înainte de a pune o singură întrebare analitică
- Citește lista valorilor distincte pentru a prinde variantele de scriere și formatele mixte
- Cere metoda și excluderile alături de fiecare cifră
- Marchează grupurile mici ca fiind prea mici, în loc să raportezi un procent pentru ele
- Rulează întotdeauna promptul "ce e suspect la aceste date"
- Verifică manual, prin sondaj, cel mai mic grup, înainte de a avea încredere în tabel
- Verifică încrucișat cifrele importante cu un al doilea model
- Cere formula sau codul atunci când cifra trebuie să fie exactă
Întrebări frecvente
Cât de mare poate fi foaia mea de calcul?
Depinde de plan și de model, iar limita practică este fereastra de context a modelului, nu o limită de dimensiune a fișierului. Claude Sonnet 5, GPT-5.6 Terra și Gemini 3.5 Flash citesc toate o fereastră de context de 1M tokeni în Whizi, adică aproximativ 1.900 de pagini de manuscris de date. Dincolo de atât, eșantionează deliberat și cere modelului să precizeze eroarea de eșantionare, în loc să lași fișierul trunchiat silențios, ceea ce e modul de eșec care produce răspunsuri sigure pe sine despre o fracțiune din datele tale.
Poate IA să prindă erorile din foaia mea de calcul?
Da, și este unul dintre prompturile cu cel mai mare randament disponibile. Întrebarea despre ce e suspect la date scoate la iveală în mod fiabil importuri duplicate, ziua în care s-a stricat urmărirea, unități sau monede mixte, rânduri de subtotal rămase în date și distribuții care se schimbă pe parcursul fișierului. Cere-i să citeze rândurile concrete, ca să poți verifica fiecare descoperire în loc să iei lista pe încredere.
Pot avea încredere în cifrele pe care mi le oferă?
Ai încredere în structură, verifică aritmetica. Modelele de limbaj sunt puternice la identificarea calculului necesar și la descrierea a ce se află într-un set de date, și mai slabe la lanțuri lungi de operații aritmetice pe multe rânduri, unde eșuează tăcut cu un răspuns greșit, dar bine formatat. Verifică manual cel mai mic grup, verifică încrucișat cifrele principale cu un al doilea model, iar pentru orice trebuie să fie exact, cere formula Excel sau codul Python și rulează-l tu însuți.
Care model e cel mai bun pentru lucrul cu foi de calcul?
GPT pentru raționament structurat, formate stricte de ieșire și tabele sau JSON curate. Claude ca verificare încrucișată la agregări cu mai mulți pași, pentru că tinde să facă greșeli diferite, nu aceleași. Gemini când fișierul e foarte mare sau când vrei să analizezi o foaie de calcul alături de un PDF sau un raport în aceeași conversație.
Funcționează cu formule Excel și mai multe foi?
Citește valorile, nu execută registrul tău de calcul, așa că rezultatele formulelor ajung, dar logica formulei vii nu. Pentru registre cu mai multe foi, spune ce foaie ai în vedere și descrie cum se leagă foile între ele, sau exportă foaia care te interesează ca CSV. Fișierele construite pentru prezentare, cu celule îmbinate și subtotaluri în interiorul datelor, cauzează mult mai multe probleme decât fișierele mari.