Cara menganalisis hamparan dengan AI dalam Whizi

Jawapan Ringkas

Untuk menganalisis hamparan dengan AI, muat naik fail CSV atau Excel dan profilkannya dahulu sebelum bertanya apa-apa: jumlah baris, nilai yang hilang, pendua, dan nilai unik bagi setiap lajur. Kemudian tanya soalan sebenar anda dan minta kaedah pengiraan disertakan bersama setiap angka. Jalankan analisis dalam GPT, kemudian sahkan dengan menyemak satu kumpulan secara manual dan semak silang dengan Claude.

Profilkan data sebelum anda bertanya apa-apa

Cara paling biasa analisis hamparan menjadi tersasar tiada kaitan dengan AI. Ia berlaku apabila fail mengandungi 14 baris dengan ruang berlebih di hujung nama wilayah, dua format tarikh berbeza, satu baris subjumlah yang tertinggal di tengah-tengah, dan 300 sel kosong dalam lajur yang anda hendak purata. Tanya soalan anda dahulu dan anda akan mendapat jawapan yang yakin tetapi dikira daripada data yang rosak.

Jadi gesaan pertama adalah sama untuk setiap fail.

Gesaan: profil data

Profilkan fail ini sebelum kita menganalisis apa-apa. Berikan: jumlah baris, nama lajur berserta jenis yang disimpulkan, bilangan dan peratusan nilai yang hilang bagi setiap lajur, bilangan baris pendua yang tepat sama, nilai unik bagi setiap lajur dengan kurang daripada 25 nilai unik, nilai min dan maks bagi setiap lajur berangka dan tarikh, dan mana-mana lajur yang nilainya kelihatan tidak konsisten (format bercampur, ruang berlebih, unit bercampur, format tarikh bercampur). Jangan analisis atau tafsir lagi. Beritahu saya sahaja apa yang ada dalam fail ini dan apa yang kelihatan tidak kena.

Satu gesaan itu sahaja sudah mengesan kebanyakan perkara yang boleh merosakkan analisis. Senarai nilai unik khususnya adalah tempat anda menemui bahawa "UK", "U.K.", dan "United Kingdom" adalah tiga wilayah berasingan dalam data anda.

Gesaan: baiki apa yang ditemui

Seragamkan isu yang anda kenal pasti: potong ruang berlebih, seragamkan [lajur] kepada satu format sahaja, dan gabungkan varian ini: [senaraikan]. Tunjukkan pemetaan yang anda gunakan sebagai jadual sebelum melaksanakannya. Jangan buang mana-mana baris tanpa memberitahu saya baris mana dan sebabnya.

Tanya soalan yang menghasilkan jawapan yang boleh disemak

Soalan kabur mendapat jawapan kabur. Gesaan yang berkesan menamakan lajur, operasi, dan format hasil, serta meminta cara pengiraannya ditunjukkan.

Gesaan: pengagregatan dengan pengiraan ditunjukkan

Kumpulkan mengikut [lajur] dan kira [metrik]. Berikan jadual Markdown dengan kumpulan, bilangan baris di dalamnya, dan metrik tersebut. Di bawah jadual, nyatakan dengan tepat bagaimana anda mengira metrik itu, baris mana yang anda kecualikan dan sebabnya, dan bagaimana anda mengendalikan sel kosong. Susun menurun mengikut [lajur].

Gesaan: soalan kohort

Bagi setiap [dimensi kohort, contohnya bulan pendaftaran], kira [metrik] pada [selang masa]. Tunjukkan saiz kohort bersama setiap angka. Tandakan mana-mana kohort dengan kurang daripada [n] baris sebagai terlalu kecil untuk ditafsir dan bukannya melaporkan peratusan untuknya.

Arahan terakhir itu mengelakkan hasil yang paling mengelirukan dalam analisis hamparan: kohort empat pengguna dilaporkan sebagai "75% pengekalan" dan duduk dalam jadual bersebelahan dengan kohort sembilan ribu.

Gesaan: pemburuan anomali

Apa yang mencurigakan tentang data ini? Cari: nilai di luar julat yang munasabah, kejutan mendadak dalam siri masa, lajur di mana taburan berubah separuh jalan, baris yang pendua tepat atau hampir sama, nilai yang kelihatan terlalu bulat, dan apa-apa yang menunjukkan perubahan dalam cara data dikumpulkan. Bagi setiap satu, petik baris yang berkenaan.

Itulah gesaan paling bernilai di halaman ini dan ia tiada padanan dalam aliran kerja hamparan biasa. Ia secara rutin menemui hari penjejakan rosak, vendor yang mula melaporkan dalam mata wang berbeza, dan import pendua yang menggelembungkan satu suku tahun.

Gesaan: spesifikasi carta

Cadangkan carta yang sesuai untuk soalan dan bentuk data ini, dan terangkan mengapa alternatif yang lebih jelas sebenarnya lebih lemah di sini. Kemudian berikan saya spesifikasinya: jenis carta, x, y, siri, pengagregatan, susunan isihan, dan rawatan paksi. Jangan guna paksi berkembar. Jangan potong paksi carta bar.

Di mana pengiraan sebenarnya tersilap

Ini memerlukan jawapan yang jelas, kerana "AI lemah dalam matematik" adalah benar tetapi juga kabur dan tidak membantu.

Model bahasa yang menaakul angka dalam teks sebenarnya melengkapkan corak, bukan mengira. Ia boleh dipercayai untuk menerangkan struktur, mengkategorikan baris, dan mengenal pasti pengiraan yang anda perlukan. Ia jauh kurang boleh dipercayai untuk melaksanakan rantaian pengiraan yang panjang merentasi beratus-ratus baris, dan ia gagal secara senyap: hasilnya adalah jadual yang kelihatan kemas dengan angka yang salah tanpa sebarang isyarat amaran.

Peraturan praktikal:

  • Minta kaedah, bukan sekadar hasil. "Nyatakan dengan tepat bagaimana anda mengira ini dan apa yang anda kecualikan" menjadikan kesilapan itu kelihatan jika ada.
  • Semak satu kumpulan secara manual. Pilih kumpulan terkecil dalam jadual hasil dan sahkan dalam hamparan sebenar. Jika sepadan, kaedah itu berkemungkinan betul; jika tidak, tiada apa dalam jadual itu boleh dipercayai.
  • Semak silang apa-apa yang penting dengan model kedua. Dua model bebas yang mencapai angka yang sama adalah bukti yang jauh lebih baik berbanding satu model mengulangi dirinya. Paparan bersebelahan Whizi wujud khusus untuk ini.
  • Perhatikan pengiraan berganda. Baris subjumlah yang tertinggal dalam fail dan gabungan satu-ke-banyak adalah dua punca biasa, dan model tidak akan tahu ia salah.
  • Untuk apa-apa yang perlu tepat, minta formula atau kod. Berikan saya formula Excel atau berikan saya kod pandas meletakkan pengiraan dalam enjin yang deterministik, dan anda kekalkan model untuk bahagian yang ia mahir, iaitu mengetahui pengiraan mana yang perlu dijalankan.

Yang terakhir itulah jawapan sebenar untuk kerja kewangan atau pelaporan. Guna model untuk mereka bentuk analisis, guna hamparan atau skrip anda untuk melaksanakannya.

Model mana membaca fail mana, dan berapa besar dianggap terlalu besar?

CSV dan Excel kedua-duanya boleh dimuat naik terus, dan ketiga-tiga model membahagikan kerja dengan kemas.

ModelTetingkap konteksKredit setiap mesejGuna untuk
GPT-5.6 Terra1M token4Format ketat: jadual bersih, JSON, pemetaan lajur yang tepat
Claude Sonnet 51M token10Laluan semak silang bagi pengagregatan berbilang langkah
Gemini 3.5 Flash1M token, kira-kira 1,900 halaman manuskrip8Fail terbesar, atau hamparan bersama PDF dalam satu perbualan

Angka konteks dan kredit diperoleh daripada indeks kos model Whizi, kadar tersenarai diambil pada 2026-08-20.

Beberapa nota praktikal:

  • Beri ia segi empat yang bersih. Satu baris tajuk, tiada sel bergabung, tiada baris kosong pemisah, tiada nota dalam lajur K. Laporan berformat tajuk berbilang mengelirukan pengekstrakan lebih daripada had saiz fail mana-mana.
  • Hantar helaian mentah, bukan helaian pembentangan. Versi dengan format dan subjumlah adalah yang menghasilkan pengiraan berganda.
  • Fail yang sangat lebar mendapat manfaat daripada senarai lajur dahulu. Tanya apa maksud setiap lajur sebelum menganalisis jika namanya sukar difahami, dan beritahu model apa yang ia tersilap.
  • Untuk fail yang sangat besar, guna Gemini 3.5 Flash, yang membaca konteks 1M token yang sama seperti Claude Sonnet 5 dan GPT-5.6 Terra pada kos paling rendah setiap jawapan antara ketiga-tiganya. Selebihnya, sampel secara sengaja: analisis sampel rawak 5000 baris dan beritahu saya ralat pensampelan yang perlu saya jangkakan bagi setiap angka adalah lebih baik daripada memotong secara senyap.
  • Buang data peribadi dahulu. Nama, e-mel, dan pengecam hampir tidak pernah diperlukan untuk analisis, dan membuangnya lebih pantas daripada berdebat sama ada anda dibenarkan memuat naiknya.

Mekanik muat naik dibincangkan dalam memuat naik dokumen.

Urutan lapan langkah penuh pada fail sebenar

Keseluruhan aliran kerja pada fail sebenar, mengikut urutan:

  1. Muat naik. Jalankan gesaan profil. Baca nilai unik dan bilangan kosong dengan teliti.
  2. Baiki apa yang ditemui, semak jadual pemetaan sebelum ia dilaksanakan.
  3. Minta ringkasan tentang apa data ini berkenaan dan tiga soalan yang difikirkannya patut anda tanya. Langkah ini pantas dan selalunya membentuk semula analisis.
  4. Tanya soalan sebenar anda, dengan kaedah dan pengecualian diwajibkan dalam jawapan.
  5. Jalankan gesaan anomali, setiap kali. Di sinilah kejutan berada.
  6. Semak kumpulan terkecil secara manual.
  7. Semak silang angka utama dengan model kedua.
  8. Minta spesifikasi carta, atau formula jika angka itu perlu tepat dan boleh dihasilkan semula.

Langkah 1, 5, dan 6 adalah yang selalu dilangkau orang, dan itulah yang membezakan analisis yang boleh anda pertahankan daripada tekaan yang hanya kelihatan kemas.

Senarai Semak
  • Profilkan fail sebelum bertanya walau satu soalan analitikal
  • Baca senarai nilai unik untuk mengesan variasi ejaan dan format bercampur
  • Wajibkan kaedah dan pengecualian disertakan bersama setiap angka
  • Tandakan kumpulan kecil sebagai terlalu kecil dan bukannya melaporkan peratusan untuknya
  • Sentiasa jalankan gesaan "apa yang mencurigakan tentang data ini"
  • Semak kumpulan terkecil secara manual sebelum mempercayai jadual
  • Semak silang angka penting dengan model kedua
  • Minta formula atau kod apabila angka perlu betul-betul tepat

Soalan Lazim

Berapa besar hamparan saya boleh jadi?

Ia bergantung pada pelan dan model, dan had praktikalnya ialah tetingkap konteks model dan bukannya had saiz fail. Claude Sonnet 5, GPT-5.6 Terra, dan Gemini 3.5 Flash semuanya membaca konteks 1M token dalam Whizi, kira-kira 1,900 halaman manuskrip data. Melebihi itu, ambil sampel secara sengaja dan minta model menyatakan ralat pensampelan berbanding membiarkan fail dipotong secara senyap, iaitu mod kegagalan yang menghasilkan jawapan yang yakin tentang hanya sebahagian kecil data anda.

Bolehkah AI mengesan kesilapan hamparan saya?

Ya, dan ia adalah salah satu gesaan yang paling bernilai. Bertanya apa yang mencurigakan tentang data secara konsisten mendedahkan import pendua, hari penjejakan rosak, unit atau mata wang bercampur, baris subjumlah yang tertinggal dalam data, dan taburan yang berubah separuh jalan dalam fail. Minta ia petik baris tertentu supaya anda boleh sahkan setiap penemuan berbanding hanya percaya senarai itu begitu sahaja.

Bolehkah saya percaya angka yang ia berikan?

Percayai strukturnya, sahkan pengiraannya. Model bahasa kuat dalam mengenal pasti pengiraan yang diperlukan dan menerangkan apa yang ada dalam set data, tetapi lebih lemah dalam rantaian pengiraan panjang merentasi banyak baris, di mana ia gagal secara senyap dengan jawapan salah yang kelihatan kemas. Semak kumpulan terkecil secara manual, semak silang angka utama dengan model kedua, dan untuk apa-apa yang perlu tepat, minta formula Excel atau kod Python dan jalankan sendiri.

Model manakah terbaik untuk kerja hamparan?

GPT untuk penaakulan berstruktur, format hasil yang ketat, dan jadual atau JSON yang bersih. Claude sebagai semakan silang bagi pengagregatan berbilang langkah, kerana ia cenderung membuat kesilapan yang berbeza dan bukannya kesilapan yang sama. Gemini apabila fail sangat besar atau apabila anda mahu menganalisis hamparan bersama PDF atau laporan dalam perbualan yang sama.

Adakah ia berfungsi dengan formula Excel dan berbilang helaian?

Ia membaca nilai dan bukannya melaksanakan buku kerja anda, jadi hasil formula terpapar tetapi logik formula langsung tidak. Untuk buku kerja berbilang helaian, nyatakan helaian mana yang anda maksudkan dan terangkan bagaimana helaian itu berkait, atau eksport helaian yang anda perlukan sebagai CSV. Fail yang dibina untuk pembentangan, dengan sel bergabung dan subjumlah di dalam data, menyebabkan lebih banyak masalah berbanding fail yang besar.