किसी भी सवाल से पहले डेटा को प्रोफ़ाइल करें
स्प्रेडशीट एनालिसिस के गलत होने का सबसे आम तरीका AI से जुड़ा नहीं होता। असल बात यह है कि फ़ाइल में क्षेत्र के नाम में ट्रेलिंग स्पेस वाली 14 पंक्तियां, दो डेट फ़ॉर्मैट, बीच में छूटा हुआ एक सबटोटल रो, और जिस कॉलम का आप औसत निकालने वाले हैं उसमें 300 खाली सेल होते हैं। पहले अपना सवाल पूछें तो आपको कचरे पर गणना किया हुआ एक भरोसेमंद जवाब मिलेगा।
इसलिए पहला प्रॉम्प्ट हर फ़ाइल पर एक जैसा होता है।
प्रॉम्प्ट: प्रोफ़ाइल
इस फ़ाइल को एनालाइज़ करने से पहले प्रोफ़ाइल करें। बताएं: रो काउंट, अनुमानित टाइप के साथ कॉलम नाम, हर कॉलम में मिसिंग वैल्यूज़ की संख्या और प्रतिशत, एग्जैक्ट डुप्लिकेट रो की संख्या, 25 से कम डिस्टिंक्ट वैल्यूज़ वाले हर कॉलम की डिस्टिंक्ट वैल्यूज़, हर न्यूमेरिक और डेट कॉलम का मिन और मैक्स, और कोई भी कॉलम जिसमें वैल्यूज़ असंगत लगें (मिक्स्ड फ़ॉर्मैट, ट्रेलिंग व्हाइटस्पेस, मिक्स्ड यूनिट, मिक्स्ड डेट फ़ॉर्मैट)। अभी एनालाइज़ या इंटरप्रेट न करें। बस बताएं कि फ़ाइल में क्या है और उसमें क्या गड़बड़ लगती है।
यह अकेला प्रॉम्प्ट उस ज़्यादातर चीज़ को पकड़ लेता है जो वरना एनालिसिस को बर्बाद कर देती। खासकर डिस्टिंक्ट-वैल्यूज़ लिस्ट में आपको पता चलता है कि आपके डेटा में "UK", "U.K." और "United Kingdom" तीन अलग क्षेत्र हैं।
प्रॉम्प्ट: मिली गड़बड़ियां ठीक करें
जो समस्याएं आपने खोजी हैं उन्हें स्टैंडर्डाइज़ करें: व्हाइटस्पेस ट्रिम करें, [column] को एक ही फ़ॉर्मैट में लाएं, और इन वेरिएंट्स को मिलाएं: [list them]। लागू करने से पहले जो मैपिंग आपने अप्लाई की है वह टेबल के रूप में मुझे दिखाएं। कोई भी रो बिना बताए न हटाएं कि कौन सी और क्यों।
ऐसे सवाल पूछें जिनके जवाब चेक किए जा सकें
अस्पष्ट सवालों के जवाब भी अस्पष्ट मिलते हैं। जो प्रॉम्प्ट काम करते हैं वे कॉलम, ऑपरेशन और आउटपुट फ़ॉर्मैट का नाम लेते हैं, और तरीका बताने को भी कहते हैं।
प्रॉम्प्ट: तरीका दिखाते हुए एग्रीगेशन
[column] के हिसाब से ग्रुप करें और [metric] कैलकुलेट करें। ग्रुप, उसमें मौजूद रो की गिनती और मेट्रिक के साथ एक Markdown टेबल दें। टेबल के नीचे ठीक-ठीक बताएं कि आपने मेट्रिक कैसे कैलकुलेट किया, कौन सी रो क्यों बाहर रखीं, और खाली सेल कैसे संभाले। [column] के हिसाब से घटते क्रम में सॉर्ट करें।
प्रॉम्प्ट: कोहोर्ट सवाल
हर [cohort dimension, जैसे साइनअप महीना] के लिए, [interval] पर [metric] कैलकुलेट करें। हर आंकड़े के साथ कोहोर्ट साइज़ भी दिखाएं। [n] से कम रो वाले किसी भी कोहोर्ट को प्रतिशत बताने की बजाय "इंटरप्रेट करने के लिए बहुत छोटा" फ़्लैग करें।
यह आखिरी निर्देश स्प्रेडशीट एनालिसिस के सबसे भ्रामक आउटपुट को रोकता है: चार यूज़र्स का एक कोहोर्ट जिसे "75% रिटेंशन" बताया जाए और नौ हज़ार के कोहोर्ट के बगल में एक टेबल में बैठा दिया जाए।
प्रॉम्प्ट: एनोमली ढूंढना
इस डेटा में क्या संदिग्ध लगता है? देखें: प्रशंसनीय दायरे से बाहर की वैल्यूज़, टाइम सीरीज़ में अचानक आया ब्रेक, ऐसे कॉलम जिनमें डिस्ट्रीब्यूशन बीच में बदल जाता है, ऐसी रो जो एग्जैक्ट या लगभग डुप्लिकेट हों, वैल्यूज़ जो बहुत ज़्यादा गोल लगें, और कुछ भी जो यह संकेत दे कि डेटा इकट्ठा करने का तरीका बदल गया। हर एक के लिए, संबंधित रो कोट करें।
यह इस पेज पर सबसे ज़्यादा काम का प्रॉम्प्ट है और सामान्य स्प्रेडशीट वर्कफ़्लो में इसका कोई विकल्प नहीं है। यह अक्सर वह दिन ढूंढ निकालता है जब ट्रैकिंग टूटी थी, वह वेंडर जिसने अलग करेंसी में रिपोर्ट करना शुरू किया, और वह डुप्लिकेट इंपोर्ट जिसने किसी तिमाही को बढ़ा-चढ़ाकर दिखाया।
प्रॉम्प्ट: चार्ट स्पेसिफ़िकेशन
इस सवाल और इस डेटा शेप के लिए सही चार्ट सुझाएं, और बताएं कि सामान्य विकल्प यहां क्यों कमज़ोर है। फिर मुझे स्पेसिफ़िकेशन दें: चार्ट टाइप, x, y, सीरीज़, एग्रीगेशन, सॉर्ट ऑर्डर और एक्सिस ट्रीटमेंट। डुअल एक्सिस का इस्तेमाल न करें। बार चार्ट एक्सिस को ट्रंकेट न करें।
गणित असल में कहां गलत होता है
इसका सीधा जवाब बनता है, क्योंकि "AI गणित में कमज़ोर है" यह बात सही भी है और बेकार जितनी अस्पष्ट भी।
टेक्स्ट में नंबरों पर तर्क करते समय लैंग्वेज मॉडल पैटर्न कंप्लीशन कर रहा होता है, गणना नहीं। यह स्ट्रक्चर बताने, रो को कैटेगराइज़ करने और यह पहचानने में भरोसेमंद है कि आपको कौन सी गणना चाहिए। सैकड़ों रो में लंबी अरिथमेटिक चेन करने में यह बहुत कम भरोसेमंद है, और यह चुपचाप फेल होता है: आउटपुट गलत नंबरों की एक अच्छी तरह फ़ॉर्मैट की गई टेबल होती है, बिना किसी चेतावनी के।
व्यावहारिक नियम:
- सिर्फ़ नतीजा नहीं, तरीका भी मांगें। "ठीक-ठीक बताएं कि आपने यह कैसे कैलकुलेट किया और क्या बाहर रखा" पूछने से गलती होने पर वह दिखाई देने लगती है।
- एक ग्रुप को हाथ से स्पॉट चेक करें। आउटपुट टेबल में सबसे छोटा ग्रुप चुनें और उसे असली स्प्रेडशीट में वेरिफ़ाई करें। अगर मैच हो जाए तो तरीका शायद सही है; अगर नहीं, तो टेबल की किसी भी चीज़ पर भरोसा नहीं किया जा सकता।
- महत्वपूर्ण चीज़ को दूसरे मॉडल से क्रॉस-चेक करें। दो स्वतंत्र मॉडल का एक ही नंबर पर पहुंचना, एक मॉडल के खुद को दोहराने से कहीं बेहतर सबूत है। Whizi का साइड-बाय-साइड व्यू ठीक इसी के लिए है।
- डबल काउंटिंग पर नज़र रखें। फ़ाइल में छूटी सबटोटल रो और वन-टू-मैनी जॉइन दो सबसे आम वजहें हैं, और मॉडल को पता नहीं चलेगा कि वे गलत हैं।
- जो भी बिल्कुल सटीक होना चाहिए, उसके लिए फ़ॉर्मूला या कोड मांगें।
Give me the Excel formulaयाgive me the pandas codeगणित को एक डिटरमिनिस्टिक इंजन में डाल देता है, और मॉडल को उस काम के लिए रखा रहता है जिसमें वह अच्छा है, यानी यह पहचानना कि कौन सी गणना चलानी है।
वित्तीय या रिपोर्टिंग काम के लिए आखिरी वाला ही असली जवाब है। एनालिसिस डिज़ाइन करने के लिए मॉडल का इस्तेमाल करें, उसे एक्सिक्यूट करने के लिए अपनी स्प्रेडशीट या स्क्रिप्ट का।
कौन सा मॉडल कौन सी फ़ाइल पढ़ता है, और कितनी बड़ी फ़ाइल ज़्यादा बड़ी है?
CSV और Excel दोनों सीधे अपलोड होते हैं, और तीनों मॉडल काम को साफ़-साफ़ बांट लेते हैं।
| मॉडल | कॉन्टेक्स्ट विंडो | प्रति मैसेज क्रेडिट | किसके लिए इस्तेमाल करें |
|---|---|---|---|
| GPT-5.6 Terra | 1M टोकन | 4 | सख़्त फ़ॉर्मैट: साफ़ टेबल, JSON, एग्ज़ैक्ट कॉलम मैपिंग |
| Claude Sonnet 5 | 1M टोकन | 10 | मल्टी-स्टेप एग्रीगेशन पर क्रॉस-चेक पास |
| Gemini 3.5 Flash | 1M टोकन, लगभग 1,900 पांडुलिपि पृष्ठ | 8 | सबसे बड़ी फ़ाइलें, या एक ही थ्रेड में स्प्रेडशीट और PDF साथ में |
कॉन्टेक्स्ट और क्रेडिट के आंकड़े Whizi के मॉडल कॉस्ट इंडेक्स से लिए गए हैं, लिस्ट रेट 2026-08-20 को फ़ेच की गईं।
कुछ व्यावहारिक बातें:
- इसे एक साफ़ रेक्टेंगल दें। एक हेडर रो, कोई मर्ज्ड सेल नहीं, कोई खाली स्पेसर रो नहीं, कॉलम K में कोई नोट नहीं। मल्टी-हेडर वाली फ़ॉर्मैटेड रिपोर्ट किसी भी फ़ाइल साइज़ लिमिट से ज़्यादा एक्सट्रैक्शन को उलझाती हैं।
- प्रेजेंटेशन शीट नहीं, रॉ शीट भेजें। फ़ॉर्मैटिंग और सबटोटल वाला वर्ज़न ही डबल काउंटिंग पैदा करता है।
- बहुत चौड़ी फ़ाइलों के लिए पहले कॉलम लिस्ट मांगना फ़ायदेमंद है। अगर नाम समझ में न आएं तो एनालाइज़ करने से पहले पूछें कि हर कॉलम का मतलब क्या है, और मॉडल को बताएं कि उसने कहां गलती की।
- बहुत बड़ी फ़ाइलों के लिए Gemini 3.5 Flash इस्तेमाल करें, जो Claude Sonnet 5 और GPT-5.6 Terra जितना ही 1M टोकन कॉन्टेक्स्ट पढ़ता है, तीनों में सबसे कम प्रति-जवाब लागत पर। उससे भी आगे, सोच-समझकर सैंपल लें:
analyse a random 5000 row sample and tell me the sampling error I should expect on each figureचुपचाप ट्रंकेट होने से बेहतर है। - पहले पर्सनल डेटा हटाएं। नाम, ईमेल और आइडेंटिफ़ायर एनालिसिस के लिए लगभग कभी ज़रूरी नहीं होते, और उन्हें हटाना इस बहस से तेज़ है कि आपको उन्हें अपलोड करने की इजाज़त थी या नहीं।
अपलोड कैसे काम करता है, यह डॉक्यूमेंट अपलोड करना में बताया गया है।
एक असली फ़ाइल पर पूरा आठ-स्टेप सीक्वेंस
एक असली फ़ाइल पर पूरा वर्कफ़्लो, क्रम में:
- अपलोड करें। प्रोफ़ाइल प्रॉम्प्ट चलाएं। डिस्टिंक्ट वैल्यूज़ और मिसिंग काउंट ध्यान से पढ़ें।
- जो गड़बड़ी मिली उसे ठीक करें, लागू होने से पहले मैपिंग टेबल की समीक्षा करें।
- डेटा किस बारे में है और मॉडल किन तीन सवालों को पूछने लायक मानता है, उसका सारांश मांगें। यह स्टेप जल्दी होता है और अक्सर एनालिसिस को नए सिरे से दिखा देता है।
- अपना असली सवाल पूछें, जवाब में तरीका और एक्सक्लूज़न ज़रूरी बताते हुए।
- एनोमली प्रॉम्प्ट हमेशा चलाएं। यहीं पर हैरान करने वाली बातें मिलती हैं।
- सबसे छोटे ग्रुप को हाथ से स्पॉट चेक करें।
- मुख्य नंबर को दूसरे मॉडल से क्रॉस-चेक करें।
- चार्ट स्पेसिफ़िकेशन मांगें, या फ़ॉर्मूला अगर नंबर बिल्कुल सटीक और रिप्रोड्यूसिबल होना चाहिए।
स्टेप 1, 5 और 6 ही वे हैं जिन्हें लोग छोड़ देते हैं, और यही वे हैं जो एक बचाव-योग्य एनालिसिस को एक अच्छी तरह फ़ॉर्मैट किए गए अंदाज़े से अलग करते हैं।
- किसी भी एनालिटिकल सवाल से पहले फ़ाइल को प्रोफ़ाइल करें
- वेरिएंट स्पेलिंग और मिक्स्ड फ़ॉर्मैट पकड़ने के लिए डिस्टिंक्ट-वैल्यू लिस्ट पढ़ें
- हर नंबर के साथ तरीका और एक्सक्लूज़न ज़रूरी बताएं
- छोटे ग्रुप के लिए प्रतिशत बताने की बजाय उन्हें बहुत छोटा फ़्लैग करें
- हमेशा "इस डेटा में क्या संदिग्ध है" प्रॉम्प्ट चलाएं
- टेबल पर भरोसा करने से पहले सबसे छोटे ग्रुप को हाथ से स्पॉट चेक करें
- महत्वपूर्ण आंकड़ों को दूसरे मॉडल से क्रॉस-चेक करें
- जब नंबर बिल्कुल सही होना ज़रूरी हो तो फ़ॉर्मूला या कोड मांगें
अक्सर पूछे जाने वाले सवाल
मेरी स्प्रेडशीट कितनी बड़ी हो सकती है?
यह प्लान और मॉडल पर निर्भर करता है, और व्यावहारिक सीमा फ़ाइल साइज़ कैप की बजाय मॉडल का कॉन्टेक्स्ट विंडो है। Claude Sonnet 5, GPT-5.6 Terra और Gemini 3.5 Flash, सभी Whizi में 1M टोकन कॉन्टेक्स्ट पढ़ते हैं, यानी डेटा के लगभग 1,900 पांडुलिपि पृष्ठ। उससे ज़्यादा होने पर सोच-समझकर सैंपल लें और मॉडल से सैंपलिंग एरर बताने को कहें, बजाय इसके कि फ़ाइल चुपचाप ट्रंकेट हो जाए, क्योंकि यही वह फ़ेलियर मोड है जो आपके डेटा के एक हिस्से पर भरोसेमंद जवाब देता है।
क्या AI मेरी स्प्रेडशीट की गलतियां पकड़ सकता है?
हां, और यह मौजूद सबसे हाई-लीवरेज प्रॉम्प्ट में से एक है। डेटा में क्या संदिग्ध है यह पूछना भरोसेमंद तरीके से डुप्लिकेट इंपोर्ट, वह दिन जब ट्रैकिंग टूटी, मिक्स्ड यूनिट या करेंसी, डेटा के अंदर छूटी सबटोटल रो, और बीच में बदलने वाले डिस्ट्रीब्यूशन को सामने लाता है। इसे संबंधित रो कोट करने को कहें ताकि आप भरोसा करने की बजाय हर खोज को खुद वेरिफ़ाई कर सकें।
क्या मैं इसके दिए नंबरों पर भरोसा कर सकता हूं?
स्ट्रक्चर पर भरोसा करें, गणित को वेरिफ़ाई करें। लैंग्वेज मॉडल यह पहचानने में मज़बूत होते हैं कि कौन सी गणना ज़रूरी है और डेटासेट में क्या है यह बताने में, और कई रो में लंबी अरिथमेटिक चेन में कमज़ोर, जहां वे चुपचाप एक अच्छी तरह फ़ॉर्मैट की गई गलत जवाब के साथ फेल होते हैं। सबसे छोटे ग्रुप को हाथ से स्पॉट चेक करें, मुख्य आंकड़ों को दूसरे मॉडल से क्रॉस-चेक करें, और जो भी बिल्कुल सटीक होना चाहिए उसके लिए Excel फ़ॉर्मूला या Python कोड मांगें और उसे खुद चलाएं।
स्प्रेडशीट के काम के लिए कौन सा मॉडल सबसे अच्छा है?
GPT स्ट्रक्चर्ड रीज़निंग, सख़्त आउटपुट फ़ॉर्मैट और साफ़ टेबल या JSON के लिए। Claude मल्टी-स्टेप एग्रीगेशन पर क्रॉस-चेक के लिए, क्योंकि यह एक जैसी गलतियां दोहराने की बजाय अलग तरह की गलतियां करता है। Gemini तब जब फ़ाइल बहुत बड़ी हो या आप एक ही बातचीत में स्प्रेडशीट के साथ PDF या रिपोर्ट भी एनालाइज़ करना चाहें।
क्या यह Excel फ़ॉर्मूला और कई शीट के साथ काम करता है?
यह आपकी वर्कबुक चलाता नहीं, सिर्फ़ वैल्यूज़ पढ़ता है, इसलिए फ़ॉर्मूला के नतीजे तो आ जाते हैं पर लाइव फ़ॉर्मूला लॉजिक नहीं। कई शीट वाली वर्कबुक के लिए बताएं कि आपका मतलब किस शीट से है और शीट आपस में कैसे जुड़ी हैं, या जिस शीट की परवाह है उसे CSV के रूप में एक्सपोर्ट करें। प्रेजेंटेशन के लिए बनी फ़ाइलें, जिनमें मर्ज्ड सेल और डेटा के अंदर सबटोटल हों, बड़ी फ़ाइलों से कहीं ज़्यादा दिक्कत देती हैं।