Whizi में PDF के साथ ऑनलाइन चैट कैसे करें

त्वरित उत्तर

PDF को मैसेज बॉक्स में खींचकर छोड़िए या पेपरक्लिप आइकन पर क्लिक करके अटैच कीजिए, फिर अपना सवाल आसान भाषा में पूछिए। आपके प्लान का कोई भी मॉडल इसे पढ़ सकता है, और आप उसी फाइल पर बिना दोबारा अपलोड किए मॉडल बदल सकते हैं। किसी जवाब पर भरोसा करने से पहले मॉडल से वह हिस्सा कोट करने को कहिए जिसका उसने इस्तेमाल किया।

छोटा जवाब

PDF को मैसेज बॉक्स में खींचिए या उसे अटैच करने के लिए पेपरक्लिप आइकन पर क्लिक कीजिए, फिर अपना सवाल आसान भाषा में पूछिए। आपके प्लान का कोई भी मॉडल इसे पढ़ सकता है, और आप उसी फाइल पर बिना दोबारा अपलोड किए मॉडल बदल सकते हैं।

किसी जवाब पर भरोसा करने से पहले एक काम कीजिए: मॉडल से वह हिस्सा कोट करने को कहिए जिसका उसने इस्तेमाल किया। ट्रेनिंग डेटा से निकला भरोसेमंद जवाब, न कि आपकी फाइल से, वह चूक है जो लोगों को पैसे की कीमत चुकाती है, और एक लोकेटिंग सवाल इसे लगभग दस सेकंड में पकड़ लेता है। इस पेज का बाकी हिस्सा यही अच्छी तरह करने के बारे में है।

पहले पक्का कीजिए कि यह आपका दस्तावेज पढ़ रहा है

दस्तावेज चैट में सबसे खतरनाक चूक गलत जवाब नहीं है, बल्कि आपकी फाइल के बजाय ट्रेनिंग डेटा से निकला भरोसेमंद जवाब है। यह उन दस्तावेजों के साथ सबसे ज्यादा होता है जो किसी आम चीज से मिलते जुलते हों: एक स्टैंडर्ड कमर्शियल लीज़, कोई जानी-मानी रेगुलेशन, कोई खूब चर्चित पेपर। मॉडल इस विधा को इतना अच्छी तरह जानता है कि बिना आपके असली टेक्स्ट को देखे भी एक विश्वसनीय जवाब बना दे, और आउटपुट में कुछ भी यह संकेत नहीं देता कि उसने ऐसा किया।

एक आदत इसे दूर कर देती है। अपना असली सवाल पूछने से पहले, एक लोकेटिंग सवाल पूछिए।

अटैच किए गए दस्तावेज में वह हिस्सा कोट कीजिए जो [विषय] पर बात करता है, और बताइए यह किस पेज या सेक्शन में है। अगर यह दस्तावेज में नहीं है, तो साफ बताइए।

अगर यह कोई असली कोट लौटाता है, तो यह आपकी फाइल पढ़ रहा है। अगर यह एक सामान्य पैराफ्रेज़ देता है या कोई ऐसी चीज नहीं ढूंढ पाता जो आपको पता है वहां है, तो एक्सट्रैक्शन फेल हो गया है और उसके बाद का हर जवाब संदिग्ध है। इसमें दस सेकंड लगते हैं और यही एक टूल और एक देनदारी के बीच का फर्क है।

इस आदत को असली सवालों में भी लाइए: जो सटीक टेक्स्ट आपके जवाब का समर्थन करता है उसे कोट कीजिए किसी भी ऐसे प्रॉम्प्ट में होना चाहिए जिसके जवाब पर भरोसा किया जाना है।

दस्तावेज के लिए मॉडल चुनना

दस्तावेजमॉडलक्यों
100+ पेज की रिपोर्ट, फाइलिंग, पूरे कॉन्ट्रैक्ट सेटGemini1,000,000 टोकन का कॉन्टेक्स्ट विंडो, इसलिए दस्तावेज टुकड़ों में बंटने के बजाय सचमुच पूरा मौजूद रहता है
कॉन्ट्रैक्ट, पॉलिसी, जहां भी बारीकी मायने रखती हैClaudeबारीकी में और यह बताने में सबसे बेहतर कि दस्तावेज क्या नहीं कहता
इनवॉइस, फॉर्म, छोटी संरचित फाइलेंGPTतेज़, और टेबल या JSON में सख्त एक्सट्रैक्शन में सबसे भरोसेमंद
आंकड़ों वाले पेपर, स्कैन किए पेज, डायग्रामकोई भी मल्टीमॉडल मॉडलजहां टेक्स्ट एक्सट्रैक्शन कमज़ोर पड़ता है वहां पेज को इमेज की तरह पढ़ता है

कॉन्टेक्स्ट विंडो वाली बात समझनी जरूरी है। जब कोई दस्तावेज मॉडल की क्षमता से बड़ा हो जाता है, तो उसे टुकड़ों में प्रोसेस करना पड़ता है, और जिन सवालों के लिए पूरे दस्तावेज की एक साथ जरूरत होती है (क्या यहां कुछ क्लॉज 14 का खंडन करता है, क्या यह शब्द कहीं परिभाषित है, इन तीन सेक्शन में से कौन सा असंगत है) वे अविश्वसनीय हो जाते हैं। यही खास वजह है कि लंबी फाइलों पर सामान्य पसंद के बजाय बड़े कॉन्टेक्स्ट वाले मॉडल की तरफ जाना चाहिए।

आप बिना दोबारा अपलोड किए मॉडल बदल सकते हैं, इसलिए एक मॉडल से पढ़िए और उसी फाइल पर दूसरे से एक्सट्रैक्ट कीजिए। बातचीत के बीच मॉडल बदलना देखिए।

दस्तावेज के प्रकार के हिसाब से प्रॉम्प्ट

कॉन्ट्रैक्ट और एग्रीमेंट

अटैच किए गए एग्रीमेंट से एक टेबल में निकालिए: अवधि और नवीनीकरण, समाप्ति की नोटिस अवधि, भुगतान शर्तें, देनदारी की सीमा, क्षतिपूर्ति, गवर्निंग लॉ, असाइनमेंट, और कोई भी क्लॉज जो समाप्ति के बाद भी लागू रहता है। हर एक के लिए, क्लॉज नंबर दीजिए और मुख्य वाक्य कोट कीजिए। फिर अलग से उन जिम्मेदारियों की सूची दीजिए जो उनके बजाय हम पर आती हैं।

उस सवाल से आगे बढ़िए जो असल में मायने रखता है: इस तरह के कॉन्ट्रैक्ट की स्टैंडर्ड शर्तों की तुलना में इस एग्रीमेंट में क्या असामान्य है, और स्पष्ट रूप से क्या गायब है? जोखिम आमतौर पर वहीं होता है जो गायब है, और यह ऐसी चीज है जिसे कीवर्ड सर्च कभी नहीं ढूंढ सकता।

रिसर्च पेपर

अटैच किए गए पेपर के लिए बताइए: रिसर्च सवाल, स्टडी डिज़ाइन, सैंपल और आबादी, मुख्य परिणाम, इसके इफेक्ट साइज़ के साथ हेडलाइन नतीजा, बताई गई सीमाएं, और फंडिंग का स्रोत। फिर मुझे इस पेपर के उन तीन दावों के बारे में बताइए जिन्हें उद्धृत करने से पहले स्वतंत्र रूप से जांचने की जरूरत होगी।

लंबी रिपोर्ट और फाइलिंग

अटैच की गई रिपोर्ट को दस्तावेज के क्रम के बजाय महत्व के क्रम में 10 बुलेट में संक्षेप कीजिए। फिर सूची दीजिए: वे तीन आंकड़े जिनकी किसी निर्णय लेने वाले को उनके पेज संदर्भ के साथ परवाह होगी, कोई भी बात जो रिपोर्ट स्रोत बताए बिना तथ्य के रूप में पेश करती है, और कोई भी जगह जहां सारांश या कार्यकारी सेक्शन दस्तावेज में बाद के विवरण से असहमत हो।

यह आखिरी जांच अक्सर हैरानी से असली समस्याएं ढूंढ लेती है। कार्यकारी सारांश जल्दी लिखे जाते हैं और उन सेक्शन से कम संपादित होते हैं जिनका वे सारांश देते हैं।

दो दस्तावेजों की तुलना

contract-a.pdf और contract-b.pdf की तुलना क्लॉज दर क्लॉज कीजिए। हर सारगर्भित अंतर की एक टेबल दीजिए: विषय, A क्या कहता है, B क्या कहता है, और कौन सा हमारे पक्ष में है। फॉर्मेटिंग और नंबरिंग के अंतर को नजरअंदाज कीजिए। अलग से सूची दीजिए कि किसी एक में क्या है और दूसरे में गायब है।

इसे इस्तेमाल लायक चीज में बदलना

निष्कर्षों को कार्यकारी दर्शकों के लिए 150 शब्दों में फिर से लिखिए। जरूरी फैसले से शुरुआत कीजिए। ऐसी कोई शब्दावली न रखिए जो परिभाषित न हो। इसे प्रसारित करने से पहले जो कुछ भी मुझे जांचना चाहिए उसे फ्लैग कीजिए।

ट्रबलशूटिंग

"मुझे कोई दस्तावेज नहीं दिख रहा।" पक्का कीजिए कि फाइल का अपलोड पूरा हो गया है, फिर अपने मैसेज में उसे नाम से साफ तौर पर संदर्भित कीजिए। बहुत लंबी थ्रेड में, दोबारा अटैच करना या सिर्फ फाइल के साथ नई चैट शुरू करना, इस बारे में बहस करने से तेज़ है।

स्कैन की गई PDF, टूटा-फूटा या गायब टेक्स्ट। दस्तावेज एक इमेज है, इसलिए सादे टेक्स्ट एक्सट्रैक्शन के पास पढ़ने को कम मिलता है। Whizi यह पहचानता है कि किसी PDF के पेज कितना कम टेक्स्ट देते हैं, और इसे एक बार सर्वर-साइड विज़न पास से गुजारता है जो हर पेज की ट्रांसक्रिप्ट लौटाता है। कम रिज़ॉल्यूशन, असामान्य फॉन्ट, हस्तलेख और घनी टेबल के साथ सटीकता घट जाती है। चूंकि एक गलत पढ़ा गया अंक एक धाराप्रवाह जवाब में अदृश्य रहता है, स्कैन किए गए दस्तावेज से लिया गया हर आंकड़ा मूल पेज से मिलाकर जांचिए।

टेबल गलत निकलते हैं। PDF की टेबल नीचे से बहुत खराब तरीके से संरचित होती हैं। पहले टेबल को ज्यों का त्यों दोबारा बनाने को कहिए, इसे पेज से मिलाइए, और तभी विश्लेषण मांगिए। भारी टेबल वाले काम के लिए, पेज को इमेज की तरह पढ़ने वाला मल्टीमॉडल मॉडल अक्सर टेक्स्ट एक्सट्रैक्शन से ज्यादा भरोसेमंद होता है।

इसने कुछ ऐसा छोड़ दिया जो आपको पता है वहां है। लोकेटिंग सवाल पूछिए। अगर मॉडल वह हिस्सा कोट नहीं कर पाता जो आप देख सकते हैं, तो समस्या तर्क की नहीं, एक्सट्रैक्शन की है। कोई दूसरा मॉडल आज़माइए, या सिर्फ जरूरी पेज अपलोड कीजिए।

फाइल बहुत बड़ी है। बड़े कॉन्टेक्स्ट वाला मॉडल इस्तेमाल कीजिए, या पेज संख्या के बजाय मकसद के हिसाब से बांटिए। जिन तीन सेक्शन की आपको असल में जरूरत है उन्हें अपलोड करना 400 पेज अपलोड करके उम्मीद लगाने से बेहतर है।

बातचीत आगे बढ़ने के साथ जवाब धुंधले होते जाते हैं। लंबी थ्रेड ऐसा कॉन्टेक्स्ट जमा कर लेती हैं जो दस्तावेज से होड़ करता है। फाइल और अपनी जरूरत के संक्षिप्त बयान के साथ नई चैट शुरू कीजिए।

भरोसा करने से पहले जांच लीजिए

तीन जांच, महत्व के क्रम में।

किसी भी परिणामकारी बात पर कोट मांगिए। एक कोट किया गया हिस्सा सेकंडों में जांचा जा सकता है; एक पैराफ्रेज़ नहीं। यह अकेली आदत दस्तावेज संबंधी काम में ज्यादातर जोखिम खत्म कर देती है।

दूसरे मॉडल से क्रॉस-चेक कीजिए। उसी फाइल पर वही सवाल किसी दूसरे मॉडल से पूछिए। सहमति सार्थक सबूत है; असहमति आपको बताती है कि ठीक कहां देखना है। Whizi की साइड बाय साइड तुलना इसी के लिए है।

पूछिए कि यह किस बारे में अनिश्चित है। ऊपर दिए आपके जवाबों में से किस पर आपको सबसे कम भरोसा है, और दस्तावेज में क्या अस्पष्ट है? मॉडल आत्म-मूल्यांकन में अपूर्ण होते हैं, लेकिन वे जो अस्पष्टताएं सामने लाते हैं वे आमतौर पर स्रोत में सच में मौजूद अस्पष्टताएं होती हैं, जो खुद दस्तावेज के बारे में उपयोगी जानकारी है।

और किसी भी ऐसी चीज के लिए स्थायी नियम जिसके नतीजे हों, यानी कानूनी, वित्तीय, चिकित्सीय या अनुपालन सामग्री: मॉडल हिस्सा ढूंढता है, फैसला आप लेते हैं। यह एक रीडिंग असिस्टेंट है, सलाहकार नहीं, और इसके आउटपुट पर लिए गए फैसले की जिम्मेदारी पूरी तरह आपकी है।

चेकलिस्ट
  • यह पक्का करने के लिए पहले एक लोकेटिंग सवाल पूछिए कि मॉडल आपकी फाइल पढ़ रहा है
  • हर परिणामकारी जवाब के लिए सटीक कोट मांगिए
  • लंबे दस्तावेजों के लिए बड़े कॉन्टेक्स्ट वाला मॉडल इस्तेमाल कीजिए ताकि कुछ भी टुकड़ों में न कटे
  • दस्तावेज जो कहता है उसके साथ-साथ यह भी पूछिए कि स्पष्ट रूप से क्या गायब है
  • स्कैन किए दस्तावेजों से लिए आंकड़ों को मूल पेज से मिलाकर जांचिए
  • टेबल को ज्यों का त्यों दोबारा बनाइए और विश्लेषण से पहले उन्हें जांचिए
  • किसी भी जरूरी चीज को दूसरे मॉडल से क्रॉस-चेक कीजिए

अक्सर पूछे जाने वाले सवाल

PDF का अधिकतम आकार कितना है?

हर अपलोड की गई फाइल 10 MB तक सीमित है, और एक मैसेज में 6 फाइलों तक की गुंजाइश है। इसके भीतर, असली सीमा फाइल की सीमा से ज्यादा मॉडल का कॉन्टेक्स्ट विंडो है। Whizi में Gemini 1,000,000 टोकन का कॉन्टेक्स्ट विंडो रखता है, इसलिए लंबी रिपोर्ट, फाइलिंग और कई कॉन्ट्रैक्ट सेट के लिए इसकी सिफारिश की जाती है। उससे ज्यादा होने पर, पूरा दस्तावेज न अपलोड कीजिए, बल्कि जो सेक्शन आपको असल में चाहिए वो अपलोड कीजिए, क्योंकि लक्षित कॉन्टेक्स्ट भी आमतौर पर ज्यादा तेज़ जवाब देता है।

क्या Whizi मेरी PDF को स्टोर करता है?

अपलोड की गई फाइलें आपके खाते में स्टोर होती हैं, 30 दिनों तक में समाप्त होने के लिए कॉन्फ़िगर की जाती हैं, और कभी भी पहले डिलीट की जा सकती हैं। Whizi आपके प्रॉम्प्ट, फाइलों, बातचीत, वॉइस ट्रांसक्रिप्ट या जनरेट की गई सामग्री का इस्तेमाल Whizi के अपने AI मॉडल को ट्रेन करने के लिए नहीं करता, और उस सामग्री को ट्रेनिंग डेटा के रूप में नहीं बेचता। किसी फाइल को डिलीट करने से बातचीत में उसके बारे में जो पहले चर्चा हुई थी वह नहीं हटती, इसलिए अगर दस्तावेज इतना संवेदनशील है कि डिलीट करने लायक हो, तो चैट भी डिलीट कीजिए।

क्या मैं एक साथ कई PDF से चैट कर सकता हूं?

हां, और दस्तावेजों के बीच तुलना ही वह जगह है जहां यह सबसे ज्यादा काम आता है। एक ही थ्रेड में कई फाइलें अपलोड कीजिए और अपने प्रॉम्प्ट में उन्हें नाम से संदर्भित कीजिए, वरना मॉडल बिना बताए खुद तय कर लेता है कि किससे जवाब देना है। क्लॉज दर क्लॉज कॉन्ट्रैक्ट तुलना, कई रिपोर्ट में निष्कर्षों को मिलाना, और दस्तावेजों के बीच विरोधाभास ढूंढना, इन सबके लिए सब कुछ एक साथ मौजूद होना जरूरी है, जो बड़े कॉन्टेक्स्ट वाला मॉडल इस्तेमाल करने की एक और वजह है।

क्या यह स्कैन की गई PDF के साथ काम करता है?

हां। Whizi यह पहचानता है कि किसी स्कैन की गई या इमेज-भारी PDF के पेज कितना कम टेक्स्ट देते हैं, और इसे सर्वर-साइड विज़न पास के जरिए पेज दर पेज ट्रांसक्राइब करता है। साफ स्कैन पर सटीकता अच्छी होती है और कम रिज़ॉल्यूशन, असामान्य फॉन्ट, हस्तलेख और घनी टेबल के साथ घट जाती है। चूंकि एक गलत पढ़ा गया अक्षर एक बाकी सब जगह धाराप्रवाह दिखने वाले जवाब के अंदर गलत नंबर बना देता है, स्कैन किए गए दस्तावेज से लिया गया कोई भी आंकड़ा मूल पेज से मिलाकर जांचिए।

मुझे कैसे पता चले कि जवाब असल में मेरे दस्तावेज से आया है?

कोट मांगिए। मॉडल से कहिए कि वह अपने जवाब का समर्थन करने वाला सटीक हिस्सा पेज या सेक्शन के साथ कोट करे, और साफ तौर पर बताए अगर जानकारी दस्तावेज में नहीं है। आपकी फाइल के बजाय ट्रेनिंग डेटा से निकले जवाब दस्तावेज चैट में सबसे खतरनाक चूक हैं, ठीक इसलिए क्योंकि वे आम तरह के दस्तावेजों के लिए विश्वसनीय लगते हैं, और एक जांचने लायक कोट मांगना ही फर्क बताने का इकलौता भरोसेमंद तरीका है।