پروفایل کردن داده پیش از هر پرسشی
رایجترین دلیلی که تحلیل صفحات گسترده به مشکل میخورد، هیچ ربطی به هوش مصنوعی ندارد. مشکل این است که فایل شامل 14 ردیف با فاصلهٔ اضافی در نام منطقه، دو قالب تاریخ متفاوت، یک ردیف جمعجزء که کسی وسط جدول جا گذاشته و 300 خانهٔ خالی در ستونی است که قرار است میانگین بگیرید. اگر ابتدا پرسش خود را مطرح کنید، پاسخی مطمئن اما محاسبهشده روی دادههای خراب دریافت خواهید کرد.
پس اولین پرامپت در همهٔ فایلها یکسان است.
پرامپت: پروفایل
پیش از هر تحلیلی، این فایل را پروفایل کن. برگردان: تعداد ردیفها، نام ستونها همراه با نوع استنباطشده، تعداد و درصد مقادیر خالی در هر ستون، تعداد ردیفهای کاملاً تکراری، مقادیر منحصربهفرد برای هر ستونی که کمتر از 25 مقدار متفاوت دارد، کمینه و بیشینهٔ هر ستون عددی و تاریخی، و هر ستونی که مقادیرش ناسازگار به نظر میرسد (قالبهای متفاوت، فاصلهٔ اضافی، واحدهای متفاوت، قالبهای تاریخ متفاوت). هنوز تحلیل یا تفسیر نکن. فقط بگو در فایل چه چیزی هست و چه چیزی اشتباه به نظر میرسد.
همین یک پرامپت بیشتر مشکلاتی را که میتوانستند تحلیل را خراب کنند، شناسایی میکند. فهرست مقادیر منحصربهفرد بهویژه جایی است که متوجه میشوید «UK»، «U.K.» و «United Kingdom» سه منطقهٔ جداگانه در دادههای شما هستند.
پرامپت: رفع مشکلات یافتشده
مشکلاتی را که شناسایی کردی استاندارد کن: فاصلههای اضافی را حذف کن، [ستون] را به یک قالب یکسان تبدیل کن و این نسخههای متفاوت را یکی کن: [فهرست آنها]. پیش از اعمال، نگاشتی را که به کار بردهای بهصورت جدول نشانم بده. هیچ ردیفی را بدون گفتن اینکه کدام است و چرا، حذف نکن.
پرسشهایی بپرسید که پاسخهای قابلبررسی تولید کنند
پرسشهای مبهم پاسخهای مبهم میگیرند. پرامپتهایی که جواب میدهند نام ستون، عملیات و قالب خروجی را مشخص میکنند و روش انجام کار را نیز میخواهند.
پرامپت: تجمیع همراه با نمایش روش کار
بر اساس [ستون] گروهبندی کن و [معیار] را محاسبه کن. یک جدول مارکداون با گروه، تعداد ردیفهای آن و معیار برگردان. زیر جدول، دقیقاً بگو معیار را چگونه محاسبه کردی، کدام ردیفها را چرا حذف کردی و با خانههای خالی چه کردی. بر اساس [ستون] بهصورت نزولی مرتب کن.
پرامپت: پرسش کوهورت
برای هر [بُعد کوهورت، مثلاً ماه ثبتنام]، [معیار] را در [بازه] محاسبه کن. اندازهٔ کوهورت را کنار هر عدد نشان بده. هر کوهورتی را که کمتر از [n] ردیف دارد بهجای گزارش درصد، بهعنوان «کوچکتر از آن است که قابل تفسیر باشد» علامت بزن.
این دستور آخر از گمراهکنندهترین خروجی ممکن در تحلیل صفحات گسترده جلوگیری میکند: کوهورتی با چهار کاربر که بهصورت «نگهداشت 75%» گزارش شده و کنار کوهورتی با نههزار کاربر در یک جدول نشسته است.
پرامپت: شکار ناهنجاری
چه چیزی در این داده مشکوک است؟ دنبال این موارد بگرد: مقادیر خارج از بازهٔ محتمل، ناپیوستگیهای ناگهانی در یک سری زمانی، ستونهایی که توزیعشان در میانهٔ راه تغییر میکند، ردیفهایی که کاملاً یا تقریباً تکراریاند، مقادیری که بیش از حد گرد به نظر میرسند، و هر چیزی که نشاندهندهٔ تغییر در نحوهٔ جمعآوری داده باشد. برای هر مورد، ردیفهای دقیق را نقلقول کن.
این باارزشترین پرامپت این صفحه است و در گردش کار معمول صفحات گسترده معادلی ندارد. این پرامپت بهطور مرتب روزی را که ردیابی خراب شده، فروشندهای که با ارز دیگری گزارش میداده و ایمپورت تکراریای که آمار یک فصل را متورم کرده، پیدا میکند.
پرامپت: مشخصات نمودار
نمودار مناسب برای این پرسش و شکل این داده را پیشنهاد بده و توضیح بده چرا گزینهٔ بدیهی جایگزین در اینجا بدتر است. سپس مشخصات را بده: نوع نمودار، محور x، محور y، سریها، نحوهٔ تجمیع، ترتیب مرتبسازی و نحوهٔ برخورد با محورها. از محور دوگانه استفاده نکن. محور نمودار میلهای را کوتاه نکن.
جایی که محاسبات واقعاً اشتباه میشوند
این موضوع سزاوار پاسخی روشن است، چون این جمله که «هوش مصنوعی در ریاضی ضعیف است» هم درست است و هم بهشکلی بیفایده مبهم.
مدل زبانی که روی اعداد درون متن استدلال میکند، در حال تکمیل الگو است، نه محاسبه. این مدل در توصیف ساختار، دستهبندی ردیفها و تشخیص اینکه چه محاسبهای لازم است، قابل اعتماد است. اما در انجام یک زنجیرهٔ طولانی از محاسبات روی صدها ردیف، بسیار کمتر قابل اعتماد است و بهآرامی و بدون هشدار شکست میخورد: خروجی، جدولی قالببندیشده و زیبا از اعداد اشتباه است، بدون هیچ نشانهای از مشکل.
قواعد عملی:
- درخواست روش را بده، نه فقط نتیجه را. «دقیقاً بگو این را چگونه محاسبه کردی و چه چیزی را حذف کردی» باعث میشود اشتباه، در صورت وجود، دیده شود.
- یک گروه را با دست بررسی کن. کوچکترین گروه را در جدول خروجی انتخاب کن و آن را در خود صفحه گسترده تأیید کن. اگر مطابقت داشت، روش احتمالاً درست است؛ اگر نداشت، به هیچچیز در جدول نمیتوان اعتماد کرد.
- هر چیز مهمی را با یک مدل دوم مقایسه متقابل کن. رسیدن دو مدل مستقل به یک عدد یکسان، شواهدی بهمراتب بهتر از تکرار یک مدل از خودش است. نمای کنار هم Whizi دقیقاً برای همین ساخته شده است.
- مراقب شمارش دوگانه باش. ردیفهای جمعجزء که در فایل جا ماندهاند و پیوندهای یکبهچند دو مقصر معمول هستند و مدل نمیداند که اشتباهاند.
- برای هر چیزی که باید دقیقاً درست باشد، فرمول یا کد را بخواه.
فرمول اکسل را به من بدهیاکد pandas را به من بدهمحاسبات را در یک موتور قطعی قرار میدهد و مدل را برای بخشی نگه میداری که در آن خوب است: دانستن اینکه چه محاسبهای باید اجرا شود.
آن مورد آخر پاسخ واقعی برای کارهای مالی یا گزارشدهی است. از مدل برای طراحی تحلیل استفاده کن و از صفحهگسترده یا اسکریپت خودت برای اجرای آن.
کدام مدل کدام فایل را میخواند و چه اندازهای خیلی بزرگ است؟
هر دو فرمت CSV و اکسل مستقیماً قابل بارگذاریاند و این سه مدل کار را بهروشنی بین خود تقسیم میکنند.
| مدل | پنجرهٔ زمینه | اعتبار به ازای هر پیام | مناسب برای |
|---|---|---|---|
| GPT-5.6 Terra | 1M توکن | 4 | قالبهای دقیق: جدولهای تمیز، JSON، نگاشتهای دقیق ستون |
| Claude Sonnet 5 | 1M توکن | 10 | مرحلهٔ مقایسهٔ متقابل در تجمیع چندمرحلهای |
| Gemini 3.5 Flash | 1M توکن، حدود 1,900 صفحهٔ نسخهٔ خطی | 8 | بزرگترین فایلها، یا یک صفحه گسترده بههمراه یک PDF در یک گفتگو |
ارقام زمینه و اعتبار از شاخص هزینهٔ مدل Whizi گرفته شدهاند، نرخهای فهرست در تاریخ 2026-08-20 دریافت شدهاند.
چند نکتهٔ عملی:
- یک مستطیل تمیز بده. یک ردیف عنوان، بدون سلولهای ادغامشده، بدون ردیفهای خالی فاصلهگذار، بدون یادداشت در ستون K. گزارشهای با قالب چندعنوانی بیش از هر محدودیت اندازهٔ فایلی، استخراج را گیج میکنند.
- برگهٔ خام را بفرست، نه برگهٔ ارائه را. نسخهای که قالببندی و جمعجزءها را دارد، همان نسخهای است که شمارش دوگانه ایجاد میکند.
- فایلهای خیلی پهن از فهرست ستونها اول سود میبرند. اگر نام ستونها گنگ است، پیش از تحلیل بپرس معنی هر ستون چیست و به مدل بگو کجا اشتباه کرده.
- برای فایلهای خیلی بزرگ از Gemini 3.5 Flash استفاده کن، که همان پنجرهٔ زمینهٔ 1M توکنی Claude Sonnet 5 و GPT-5.6 Terra را با کمترین هزینه به ازای هر پاسخ در میان این سه میخواند. فراتر از آن، عمداً نمونهگیری کن:
یک نمونهٔ تصادفی 5000 ردیفی را تحلیل کن و بگو چه خطای نمونهگیریای را باید برای هر عدد انتظار داشته باشمبهتر از کوتاهشدن خاموش فایل است. - ابتدا دادههای شخصی را حذف کن. نامها، ایمیلها و شناسهها تقریباً هیچوقت برای تحلیل لازم نیستند و حذف آنها سریعتر از بحث دربارهٔ این است که آیا اجازهٔ بارگذاری آنها را داشتهاید یا نه.
جزئیات فنی بارگذاری در بارگذاری اسناد توضیح داده شده است.
دنبالهٔ کامل هشتمرحلهای روی یک فایل واقعی
کل گردش کار روی یک فایل واقعی، به ترتیب:
- بارگذاری کن. پرامپت پروفایل را اجرا کن. مقادیر منحصربهفرد و شمار خانههای خالی را با دقت بخوان.
- مشکلات یافتشده را رفع کن، پیش از اعمال، جدول نگاشت را بررسی کن.
- خلاصهای از موضوع داده و سه پرسشی که فکر میکند باید بپرسی بخواه. این مرحله سریع است و اغلب چارچوب تحلیل را عوض میکند.
- پرسش واقعی خودت را بپرس، با الزام روش و مواردِ حذفشده در پاسخ.
- همیشه پرامپت ناهنجاری را اجرا کن. اینجاست که غافلگیریها پیدا میشوند.
- کوچکترین گروه را با دست بررسی کن.
- عدد اصلی را با یک مدل دوم مقایسه متقابل کن.
- مشخصات نمودار را بخواه، یا اگر عدد باید دقیق و بازتولیدپذیر باشد، فرمول را بخواه.
مراحل 1، 5 و 6 همان مراحلی هستند که مردم نادیده میگیرند و همانهایی هستند که تحلیل قابل دفاع را از یک حدس زیبا قالببندیشده جدا میکنند.
- فایل را پیش از پرسیدن حتی یک پرسش تحلیلی پروفایل کن
- فهرست مقادیر منحصربهفرد را بخوان تا املاهای متفاوت و قالبهای مخلوط را بیابی
- روش و موارد حذفشده را در کنار هر عدد بخواه
- گروههای کوچک را بهجای گزارش درصد، بهعنوان بیشازحد کوچک علامت بزن
- همیشه پرامپت «چه چیزی در این داده مشکوک است» را اجرا کن
- پیش از اعتماد به جدول، کوچکترین گروه را با دست بررسی کن
- ارقام مهم را با یک مدل دوم مقایسه متقابل کن
- وقتی عدد باید دقیقاً درست باشد، فرمول یا کد را بخواه
پرسشهای متداول
صفحه گستردهام چقدر میتواند بزرگ باشد؟
این به پلن و مدل بستگی دارد، و محدودیت عملی، پنجرهٔ زمینهٔ مدل است، نه سقف اندازهٔ فایل. Claude Sonnet 5، GPT-5.6 Terra و Gemini 3.5 Flash همگی در Whizi یک پنجرهٔ زمینهٔ 1M توکنی را میخوانند، تقریباً معادل 1,900 صفحهٔ نسخهٔ خطی داده. فراتر از آن، عمداً نمونهگیری کن و از مدل بخواه خطای نمونهگیری را بیان کند، بهجای اینکه اجازه دهی فایل بیسروصدا کوتاه شود، که همان حالت خرابی است که پاسخهای مطمئن دربارهٔ بخشی از دادهات تولید میکند.
آیا هوش مصنوعی میتواند خطاهای صفحه گستردهام را پیدا کند؟
بله، و این یکی از پربازدهترین پرامپتهای موجود است. پرسیدن اینکه چه چیزی در داده مشکوک است بهطور قابل اعتماد ایمپورتهای تکراری، روزی که ردیابی خراب شده، واحدها یا ارزهای مخلوط، ردیفهای جمعجزء جامانده در داده و توزیعهایی که در میانهٔ فایل تغییر میکنند را آشکار میکند. از مدل بخواه ردیفهای دقیق را نقلقول کند تا بتوانی هر یافته را تأیید کنی، بهجای اینکه فهرست را کورکورانه باور کنی.
آیا میتوانم به اعدادی که میدهد اعتماد کنم؟
به ساختار اعتماد کن، محاسبات را تأیید کن. مدلهای زبانی در تشخیص اینکه چه محاسبهای لازم است و توصیف محتوای یک مجموعهداده قوی هستند و در زنجیرههای طولانی محاسبات روی ردیفهای زیاد ضعیفتر، جایی که بیسروصدا با یک پاسخ اشتباه اما زیبا شکست میخورند. کوچکترین گروه را با دست بررسی کن، ارقام اصلی را با یک مدل دوم مقایسه متقابل کن و برای هرچیزی که باید دقیقاً درست باشد، فرمول اکسل یا کد پایتون را بخواه و خودت اجرایش کن.
کدام مدل برای کار با صفحات گسترده بهترین است؟
GPT برای استدلال ساختاریافته، قالبهای خروجی دقیق و جدولها یا JSON تمیز. Claude بهعنوان مقایسهٔ متقابل در تجمیع چندمرحلهای، چون معمولاً اشتباهات متفاوتی میکند نه همان اشتباهات. Gemini وقتی فایل خیلی بزرگ است یا میخواهی یک صفحه گسترده را در کنار یک PDF یا گزارش در همان گفتگو تحلیل کنی.
آیا با فرمولهای اکسل و چند برگه کار میکند؟
این ابزار مقادیر را میخواند نه اینکه کاربرگ تو را اجرا کند، بنابراین نتایج فرمول منتقل میشوند اما منطق زندهٔ فرمول منتقل نمیشود. برای کاربرگهای چندبرگهای، بگو منظورت کدام برگه است و رابطهٔ برگهها را توضیح بده، یا برگهٔ موردنظرت را بهصورت CSV خروجی بگیر. فایلهای ساختهشده برای ارائه، با سلولهای ادغامشده و جمعجزءهای داخل داده، مشکلات بسیار بیشتری نسبت به فایلهای بزرگ ایجاد میکنند.