چگونه صفحات گسترده را با هوش مصنوعی در Whizi تحلیل کنیم

پاسخ سریع

برای تحلیل یک صفحه گسترده با هوش مصنوعی، فایل CSV یا اکسل را بارگذاری کنید و پیش از هر پرسشی، آن را پروفایل کنید: تعداد ردیف‌ها، مقادیر خالی، رکوردهای تکراری و مقادیر منحصربه‌فرد هر ستون. سپس پرسش واقعی خود را مطرح کنید و در کنار هر عدد، روش محاسبه را نیز بخواهید. تحلیل را در GPT اجرا کنید، سپس با بررسی دستی یک گروه و مقایسه متقابل با Claude آن را تأیید کنید.

پروفایل کردن داده پیش از هر پرسشی

رایج‌ترین دلیلی که تحلیل صفحات گسترده به مشکل می‌خورد، هیچ ربطی به هوش مصنوعی ندارد. مشکل این است که فایل شامل 14 ردیف با فاصلهٔ اضافی در نام منطقه، دو قالب تاریخ متفاوت، یک ردیف جمع‌جزء که کسی وسط جدول جا گذاشته و 300 خانهٔ خالی در ستونی است که قرار است میانگین بگیرید. اگر ابتدا پرسش خود را مطرح کنید، پاسخی مطمئن اما محاسبه‌شده روی داده‌های خراب دریافت خواهید کرد.

پس اولین پرامپت در همهٔ فایل‌ها یکسان است.

پرامپت: پروفایل

پیش از هر تحلیلی، این فایل را پروفایل کن. برگردان: تعداد ردیف‌ها، نام ستون‌ها همراه با نوع استنباط‌شده، تعداد و درصد مقادیر خالی در هر ستون، تعداد ردیف‌های کاملاً تکراری، مقادیر منحصربه‌فرد برای هر ستونی که کمتر از 25 مقدار متفاوت دارد، کمینه و بیشینهٔ هر ستون عددی و تاریخی، و هر ستونی که مقادیرش ناسازگار به نظر می‌رسد (قالب‌های متفاوت، فاصلهٔ اضافی، واحدهای متفاوت، قالب‌های تاریخ متفاوت). هنوز تحلیل یا تفسیر نکن. فقط بگو در فایل چه چیزی هست و چه چیزی اشتباه به نظر می‌رسد.

همین یک پرامپت بیشتر مشکلاتی را که می‌توانستند تحلیل را خراب کنند، شناسایی می‌کند. فهرست مقادیر منحصربه‌فرد به‌ویژه جایی است که متوجه می‌شوید «UK»، «U.K.» و «United Kingdom» سه منطقهٔ جداگانه در داده‌های شما هستند.

پرامپت: رفع مشکلات یافت‌شده

مشکلاتی را که شناسایی کردی استاندارد کن: فاصله‌های اضافی را حذف کن، [ستون] را به یک قالب یکسان تبدیل کن و این نسخه‌های متفاوت را یکی کن: [فهرست آن‌ها]. پیش از اعمال، نگاشتی را که به کار برده‌ای به‌صورت جدول نشانم بده. هیچ ردیفی را بدون گفتن اینکه کدام است و چرا، حذف نکن.

پرسش‌هایی بپرسید که پاسخ‌های قابل‌بررسی تولید کنند

پرسش‌های مبهم پاسخ‌های مبهم می‌گیرند. پرامپت‌هایی که جواب می‌دهند نام ستون، عملیات و قالب خروجی را مشخص می‌کنند و روش انجام کار را نیز می‌خواهند.

پرامپت: تجمیع همراه با نمایش روش کار

بر اساس [ستون] گروه‌بندی کن و [معیار] را محاسبه کن. یک جدول مارک‌داون با گروه، تعداد ردیف‌های آن و معیار برگردان. زیر جدول، دقیقاً بگو معیار را چگونه محاسبه کردی، کدام ردیف‌ها را چرا حذف کردی و با خانه‌های خالی چه کردی. بر اساس [ستون] به‌صورت نزولی مرتب کن.

پرامپت: پرسش کوهورت

برای هر [بُعد کوهورت، مثلاً ماه ثبت‌نام]، [معیار] را در [بازه] محاسبه کن. اندازهٔ کوهورت را کنار هر عدد نشان بده. هر کوهورتی را که کمتر از [n] ردیف دارد به‌جای گزارش درصد، به‌عنوان «کوچک‌تر از آن است که قابل تفسیر باشد» علامت بزن.

این دستور آخر از گمراه‌کننده‌ترین خروجی ممکن در تحلیل صفحات گسترده جلوگیری می‌کند: کوهورتی با چهار کاربر که به‌صورت «نگه‌داشت 75%» گزارش شده و کنار کوهورتی با نه‌هزار کاربر در یک جدول نشسته است.

پرامپت: شکار ناهنجاری

چه چیزی در این داده مشکوک است؟ دنبال این موارد بگرد: مقادیر خارج از بازهٔ محتمل، ناپیوستگی‌های ناگهانی در یک سری زمانی، ستون‌هایی که توزیعشان در میانهٔ راه تغییر می‌کند، ردیف‌هایی که کاملاً یا تقریباً تکراری‌اند، مقادیری که بیش از حد گرد به نظر می‌رسند، و هر چیزی که نشان‌دهندهٔ تغییر در نحوهٔ جمع‌آوری داده باشد. برای هر مورد، ردیف‌های دقیق را نقل‌قول کن.

این باارزش‌ترین پرامپت این صفحه است و در گردش کار معمول صفحات گسترده معادلی ندارد. این پرامپت به‌طور مرتب روزی را که ردیابی خراب شده، فروشنده‌ای که با ارز دیگری گزارش می‌داده و ایمپورت تکراری‌ای که آمار یک فصل را متورم کرده، پیدا می‌کند.

پرامپت: مشخصات نمودار

نمودار مناسب برای این پرسش و شکل این داده را پیشنهاد بده و توضیح بده چرا گزینهٔ بدیهی جایگزین در اینجا بدتر است. سپس مشخصات را بده: نوع نمودار، محور x، محور y، سری‌ها، نحوهٔ تجمیع، ترتیب مرتب‌سازی و نحوهٔ برخورد با محورها. از محور دوگانه استفاده نکن. محور نمودار میله‌ای را کوتاه نکن.

جایی که محاسبات واقعاً اشتباه می‌شوند

این موضوع سزاوار پاسخی روشن است، چون این جمله که «هوش مصنوعی در ریاضی ضعیف است» هم درست است و هم به‌شکلی بی‌فایده مبهم.

مدل زبانی که روی اعداد درون متن استدلال می‌کند، در حال تکمیل الگو است، نه محاسبه. این مدل در توصیف ساختار، دسته‌بندی ردیف‌ها و تشخیص اینکه چه محاسبه‌ای لازم است، قابل اعتماد است. اما در انجام یک زنجیرهٔ طولانی از محاسبات روی صدها ردیف، بسیار کمتر قابل اعتماد است و به‌آرامی و بدون هشدار شکست می‌خورد: خروجی، جدولی قالب‌بندی‌شده و زیبا از اعداد اشتباه است، بدون هیچ نشانه‌ای از مشکل.

قواعد عملی:

  • درخواست روش را بده، نه فقط نتیجه را. «دقیقاً بگو این را چگونه محاسبه کردی و چه چیزی را حذف کردی» باعث می‌شود اشتباه، در صورت وجود، دیده شود.
  • یک گروه را با دست بررسی کن. کوچک‌ترین گروه را در جدول خروجی انتخاب کن و آن را در خود صفحه گسترده تأیید کن. اگر مطابقت داشت، روش احتمالاً درست است؛ اگر نداشت، به هیچ‌چیز در جدول نمی‌توان اعتماد کرد.
  • هر چیز مهمی را با یک مدل دوم مقایسه متقابل کن. رسیدن دو مدل مستقل به یک عدد یکسان، شواهدی به‌مراتب بهتر از تکرار یک مدل از خودش است. نمای کنار هم Whizi دقیقاً برای همین ساخته شده است.
  • مراقب شمارش دوگانه باش. ردیف‌های جمع‌جزء که در فایل جا مانده‌اند و پیوندهای یک‌به‌چند دو مقصر معمول هستند و مدل نمی‌داند که اشتباه‌اند.
  • برای هر چیزی که باید دقیقاً درست باشد، فرمول یا کد را بخواه. فرمول اکسل را به من بده یا کد pandas را به من بده محاسبات را در یک موتور قطعی قرار می‌دهد و مدل را برای بخشی نگه می‌داری که در آن خوب است: دانستن اینکه چه محاسبه‌ای باید اجرا شود.

آن مورد آخر پاسخ واقعی برای کارهای مالی یا گزارش‌دهی است. از مدل برای طراحی تحلیل استفاده کن و از صفحه‌گسترده یا اسکریپت خودت برای اجرای آن.

کدام مدل کدام فایل را می‌خواند و چه اندازه‌ای خیلی بزرگ است؟

هر دو فرمت CSV و اکسل مستقیماً قابل بارگذاری‌اند و این سه مدل کار را به‌روشنی بین خود تقسیم می‌کنند.

مدلپنجرهٔ زمینهاعتبار به ازای هر پیاممناسب برای
GPT-5.6 Terra1M توکن4قالب‌های دقیق: جدول‌های تمیز، JSON، نگاشت‌های دقیق ستون
Claude Sonnet 51M توکن10مرحلهٔ مقایسهٔ متقابل در تجمیع چندمرحله‌ای
Gemini 3.5 Flash1M توکن، حدود 1,900 صفحهٔ نسخهٔ خطی8بزرگ‌ترین فایل‌ها، یا یک صفحه گسترده به‌همراه یک PDF در یک گفتگو

ارقام زمینه و اعتبار از شاخص هزینهٔ مدل Whizi گرفته شده‌اند، نرخ‌های فهرست در تاریخ 2026-08-20 دریافت شده‌اند.

چند نکتهٔ عملی:

  • یک مستطیل تمیز بده. یک ردیف عنوان، بدون سلول‌های ادغام‌شده، بدون ردیف‌های خالی فاصله‌گذار، بدون یادداشت در ستون K. گزارش‌های با قالب چندعنوانی بیش از هر محدودیت اندازهٔ فایلی، استخراج را گیج می‌کنند.
  • برگهٔ خام را بفرست، نه برگهٔ ارائه را. نسخه‌ای که قالب‌بندی و جمع‌جزءها را دارد، همان نسخه‌ای است که شمارش دوگانه ایجاد می‌کند.
  • فایل‌های خیلی پهن از فهرست ستون‌ها اول سود می‌برند. اگر نام ستون‌ها گنگ است، پیش از تحلیل بپرس معنی هر ستون چیست و به مدل بگو کجا اشتباه کرده.
  • برای فایل‌های خیلی بزرگ از Gemini 3.5 Flash استفاده کن، که همان پنجرهٔ زمینهٔ 1M توکنی Claude Sonnet 5 و GPT-5.6 Terra را با کمترین هزینه به ازای هر پاسخ در میان این سه می‌خواند. فراتر از آن، عمداً نمونه‌گیری کن: یک نمونهٔ تصادفی 5000 ردیفی را تحلیل کن و بگو چه خطای نمونه‌گیری‌ای را باید برای هر عدد انتظار داشته باشم بهتر از کوتاه‌شدن خاموش فایل است.
  • ابتدا داده‌های شخصی را حذف کن. نام‌ها، ایمیل‌ها و شناسه‌ها تقریباً هیچ‌وقت برای تحلیل لازم نیستند و حذف آن‌ها سریع‌تر از بحث دربارهٔ این است که آیا اجازهٔ بارگذاری آن‌ها را داشته‌اید یا نه.

جزئیات فنی بارگذاری در بارگذاری اسناد توضیح داده شده است.

دنبالهٔ کامل هشت‌مرحله‌ای روی یک فایل واقعی

کل گردش کار روی یک فایل واقعی، به ترتیب:

  1. بارگذاری کن. پرامپت پروفایل را اجرا کن. مقادیر منحصربه‌فرد و شمار خانه‌های خالی را با دقت بخوان.
  2. مشکلات یافت‌شده را رفع کن، پیش از اعمال، جدول نگاشت را بررسی کن.
  3. خلاصه‌ای از موضوع داده و سه پرسشی که فکر می‌کند باید بپرسی بخواه. این مرحله سریع است و اغلب چارچوب تحلیل را عوض می‌کند.
  4. پرسش واقعی خودت را بپرس، با الزام روش و مواردِ حذف‌شده در پاسخ.
  5. همیشه پرامپت ناهنجاری را اجرا کن. اینجاست که غافلگیری‌ها پیدا می‌شوند.
  6. کوچک‌ترین گروه را با دست بررسی کن.
  7. عدد اصلی را با یک مدل دوم مقایسه متقابل کن.
  8. مشخصات نمودار را بخواه، یا اگر عدد باید دقیق و بازتولیدپذیر باشد، فرمول را بخواه.

مراحل 1، 5 و 6 همان مراحلی هستند که مردم نادیده می‌گیرند و همان‌هایی هستند که تحلیل قابل دفاع را از یک حدس زیبا قالب‌بندی‌شده جدا می‌کنند.

فهرست بررسی
  • فایل را پیش از پرسیدن حتی یک پرسش تحلیلی پروفایل کن
  • فهرست مقادیر منحصربه‌فرد را بخوان تا املاهای متفاوت و قالب‌های مخلوط را بیابی
  • روش و موارد حذف‌شده را در کنار هر عدد بخواه
  • گروه‌های کوچک را به‌جای گزارش درصد، به‌عنوان بیش‌ازحد کوچک علامت بزن
  • همیشه پرامپت «چه چیزی در این داده مشکوک است» را اجرا کن
  • پیش از اعتماد به جدول، کوچک‌ترین گروه را با دست بررسی کن
  • ارقام مهم را با یک مدل دوم مقایسه متقابل کن
  • وقتی عدد باید دقیقاً درست باشد، فرمول یا کد را بخواه

پرسش‌های متداول

صفحه گسترده‌ام چقدر می‌تواند بزرگ باشد؟

این به پلن و مدل بستگی دارد، و محدودیت عملی، پنجرهٔ زمینهٔ مدل است، نه سقف اندازهٔ فایل. Claude Sonnet 5، GPT-5.6 Terra و Gemini 3.5 Flash همگی در Whizi یک پنجرهٔ زمینهٔ 1M توکنی را می‌خوانند، تقریباً معادل 1,900 صفحهٔ نسخهٔ خطی داده. فراتر از آن، عمداً نمونه‌گیری کن و از مدل بخواه خطای نمونه‌گیری را بیان کند، به‌جای اینکه اجازه دهی فایل بی‌سروصدا کوتاه شود، که همان حالت خرابی است که پاسخ‌های مطمئن دربارهٔ بخشی از داده‌ات تولید می‌کند.

آیا هوش مصنوعی می‌تواند خطاهای صفحه گسترده‌ام را پیدا کند؟

بله، و این یکی از پربازده‌ترین پرامپت‌های موجود است. پرسیدن اینکه چه چیزی در داده مشکوک است به‌طور قابل اعتماد ایمپورت‌های تکراری، روزی که ردیابی خراب شده، واحدها یا ارزهای مخلوط، ردیف‌های جمع‌جزء جامانده در داده و توزیع‌هایی که در میانهٔ فایل تغییر می‌کنند را آشکار می‌کند. از مدل بخواه ردیف‌های دقیق را نقل‌قول کند تا بتوانی هر یافته را تأیید کنی، به‌جای اینکه فهرست را کورکورانه باور کنی.

آیا می‌توانم به اعدادی که می‌دهد اعتماد کنم؟

به ساختار اعتماد کن، محاسبات را تأیید کن. مدل‌های زبانی در تشخیص اینکه چه محاسبه‌ای لازم است و توصیف محتوای یک مجموعه‌داده قوی هستند و در زنجیره‌های طولانی محاسبات روی ردیف‌های زیاد ضعیف‌تر، جایی که بی‌سروصدا با یک پاسخ اشتباه اما زیبا شکست می‌خورند. کوچک‌ترین گروه را با دست بررسی کن، ارقام اصلی را با یک مدل دوم مقایسه متقابل کن و برای هرچیزی که باید دقیقاً درست باشد، فرمول اکسل یا کد پایتون را بخواه و خودت اجرایش کن.

کدام مدل برای کار با صفحات گسترده بهترین است؟

GPT برای استدلال ساختاریافته، قالب‌های خروجی دقیق و جدول‌ها یا JSON تمیز. Claude به‌عنوان مقایسهٔ متقابل در تجمیع چندمرحله‌ای، چون معمولاً اشتباهات متفاوتی می‌کند نه همان اشتباهات. Gemini وقتی فایل خیلی بزرگ است یا می‌خواهی یک صفحه گسترده را در کنار یک PDF یا گزارش در همان گفتگو تحلیل کنی.

آیا با فرمول‌های اکسل و چند برگه کار می‌کند؟

این ابزار مقادیر را می‌خواند نه اینکه کاربرگ تو را اجرا کند، بنابراین نتایج فرمول منتقل می‌شوند اما منطق زندهٔ فرمول منتقل نمی‌شود. برای کاربرگ‌های چندبرگه‌ای، بگو منظورت کدام برگه است و رابطهٔ برگه‌ها را توضیح بده، یا برگهٔ موردنظرت را به‌صورت CSV خروجی بگیر. فایل‌های ساخته‌شده برای ارائه، با سلول‌های ادغام‌شده و جمع‌جزءهای داخل داده، مشکلات بسیار بیشتری نسبت به فایل‌های بزرگ ایجاد می‌کنند.