בצעו פרופיל לנתונים לפני שאתם שואלים אותם משהו
הדרך הנפוצה ביותר שבה ניתוח גיליונות נכשל אינה קשורה ל-AI בכלל. הבעיה היא שהקובץ מכיל 14 שורות עם רווח סופי בשם האזור, שני פורמטי תאריך, שורת סיכום ביניים שמישהו השאיר באמצע, ו-300 תאים ריקים בעמודה שאתם עומדים לחשב את הממוצע שלה. אם תשאלו את השאלה שלכם קודם, תקבלו תשובה בטוחה שמחושבת מעל זבל.
אז הפרומפט הראשון זהה בכל קובץ.
פרומפט: הפרופיל
בצע פרופיל לקובץ הזה לפני שאנחנו מנתחים משהו. החזר: מספר השורות, שמות העמודות עם הטיפוס המשוער, המספר והאחוז של ערכים חסרים בכל עמודה, מספר השורות הכפולות המדויקות, הערכים הייחודיים בכל עמודה עם פחות מ-25 ערכים ייחודיים, המינימום והמקסימום של כל עמודת מספרים ותאריכים, וכל עמודה שהערכים בה נראים לא עקביים (פורמטים מעורבים, רווחים סופיים, יחידות מעורבות, פורמטי תאריך מעורבים). אל תנתח או תפרש עדיין. רק ספר לי מה יש בקובץ ומה נראה בו לא תקין.
פרומפט אחד זה תופס את רוב מה שהיה עלול להרוס את הניתוח. רשימת הערכים הייחודיים היא במיוחד המקום שבו מגלים ש-"UK", "U.K." ו-"United Kingdom" הם שלושה אזורים נפרדים בנתונים שלכם.
פרומפט: תיקון מה שנמצא
תקנן את הבעיות שזיהית: קצץ רווחים, אחד את [עמודה] לפורמט אחד, ואחד את הווריאציות האלה: [רשימה]. הצג לי את המיפוי שהחלת כטבלה לפני שהוא מוחל. אל תמחק שורות בלי לספר לי אילו ומדוע.
שאלו שאלות שמייצרות תשובות שאפשר לאמת
שאלות מעורפלות מקבלות תשובות מעורפלות. הפרומפטים שעובדים מציינים בשם את העמודה, את הפעולה ואת פורמט הפלט, ומבקשים את דרך החישוב.
פרומפט: אגרגציה עם הצגת דרך החישוב
קבץ לפי [עמודה] וחשב [מדד]. החזר טבלת Markdown עם הקבוצה, מספר השורות בה, והמדד. מתחת לטבלה, ציין בדיוק איך חישבת את המדד, אילו שורות הוצאת ומדוע, ואיך התייחסת לתאים ריקים. סדר בסדר יורד לפי [עמודה].
פרומפט: שאלת הקוהורט
לכל [ממד קוהורט, לדוגמה חודש הרשמה], חשב [מדד] ב[מרווח]. הצג את גודל הקוהורט לצד כל נתון. סמן כל קוהורט עם פחות מ-[n] שורות כקטן מדי לפרשנות במקום לדווח עליו אחוז.
ההוראה האחרונה הזו מונעת את הפלט המטעה ביותר בניתוח גיליונות: קוהורט של ארבעה משתמשים שמדווח כ-"75% שימור" ויושב בטבלה לצד קוהורט של תשעת אלפים.
פרומפט: חיפוש חריגות
מה חשוד בנתונים האלה? חפש: ערכים מעבר לתחום סביר, קפיצות פתאומיות בסדרת זמן, עמודות שבהן ההתפלגות משתנה באמצע, שורות שהן כפילויות מדויקות או קרובות, ערכים שנראים עגולים מדי, וכל דבר שמעיד על שינוי באופן שבו הנתונים נאספו. לכל אחד, ציטט את השורות הספציפיות.
זה הפרומפט בעל הערך הגבוה ביותר בעמוד הזה ואין לו מקביל בזרימת עבודה רגילה עם גיליונות. הוא מוצא באופן שגרתי את היום שבו המעקב התקלקל, את הספק שהתחיל לדווח במטבע אחר, ואת ייבוא הכפילות שהגדיל בטעות רבעון שלם.
פרומפט: מפרט הגרף
המלץ על הגרף המתאים לשאלה הזו ולצורת הנתונים הזו, והסבר מדוע האלטרנטיבה המתבקשת גרועה יותר כאן. אחר כך תן לי את המפרט: סוג הגרף, x, y, סדרה, אגרגציה, סדר מיון, וטיפול בצירים. אל תשתמש בציר כפול. אל תקטע ציר של גרף עמודות.
היכן החישוב האריתמטי באמת נכשל
זה מגיע לתשובה ישירה, כי "AI גרוע במתמטיקה" הוא גם נכון וגם לא מועיל בעמימותו.
מודל שפה שמחשב מספרים בתוך טקסט מבצע השלמת תבניות, לא חישוב. הוא אמין בתיאור מבנה, בסיווג שורות ובזיהוי איזה חישוב צריך. הוא הרבה פחות אמין בביצוע שרשרת חישוב אריתמטי ארוכה על פני מאות שורות, והוא נכשל בשקט: הפלט הוא טבלה מעוצבת יפה של מספרים שגויים בלי שום סימן מצוקה.
הכללים המעשיים:
- בקשו את השיטה, לא רק את התוצאה. "ציין בדיוק איך חישבת את זה ומה הוצאת" חושף את השגיאה כשיש כזו.
- בדקו נקודתית קבוצה אחת בעצמכם. בחרו את הקבוצה הקטנה ביותר בטבלת הפלט ואמתו אותה בגיליון האמיתי. אם היא תואמת, השיטה כנראה נכונה; אם לא, אין דבר בטבלה שאפשר לסמוך עליו.
- הצלבו כל דבר משמעותי עם מודל שני. שני מודלים עצמאיים שמגיעים לאותו מספר הם עדות טובה משמעותית משכפול תשובה אחת של מודל אחד. תצוגת ההשוואה הצדדית של Whizi קיימת בדיוק לשם כך.
- שימו לב לספירה כפולה. שורות סיכום ביניים שנשארו בקובץ וחיבורים של אחד-לרבים הם שני החוטאים הרגילים, והמודל לא ידע שהם שגויים.
- לכל דבר שחייב להיות מדויק, בקשו את הנוסחה או את הקוד.
תן לי את נוסחת ה-Excelאותן לי את קוד ה-pandasמעביר את החישוב האריתמטי למנוע דטרמיניסטי, ואתם שומרים על המודל לחלק שהוא טוב בו, שזה לדעת איזה חישוב להריץ.
הכלל האחרון הוא התשובה האמיתית לעבודה פיננסית או לדיווחים. השתמשו במודל לעצב את הניתוח, השתמשו בגיליון או בסקריפט כדי להריץ אותו.
איזה מודל קורא איזה קובץ, ומה נחשב גדול מדי?
CSV ו-Excel שניהם מעלים ישירות, ושלושת המודלים מחלקים את העבודה בצורה נקייה.
| מודל | חלון הקשר | קרדיטים להודעה | השתמשו בו לשם |
|---|---|---|---|
| GPT-5.6 Terra | 1M טוקנים | 4 | פורמטים נוקשים: טבלאות נקיות, JSON, מיפויי עמודות מדויקים |
| Claude Sonnet 5 | 1M טוקנים | 10 | מעבר ההצלבה על אגרגציה מרובת שלבים |
| Gemini 3.5 Flash | 1M טוקנים, בערך 1,900 עמודי כתב יד | 8 | הקבצים הגדולים ביותר, או גיליון בצירוף PDF באותה שיחה |
נתוני ההקשר והקרדיטים מגיעים ממדד עלות המודלים של Whizi, תעריפי הרשימה נלקחו בתאריך 2026-08-20.
כמה הערות מעשיות:
- תנו לו מלבן נקי. שורת כותרת אחת, בלי תאים מאוחדים, בלי שורות רווח ריקות, בלי הערות בעמודה K. דוחות בפורמט של כותרות מרובות מבלבלים את החילוץ יותר מכל מגבלת גודל קובץ.
- שלחו את הגיליון הגולמי, לא את גיליון המצגת. הגרסה עם העיצוב ושורות הסיכום היא זו שמייצרת ספירה כפולה.
- קבצים רחבים מאוד נהנים מרשימת עמודות מראש. שאלו למה כל עמודה מתייחסת לפני הניתוח אם השמות מוזרים, וספרו למודל איפה הוא טעה.
- לקבצים גדולים מאוד, השתמשו ב-Gemini 3.5 Flash, שקורא את אותו חלון הקשר של 1M טוקנים כמו Claude Sonnet 5 ו-GPT-5.6 Terra בעלות הנמוכה ביותר לתשובה מבין השלושה. מעבר לזה, בצעו מדגם באופן מכוון:
נתח מדגם אקראי של 5000 שורות וספר לי איזה שיעור טעות מדגמית עלי לצפות בכל נתוןטוב יותר מקיטוע שקט של הקובץ. - הסירו נתונים אישיים קודם. שמות, אימיילים ומזהים כמעט אף פעם לא נדרשים לניתוח, והסרתם מהירה יותר מלהתדיין אם הותר לכם להעלות אותם.
המכניקה של ההעלאות מכוסה בהעלאת מסמכים.
רצף שמונת השלבים המלא על קובץ אמיתי
כל זרימת העבודה על קובץ אמיתי, לפי הסדר:
- העלו. הריצו את פרומפט הפרופיל. קראו את הערכים הייחודיים והמספרים החסרים בקפידה.
- תקנו את מה שנמצא, בסקירת טבלת המיפוי לפני שהיא מוחלת.
- בקשו סיכום של מה הנתונים עוסקים בו ושלוש השאלות שהוא חושב שכדאי לכם לשאול. השלב הזה מהיר ולעיתים קרובות מגדיר מחדש את הניתוח.
- שאלו את השאלה האמיתית שלכם, עם דרישה לשיטה ולהחרגות בתשובה.
- הריצו את פרומפט החריגות, בכל מקרה. כאן נמצאות ההפתעות.
- בדקו נקודתית את הקבוצה הקטנה ביותר בעצמכם.
- הצלבו את המספר המרכזי עם מודל שני.
- בקשו את מפרט הגרף, או את הנוסחה אם המספר צריך להיות מדויק וניתן לשכפול.
שלבים 1, 5 ו-6 הם אלה שאנשים מדלגים עליהם, והם אלה שמפרידים בין ניתוח שאפשר להגן עליו לבין השערה מעוצבת יפה.
- בצעו פרופיל לקובץ לפני ששואלים שאלה אנליטית אחת
- קראו את רשימת הערכים הייחודיים כדי לתפוס איות בווריאציות ופורמטים מעורבים
- דרשו את השיטה וההחרגות לצד כל מספר
- סמנו קבוצות קטנות כקטנות מדי במקום לדווח עליהן אחוז
- הריצו תמיד את הפרומפט "מה חשוד בנתונים האלה"
- בדקו נקודתית את הקבוצה הקטנה ביותר בעצמכם לפני שסומכים על הטבלה
- הצלבו נתונים משמעותיים עם מודל שני
- בקשו את הנוסחה או הקוד כשהמספר חייב להיות מדויק לגמרי
שאלות נפוצות
כמה גדול יכול להיות הגיליון שלי?
זה תלוי בתוכנית ובמודל, והמגבלה המעשית היא חלון ההקשר של המודל ולא תקרת גודל קובץ. Claude Sonnet 5, GPT-5.6 Terra ו-Gemini 3.5 Flash כולם קוראים חלון הקשר של 1M טוקנים ב-Whizi, בערך 1,900 עמודי כתב יד של נתונים. מעבר לזה, בצעו מדגם באופן מכוון ובקשו מהמודל לציין את שיעור הטעות המדגמית במקום לאפשר לקובץ להיקטע בשקט, שזו תבנית הכשל שמייצרת תשובות בטוחות על שבריר מהנתונים שלכם.
האם AI יכול לתפוס שגיאות בגיליון שלי?
כן, וזה אחד הפרומפטים בעלי הערך הגבוה ביותר שקיימים. השאלה מה חשוד בנתונים חושפת באופן אמין ייבוא כפול, את היום שבו המעקב התקלקל, יחידות או מטבעות מעורבים, שורות סיכום ביניים שנשארו בתוך הנתונים, והתפלגויות שמשתנות באמצע הקובץ. בקשו ממנו לצטט את השורות הספציפיות כדי שתוכלו לאמת כל ממצא במקום לקבל את הרשימה על אמון.
האם אני יכול לסמוך על המספרים שהוא נותן לי?
סמכו על המבנה, אמתו את החישוב האריתמטי. מודלי שפה חזקים בזיהוי איזה חישוב נדרש ובתיאור מה יש במערך נתונים, וחלשים יותר בשרשראות חישוב אריתמטי ארוכות על פני שורות רבות, שבהן הם נכשלים בשקט עם תשובה שגויה מעוצבת יפה. בדקו נקודתית את הקבוצה הקטנה ביותר בעצמכם, הצלבו נתונים מרכזיים עם מודל שני, ולכל דבר שחייב להיות מדויק, בקשו את נוסחת ה-Excel או קוד Python והריצו אותו בעצמכם.
איזה מודל הכי מתאים לעבודה עם גיליונות?
GPT לחישוב מבני, פורמטי פלט נוקשים, וטבלאות או JSON נקיים. Claude כהצלבה על אגרגציה מרובת שלבים, כי הוא נוטה לעשות טעויות שונות ולא את אותן הטעויות. Gemini כשהקובץ גדול מאוד או כשרוצים לנתח גיליון בצירוף PDF או דוח באותה שיחה.
האם זה עובד עם נוסחאות Excel וגיליונות מרובים?
הוא קורא את הערכים ולא מריץ את חבילת העבודה שלכם, כך שתוצאות הנוסחאות עוברות אבל לוגיקת הנוסחה החייה לא. לחבילות עבודה מרובות גיליונות, ציינו לאיזה גיליון אתם מתכוונים ותארו איך הגיליונות מתייחסים זה לזה, או ייצאו את הגיליון שמעניין אתכם כ-CSV. קבצים שנבנו למצגת, עם תאים מאוחדים וסיכומי ביניים בתוך הנתונים, גורמים לבעיות רבות יותר מקבצים גדולים.