איך מעלים מסמכים ומבצעים ניתוח מסמכים AI ב-Whizi

תשובה מהירה

צרפו את הקובץ בתיבת ההודעה, על ידי גרירה או לחיצה על סמל האטב, ואז שאלו את שאלתכם. Whizi מקבל קבצי PDF, מסמכי Word, גיליונות אלקטרוניים, תמונות וקבצי קוד או טקסט רגיל. מה שהמודל מקבל שונה בהתאם לסוג: טקסט מחולץ עבור מסמכים, ערכי תא עבור גיליונות, והתמונה עצמה עבור קבצי תמונה.

סוגי קבצים נתמכים, ומה קורה בפועל לכל אחד

צרפו את הקובץ בגרירה לתיבת ההודעה או בלחיצה על סמל האטב, ואז שאלו את שאלתכם. מה שהמודל מקבל שונה לפי סוג הקובץ, וההבנה מה שייך למה מסביר את רוב התוצאות המפתיעות.

סוגסיומותעם מה המודל עובד
קבצי PDF עם טקסט.pdfהטקסט המחולץ, בסדר קריאה, כולל טבלאות כטקסט
קבצי PDF סרוקים.pdfתמליל לכל עמוד ממעבר ראייה בצד השרת
מסמכי Word.docxטקסט המסמך, מחולץ בדפדפן שלכם
גיליונות אלקטרוניים.xlsx, .csvערכי תא כטקסט, לא נוסחאות חיות
תמונות.png, .jpg, .jpegהתמונה עצמה, נקראת על ידי מודל מולטימודאלי

| קוד וטקסט רגיל | .py, .js, .ts, .go, .md, .txt וכדומה | תוכן הקובץ כלשונו

שתי תוצאות שכדאי להפנים. ראשית, גיליון אלקטרוני מגיע כערכים ולא כחוברת עבודה פעילה, כך שהמודל יכול לקרוא מה שהנוסחה שלכם הפיקה אך לא להריץ אותה מחדש. שנית, PDF סרוק עבר תמלול ראייה ולא חילוץ טקסט רגיל, ופונט חריג, הערה בכתב יד או סריקה ברזולוציה נמוכה עדיין יכולים לגרום לתו שגוי בתוך מספר. אמתו נתונים ממסמכים סרוקים לעומת המקור. הערה לגבי תמונות: תיבת ההודעה דוחה קבצי GIF ומבקשת PNG או JPEG במקום.

הכינו את הקובץ לפני שאתם שואלים משהו

חמש דקות כאן חוסכות שיחה מבלבלת בהמשך.

  • תנו לקובץ שם שמתאר אותו. המודל רואה את שם הקובץ, ו-2025-q3-vendor-contract-acme.pdf נותן לו הקשר שימושי ש-document(3).pdf לא נותן. זה משנה עוד יותר כשכמה קבצים נמצאים בשיחה.
  • שלחו את המקור, לא את גרסת המצגת. בעיקר בגיליונות אלקטרוניים, גרסה עם תאים ממוזגים, סיכומי משנה בתוך הנתונים והערות בשוליים גורמת ליותר שגיאות מקובץ פשוט גדול.
  • פצלו מסמכים ענקיים לפי מטרה, לא לפי גודל. אם אתם צריכים רק את פרקי המתודולוגיה והתוצאות, העלאת אלה בלבד טובה יותר מהעלאת 400 עמודים ותקווה שהתשומת לב תגיע למקום הנכון.
  • הסירו נתונים אישיים שאינכם צריכים. שמות, אימיילים ומזהים נדרשים לעיתים רחוקות לניתוח, והסרתם מהירה יותר מהחלטה אם הותר לכם להעלות אותם.
  • בדקו שה-PDF הוא באמת טקסט. נסו לבחור טקסט בקורא ה-PDF שלכם. אם אינכם יכולים, זו סריקה, Whizi יתמלל אותה במעבר ראייה, ומספרים כדאי לבדוק לעומת המקור.

בחירת המודל לקובץ

הבחירה הזו חשובה יותר מהפרומפט בעבודה עם מסמכים.

  • Gemini לכל דבר ארוך. מודלי Gemini ב-Whizi נושאים חלון הקשר של 1,000,000 טוקנים, כך שדוח של 200 עמודים, מארז חוזים מלא, או תריסר מאמרים יכולים להיות נוכחים בבת אחת במקום להיעבד בחלקים. שאלות חוצות מסמכים עובדות כראוי רק כשהכול נמצא בהקשר בפועל.
  • Claude לניואנס. שפה משפטית, מסמכי מדיניות, כל מקום שבו המשמעות תלויה בהסתייגות ואמירות מגבילות. הוא גם הטוב ביותר באמירה מה מסמך לא אומר, מה שהוא לעיתים קרובות השאלה האמיתית.
  • GPT לחילוץ. חשבוניות, טפסים, נתונים מבניים, כל מקום שבו אתם רוצים בחזרה טבלה קפדנית או JSON ושמות שדות עקביים על פני מאות שורות.
  • כל מודל מולטימודאלי לתמונות, תרשימים, צילומי מסך ודיאגרמות. בקשו ממנו לתאר מה שהוא רואה לפני שאתם מבקשים ממנו לפרש, וזה תופס קריאות שגויות מוקדם.

אתם יכולים להחליף מודלים באמצע השיחה בלי להעלות מחדש, וזו הנקודה בעבודה בסביבת עבודה אחת. קראו עם Gemini, חלצו עם GPT, ותנו ל-Claude לכתוב את הסיכום, הכול על אותו קובץ מצורף. ראו החלפת מודלים באמצע שיחה.

עבודה עם כמה מסמכים בבת אחת

שאלות על מסמך יחיד שימושיות. שאלות על כמה מסמכים הן המקום שבו זה מפסיק להיות נוחות ומתחיל להיות יכולת שלא היתה לכם קודם.

פרומפט: השוואה

השוו בין contract-a.pdf ל-contract-b.pdf. החזירו טבלה של כל סעיף שנבדל: הסעיף, מה A אומר, מה B אומר, ומי נוח יותר לנו ולמה. התעלמו מהבדלים בעימוד ובמספור. פרטו סעיפים שקיימים באחד וחסרים באחר בנפרד.

פרומפט: איחוד

בכל הקבצים המצורפים, בנו טבלה אחת שעונה על [שאלה]. שורה אחת לכל מסמך, עם שם המסמך בעמודה הראשונה. במקום שמסמך לא מתייחס לזה, כתבו לא מתייחס. אל תאחדו מסמכים שמשתמשים בהגדרות שונות בלי לסמן זאת.

פרומפט: מציאת סתירה

היכן המסמכים האלה סותרים אחד את השני? צטטו את שני הקטעים זה לצד זה וציינו את שם הקובץ שממנו הגיע כל אחד. הבחינו בין סתירות אמיתיות לבין הבדלים בהיקף או בתאריך.

התייחסו לקבצים בשמם בפרומפט שלכם ברגע שיש יותר מאחד. "בהסכם עם הספק, מה תקופת ההודעה המוקדמת?" חד משמעי; "מה תקופת ההודעה המוקדמת?" מכריח את המודל לבחור, והוא לא יגיד לכם באיזה הוא בחר.

כשהתשובה נראית שגויה

רצף אבחון קצר שפותר את רוב הבעיות.

המודל אומר שהוא לא רואה את הקובץ. אשרו שהקובץ המצורף אכן הועלה, ואז התייחסו אליו במפורש: "בדוח המצורף report.pdf". בעיקר לתמונות, האמירה "הביטו בתמונה המצורפת" מבטיחה שהמסלול המולטימודאלי בשימוש ולא שהמודל עונה מטקסט השאלה שלכם בלבד.

התשובה על המסמך הלא נכון. ציינו את שם הקובץ בכל שאלה ברגע שבשיחה יש כמה מסמכים.

המספרים שגויים באופן עדין במסמך סרוק. זה תמלול הסריקה, לא ההיגיון. בקשו מהמודל לצטט את השורה הסובבת כלשונה כדי שתוכלו לראות מה הוא קרא, ואז בדקו את המקור.

הוא פספס משהו שאתם יודעים שנמצא בקובץ. שאלו שאלת איתור קודם: צטטו את הקטע שדן ב[נושא] וציינו את העמוד או הפרק שלו. אם הוא לא מוצא אותו, החילוץ הוא הבעיה, לא ההיגיון. נסו מודל אחר או העלו את העמודים הרלוונטיים בנפרד.

הוא מסכם במקום לענות. בקשו את הראיה ולא את המסקנה: צטטו את הטקסט המדויק שמבסס את התשובה שלכם. זה גם תופס את המקרה שבו התשובה הוסקה מידע כללי ולא מהמסמך שלכם, וזו הכשלה החשובה ביותר לתפוס.

הבדיקה האחרונה הזו כדאי להדגיש. מודל שנשאל על סוג חוזה מוכר, תקנה נפוצה או מאמר מפורסם יכול לענות בסבירות מנתוני האימון בלי להתייעץ עם הקובץ שלכם בכלל. דרישת ציטוט מחייבת את התשובה להיות מעוגנת במסמך שבפועל נמצא לפניו.

פרטיות ומה לחשוב עליו לפני ההעלאה

קבצים מצורפים שהועלו מוגדרים לפוג עד 30 יום, ואתם יכולים למחוק קובץ או שיחה שלמה בעצמכם מוקדם יותר. Whizi לא משתמש בפרומפטים, בקבצים, בשיחות, בתמלילי קול או בתוכן שנוצר שלכם כדי לאמן מודלי AI בבעלות Whizi, ולא מוכר את התוכן הזה כנתוני אימון. הספק שמריץ את המודל שבחרתם מקבל את מה שהוא צריך כדי לענות ועשוי להחזיק מטמונים זמניים לפי מדיניותו שלו.

השיקול שנשאר שלכם הוא אם המסמך הוא בכלל כזה שמותר לכם לעבד עם שירות צד שלישי. הקטגוריות שכדאי להתעכב עליהן: נתונים אישיים של אנשים אחרים, כל דבר המכוסה בסעיף סודיות ספציפי, מידע מהותי שאינו ציבורי, ונתונים מוסדרים כמו רשומות בריאות או פיננסיות שכפופות לכללי טיפול מיוחדים.

הדרך המעשית האמצעית לרוב האנשים היא לצנזר ולא להימנע. שמות שהוחלפו בתפקידים, נתונים שהוצגו כאינדקס ולא כמוחלטים, ומזהים שהוסרו ישמרו על כל מה שהניתוח צריך בעוד הם מסירים את רוב מה שהופך מסמך לרגיש.

רשימת בדיקה
  • תנו לקבצים שם תיאורי, מכיוון שהמודל רואה את שם הקובץ
  • בדקו אם PDF הוא טקסט או סריקה לפני שאתם בוטחים במספרים המחולצים
  • העלו את גיליון המקור, לא את גרסת המצגת המעוצבת
  • בחרו Gemini לקבצים ארוכים, Claude לניואנס, GPT לחילוץ
  • התייחסו לקבצים בשמם ברגע שיש יותר מאחד מצורף
  • בקשו ציטוט תומך כדי שתשובות יישארו מעוגנות במסמך
  • הסירו נתונים אישיים שאינכם צריכים לניתוח

שאלות נפוצות

האם ההעלאות שלי פרטיות?

ההעלאות מאוחסנות בחשבון שלכם, מוגדרות לפוג עד 30 יום, וניתן למחוק אותן מוקדם יותר בכל עת שתרצו. Whizi לא משתמש בפרומפטים, בקבצים, בשיחות, בתמלילי קול או בתוכן שנוצר שלכם כדי לאמן מודלי AI בבעלות Whizi, ולא מוכר את התוכן הזה כנתוני אימון. מה שנשאר בשליטתכם הוא אם מסמך מסוים הוא כזה שמותר לכם לשלוח לשירות צד שלישי, וזה נשלט בדרך כלל על ידי החוזים שלכם או המדיניות הפנימית שלכם ולא על ידי שלנו.

מה הגודל המקסימלי של קובץ?

באתר כל קובץ יכול להיות עד 100 מגה-בייט, והודעה אחת יכולה לשאת עד 6 קבצים; אפליקציית ה-iOS מגבילה קובץ ל-10 מגה-בייט. במגבלות האלה האילוץ המכריע הוא חלון ההקשר של המודל: לחוזים ארוכים, דוחות ומארזים מרובי מסמכים, בחרו מודל בעל הקשר גדול כמו Gemini, או העלו את הקטעים הרלוונטיים במקום את הקובץ כולו, מכיוון שהקשר ממוקד בדרך כלל מפיק תשובה טובה יותר בכל מקרה.

אפשר למחוק קובץ אחרי הצ'אט?

כן, אפשר להסיר קבצים בכל עת, והעלאות שאתם משאירים כמו שהן מוגדרות לפוג באופן עצמאי עד 30 יום. שימו לב שהסרת קובץ לא מוחקת רטרואקטיבית מה שכבר נדון בשיחה, אז אם התוכן רגיש מספיק כדי להצדיק מחיקת הקובץ, מחקו גם את השיחה.

האם זה עובד עם PDF סרוקים?

כן. Whizi מזהה PDF עמוס בתמונות או סרוק לפי כמה מעט טקסט העמודים שלו מפיקים ושולח אותו פעם אחת במעבר ראייה בצד השרת שמחזיר תמליל לכל עמוד. הדיוק גבוה בסריקות נקיות ויורד עם רזולוציה נמוכה, פונטים חריגים, כתב יד ופריסות טבלה מורכבות. מכיוון שתו שגוי במספר בלתי נראה בתשובה שוטפת, אמתו כל נתון ממסמך סרוק לעומת המקור.

אפשר להעלות כמה מסמכים לאותה שיחה?

כן, וזה המקום שבו נמצא רוב הערך. השוואת שני חוזים סעיף לסעיף, איחוד ממצאים על פני מארז דוחות, או מציאת סתירות בין מסמכים הם דברים שדורשים שהכול יהיה בהקשר בבת אחת. התייחסו לקבצים בשמם בפרומפטים שלכם ברגע שיש יותר מאחד, אחרת המודל בוחר במקומכם בלי לומר באיזה הוא בחר.