איך עושים צאט pdf באונליין ב-Whizi

תשובה מהירה

גררו את קובץ ה-PDF לתוך תיבת ההודעה או לחצו על סמל המהדק, ואז שאלו את השאלה שלכם בשפה פשוטה. כל מודל שכלול במסלול שלכם יכול לקרוא אותו, ואפשר להחליף בין מודלים על אותו קובץ בלי להעלות אותו מחדש. לפני שסומכים על תשובה, בקשו מהמודל לצטט את הקטע שהוא הסתמך עליו.

התשובה הקצרה

גררו את קובץ ה-PDF לתוך תיבת ההודעה או לחצו על סמל המהדק כדי לצרף אותו, ואז שאלו את השאלה שלכם בשפה פשוטה. כל מודל שכלול במסלול שלכם יכול לקרוא אותו, ואפשר להחליף בין מודלים על אותו קובץ בלי להעלות אותו מחדש.

עשו דבר אחד לפני שאתם סומכים על תשובה: בקשו מהמודל לצטט את הקטע שהוא הסתמך עליו. כלים שמחפשים בקובץ במקום לקרוא אותו כולו מוצאים קטעים לפי משמעות, ומה הן embeddings בבינה מלאכותית מסביר איך זה עובד. תשובה בטוחה שמגיעה מנתוני האימון ולא מהקובץ שלכם היא התקלה שעולה לאנשים כסף, ושאלת איתור תופסת אותה בערך בעשר שניות. שאר העמוד הזה מסביר איך לעשות את זה נכון.

ראשית, ודאו שהוא קורא את המסמך שלכם

התקלה המסוכנת ביותר בצ'אט על מסמכים אינה תשובה שגויה, אלא תשובה בטוחה שמגיעה מנתוני האימון ולא מהקובץ שלכם. זה קורה בעיקר עם מסמכים שדומים למשהו נפוץ: חוזה שכירות מסחרי סטנדרטי, תקנה מוכרת, מאמר שנדון בו הרבה. המודל מכיר את הסוגה מספיק טוב כדי לייצר תשובה סבירה בלי להתייעץ עם הטקסט הספציפי שלכם, ושום דבר בפלט לא מסמן שזה מה שקרה.

הרגל אחד מסלק את הבעיה הזו. לפני שאתם שואלים את השאלה האמיתית שלכם, שאלו שאלת איתור.

צטט את הקטע במסמך המצורף שדן ב-[נושא], וציין את העמוד או הסעיף שבו הוא מופיע. אם הוא לא נמצא במסמך, אמור זאת.

אם המודל מחזיר ציטוט אמיתי, הוא קורא את הקובץ שלכם. אם הוא מייצר ניסוח כללי או שהוא לא מוצא משהו שאתם יודעים שנמצא שם, החילוץ נכשל וכל התשובות שלאחר מכן חשודות. זה לוקח עשר שניות וזה ההבדל בין כלי לבין מטרד.

העבירו את ההרגל הזה גם לשאלות האמיתיות: צטט את הטקסט המדויק שתומך בתשובה שלך צריך להופיע בכל פרומפט שהתשובה שלו תשמש להחלטה.

בחירת מודל למסמך

מסמךמודלהסיבה
דוחות מ-100 עמודים ומעלה, תיקים, סטים שלמים של חוזיםGeminiחלון קונטקסט של 1,000,000 טוקנים, כך שהמסמך נמצא באמת ולא מחולק לחלקים
חוזים, מדיניות, כל דבר שבו הסתייגות חשובהClaudeהטוב ביותר בניואנסים ובלהגיד לכם מה מסמך לא אומר
חשבוניות, טפסים, קבצים מבניים קצריםGPTמהיר, והאמין ביותר בחילוץ קפדני לטבלאות או JSON
מאמרים עם תרשימים, עמודים סרוקים, דיאגרמותכל מודל מולטימודליקורא את העמוד כתמונה במקום שבו חילוץ טקסט נכשל

הנקודה על חלון הקונטקסט שווה הרחבה. כשמסמך עולה על מה שמודל יכול להכיל, הוא חייב להיעבד בחלקים, ושאלות שדורשות את כל המסמך בבת אחת (האם משהו כאן סותר את סעיף 14, האם המונח הזה מוגדר בכלל, איזה מבין שלושת הסעיפים האלה לא עקבי) הופכות לא אמינות. זו הסיבה הספציפית לפנות למודל בעל הקונטקסט הגדול בקבצים ארוכים, ולא סתם העדפה כללית.

אפשר להחליף מודלים בלי להעלות מחדש, כך שאפשר לקרוא עם מודל אחד ולחלץ עם מודל אחר על אותו קובץ. ראו החלפת מודלים במהלך שיחה.

פרומפטים לפי סוג מסמך

חוזים והסכמים

מהחוזה המצורף, חלץ לטבלה: תקופה וחידוש, תקופת הודעה מוקדמת לביטול, תנאי תשלום, תקרת אחריות, שיפויים, דין החל, העברת זכויות, וכל סעיף ששורד ביטול. לכל אחד, ציין את מספר הסעיף וצטט את המשפט המחייב. אחר כך רשום בנפרד את החובות שמוטלות עלינו לעומת אלה שמוטלות עליהם.

המשיכו עם השאלה שבאמת חשובה: מה בהסכם הזה חריג בהשוואה לתנאים סטנדרטיים לסוג חוזה כזה, ומה נעדר במובלט? היעדרות היא המקום שבו הסיכון בדרך כלל מתחבא, וזה דבר שחיפוש מילות מפתח לעולם לא ימצא.

מאמרי מחקר

מהמאמר המצורף, החזר: שאלת המחקר, עיצוב המחקר, המדגם והאוכלוסייה, התוצאה העיקרית, התוצאה המרכזית עם גודל האפקט שלה, המגבלות שהוזכרו, ומקור המימון. אחר כך אמור לי אילו שלוש קביעות במאמר הזה יצריכו אימות עצמאי לפני שאני מצטט אותן.

דוחות ותיקים ארוכים

סכם את הדוח המצורף ב-10 נקודות מסודרות לפי חשיבות ולא לפי סדר המסמך. אחר כך רשום: שלושת המספרים שיהיו חשובים למקבל החלטות עם הפניות לעמוד, כל דבר שהדוח מציג כעובדה בלי מקור, וכל מקום שבו הסיכום או הפרק המנהלי סותר את הפירוט שמופיע בהמשך המסמך.

הבדיקה האחרונה הזו מוצאת בעיות אמיתיות בתדירות מפתיעה. תקצירים מנהליים נכתבים מוקדם ונערכים פחות מהסעיפים שהם מסכמים.

השוואה בין שני מסמכים

השווה בין contract-a.pdf ל-contract-b.pdf סעיף מול סעיף. החזר טבלה של כל הבדל מהותי: נושא, מה אומר A, מה אומר B, ולמי זה משתלם עבורנו. התעלם מהבדלי עימוד ומספור. רשום בנפרד כל דבר שקיים באחד וחסר באחר.

להפוך את זה למשהו שאפשר להשתמש בו

כתוב מחדש את הממצאים לקהל בכיר ב-150 מילים. התחל עם ההחלטה הנדרשת. בלי מונחים שלא מוגדרים. סמן כל דבר שכדאי לי לאמת לפני שמפיצים את זה.

פתרון תקלות

"אני לא רואה מסמך." ודאו שהקובץ סיים להיטען, ואז הפנו אליו במפורש בשם בהודעה שלכם. בשיחות מאוד ארוכות, צירוף חדש של הקובץ או פתיחת צ'אט חדש איתו בלבד מהיר יותר מלהתעמת על זה.

PDF סרוק, טקסט מבולבל או חסר. המסמך הוא תמונה, כך שלחילוץ טקסט רגיל אין הרבה מה לקרוא. Whizi מזהה PDF עמוס בתמונות לפי כמה טקסט מועט עמודיו מספקים, ושולח אותו פעם אחת בתהליך ראייה בצד השרת שמחזיר תמלול לכל עמוד. הדיוק יורד ברזולוציה נמוכה, בגופנים לא שגרתיים, בכתב יד ובטבלאות דחוסות. מכיוון שספרה שנקראה לא נכון אינה נראית בתשובה שוטפת, בדקו כל מספר ממסמך סרוק לעומת העמוד המקורי.

טבלאות יוצאות שגויות. טבלאות ב-PDF ידועות במבנה שלהן שהוא לקוי מאוד מתחת לפני השטח. בקשו שהטבלה תופיע במדויק תחילה, בדקו אותה לעומת העמוד, ורק אחר כך בקשו ניתוח. לעבודה כבדה עם טבלאות, מודל מולטימודלי שקורא את העמוד כתמונה מהימן לרוב יותר מחילוץ טקסט.

הוא פספס משהו שאתם יודעים שנמצא שם. שאלו את שאלת האיתור. אם המודל לא יכול לצטט קטע שאתם רואים, הבעיה היא בחילוץ ולא בהיגיון. נסו מודל אחר, או העלו רק את העמודים הרלוונטיים.

הקובץ גדול מדי. השתמשו במודל בעל הקונטקסט הגדול, או פצלו לפי מטרה ולא לפי כמות עמודים. העלאת שלושת הסעיפים שאתם באמת צריכים עולה על העלאת 400 עמודים בתקווה.

התשובות הופכות מעורפלות יותר ככל שהשיחה מתמשכת. שיחות ארוכות מצטרפות עם קונטקסט שמתחרה עם המסמך. פתחו צ'אט חדש עם הקובץ ואמירה תמציתית של מה שאתם צריכים.

אמתו לפני שסומכים על זה

שלוש בדיקות, לפי סדר חשיבות.

דרשו ציטוטים על כל דבר משמעותי. קטע מצוטט אפשר לבדוק בשניות; ניסוח חלופי אי אפשר. הנוהג הבודד הזה מסלק את רוב הסיכון בעבודה על מסמכים.

בדקו הצטלבות עם מודל שני. שאלו את אותה שאלה על מודל אחר על אותו קובץ. הסכמה היא ראיה משמעותית; אי הסכמה אומרת לכם בדיוק איפה לבדוק. ההשוואה זה לצד זה של Whizi קיימת בדיוק בשביל זה.

שאלו במה הוא לא בטוח. באילו מהתשובות שלך למעלה אתה הכי פחות בטוח, ומה במסמך מעורפל? מודלים אינם מושלמים בהערכה עצמית, אבל העמימויות שהם מעלים בדרך כלל הן עמימויות אמיתיות במקור, וזה מידע שימושי על המסמך עצמו.

והכלל הקבוע לכל דבר שנושא בתוכו השלכות, כלומר חומר משפטי, פיננסי, רפואי או רגולטורי: המודל מוצא את הקטע, אתם מקבלים את השיקול. זה עוזר קריאה, לא יועץ, והאחריות על החלטה שהתקבלה לפי הפלט שלו היא כולה שלכם.

רשימת בדיקה
  • שאלו שאלת איתור תחילה כדי לאשר שהמודל קורא את הקובץ שלכם
  • דרשו ציטוט מדויק לכל תשובה משמעותית
  • השתמשו במודל בעל הקונטקסט הגדול למסמכים ארוכים כדי שדבר לא יחולק ויאבד
  • שאלו מה נעדר במובלט וגם מה המסמך אומר
  • אמתו מספרים ממסמכים סרוקים לעומת העמוד המקורי
  • שכפלו טבלאות במדויק ובדקו אותן לפני שמנתחים אותן
  • בדקו הצטלבות של כל דבר חשוב עם מודל שני

שאלות נפוצות

מה גודל ה-PDF המקסימלי?

באתר כל קובץ שמועלה יכול להיות עד 100MB, והודעה אחת יכולה לשאת עד 6 קבצים; אפליקציית iOS מגבילה קובץ ל-10MB. במסגרת זו, האילוץ האמיתי הוא חלון הקונטקסט של המודל ולא תקרת הקובץ. Gemini ב-Whizi נושא חלון קונטקסט של 1,000,000 טוקנים, ולכן הוא ההמלצה לדוחות ארוכים, תיקים וסטים של חוזים מרובים. מעל לזה, העלו את הסעיפים שאתם באמת צריכים ולא את כל המסמך, כיוון שקונטקסט ממוקד בדרך כלל מייצר גם תשובה חדה יותר.

האם Whizi שומר את קבצי ה-PDF שלי?

קבצים שהועלו נשמרים תחת החשבון שלכם, מוגדרים לפוג לאחר עד 30 ימים, ואפשר למחוק אותם מוקדם יותר בכל עת. Whizi לא משתמש בפרומפטים, בקבצים, בשיחות, בתמלולי קול או בתוכן שנוצר שלכם לאימון מודלי בינה מלאכותית בבעלות Whizi, ולא מוכר את התוכן הזה כנתוני אימון. מחיקת קובץ אינה מסירה את מה שכבר נדון עליו בשיחה, כך שאם המסמך רגיש מספיק כדי להצדיק מחיקה, מחקו גם את הצ'אט.

אפשר לעשות צ'אט עם כמה PDF בבת אחת?

כן, וההשוואה בין מסמכים היא המקום שבו זה הכי שימושי. העלו כמה קבצים לאותה שיחה והתייחסו אליהם בשם בפרומפטים שלכם, אחרת המודל בוחר מאיזה קובץ לענות בלי לספר לכם. השוואת חוזים סעיף מול סעיף, איחוד ממצאים בין דוחות, ומציאת סתירות בין מסמכים, כולם דורשים שהכול יהיה נוכח בבת אחת, וזו עוד סיבה להשתמש במודל בעל הקונטקסט הגדול.

האם זה עובד עם PDF סרוקים?

כן. Whizi מזהה PDF סרוק או עמוס בתמונות לפי כמה טקסט מועט עמודיו מספקים, ומתמלל אותו עמוד אחר עמוד בתהליך ראייה בצד השרת. הדיוק טוב בסריקות נקיות ונפגם ברזולוציה נמוכה, בגופנים לא שגרתיים, בכתב יד ובטבלאות דחוסות. מכיוון שתו שנקרא לא נכון מייצר מספר שגוי בתוך תשובה שוטפת אחרת, בדקו כל מספר שנלקח ממסמך סרוק לעומת העמוד המקורי.

איך יודעים שהתשובה בכלל הגיעה מהמסמך שלי?

דרשו ציטוט. בקשו מהמודל לצטט את הקטע המדויק שתומך בתשובה שלו לצד העמוד או הסעיף, ולציין בבירור אם המידע לא נמצא במסמך. תשובות שמגיעות מנתוני האימון ולא מהקובץ שלכם הן התקלה המסוכנת ביותר בצ'אט על מסמכים, בדיוק כי הן סבירות עבור סוגי מסמכים נפוצים, ולדרוש ציטוט שאפשר לאמת היא הדרך האמינה היחידה להבחין בהבדל.