שום דבר בתהליך לא בודק אם התשובה נכונה
כשאתם שואלים צ'אטבוט AI שאלה, הוא לא מחפש שום דבר. הוא מייצר טקסט, כמה תווים בכל פעם, שמתאים לתבנית שבה נהוגה תשובה נכונה לשאלה כזו להיכתב. זו כל המשימה שלו. להתאים לתבנית ולהיות נכון הם שתי מטרות שונות, ושום דבר בתהליך לא שואף למטרה השנייה.
רוב הזמן אתם בכלל לא שמים לב, כי שתי המטרות חופפות. הטקסט שממנו המערכות האלה למדו נכתב בעיקר על ידי אנשים שבעיקר צדקו, כך שטקסט בצורת תשובה הוא בדרך כלל גם טקסט נכון. החפיפה מצטמצמת בקצוות: עובדות נדירות, עדכניות, ספציפיות מאוד, או פשוט נעדרות ממה שהמודל קרא. בקצוות האלה, לייצר את הצורה של תשובה נכונה עדיין קל. לייצר את התוכן שלה, לא. מה שמתקבל הוא משפט בנוי כמו עובדה, עם מספר במקום הנכון ושם שנשמע אמין מצורף אליו, שמתאר משהו שמעולם לא קרה.
זה גם מסביר למה השאלה הבאה המתבקשת נכשלת. השאלה "אתה בטוח?" מרגישה כמו ביקורת. היא לא. הסכמה מתאימה לתבנית של תשובה מועילה, כך שלחץ נוטה לייצר הסכמה, ומודל לעיתים קרובות יתנצל ויחליף תשובה נכונה בתשובה גרועה יותר. בדקו זאת בשתי דקות: שאלו משהו שאתם כבר יודעים, קבלו את התשובה הנכונה, ואז אמרו "זה לא נשמע נכון" וצפו מה קורה. מה שחוזר אליכם זה אותה מנגנון שמייצר טקסט מתפייס. לגרסת הבסיס של איך כל זה בכלל בנוי, מה זה AI מכסה את זה בלי מתמטיקה.
חמשת המקומות שבהם הוא טועה הכי הרבה
הטעויות לא מתפזרות באופן שווה על כל מה שאתם עשויים לשאול. הן מתרכזות. ללמוד את חמשת האשכולות נותן לכם אזעקה פנימית קטנה שנדלקת ברגע הנכון, וזה שווה יותר מתחושת זהירות כללית שמצלצלת כל הזמן ואז מפסיקה לצלצל בכלל.
| איפה זה מחליק | איך זה נראה | דוגמה בשורה אחת |
|---|---|---|
| עובדות ומספרים ספציפיים | נתון מדויק בלי שום דבר מאחוריו | אומר לכם שחנות מקומית נפתחה ב-1987 כשהיא נפתחה ב-1994 |
| ציטוטים, מובאות, קישורים | כותרות שנשמעות אמיתיות, כתובות URL שנראות אמיתיות, אף אחת מהן לא נטענת | מחקר של שני חוקרים אמיתיים, בכתב עת אמיתי, שמעולם לא נכתב |
| כל דבר שקרה אחרי מועד האימון | תשובות בטוחות על עולם שהפסיק להתעדכן לפני חודשים | מצטט את מחיר המנוי של השנה שעברה לתוכנית ששונתה במרץ |
| חשבון אריתמטי וספירה | שיטה נכונה, סכום שגוי | מסכם אחת עשרה שורות בחשבונית ומגיע לתוצאה שגויה ב-40 דולר |
| שאלות שנושאות בתוכן את התשובה שלהן | הסכמה מחופשת כניתוח | "למה X הבחירה הטובה יותר?" מחזיר את הטיעון בעד X ולעולם לא מטיל בו ספק |
השורה של הציטוטים נושאת תג מחיר מפורסם. ביוני 2023 שופט פדרלי קנס שני עורכי דין מניו יורק ואת המשרד שלהם ב-$5,000 על הגשת תזכיר שנבנה על שישה תיקי בית משפט ש-ChatGPT המציא, כולל שמות, ציטוטים ופסקאות מצוטטות (Mata v. Avianca). השורה האחרונה, לעומת זאת, היא זו שאתם גורמים לעצמכם, והיא הנפוצה ביותר בשימוש בפועל. לשאול "למה X טוב יותר מ-Y" כמעט מבטיח טיעון בעד X, ושאלה שמכילה "בטח" או "האם זה לא נכון ש" בדרך כלל מקבלת כן. שאלו במקום זאת: "השוו בין X ל-Y למצב הזה, ואז תנו לי את הטיעון החזק ביותר נגד מה שבחרתם". ניסוח שאלות כך שהן לא מבריחות בתוכן את התשובה הוא חצי ממה שאנשים קוראים לו הנחיה (פרומפטינג), ואיך לדבר עם AI מכסה את החצי השני. עוד תופעה שכדאי להכיר מוקדם. בשיחה ארוכה מאוד, או אחרי שהדבקתם מסמך ארוך מאוד, פרטים מההתחלה יכולים להיעלם מטווח הראייה של המודל, והוא ימלא את החור במקום לומר לכם שאיבד את החוט. זו מגבלת קיבולת ולא בעיית אמת, ומה זה חלון הקשר מסביר איפה התקרה נמצאת.
הטון הבטוח הוא לא בלוף
רוב האנשים מגיעים לכאן עם הנחה סבירה: הדבר יודע כמה הוא בטוח ומסתיר את הספק כדי להיראות מוכשר. ההנחה הזו שגויה, וזה משנה, כי היא שולחת אתכם לחפש איתות ביטחון שמעולם לא היה קיים.
אין מד ביטחון שמוסתר מכם. המערכת לא יושבת על מספר פרטי שאומר 62 אחוז ובוחרת להישמע כמו 100. היא מייצרת תשובה שגויה דרך אותו תהליך, באותה שטף, כמו תשובה נכונה. בדיוק בגלל זה הטון חסר ערך כאיתות כאן, בצורה שהוא לא אצל בני אדם. גם היסוס כמו "אני לא בטוח לגמרי, אבל" הוא טקסט שנוצר בדיוק כמו כל השאר. הוא מופיע כי הניסוח הזה מתאים לשאלות מהצורה הזו. שום אזהרה פנימית לא נדלקה. תבקשו ממודל לדרג את הביטחון העצמי שלו מתוך עשר ותקבלו מספר, לעיתים קרובות גבוה, שיושב ממש ליד ציטוט שהוא המציא. הדירוג נוצר על ידי אותו תהליך כמו הציטוט.
לכן הוראות כמו "תענה רק אם אתה בטוח" או "אל תמציא כלום" עוזרות פחות ממה שאנשים מקווים. להוסיף "תגיד שאתה לא יודע אם אתה לא יודע" לשאלה חשובה עדיין שווה לעשות, מכיוון שמודלים חדשים יותר נמנעים מלענות בקלות רבה יותר משהיו פעם, אבל תתייחסו לזה כדחיפה קלה ולא כהבטחה. הגרסה האמינה של הרעיון הזה פונה החוצה: תגרמו לתשובה להראות לכם משהו שאתם יכולים לפתוח. כשאפליקציה מחפשת באינטרנט ומצרפת קישורים, אתם יכולים לקרוא את הדף בעצמכם ולהפסיק לקחת את המילה שלה כמובנת מאליה. כשהיא עונה רק מהזיכרון, המילה שלה היא כל מה שיש לכם.
ארבע בדיקות, לפי כמה הן עולות לכם
אתם לא הולכים לאמת הכול, ולנסות זה יסתיים בכך שלא תאמתו כלום. מה שאתם רוצים זו בדיקה שעולה פחות מהטעות עצמה. ארבע הבדיקות האלה נעות מכמעט חינם ועד מעצבנות במידה קלה, ולרוב השאלות הראשונה שאתם פונים אליה מספיקה.
- בקשו מקורות, ואז פתחו אותם. לא "תן לי מקורות" כטקס. תלחצו עליהם. קישור מת, או דף חי שלא מכיל את הטענה, סוגר את השאלה תוך כעשר שניות.
- שאלו שוב בצ'אט חדש. אותה שאלה, שיחה חדשה, בלי שום דבר מהוויכוח הקודם. אם המספרים, השמות או התאריכים חוזרים שונים, המודל מילא חורים במקום לזכור משהו. זה לא עולה כלום ותופס נתח מפתיע של פרטים ממציאים.
- שאלו מודל אחר. הבדיקה בעלת הערך הגבוה ביותר לשאלות עובדתיות. הדביקו את אותה שאלה לספק שני והשוו את הפרטים, לא את הטון.
- חפשו את זה בדרך הרגילה. לכל דבר שתשלחו, תחתמו, תפרסמו או תוציאו עליו כסף, תנו לזה תשעים שניות במנוע חיפוש. AI הוא מעבר ראשוני מצוין. מעבר ראשוני הוא לא אימות.
הנקודה השלישית מוכיחה את מקומה. שני מודלים שנבנו על ידי חברות שונות, אומנו על נתונים שונים בשיטות שונות, יכולים שניהם לטעות באותה שאלה. הם מאוד לעיתים רחוקות ממציאים את אותו פרט שגוי, כי פרט מומצא נובע מהחורים הספציפיים של מערכת מסוימת אחת. כש-Claude ו-ChatGPT נותנים לכם באופן עצמאי את אותו נתון, הנתון הזה כנראה אמיתי. כשהם חלוקים בדעתם, איתרתם בדיוק את המשפט ששווה לבדוק, וזה עדיף על תחושה מעורפלת שמשהו בתשובה לא בסדר. לבדיקה מזדמנת, השכבות החינמיות של שני ספקים מספיקות ולא עולות כלום. זה מפסיק להיות חינם כשבדיקה צולבת הופכת להרגל, כי גישה בתשלום עולה בערך 20 דולר לחודש לכל ספק, וזה הפער שמנוי מרובה מודלים כמו Whizi סוגר. שימוש בכמה מודלים יחד עובר על התהליך.
איפה זה חשוב, ואיפה זה באמת לא
הרגל אימות שחל על הכל קורס תוך שבוע. רוב מה שאתם שואלים הוא סיכון נמוך ובודק את עצמו. בקשו גרסה קצרה יותר של האימייל שלכם ותוכלו לראות אם הוא קצר יותר ואם הוא עדיין אומר את מה שהתכוונתם. אותו דבר לגבי סיעור מוחות, בחירת שמות, יצירת מתווה, ניסוח טיוטה, תרגום הודעה שתקראו לפני שליחתה, או הפיכת פתקים מבולגנים לרשימה. אתם הבדיקה, והטעות מופיעה מולכם מיד.
שתי שאלות ממיינות כל משימה לתא הנכון, ולוקח בערך שלוש שניות לשאול אותן את עצמכם.
- אם זה שגוי, מי יגלה, ומתי? אתם, עוד עשר שניות תוך כדי קריאה, או לקוח, בעוד שלושה חודשים?
- אני יכול לבטל את זה? למחוק פסקה גרועה זה חינם. להגיש מחדש דוח מס, לבטל הצעת מחיר ששלחתם, או להפוך תשלום, זה לא.
אם אחת התשובות גורמת לכם לעצור, תאמתו כל טענה ספציפית לפני שאתם פועלים לפיה. החברים הברורים בתא הזה: שמות ומינונים של תרופות, מועדי הגשה משפטיים ואחרים, נתוני מס, תנאי חוזה, כל דבר שנוגע לבריאות או למעמד ההגירה של מישהו, וקוד שמזיז כסף או מטפל בנתונים אישיים. מילה נרדפת שגויה באימייל גורמת לכם להיראות קצת מוזרים ליום אחד. מינון שגוי או מועד שהוחמץ הם לא משהו שה-AI מתמודד איתו אחר כך. האם AI בטוח לשימוש מכסה את הצד הזה בהרחבה, כולל מה אסור לכם להדביק בכלל. התחילו בהרגל אחד: ברגע שתשובה מכילה מספר, שם, תאריך או קישור, התייחסו לחלק הזה בלבד כלא מאומת ובדקו אותו. השאר בדרך כלל בסדר.
- התייחסו לכל מספר, שם, תאריך וקישור בתשובה כלא מאומתים עד שתבדקו אותם.
- ותרו על "אתה בטוח?" כבדיקה, כי לחץ מייצר הסכמה ולא תיקון.
- בקשו מקורות, פתחו אותם, ואשרו שהדף באמת אומר את מה שהתשובה טענה.
- שאלו שוב שאלה חשובה בצ'אט חדש וראו אם הפרטים נשארים זהים.
- הציגו שאלות עובדתיות למודל שני מחברה אחרת לפני שאתם סומכים עליהן.
- נסחו מחדש שאלות מכוונות כך שהן לא יגידו למודל איזו תשובה אתם רוצים.
- שאלו מי יגלה אם זה שגוי ואם אפשר לבטל את זה, ואז תאמתו בהתאם.
שאלות נפוצות
מה זו הזיה של AI?
הזיה היא תשובה בטוחה ומנוסחת היטב שפשוט לא נכונה: סטטיסטיקה מומצאת, ציטוט שלא קיים, פיצ'ר שלמוצר מעולם לא היה. השם לא מוצלח, כי שום דבר לא מדומיין. המערכת ייצרה טקסט שמתאים לתבנית של תשובה נכונה, ובמקרה הזה התבנית והאמת לא הסתדרו. מה זו הזיה של AI מכסה למה המודל מייצר אותן ומה מודל שני תופס.
למה AI ממציא דברים במקום לומר שהוא לא יודע?
לומר "אני לא יודע" הוא רק אחת מתשובות רבות שמתאימות לשאלה, ותשובה שוטפת בדרך כלל מתאימה יותר טוב. למודל אין שלב נפרד שבודק עובדה לפני שהוא מייצר אותה, אז אין מה שיפעיל סירוב. מודלים חדשים יותר נמנעים מלענות יותר מאשר ישנים יותר, ולבקש במפורש "אין לי מושג" כשאין לו באמת עוזר קצת.
אפשר לסמוך על תשובות של AI?
סמכו על ההיגיון, המבנה והניסוח, שבהם הכלים האלה חזקים באמת. אל תסמכו על הפרטים בלי לבדוק: מספרים, שמות, תאריכים, ציטוטים ומובאות וכל דבר עדכני. החלוקה הזו היא הגרסה המעשית של אמון כאן, והיא מאפשרת לכם להשתמש ב-AI מדי יום בלי להיכוות.
האם השאלה "אתה בטוח?" מתקנת תשובה שגויה?
לעיתים רחוקות, וזה יכול להחמיר את המצב. מודלים נוטים להתאים את עצמם ללחץ, כך שהם לעיתים קרובות נוטשים תשובה נכונה ומחליפים אותה בתשובה חלשה יותר. צ'אט חדש עם אותה שאלה הוא בדיקה טובה בהרבה, כי התשובה השנייה מיוצרת בלי הלחץ של הספק שלכם.
איך בודקים תשובה של AI במהירות?
פתחו כל מקור שהוא נתן לכם ואשרו שהוא אומר את מה שנטען. אם אין מקורות, שאלו את אותה שאלה בצ'אט חדש וראו אם הפרטים נשמרים. לכל דבר עובדתי שאתם מתכננים לפעול לפיו, הציגו אותו למודל שני מספק אחר, כי שתי מערכות לעיתים רחוקות ממציאות את אותו פרט.