איך עושים השוואת מודלי AI זה לצד זה ב-Whizi

תשובה מהירה

כדי לעשות השוואת מודלי AI זה לצד זה ב-Whizi, לחצו על Compare בכותרת הצ'אט, בחרו מודל לכל עמודה, ושלחו פרומפט אחד לשתיהן. לכל עמודה הקשר משלה, כך שאף תשובה לא מוטה על ידי האחרת. השוואה זה לצד זה היא תכונת Powerhouse, וכל תשובה מחויבת בקצב הקרדיטים של המודל שלה.

התשובה הקצרה

לחצו על Compare בכותרת הצ'אט, בחרו מודל לכל עמודה, ושלחו פרומפט אחד לשתיהן. לכל עמודה שיחה חבויה משלה, כך שאף מודל לא רואה את הפלט של השני ואף תשובה לא מוטה על ידי האחרת, וזו כל הסיבה שההשוואה שווה משהו. העמודות זורמות אחת אחרי השנייה, שמאל ואז ימין, כי כל חשבון מריץ יצירה אחת בכל פעם.

השוואה זה לצד זה היא תכונת Powerhouse ומריצה שני מודלים בכל פעם. כל תשובה מחויבת בקצב הקרדיטים של המודל שלה, כך שהשוואה בין מודל של 10 קרדיטים למודל של 20 קרדיטים עולה 30 קרדיטים.

השתמשו בה כדי להחליט איזה מודל צריך להיות המודל שלכם כברירת מחדל לסוג עבודה מסוים. אם אתם רוצים לשפר תשובה אחת ולא להשוות בין שתיים, עשו את הדבר האחר: החליפו מודלים בתוך אותה שיחה ובקשו מהמודל השני לבקר את הראשון.

למה בנצ'מארקים לא עונים על השאלה שלכם

בנצ'מארקים מתפרסמים מדדים ביצועים על משימות סטנדרטיות. השאלה שלכם ממוקדת ושימושית יותר: איזה מודל טוב יותר בדבר שאתם עושים אישית עשרים פעם בשבוע. אלו שאלות שונות, ולשאלה השנייה אין תשובה מתפרסמת כי לאף אחד אין את עומס העבודה שלכם.

הרצת פרומפט אחד על שני מודלים לוקחת בערך שלושים שניות ועונה על השאלה במישרין. החלק החשוב הוא לא שאתם מקבלים שתי תשובות, אלא שאתם מגלים כמה גדול הפער. לפעמים הפלטים דומים מאוד, וזה אומר לכם להפסיק לחשוב על בחירת מודל למשימה הזו. לפעמים אחד מהם לא שמיש, וזה שווה לדעת לפני שבונים על זה תהליך עבודה.

הדבר השני שההשוואה תופסת הוא טעות בטוחה בעצמה. כשלשני מודלים תשובות שונות באופן מהותי לשאלה עובדתית, לפחות אחד מהם טועה, ולא הייתם יודעים את זה מקריאה של אחד מהם בלבד. האות הזה לא קיים בתהליך עבודה עם מודל בודד, בשום מחיר.

קבעו מה 'טוב יותר' אומר לפני שקוראים

המלכודת בהשוואה זה לצד זה היא העדפת הפלט שהוא ארוך יותר, בטוח יותר בעצמו, או מלוטש יותר. אלו לא סימני איכות. קבעו את הקריטריון שלכם קודם, ואז קראו.

משימהמה 'טוב יותר' אומרמה להתעלם ממנו
כתיבהדורש פחות עריכה כדי להיות מוכן לשליחהאורך, אוצר מילים, התלהבות
מחקר עובדתימקורות שמאששים ותומכים בטענהשטף וביטחון
חילוץ מידעסכימה נכונה, בלי שדות מומצאים, תוויות עקביותאיכות הפרוזה סביב הטבלה
חשיבההשלבים מחזיקים מעמד והמקרה הקצה מטופלאם המסקנה תואמת את מה שחשבתם קודם
קודמטפל בנתיב הכשל, ניתן לסקירהחוכמה, קיצור
סיכוםשומר על מה שחשוב ומשמיט את מה שלאהיקף כולל

טריק מעשי: לפני שקוראים אחד מהפלטים, כתבו משפט אחד שמתאר מה תשובה טובה צריכה להכיל. אחר כך קראו. זה לוקח עשר שניות ומונע את הטיית הליטוש, שהיא חזקה ולרוב לא מודעת.

בשאלות עובדתיות, בדקו את חוסר ההסכמה ולא את המנצח. כשלשני מודלים תשובה זהה למספר מסוים ומקור, יש בסיס סביר לביטחון. כשהם חלוקים, זה הדבר שצריך לבדוק, וזו התוצאה הכי שווה בכל התרגיל.

פרומפטים שחושפים הבדלים אמיתיים

חלק מהמשימות מפרידות בין המודלים בצורה חדה וחלקן לא. אם אתם רוצים ללמוד משהו מהשוואה, השתמשו בפרומפטים שמפעילים לחץ על יכולת ספציפית.

  • טון בזמן קושי. כתוב פנייה ללקוח שמסבירה שפספסנו את המועד, תוך לקיחת אחריות בלי התנצלות מוגזמת ובלי תירוצים. עד 120 מילים. הבדלים ברגיסטר מתגלים כאן באופן מיידי.
  • חילוץ קפדני. חלץ מהטקסט הזה כל תאריך, סכום וצד לתוך מערך JSON עם המפתחות האלו בדיוק. אם שדה חסר, השתמש ב-null. אל תסיק בעצמך. בודק משמעת פורמט ואת הנטייה להמציא.
  • חשיבה עם מלכודת. תנו בעיה עם תשובה שגויה שנשמעת סבירה, כמו שאלת שיעור או פרופורציה שהנתיב האינטואיטיבי בה שגוי. מודלים נבדלים בשאלה אם הם נוקטים בקיצור הדרך.
  • זיכרון בהקשר ארוך. העלו מסמך ארוך ושאלו על משהו שנמצא באמצע. חושף הקשר שמיש באמת, לא הקשר מוצהר.
  • הודאה באי ידיעה. מה הוכרז בנוגע ל-[משהו סתמי ממש או עדכני מאוד]? התשובה הטובה ביותר היא "אני לא יודע" ברור, או שליפה מבוססת מקור. המצאה כאן פוסלת.
  • עמידה בהגבלה שלילית. הסבר את X בלי להשתמש באנלוגיה או מטאפורה. עמידה בהוראות שליליות משתנה יותר משהייתם מצפים.

הריצו השוואות על העבודה האמיתית שלכם ולא על חידות. מודל שטוב יותר בדוח הרבעוני שלכם שימושי יותר ממודל שטוב יותר בחידת לוגיקה.

להפוך שבוע של השוואות למפת ניתוב

השוואה בודדת מעניינת. שבוע שלמות מהן ניתן להפוך לפעולה. השיטה:

  1. במשך חמישה ימים, כשמשימה חשובה, הריצו אותה על שני מודלים במקום אחד.
  2. רשמו את סוג המשימה, את המנצח, ומה גודל הפער. שלוש מילים מספיקות.
  3. בסוף השבוע, בדקו איפה מודל אחד ניצח שוב ושוב ואיפה הפלטים היו זהים בפועל.
  4. קבעו את ברירת המחדל שלכם מזה, והפסיקו להשוות במשימות שבהן הפער היה תמיד אפסי.

מה שאנשים בדרך כלל מוצאים הוא שההשוואה חשובה במיעוט מהעבודה שלהם ומיותרת בשאר. חיפושים עובדתיים מהירים, שכתובים פשוטים ועיצוב שגרתי כמעט ולא מפרידים בין המודלים. כתיבה שלקוח יקרא, מחקר שיעצב החלטה, וחשיבה על משהו לא מוכר, מפרידים ביניהם הרבה.

זו התוצאה המשולמת: אתם מפסיקים להשוות כשזה לא משנה, ושומרים על ההשוואה למשימות שבהן היא משנה את התוצאה.

השוואה זה לצד זה מול השוואה רציפה

שתי טכניקות שונות, שכדאי להבחין ביניהן.

זה לצד זה מריץ את אותו פרומפט על שני מודלים שלא רואים את הפלט זה של זה. לכל עמודה שיחה חבויה משלה, עם קידומת [Compare] בשם, שנשארת מחוץ לסרגל הצד, כך ששאלות המשך נשארות מבחן הוגן: לשני המודלים יש הקשר רב-תורות עצמאי. זה הכלי הנכון לבחירת מודל כברירת מחדל ולתפיסת חוסר הסכמה עובדתי.

רציפה פירושה לקבל תשובה, ואז להחליף מודלים בתוך אותה שיחה ולבקש מהמודל החדש לבקר אותה. השתמשו בזה כשאתם רוצים למצוא את הפגם ולא לעשות השוואה, כי המודל השני יכול להתמודד ישירות עם הטיעון הספציפי. ראו החלפת מודלים באמצע שיחה.

כלל גס: זה לצד זה כדי להחליט איזה מודל, רציפה כדי לשפר תשובה.

רשימת בדיקה
  • כתבו וחדדו את הפרומפט בצ'אט רגיל לפני ההשוואה
  • קבעו מה 'טוב יותר' אומר למשימה הזו לפני שקוראים אחד מהפלטים
  • כתבו משפט אחד שמתאר תשובה טובה, ואז קראו, כדי להימנע מהטיית הליטוש
  • בשאלות עובדתיות, התייחסו לחוסר הסכמה כתגלית ובדקו אותה
  • השוו על העבודה האמיתית שלכם, לא על חידות
  • רשמו את המנצח ואת גודל הפער במשך שבוע, ואז קבעו ברירות מחדל מהתבנית
  • הפסיקו להשוות במשימות שבהן הפער תמיד אפסי

שאלות נפוצות

כמה מודלים אפשר להשוות בכל פעם?

השוואה זה לצד זה היא תכונת Powerhouse, ומריצה שני מודלים בכל פעם, במתכוון: שתי עמודות זה הפריסה שאפשר לקרוא בעיון באמת. שלוש עמודות נוטות להפוך לריפרוף, וריפרוף מחמיץ את המטרה, כי הערך של התרגיל הוא בלשים לב איפה התשובות נבדלות באמת.

האם השוואה זה לצד זה משתמשת ביותר מההודעות החודשיות שלי?

כן, זה עולה כפול: שני מודלים מייצרים כל אחד תשובה, וכל תשובה מחויבת בקצב הקרדיטים של המודל שלה, כך שהשוואה בין מודל של 10 קרדיטים למודל של 20 קרדיטים צורכת 30 קרדיטים ולא 10 או 20. תפיסת תשובה שגויה או טיוטה לא שמישה לפני שהיא מוציאה לשולח שווה לרוב את זה. הגישה היעילה היא להשוות בהחלטות ובתוצרים, ולהשתמש במודל בודד לחיפושים שגרתיים ושכתובים מהירים.

מה אם שתי התשובות טובות באותה מידה?

זו תוצאה אמיתית ושימושית: היא אומרת לכם שהמשימה הזו לא תלויה בבחירת מודל, אז הפסיקו להשקיע בזה תשומת לב והשתמשו בברירת המחדל שלכם. רוב עומסי העבודה מתחלקים כך, עם רוב משימות שבהן המודלים החליפיים ומיעוט שבו הפער גדול. לגלות מה זה מה זו כל המטרה של הרצת השוואות במשך שבוע.

איך נמנעים מלבחור פשוט את התשובה שנשמעת טוב יותר?

קבעו את הקריטריון שלכם לפני שקוראים. פלטים ארוכים יותר, בטוחים יותר בעצמם ומלוטשים יותר מועדפים באופן שיטתי גם כשהם גרועים יותר, וההטיה הזו לרוב לא מודעת. כתיבת משפט אחד על מה שתשובה טובה צריכה להכיל, לפני שמסתכלים, מספיקה כדי לנטרל את רוב האפקט. בעבודה עובדתית, שפטו לפי האם המקורות מאששים ותומכים בטענה ולא לפי איך התשובה נשמעת.

אילו שני מודלים כדאי להשוות?

השוו בין השניים שבאמת מתלבטים ביניהם למשימה הספציפית הזו, שלרוב האנשים זה Claude מול GPT לכתיבה וחשיבה, או מודל עם הקשר גדול מול ברירת המחדל שלכם כשמעורבים מסמכים. השוואה בין מודל שלא תשתמשו בו לעולם למודל המועדף עליכם לא מגלה לכם שום דבר שתפעלו לפיו.