למה מבחני ההשקה לא יענו על השאלה שלכם
כל מודל חדש שמגיע מגיע עם תרשים שמראה אותו מוביל בסט מבחנים סטנדרטיים. המספרים האלה אמיתיים, והם גם קרובים לחסרי תועלת לגבי ההחלטה מה להשתמש בו ביום שני, משלוש סיבות.
המרווחים קטנים והמשימות לא שלכם. הבדל של שתי נקודות במבחן חשיבה לא מספר לכם כלום על מי כותב אימייל טוב יותר לקוח או שומר על סכימה יותר בעקביות על פני מאתיים שורות.
מבחנים מודדים משימות שקל לנקד. דברים עם תשובה נכונה אחת. רוב העבודה המקצועית לא כזו: טון, מבנה, שיקול דעת על מה להשמיט. שם המודלים נבדלים הכי הרבה, ושם לא נמדד כלום.
השוואות ההשקה נעשות על ידי היצרן. לא בהכרח בחוסר יושר, אבל אף אחד לא מפרסם את ההערכה שבה המודל שלו הגיע במקום השני.
השאלה שכדאי לענות עליה יותר צרה: על המשימות הספציפיות שאתם עושים עשרים פעם בשבוע, מי משני אלה טוב יותר? לזה אין תשובה מפורסמת, ולוקח בערך שעה לגלות.
מה בעצם משתנה בין גרסאות
בין השקות מובילות אחרונות, השיפורים שחשובים בשימוש יומיומי נמצאים באופן עקבי באותם תחומים, והם לעיתים נדירות אלה שמופיעים בהודעת ההשקה.
| מה השתפר | איך שמים לב | האם המבחן מראה את זה |
|---|---|---|
| ציות להנחיות | הוא מפסיק להתעלם מההגבלה השלישית שלכם | לעיתים נדירות |
| הנחיות שליליות | "אל תשתמשו במטאפורות" מתבצע בפועל | לא |
| זיכרון בהקשר ארוך | הוא מוצא את הדבר בעמוד 140, לא רק בעמוד 3 | חלקית |
| משמעת פורמט | לטבלה יש את העמודות שביקשתם, כל פעם | לא |
| חוסר ביטחון מכויל | הוא אומר שהוא לא יודע במקום להמציא | לא |
| שליטה בטון | פחות ניסוחים מחדש לפני שמשהו מוכן לשליחה | לא |
| עומק חשיבה | הוא תופס את המקרה הקצה שהחמצתם | כן, זה זה שהם מודדים |
חמש מהשבע האלה בלתי נראות בתרשים מבחן, והן הסיבה שמודל חדש מרגיש טוב יותר או פחות טוב לעבודה איתו. ציות להנחיות הוא בפרט ההבדל בין טיוטה ראשונה שאתם עורכים לבין טיוטה ראשונה שאתם זורקים.
ההערכה של שעה אחת
עשו את זה במקום לקרוא סיקור השקה. הריצו את שני המודלים זה לצד זה על החומר שלכם.
- אספו חמש משימות אמיתיות מהשבועיים האחרונים. אמיתיות, עם ההקשר האמיתי שלכם מודבק בפנים, לא הנחיות לדוגמה. כללו לפחות משימת כתיבה אחת, משימת פלט מבני אחת, ואחת שדרשה חשיבה על משהו לא מוכר.
- כתבו מה תשובה טובה מכילה לכל אחת, במשפט אחד, לפני שאתם מריצים כלום. זה השלב שמונע מכם להעדיף את התשובה הארוכה והבטוחה יותר, שהיא הטיה חזקה ובעיקר לא מודעת.
- הריצו כל משימה על שני המודלים במקביל כך שאף תשובה לא תעגן את השנייה.
- תנו ניקוד לפי מאמץ העריכה, כלומר כמה עבודה בין הפלט לבין משהו שהייתם שולחים. לא לפי איך זה נשמע.
- שימו לב לגודל הפער, לא רק למנצח. תוצאות זהות אומרות לכם להפסיק לחשוב על בחירת מודל בשביל המשימה הזו, וזה מועיל באמת.
- שמרו את היומן. בעוד שלושה חודשים, כשהגרסה הבאה תגיע, תריצו את אותן חמש משימות ותקבלו תשובה אמיתית בעשרים דקות.
הנקודה האחרונה היא המצטברת. סט הערכה שנשמר הוא הדבר היחיד שהופך כל גרסה עתידית לזולה להערכה.
שש הנחיות שמפרידות בין מודלים מובילים
שאלות כלליות מייצרות תשובות דומות מכל מודל מוכשר. אם אתם רוצים לראות הבדל, הפעילו לחץ על יכולת ספציפית.
- טון בקושי.
כתוב הודעה שאומרת ללקוח שאיחרנו במועד. קח אחריות בלי להתנצל יותר מדי ובלי תירוצים. עד 120 מילים.הבדלי רישום מופיעים באופן מיידי. - הגבלה שלילית.
הסבר [מושג] בלי להשתמש באנלוגיה או במטאפורה.ציות להנחיות שליליות משתנה הרבה יותר ממה שהייתם מצפים. - חילוץ קפדני.
חלץ כל תאריך, סכום וצד לתוך מערך JSON עם המפתחות האלה בדיוק. אם שדה חסר השתמש ב-null. אל תסיק.בודק משמעת פורמט ואת הנטייה למלא חוסרים. - זיכרון בהקשר ארוך. העלו מסמך ארוך ושאלו על משהו באמצע. חושף הקשר שמיש, מה שלא זהה להקשר המפורסם.
- הודאה באי ידיעה. שאלו על משהו אזוטרי באמת או עדכני מאוד. התשובה הטובה ביותר היא "אני לא יודע" ברור או אחזור עם מקורות. המצאה כאן פוסלת ללא קשר לכל מבחן.
- ציות למספר הגבלות. תנו שש הגבלות בבת אחת וספרו כמה שרדו. המבחן הבודד הזה מנבא שביעות רצון יומיומית טוב יותר מכל דבר אחר ברשימה.
התשובה היא בדרך כלל "שניהם, לדברים שונים"
אנשים ניגשים לגרסה חדשה ומצפים לפסק דין, והממצא הכנה אחרי הרצת ההערכה הוא כמעט תמיד מפוצל. מודל אחד מנצח בכתיבה ובטון. השני מנצח במבנה קפדני ובמהירות. הם קרובים מספיק בחשיבה כללית שזה לא מכריע בכלל.
זה לא פשרה, זו התוצאה בפועל, ויש לה משמעות מעשית. אם אתם יכולים להשתמש רק במודל אחד, אתם בוחרים באיזו קטגוריית משימות תהיו פחות טובים. אם אתם יכולים להשתמש בשניהם, השאלה על הגרסה החדשה מפסיקה להיות "האם עליי להחליף" והופכת ל"אילו משימות זזות", שזו החלטה קטנה בהרבה ובעלת סיכון נמוך יותר.
זה גם משנה מה גרסה חדשה אומרת בשבילכם. כשמודלים חדשים נכנסים לסביבת עבודה שכבר יש בה כמה, אתם מריצים שוב את חמש המשימות שלכם, מכוונים את הניתוב, וממשיכים. אין הגירה, אין ביטול מנוי, ואין חודש שימוש במשהו גרוע יותר בגלל שהתחייבתם לפני שבדקתם.
מה לעשות ביום ההשקה
אל תחליפו את הבררת המחדל שלכם באופן מיידי. רשמים משבוע ההשקה נשלטים על ידי חדשנות ועל ידי הדוגמאות שהופצו ראשונות.
הריצו שוב את סט ההערכה שלכם. עשרים דקות אם שמרתם אחד מהפעם הקודמת.
בדקו את הדברים המשעממים. חלון הקשר, האם ההנחיות הקיימות שלכם עדיין מתנהגות באותה צורה, והאם משהו שהסתמכתם עליו השתנה. מודל שטוב יותר באופן כללי יכול להיות גרוע יותר בתבנית הספציפית שלכם, וכדאי לדעת את זה לפני שמעבירים עליו עבודת ייצור.
עדכנו ניתוב לפי משימה, לא באופן גורף. העבירו את הקטגוריות שבהן המודל החדש ניצח בבירור והשאירו את השאר.
חכו שבועיים לפני שתסמכו על המגבלות. דפוסי הכשל של מודל חדש מתגלים בתוך כשבועיים של שימוש נרחב, ולעיתים נדירות הם מופיעים בהודעת ההשקה.
למסגרת הכללית ראו איך לבחור מודל AI, ולמכניקה של הרצת שני מודלים על אותה הנחיה ראו השוואת מודלים זה לצד זה.
- בנו סט של חמש משימות אמיתיות מהעבודה שלכם ושמרו אותו
- כתבו מה תשובה טובה מכילה לפני שאתם קוראים אף פלט
- הריצו את שני המודלים במקביל כך שאף אחד לא יעגן את השני
- תנו ניקוד לפי מאמץ עריכה, לא לפי איך הפלט נשמע
- תעדו את גודל הפער, כי תוצאות זהות הן מידע מועיל
- בדקו ספציפית הגבלות שליליות וציות למספר הגבלות
- חכו שבועיים לפני שמעבירים עבודת ייצור למודל חדש
- עדכנו ניתוב לפי משימה במקום להחליף באופן גורף
שאלות נפוצות
האם עליי לעבור למודל החדש ביותר?
לא ביום ההשקה, ולא באופן גורף. הריצו שוב סט קטן של המשימות האמיתיות שלכם על שני המודלים, תנו ניקוד לפי כמה עריכה כל פלט דורש, והעבירו רק את הקטגוריות שבהן המודל החדש מנצח בבירור. מודל חדש טוב יותר באופן עקבי בדברים מסוימים ולעיתים גרוע יותר באחרים, במיוחד בהנחיות קיימות שכוונו לגרסה הקודמת.
למה מבחני ההשוואה לא תואמים את החוויה שלי?
בגלל שהם מודדים מה שאפשר לנקד באופן אוטומטי, כלומר משימות עם תשובה נכונה אחת. לרוב העבודה המקצועית אין תשובה נכונה אחת, והתכונות שמכריעות שביעות רצון יומיומית, כלומר ציות להנחיות, שליטה בטון, משמעת פורמט, ולדעת מתי להגיד "אני לא יודע", לרוב לא נמדדות. מודל יכול להוביל בכל תרשים מפורסם ועדיין להיות מעצבן יותר לעבודה איתו.
כמה פעמים כדאי לי להעריך מחדש?
בכל פעם שמודל שאתם משתמשים בו מקבל גרסה משמעותית, שכיום זה בערך כל כמה חודשים, וגם פעם בעונה בכל מקרה. שמירת סט קבוע של חמש משימות אמיתיות הופכת את זה לעבודה של עשרים דקות ולא של אחר צהריים שלם, וזו הדרך היחידה לגלות שהניתוב שקבעתם לפני שישה חודשים כבר שגוי.
אני יכול פשוט להשתמש במודל שמנצח באופן כללי?
אתם יכולים, ותקבלו תוצאות פחות טובות בפרוסה צפויה מהעבודה שלכם. הממצא העקבי כשאנשים מעריכים על המשימות שלהם עצמם הוא שמודל אחד מנצח בכתיבה ובטון ואחר מנצח במבנה קפדני ובמהירות, עם חשיבה כללית קרובה מספיק שלא מכריעה כלום. אם שניהם נגישים לכם, הבחירה הופכת להיות לפי משימה ולא לפי מנוי.
האם משנה באיזה מוצר אני מגיע למודל?
המודל הוא המודל, כך שאיכות הפלט דומה בגדול איפה שתגיעו אליו. מה שמשתנה זה אם אתם יכולים להשוות, אם ההקשר עובר כשאתם מחליפים, והאם גרסה חדשה עולה לכם הגירה או שהיא רק עוד אפשרות בבורר. סביבת עבודה עם כמה מודלים הופכת כל גרסה חדשה מהחלטה להתאמה.