วิธีดูว่าโมเดล AI ใหม่ดีกว่าเดิมสำหรับงานคุณจริงหรือไม่

คำตอบโดยสรุป

การประเมินโมเดล AI ที่ดีที่สุดคือทดสอบกับงานจริงของคุณเอง ไม่ใช่อ่านผลเบนช์มาร์กตอนเปิดตัว รวบรวมงานจริงห้างานจากสองสัปดาห์ที่ผ่านมา เขียนไว้ก่อนว่าคำตอบที่ดีควรมีอะไรบ้างก่อนเริ่มทดสอบ รันทั้งสองโมเดลพร้อมกัน และให้คะแนนจากปริมาณการแก้ไขที่ต้องทำ ไม่ใช่จากความไพเราะของคำตอบ เก็บบันทึกนี้ไว้ใช้ครั้งต่อไป

ทำไมเบนช์มาร์กตอนเปิดตัวถึงตอบคำถามของคุณไม่ได้

ทุกครั้งที่มีการเปิดตัวโมเดลระดับแนวหน้า จะมาพร้อมกราฟที่แสดงว่านำหน้าในชุดการทดสอบมาตรฐาน ตัวเลขเหล่านั้นเป็นของจริง แต่แทบไม่มีประโยชน์ในการตัดสินใจว่าคุณควรใช้อะไรในวันจันทร์ ด้วยเหตุผลสามข้อ

ส่วนต่างมีน้อยและงานในเบนช์มาร์กไม่ใช่งานของคุณ ความต่างสองแต้มในเบนช์มาร์กการให้เหตุผลไม่บอกอะไรเลยว่าโมเดลไหนเขียนอีเมลถึงลูกค้าได้ดีกว่า หรือรักษาโครงสร้างข้อมูลได้แม่นยำกว่าตลอดสองร้อยแถว

เบนช์มาร์กวัดเฉพาะงานที่ให้คะแนนได้ง่าย คืองานที่มีคำตอบถูกต้องตายตัว แต่งานอาชีพส่วนใหญ่ไม่มีคำตอบแบบนั้น ไม่ว่าจะเป็นน้ำเสียง โครงสร้าง หรือการตัดสินใจว่าควรตัดอะไรออก ซึ่งเป็นจุดที่โมเดลต่างกันมากที่สุดและไม่มีการวัดผลเลย

การเปรียบเทียบตอนเปิดตัวทำโดยผู้ผลิตเอง ไม่ได้หมายความว่าไม่ซื่อสัตย์เสมอไป แต่ไม่มีใครเผยแพร่ผลทดสอบที่โมเดลของตัวเองได้อันดับสอง

คำถามที่ควรตอบจริง ๆ นั้นแคบกว่ามาก คืองานเฉพาะที่คุณทำซ้ำยี่สิบครั้งต่อสัปดาห์ โมเดลไหนในสองตัวนี้ดีกว่ากัน ไม่มีคำตอบที่เผยแพร่ไว้ล่วงหน้า และใช้เวลาหาคำตอบเองเพียงราวหนึ่งชั่วโมง

สิ่งที่มักเปลี่ยนจริงระหว่างการอัปเดตแต่ละรุ่น

ในการเปิดตัวโมเดลระดับแนวหน้าช่วงหลัง จุดที่พัฒนาขึ้นจริงในการใช้งานประจำวันมักอยู่ในหมวดเดิม ๆ และแทบไม่ใช่จุดที่ถูกเน้นในประกาศเปิดตัว

สิ่งที่พัฒนาขึ้นคุณสังเกตเห็นได้อย่างไรเบนช์มาร์กแสดงผลหรือไม่
ความสามารถในการทำตามคำสั่งมันเลิกเมินเงื่อนไขข้อที่สามของคุณน้อยครั้ง
คำสั่งเชิงปฏิเสธ"ห้ามใช้การเปรียบเทียบ" ถูกปฏิบัติตามจริงไม่
การจดจำบริบทยาวมันหาสิ่งที่อยู่หน้า 140 เจอ ไม่ใช่แค่หน้า 3บางส่วน
ความเป็นระเบียบในการจัดรูปแบบตารางมีคอลัมน์ตามที่คุณขอทุกครั้งไม่
ความไม่แน่นอนที่ปรับเทียบแล้วมันบอกว่าไม่รู้แทนที่จะกุคำตอบขึ้นมาไม่
การควบคุมน้ำเสียงแก้คำตอบน้อยลงก่อนจะส่งได้ไม่
ความลึกของการให้เหตุผลมันจับประเด็นขอบเขตที่คุณพลาดได้ใช่ นี่คือสิ่งเดียวที่พวกเขาวัด

ห้าในเจ็ดข้อนี้มองไม่เห็นในกราฟเบนช์มาร์กเลย และเป็นเหตุผลที่ทำให้โมเดลใหม่รู้สึกดีขึ้นหรือแย่ลงเวลาใช้งานจริง โดยเฉพาะความสามารถในการทำตามคำสั่งคือความต่างระหว่างร่างแรกที่คุณแค่แก้ไข กับร่างแรกที่คุณต้องทิ้งไปเลย

การประเมินภายในหนึ่งชั่วโมง

ทำแบบนี้แทนการอ่านข่าวเปิดตัว รันโมเดลทั้งสองตัวเทียบกันโดยใช้เนื้อหาของคุณเอง

  1. รวบรวมงานจริงห้างาน จากสองสัปดาห์ที่ผ่านมา ต้องเป็นงานจริงพร้อมบริบทจริงที่คุณวางลงไป ไม่ใช่พรอมต์เล่น ๆ ให้มีอย่างน้อยหนึ่งงานเขียน หนึ่งงานที่ต้องได้ผลลัพธ์เป็นโครงสร้าง และหนึ่งงานที่ต้องใช้เหตุผลกับเรื่องที่ไม่คุ้นเคย
  2. เขียนไว้ก่อนว่าคำตอบที่ดีควรมีอะไรบ้าง สำหรับแต่ละงาน เป็นประโยคเดียว ก่อนที่จะเริ่มรันจริง ขั้นตอนนี้ช่วยป้องกันไม่ให้คุณเอนเอียงไปชอบคำตอบที่ยาวกว่าและดูมั่นใจกว่า ซึ่งเป็นอคติที่รุนแรงและมักเกิดโดยไม่รู้ตัว
  3. รันแต่ละงานกับทั้งสองโมเดล พร้อมกัน เพื่อไม่ให้คำตอบหนึ่งถูกโน้มนำโดยอีกคำตอบ
  4. ให้คะแนนจากปริมาณการแก้ไข คือระยะห่างระหว่างคำตอบที่ได้กับสิ่งที่คุณจะส่งจริง ไม่ใช่จากความไพเราะของถ้อยคำ
  5. จดขนาดของความต่าง ไม่ใช่แค่ว่าใครชนะ ถ้าผลลัพธ์ใช้แทนกันได้ นั่นบอกคุณว่าไม่ต้องคิดเรื่องเลือกโมเดลสำหรับงานนั้นอีก ซึ่งมีประโยชน์จริง
  6. เก็บบันทึกไว้ อีกสามเดือนข้างหน้าเมื่อมีการเปิดตัวรุ่นใหม่ คุณแค่รันห้างานเดิมซ้ำและได้คำตอบจริงภายในยี่สิบนาที

ข้อสุดท้ายนี้คือข้อที่ทวีค่าไปเรื่อย ๆ ชุดการประเมินที่เก็บไว้เป็นสิ่งเดียวที่ทำให้การประเมินโมเดลรุ่นถัดไปทำได้ง่ายและถูกลง

หกพรอมต์ที่แยกความต่างของโมเดลระดับแนวหน้า

คำถามทั่วไปมักได้คำตอบคล้ายกันจากโมเดลที่มีความสามารถสูงทุกตัว ถ้าอยากเห็นความต่างจริง ต้องกดดันความสามารถเฉพาะจุด

  • น้ำเสียงภายใต้สถานการณ์ยาก เขียนข้อความแจ้งลูกค้าว่าเราพลาดกำหนดส่งงาน รับผิดชอบโดยไม่ขอโทษพร่ำเพรื่อและไม่หาข้อแก้ตัว ความยาวไม่เกิน 120 คำ ความต่างของระดับภาษาจะเห็นได้ทันที
  • เงื่อนไขเชิงปฏิเสธ อธิบาย [แนวคิด] โดยห้ามใช้การเปรียบเทียบหรืออุปมาใด ๆ การปฏิบัติตามคำสั่งเชิงปฏิเสธแตกต่างกันมากกว่าที่คุณคิด
  • การดึงข้อมูลแบบเข้มงวด ดึงวันที่ จำนวนเงิน และคู่สัญญาทุกรายการใส่ใน JSON array ด้วยคีย์เหล่านี้เท่านั้น หากไม่มีข้อมูลให้ใส่ null ห้ามคาดเดา ทดสอบวินัยด้านรูปแบบและแนวโน้มที่จะเติมข้อมูลเอาเอง
  • การจดจำบริบทยาว อัปโหลดเอกสารยาว ๆ แล้วถามเรื่องที่อยู่ตรงกลาง จะเผยให้เห็นบริบทที่ใช้งานได้จริง ซึ่งไม่เหมือนกับบริบทที่โฆษณาไว้
  • การยอมรับว่าไม่รู้ ถามเรื่องที่คลุมเครือจริง ๆ หรือเพิ่งเกิดขึ้นล่าสุด คำตอบที่ดีที่สุดคือ "ฉันไม่ทราบ" ที่ชัดเจน หรือคำตอบที่มีแหล่งอ้างอิง การแต่งเรื่องขึ้นมาในจุดนี้ตัดสิทธิ์ทันทีไม่ว่าเบนช์มาร์กจะบอกอะไร
  • การปฏิบัติตามหลายเงื่อนไขพร้อมกัน ให้เงื่อนไขหกข้อพร้อมกันแล้วนับว่าเหลือกี่ข้อที่ทำได้ครบ การทดสอบข้อเดียวนี้ทำนายความพึงพอใจในการใช้งานประจำวันได้ดีกว่ารายการอื่นทั้งหมด

คำตอบมักเป็น "ทั้งคู่ ใช้คนละแบบ"

คนมักเข้าหาการเปิดตัวโมเดลใหม่โดยอยากได้คำตัดสินชัดเจน แต่ผลลัพธ์จริงหลังการประเมินมักแบ่งกันเสมอ โมเดลหนึ่งชนะด้านการเขียนและน้ำเสียง อีกตัวชนะด้านโครงสร้างที่เข้มงวดและความเร็ว ส่วนการให้เหตุผลทั่วไปนั้นใกล้เคียงกันจนไม่เป็นตัวตัดสิน

นี่ไม่ใช่การพูดกลาง ๆ ให้ปลอดภัย แต่เป็นผลลัพธ์จริง และมีนัยเชิงปฏิบัติตามมา ถ้าคุณใช้ได้แค่โมเดลเดียว คุณกำลังเลือกว่าจะยอมแย่ในงานประเภทไหน แต่ถ้าใช้ได้ทั้งสองตัว คำถามตอนเปิดตัวจะไม่ใช่ "ควรเปลี่ยนไหม" อีกต่อไป แต่กลายเป็น "งานไหนควรย้าย" ซึ่งเป็นการตัดสินใจที่เล็กกว่าและเสี่ยงน้อยกว่ามาก

มันยังเปลี่ยนความหมายของการเปิดตัวโมเดลใหม่สำหรับคุณด้วย เมื่อโมเดลใหม่เข้ามาในพื้นที่ทำงานที่มีหลายโมเดลอยู่แล้ว คุณแค่รันห้างานเดิมซ้ำ ปรับการจัดสรรงาน แล้วทำงานต่อไป ไม่ต้องย้ายระบบ ไม่ต้องยกเลิกสมาชิก และไม่ต้องทนใช้ของที่แย่กว่าไปทั้งเดือนเพราะรีบตัดสินใจก่อนทดสอบ

สิ่งที่ควรทำในวันเปิดตัว

อย่าเปลี่ยนโมเดลหลักของคุณทันที ความรู้สึกในสัปดาห์เปิดตัวมักถูกครอบงำด้วยความแปลกใหม่และตัวอย่างที่ถูกแชร์ก่อนใคร

รันชุดประเมินของคุณซ้ำ ใช้เวลาแค่ยี่สิบนาทีถ้าคุณเก็บชุดเดิมไว้จากครั้งก่อน

ตรวจสอบเรื่องน่าเบื่อ ๆ ก่อน เช่น ขนาดหน้าต่างบริบท พรอมต์เดิมของคุณยังทำงานเหมือนเดิมหรือไม่ และมีอะไรที่คุณเคยพึ่งพาเปลี่ยนไปหรือเปล่า โมเดลที่ดีขึ้นโดยรวมอาจแย่ลงกับเทมเพลตเฉพาะของคุณ ซึ่งควรรู้ไว้ก่อนย้ายงานจริงไปใช้

ปรับการจัดสรรงานทีละประเภท ไม่ใช่เปลี่ยนทั้งหมดในคราวเดียว ย้ายเฉพาะประเภทงานที่โมเดลใหม่ชนะอย่างชัดเจน ส่วนที่เหลือปล่อยไว้ก่อน

รอสักสองสัปดาห์เพื่อดูข้อจำกัด จุดอ่อนของโมเดลใหม่มักปรากฏชัดหลังใช้งานกว้างขวางไปแล้วราวสองสัปดาห์ และแทบไม่เคยถูกพูดถึงในประกาศเปิดตัว

สำหรับกรอบการทำงานโดยรวม อ่านได้ที่ วิธีเลือกโมเดล AI และสำหรับวิธีการรันสองโมเดลกับพรอมต์เดียวกัน อ่านได้ที่ การเปรียบเทียบโมเดลแบบเคียงข้างกัน

เช็กลิสต์การทำงาน
  • รวบรวมชุดงานจริงห้างานจากงานของคุณเองแล้วเก็บไว้
  • เขียนไว้ก่อนว่าคำตอบที่ดีควรมีอะไรบ้าง ก่อนอ่านคำตอบทั้งสองฝั่ง
  • รันทั้งสองโมเดลพร้อมกันเพื่อไม่ให้คำตอบหนึ่งโน้มนำอีกคำตอบ
  • ให้คะแนนจากปริมาณการแก้ไข ไม่ใช่จากความไพเราะของคำตอบ
  • จดขนาดความต่างไว้ เพราะผลลัพธ์ที่ใช้แทนกันได้ก็เป็นข้อมูลที่มีประโยชน์
  • ทดสอบคำสั่งเชิงปฏิเสธและการปฏิบัติตามหลายเงื่อนไขพร้อมกันโดยเฉพาะ
  • รอสองสัปดาห์ก่อนย้ายงานจริงไปใช้โมเดลใหม่
  • ปรับการจัดสรรงานทีละประเภท แทนที่จะเปลี่ยนทั้งหมดในคราวเดียว

คำถามที่พบบ่อย

ควรเปลี่ยนไปใช้โมเดลใหม่ล่าสุดไหม

ไม่ควรเปลี่ยนในวันเปิดตัว และไม่ควรเปลี่ยนทั้งหมดในคราวเดียว ให้รันชุดงานจริงเล็ก ๆ ของคุณกับทั้งสองโมเดล ให้คะแนนจากปริมาณการแก้ไขที่แต่ละคำตอบต้องการ แล้วย้ายเฉพาะประเภทงานที่โมเดลใหม่ชนะอย่างชัดเจน โมเดลใหม่มักดีกว่าในบางเรื่องแน่นอน แต่ก็อาจแย่กว่าในบางเรื่อง โดยเฉพาะพรอมต์เดิมที่ปรับแต่งไว้สำหรับรุ่นก่อนหน้า

ทำไมเบนช์มาร์กถึงไม่ตรงกับประสบการณ์การใช้งานจริงของฉัน

เพราะเบนช์มาร์กวัดเฉพาะสิ่งที่ให้คะแนนอัตโนมัติได้ ซึ่งหมายถึงงานที่มีคำตอบถูกต้องตายตัว แต่งานอาชีพส่วนใหญ่ไม่มีคำตอบถูกต้องเพียงหนึ่งเดียว และคุณสมบัติที่กำหนดความพึงพอใจในการใช้งานประจำวัน เช่น การทำตามคำสั่ง การควบคุมน้ำเสียง วินัยด้านรูปแบบ และการรู้ว่าเมื่อไรควรพูดว่า "ฉันไม่ทราบ" แทบไม่ถูกวัดเลย โมเดลหนึ่งอาจนำหน้าในทุกกราฟที่เผยแพร่ แต่ยังใช้งานแล้วน่ารำคาญกว่าอยู่ดี

ควรประเมินใหม่บ่อยแค่ไหน

ทุกครั้งที่โมเดลที่คุณใช้มีการอัปเดตครั้งใหญ่ ซึ่งตอนนี้หมายถึงทุกไม่กี่เดือน บวกกับทุกไตรมาสไม่ว่าจะมีอัปเดตหรือไม่ การมีชุดงานจริงห้างานที่คงที่ทำให้เรื่องนี้ใช้เวลาแค่ยี่สิบนาทีแทนที่จะเป็นครึ่งวัน และเป็นวิธีเดียวที่จะรู้ว่าการจัดสรรงานที่คุณตั้งไว้เมื่อหกเดือนก่อนตอนนี้ผิดแล้ว

ใช้แค่โมเดลที่ชนะโดยรวมได้ไหม

ได้ แต่คุณจะยอมรับผลลัพธ์ที่แย่กว่าในงานบางส่วนที่คาดเดาได้ ผลลัพธ์ที่พบเสมอเมื่อคนประเมินด้วยงานของตัวเองคือ โมเดลหนึ่งชนะด้านการเขียนและน้ำเสียง ส่วนอีกตัวชนะด้านโครงสร้างที่เข้มงวดและความเร็ว โดยการให้เหตุผลทั่วไปใกล้เคียงกันจนไม่เป็นตัวตัดสิน ถ้าคุณใช้ได้ทั้งสองตัว การเลือกจะกลายเป็นเรื่องรายงาน ไม่ใช่รายการสมัครสมาชิก

สำคัญไหมว่าเข้าถึงโมเดลผ่านผลิตภัณฑ์ไหน

ตัวโมเดลก็คือโมเดลเดียวกัน คุณภาพผลลัพธ์จึงใกล้เคียงกันไม่ว่าจะเข้าถึงจากที่ไหน สิ่งที่ต่างกันคือคุณเปรียบเทียบได้หรือไม่ บริบทติดตามไปด้วยเมื่อสลับโมเดลหรือไม่ และการเปิดตัวรุ่นใหม่จะทำให้คุณต้องย้ายระบบ หรือแค่เป็นตัวเลือกเพิ่มในเมนูเลือกโมเดล พื้นที่ทำงานที่มีหลายโมเดลจะเปลี่ยนทุกการเปิดตัวจากการตัดสินใจครั้งใหญ่ให้กลายเป็นแค่การปรับเล็กน้อย