Vì sao điểm benchmark ra mắt không trả lời được câu hỏi của bạn
Mỗi bản phát hành hàng đầu đều đi kèm một biểu đồ cho thấy nó dẫn đầu trên một loạt đánh giá chuẩn hóa. Những con số đó là thật, nhưng cũng gần như vô dụng khi quyết định bạn nên dùng gì vào thứ Hai, vì ba lý do.
Khoảng cách rất nhỏ và các nhiệm vụ không phải của bạn. Chênh lệch hai điểm trên một benchmark về suy luận chẳng nói lên điều gì về việc mô hình nào viết email khách hàng hay hơn hay giữ đúng cấu trúc dữ liệu ổn định hơn qua hai trăm dòng.
Benchmark chỉ đo những nhiệm vụ dễ chấm điểm. Những thứ có đáp án đúng rõ ràng. Phần lớn công việc chuyên môn không như vậy: giọng văn, cấu trúc, khả năng phán đoán nên bỏ gì. Đó chính là nơi các mô hình khác nhau nhiều nhất và cũng là nơi không có gì được đo lường.
Các so sánh khi ra mắt do chính nhà cung cấp thực hiện. Không hẳn là thiếu trung thực, nhưng không ai công bố bài đánh giá mà mô hình của họ về nhì.
Câu hỏi đáng để trả lời hẹp hơn nhiều: trên những nhiệm vụ cụ thể bạn làm hai mươi lần một tuần, mô hình nào trong hai mô hình này tốt hơn? Câu hỏi đó chưa có đáp án công bố sẵn, và chỉ mất khoảng một giờ để tìm ra.
Điều thực sự thay đổi giữa các bản phát hành
Qua các bản phát hành hàng đầu gần đây, những cải tiến quan trọng trong sử dụng hằng ngày luôn rơi vào cùng một số nhóm, và chúng hiếm khi là những gì được nêu bật trong thông báo ra mắt.
| Điều được cải thiện | Bạn nhận ra bằng cách nào | Benchmark có thể hiện hay không |
|---|---|---|
| Tuân thủ chỉ dẫn | Nó không còn bỏ qua ràng buộc thứ ba của bạn | Hiếm khi |
| Chỉ dẫn phủ định | "Không dùng phép so sánh ẩn dụ" thực sự được tuân theo | Không |
| Ghi nhớ ngữ cảnh dài | Nó tìm ra thứ ở trang 140, không chỉ trang 3 | Một phần |
| Kỷ luật định dạng | Bảng có đúng các cột bạn yêu cầu, mọi lần | Không |
| Hiệu chỉnh mức độ chắc chắn | Nó nói không biết thay vì bịa ra | Không |
| Kiểm soát giọng văn | Ít lần viết lại hơn trước khi có thể gửi đi | Không |
| Chiều sâu suy luận | Nó bắt được trường hợp ngoại lệ mà bạn bỏ sót | Có, đây là thứ họ đo |
Năm trong bảy điều đó vô hình trên biểu đồ benchmark, và đó là lý do một mô hình mới cảm thấy tốt hơn hay tệ hơn khi làm việc cùng. Đặc biệt việc tuân thủ chỉ dẫn chính là khác biệt giữa một bản nháp bạn chỉ cần chỉnh sửa và một bản nháp bạn phải bỏ đi.
Bài đánh giá một giờ
Hãy làm điều này thay vì đọc tin tức ra mắt. Chạy song song hai mô hình trên chính tài liệu của bạn.
- Thu thập năm nhiệm vụ thật từ hai tuần gần nhất. Nhiệm vụ thật, có ngữ cảnh thực tế của bạn dán vào, không phải câu lệnh thử nghiệm sơ sài. Hãy có ít nhất một nhiệm vụ viết lách, một nhiệm vụ xuất dữ liệu có cấu trúc, và một nhiệm vụ cần suy luận về điều gì đó chưa quen thuộc.
- Ghi lại trước một câu trả lời tốt cần có gì, với mỗi nhiệm vụ, trong một câu, trước khi bạn chạy bất cứ thứ gì. Đây là bước ngăn bạn thiên vị bất kỳ câu trả lời nào dài hơn và tự tin hơn, một thiên kiến mạnh và phần lớn vô thức.
- Chạy từng nhiệm vụ trên cả hai mô hình song song để câu trả lời này không neo theo câu trả lời kia.
- Chấm điểm theo công sức chỉnh sửa, tức là cần bao nhiêu công để đi từ đầu ra tới thứ bạn có thể gửi đi. Không chấm theo cảm giác đọc.
- Ghi lại độ chênh lệch, không chỉ ai thắng. Kết quả tương đương nhau cho bạn biết nên ngừng nghĩ về việc chọn mô hình cho nhiệm vụ đó, điều này thực sự hữu ích.
- Giữ lại nhật ký. Ba tháng sau, khi bản phát hành tiếp theo ra mắt, bạn chạy lại đúng năm nhiệm vụ đó và có câu trả lời thật trong hai mươi phút.
Điểm cuối cùng đó là điểm mang lại giá trị tích lũy. Một bộ đánh giá đã lưu là thứ duy nhất khiến việc đánh giá mỗi bản phát hành sau này trở nên rẻ và nhanh.
Sáu câu lệnh cho thấy sự khác biệt giữa các mô hình hàng đầu
Các câu hỏi chung chung tạo ra câu trả lời tương tự nhau từ bất kỳ mô hình đủ mạnh nào. Nếu muốn thấy khác biệt, hãy tạo áp lực lên một năng lực cụ thể.
- Giọng văn dưới tình huống khó xử.
Viết một đoạn thông báo cho khách hàng rằng chúng ta đã trễ hạn. Nhận trách nhiệm mà không xin lỗi quá mức và không viện cớ. Dưới 120 từ.Khác biệt về sắc thái ngôn ngữ hiện ra ngay lập tức. - Ràng buộc phủ định.
Giải thích [khái niệm] mà không dùng bất kỳ phép so sánh hay ẩn dụ nào.Mức độ tuân thủ chỉ dẫn phủ định khác nhau nhiều hơn bạn tưởng. - Trích xuất nghiêm ngặt.
Trích xuất mọi ngày tháng, số tiền và bên liên quan vào một mảng JSON với đúng những khóa này. Nếu thiếu trường nào thì dùng null. Không suy đoán.Kiểm tra kỷ luật định dạng và xu hướng tự lấp đầy khoảng trống. - Ghi nhớ ngữ cảnh dài. Tải lên một tài liệu dài và hỏi về điều gì đó ở giữa tài liệu. Cho thấy ngữ cảnh thực sự dùng được, khác với ngữ cảnh được quảng cáo.
- Thừa nhận không biết. Hỏi về điều gì đó thực sự hiếm gặp hoặc rất mới. Câu trả lời tốt nhất là một câu "tôi không biết" rõ ràng hoặc một kết quả có dẫn nguồn. Bịa đặt ở đây là loại trừ ngay, bất kể benchmark nói gì.
- Tuân thủ nhiều ràng buộc cùng lúc. Đưa ra sáu ràng buộc cùng lúc và đếm xem còn bao nhiêu được giữ đúng. Bài test đơn lẻ này dự đoán mức độ hài lòng hằng ngày tốt hơn bất cứ thứ gì khác trong danh sách.
Câu trả lời thường là "cả hai, cho những việc khác nhau"
Người ta tiếp cận một bản phát hành mong muốn một phán quyết rõ ràng, và kết quả trung thực sau khi chạy đánh giá gần như luôn bị chia đôi. Một mô hình thắng về viết lách và giọng văn. Mô hình kia thắng về cấu trúc chặt chẽ và tốc độ. Chúng gần nhau đủ về suy luận tổng quát để điều đó không quyết định điều gì.
Đó không phải là né tránh, mà là kết quả thực tế, và nó có một hàm ý thực tiễn. Nếu chỉ được dùng một mô hình, bạn đang chọn nhóm nhiệm vụ nào mình sẽ làm kém hơn. Nếu có thể dùng cả hai, câu hỏi khi ra bản phát hành mới không còn là "có nên chuyển không" mà trở thành "nhiệm vụ nào nên chuyển", một quyết định nhỏ hơn và ít rủi ro hơn nhiều.
Điều này cũng thay đổi ý nghĩa của một bản phát hành đối với bạn. Khi mô hình mới xuất hiện trong một không gian làm việc vốn đã có nhiều mô hình khác, bạn chỉ cần chạy lại năm nhiệm vụ của mình, điều chỉnh cách phân luồng, rồi tiếp tục. Không có di dời, không hủy gói đăng ký, và không có cả tháng phải dùng thứ tệ hơn vì đã cam kết trước khi thử.
Nên làm gì vào ngày ra mắt
Đừng chuyển mặc định ngay lập tức. Ấn tượng tuần đầu ra mắt bị chi phối bởi sự mới lạ và bởi bất kỳ ví dụ nào lan truyền trước.
Chạy lại bộ đánh giá của bạn. Chỉ mất hai mươi phút nếu bạn đã giữ lại bộ từ lần trước.
Kiểm tra những thứ tưởng như nhàm chán. Cửa sổ ngữ cảnh, liệu các câu lệnh hiện có của bạn có còn hoạt động như cũ không, và liệu có điều gì bạn từng dựa vào đã thay đổi hay chưa. Một mô hình tốt hơn nói chung vẫn có thể tệ hơn trên mẫu cụ thể của bạn, và điều đó đáng biết trước khi bạn chuyển công việc thực tế sang nó.
Cập nhật cách phân luồng theo từng nhiệm vụ, không đại trà. Chuyển những nhóm mà mô hình mới thắng rõ ràng và giữ nguyên phần còn lại.
Chờ khoảng hai tuần để thấy các hạn chế. Các lỗi vận hành của một mô hình mới thường lộ ra sau khoảng hai tuần sử dụng rộng rãi, và chúng hiếm khi có mặt trong thông báo ra mắt.
Xem khung tổng quát tại cách chọn một mô hình AI, và xem cách vận hành để chạy hai mô hình trên cùng một câu lệnh tại so sánh mô hình song song.
- Xây dựng một bộ năm nhiệm vụ thật từ chính công việc của bạn và giữ lại nó
- Ghi lại trước câu trả lời tốt cần có gì trước khi đọc bất kỳ đầu ra nào
- Chạy song song cả hai mô hình để không câu trả lời nào neo theo câu kia
- Chấm điểm theo công sức chỉnh sửa, không theo cảm giác đọc
- Ghi lại độ chênh lệch, vì kết quả tương đương cũng là thông tin hữu ích
- Kiểm tra riêng các ràng buộc phủ định và khả năng tuân thủ nhiều ràng buộc
- Chờ hai tuần trước khi chuyển công việc thực tế sang mô hình mới
- Cập nhật cách phân luồng theo từng nhiệm vụ thay vì chuyển đại trà
Câu hỏi thường gặp
Tôi có nên chuyển sang mô hình mới nhất không?
Không nên chuyển ngay ngày ra mắt, và cũng không nên chuyển đại trà. Hãy chạy lại một bộ nhỏ các nhiệm vụ thật của bạn trên cả hai, chấm điểm theo mức độ cần chỉnh sửa mỗi đầu ra, và chỉ chuyển những nhóm mà mô hình mới thắng rõ ràng. Mô hình mới hơn thường tốt hơn ở một số việc và đôi khi tệ hơn ở việc khác, đặc biệt với các câu lệnh cũ đã được tinh chỉnh theo phiên bản trước.
Vì sao benchmark không khớp với trải nghiệm của tôi?
Vì chúng đo những gì có thể chấm điểm tự động, tức là các nhiệm vụ có đáp án đúng rõ ràng. Phần lớn công việc chuyên môn không có một đáp án đúng duy nhất, và những phẩm chất quyết định sự hài lòng hằng ngày, tức là tuân thủ chỉ dẫn, kiểm soát giọng văn, kỷ luật định dạng, và biết khi nào nên nói "tôi không biết", phần lớn không được đo lường. Một mô hình có thể dẫn đầu mọi biểu đồ công bố mà vẫn khó chịu hơn khi làm việc cùng.
Tôi nên đánh giá lại thường xuyên đến mức nào?
Bất cứ khi nào mô hình bạn đang dùng có một bản phát hành đáng kể, hiện tại là cứ vài tháng một lần, cộng thêm một lần mỗi quý dù thế nào đi nữa. Giữ một bộ cố định năm nhiệm vụ thật biến việc này thành công việc hai mươi phút thay vì cả buổi chiều, và đó là cách duy nhất để nhận ra rằng cách phân luồng bạn thiết lập sáu tháng trước giờ đã sai.
Tôi có thể cứ dùng mô hình nào thắng chung cuộc không?
Bạn có thể, và khi đó bạn sẽ chấp nhận kết quả kém hơn trên một phần công việc có thể đoán trước. Kết quả nhất quán khi người ta tự đánh giá trên nhiệm vụ của mình là một mô hình thắng về viết lách và giọng văn trong khi mô hình khác thắng về cấu trúc chặt chẽ và tốc độ, còn suy luận tổng quát thì đủ gần nhau để không quyết định điều gì. Nếu bạn có cả hai, lựa chọn trở thành theo từng nhiệm vụ thay vì theo từng gói đăng ký.
Sản phẩm tôi dùng để truy cập mô hình có quan trọng không?
Mô hình vẫn là mô hình, nên chất lượng đầu ra nhìn chung như nhau dù bạn truy cập từ đâu. Điều khác biệt là bạn có so sánh được không, ngữ cảnh có được giữ lại khi chuyển đổi không, và một bản phát hành mới sẽ khiến bạn phải di dời hay chỉ là một lựa chọn nữa trong bộ chọn. Một không gian làm việc có nhiều mô hình biến mỗi bản phát hành từ một quyết định thành một điều chỉnh nhỏ.