Cách so sánh các model AI song song trong Whizi

Trả lời nhanh

Để so sánh các model AI song song trong Whizi, nhấn Compare trên thanh tiêu đề của khung chat, chọn một model cho mỗi cột, và gửi một prompt cho cả hai. Mỗi cột giữ ngữ cảnh riêng, nên câu trả lời này không bị neo theo câu trả lời kia. So sánh song song là tính năng Powerhouse, và mỗi câu trả lời được tính phí theo mức credit riêng của model đó.

Câu trả lời ngắn gọn

Nhấn Compare trên thanh tiêu đề của khung chat, chọn một model cho mỗi cột, và gửi một prompt cho cả hai. Mỗi cột giữ một cuộc trò chuyện ẩn riêng, nên model này không thấy câu trả lời của model kia và câu trả lời không bị neo theo nhau, đó chính là lý do khiến việc so sánh có giá trị. Các cột phát ra lần lượt, trái rồi đến phải, vì mỗi tài khoản chỉ chạy một lượt sinh câu trả lời tại một thời điểm.

So sánh song song là tính năng Powerhouse và chạy hai model cùng lúc. Mỗi câu trả lời được tính phí theo mức credit riêng của model đó, nên so sánh một model 10 credit với một model 20 credit sẽ tốn 30 credit.

Dùng tính năng này để quyết định model nào nên là mặc định cho một loại công việc. Nếu bạn muốn cải thiện một câu trả lời thay vì so sánh hai câu trả lời, hãy làm việc khác: chuyển model trong cùng một luồng trò chuyện và yêu cầu model thứ hai nhận xét câu trả lời đầu tiên.

Vì sao benchmark không trả lời câu hỏi của bạn

Các benchmark được công bố đo hiệu năng trên các tác vụ chuẩn hóa. Câu hỏi của bạn hẹp hơn và hữu ích hơn: model nào giỏi hơn ở việc bạn tự làm hai mươi lần một tuần. Đó là hai câu hỏi khác nhau, và câu hỏi thứ hai không có đáp án được công bố vì không ai có khối lượng công việc giống bạn.

Chạy một prompt trên hai model chỉ mất khoảng ba mươi giây và trả lời trực tiếp câu hỏi đó. Điều quan trọng không phải là bạn có hai câu trả lời, mà là bạn biết được khoảng cách giữa chúng lớn đến đâu. Đôi khi các câu trả lời gần như giống hệt nhau, điều đó cho bạn biết nên ngừng nghĩ về việc chọn model cho tác vụ đó. Đôi khi một câu trả lời không dùng được, điều đáng biết trước khi bạn xây dựng cả một quy trình dựa trên nó.

Điều khác mà việc so sánh phát hiện được là lỗi sai nhưng tự tin. Khi hai model đưa ra câu trả lời khác nhau đáng kể cho một câu hỏi thực tế, ít nhất một câu trả lời sai, và bạn sẽ không biết điều đó nếu chỉ đọc một trong hai. Tín hiệu đó không có được trong một quy trình chỉ dùng một model, dù với giá nào.

Xác định "tốt hơn" nghĩa là gì trước khi đọc

Cái bẫy trong việc so sánh song song là ưu ái bất kỳ câu trả lời nào dài hơn, tự tin hơn, hoặc trau chuốt hơn. Đó không phải là chất lượng. Hãy xác định tiêu chí trước, rồi mới đọc.

Tác vụ"Tốt hơn" nghĩa là gìĐiều cần bỏ qua
Viết láchCần chỉnh sửa ít hơn để gửi đi đượcĐộ dài, từ vựng, sự nhiệt tình
Nghiên cứu thực tếNguồn có thể xác minh và ủng hộ luận điểmSự trôi chảy và tự tin
Trích xuấtĐúng schema, không bịa trường dữ liệu, nhãn nhất quánChất lượng văn phong quanh bảng
Suy luậnCác bước lập luận đứng vững và trường hợp biên được xử lýKết luận có khớp với suy nghĩ trước đó của bạn hay không
CodeXử lý được đường lỗi, dễ reviewSự khéo léo, độ ngắn gọn
Tóm tắtGiữ lại điều quan trọng và bỏ điều không quan trọngTính toàn diện

Một mẹo thực tế: trước khi đọc bất kỳ câu trả lời nào, hãy viết một câu mô tả một câu trả lời tốt sẽ chứa gì. Sau đó mới đọc. Việc này chỉ mất mười giây và ngăn được thiên kiến ưu ái sự trau chuốt, một thiên kiến rất mạnh và phần lớn diễn ra vô thức.

Với các câu hỏi thực tế, hãy xem sự bất đồng thay vì người thắng cuộc. Khi hai model đồng ý về một con số cụ thể và một nguồn, độ tin cậy là hợp lý. Khi chúng khác nhau, đó là điều bạn cần đi xác minh, và đó là kết quả giá trị nhất của cả bài tập này.

Những prompt bộc lộ khác biệt thật sự

Một số tác vụ phân biệt rõ các model, một số thì không. Nếu bạn muốn học được điều gì đó từ một lần so sánh, hãy dùng những prompt gây áp lực lên một năng lực cụ thể.

  • Giọng điệu trong tình huống khó xử. Viết một tin nhắn cho khách hàng giải thích rằng chúng ta đã trễ hạn, nhận trách nhiệm mà không xin lỗi thái quá và không viện cớ. Dưới 120 từ. Sự khác biệt về văn phong lộ ra ngay lập tức ở đây.
  • Trích xuất nghiêm ngặt. Trích xuất mọi ngày tháng, số tiền và bên liên quan từ văn bản này thành một mảng JSON với chính xác các khóa này. Nếu thiếu một trường, dùng null. Không suy đoán. Kiểm tra kỷ luật định dạng và xu hướng bịa đặt.
  • Suy luận có bẫy. Đưa ra một bài toán có đáp án sai nghe hợp lý, chẳng hạn câu hỏi về tỷ lệ hoặc tỷ lệ phần trăm mà cách tiếp cận trực giác lại sai. Các model khác nhau ở việc có chọn đường tắt hay không.
  • Ghi nhớ ngữ cảnh dài. Tải lên một tài liệu dài và hỏi về điều gì đó ở giữa. Bộc lộ ngữ cảnh thực sự dùng được, không phải ngữ cảnh được quảng cáo.
  • Thừa nhận không biết. Điều gì đã được công bố về [điều gì đó thực sự hiếm hoặc rất mới]? Câu trả lời tốt nhất là một câu "tôi không biết" rõ ràng hoặc một kết quả truy xuất có nguồn. Việc bịa đặt ở đây là không thể chấp nhận.
  • Tuân theo một ràng buộc phủ định. Giải thích X mà không dùng bất kỳ phép ẩn dụ hay so sánh nào. Mức độ tuân thủ các chỉ dẫn phủ định khác nhau nhiều hơn bạn tưởng.

Hãy chạy so sánh trên công việc thật của chính bạn thay vì trên các câu đố. Một model giỏi hơn ở báo cáo quý của bạn hữu ích hơn một model giỏi hơn ở câu đố logic.

Biến một tuần so sánh thành bản đồ định tuyến

Một lần so sánh thì thú vị. Một tuần so sánh thì có thể hành động được. Quy trình như sau:

  1. Trong năm ngày, bất cứ khi nào có một tác vụ quan trọng, hãy chạy nó trên hai model thay vì một.
  2. Ghi lại loại tác vụ, model thắng, và khoảng cách lớn đến đâu. Ba từ là đủ.
  3. Cuối tuần, xem chỗ nào một model thắng liên tục và chỗ nào các câu trả lời có thể thay thế cho nhau.
  4. Đặt mặc định của bạn dựa trên đó, và ngừng so sánh ở những tác vụ mà khoảng cách luôn bằng không.

Điều mọi người thường phát hiện là việc so sánh quan trọng ở một phần nhỏ công việc của họ và lãng phí thời gian ở phần còn lại. Tra cứu thông tin nhanh, viết lại đơn giản, và định dạng thường quy hiếm khi phân biệt các model. Việc viết mà khách hàng sẽ đọc, nghiên cứu sẽ ảnh hưởng đến một quyết định, và suy luận về điều gì đó xa lạ thì phân biệt chúng rất nhiều.

Kết quả đó chính là phần thưởng: bạn ngừng so sánh ở nơi không tạo ra khác biệt gì và giữ lại nó cho những tác vụ làm thay đổi kết quả.

So sánh song song so với tuần tự

Hai kỹ thuật khác nhau, đáng để phân biệt.

So sánh song song chạy cùng một prompt trên hai model không thể thấy câu trả lời của nhau. Mỗi cột giữ một cuộc trò chuyện ẩn riêng, đặt tên với tiền tố [Compare] và không hiển thị ở thanh bên, nên các câu hỏi tiếp theo vẫn giữ tính công bằng của bài kiểm tra: cả hai model đều có ngữ cảnh nhiều lượt độc lập. Đây là công cụ phù hợp để chọn model mặc định và phát hiện sự bất đồng về sự kiện thực tế.

Tuần tự nghĩa là nhận một câu trả lời, rồi chuyển model trong cùng một luồng trò chuyện và yêu cầu model mới nhận xét câu trả lời đó. Dùng cách này khi bạn muốn tìm ra lỗi thay vì thực hiện một so sánh, vì model thứ hai có thể trực tiếp phản biện luận điểm cụ thể đó. Xem chuyển model giữa cuộc trò chuyện.

Quy tắc chung: so sánh song song để quyết định chọn model nào, tuần tự để cải thiện một câu trả lời.

Danh sách kiểm tra
  • Viết và tinh chỉnh prompt trong một cuộc trò chuyện bình thường trước khi so sánh
  • Xác định "tốt hơn" nghĩa là gì cho tác vụ này trước khi đọc bất kỳ câu trả lời nào
  • Viết một câu mô tả một câu trả lời tốt, rồi mới đọc, để tránh thiên kiến ưu ái sự trau chuốt
  • Với các câu hỏi thực tế, xem sự bất đồng là phát hiện chính và đi xác minh nó
  • So sánh trên công việc thật của chính bạn, không phải trên các câu đố
  • Ghi lại model thắng và độ lớn khoảng cách trong một tuần, rồi đặt mặc định theo mô hình đó
  • Ngừng so sánh ở những tác vụ mà khoảng cách luôn bằng không

Câu hỏi thường gặp

Tôi có thể so sánh bao nhiêu model cùng lúc?

So sánh song song là tính năng Powerhouse, và nó chạy hai model cùng lúc, điều này có chủ đích: hai cột là bố cục bạn thực sự đọc kỹ được. Ba cột thường biến thành đọc lướt, và đọc lướt thì đi ngược lại mục đích, vì giá trị của bài tập này nằm ở việc nhận ra chỗ nào các câu trả lời thực sự khác nhau.

So sánh song song có dùng nhiều tin nhắn hàng tháng của tôi hơn không?

Có, tính phí gấp đôi: hai model mỗi cái tạo ra một câu trả lời, và mỗi câu trả lời được tính phí theo mức credit riêng của nó, nên so sánh một model 10 credit với một model 20 credit sẽ tốn 30 credit thay vì 10 hoặc 20. Việc phát hiện một câu trả lời sai hoặc một bản nháp không dùng được trước khi nó được gửi đi thường đáng giá công đó. Cách tiếp cận hiệu quả là so sánh cho các quyết định và sản phẩm bàn giao, và dùng một model duy nhất cho tra cứu thường quy và viết lại nhanh.

Nếu cả hai câu trả lời đều tốt như nhau thì sao?

Đó là một kết quả thật và hữu ích: nó cho bạn biết tác vụ này không phụ thuộc vào việc chọn model, vậy nên hãy ngừng dành sự chú ý vào đó và dùng bất cứ model nào là mặc định của bạn. Phần lớn khối lượng công việc chia theo cách này, với đa số tác vụ mà các model có thể thay thế cho nhau và một số ít tác vụ có khoảng cách lớn. Tìm ra cái nào là cái nào chính là mục đích của việc chạy so sánh trong một tuần.

Làm sao để tránh chỉ chọn câu trả lời nghe hay hơn?

Hãy xác định tiêu chí trước khi đọc. Các câu trả lời dài hơn, tự tin hơn, và trau chuốt hơn thường được ưu ái một cách có hệ thống ngay cả khi chúng kém hơn, và thiên kiến đó phần lớn diễn ra vô thức. Viết một câu về việc một câu trả lời tốt sẽ chứa gì, trước khi bạn xem, là đủ để chống lại phần lớn thiên kiến đó. Với công việc mang tính thực tế, hãy đánh giá dựa trên việc nguồn có xác minh và ủng hộ luận điểm hay không thay vì dựa trên cách câu trả lời đọc lên.

Tôi nên so sánh hai model nào?

Hãy so sánh hai model bạn thực sự đang phân vân cho tác vụ cụ thể đó, mà với hầu hết mọi người là Claude so với GPT cho việc viết lách và suy luận, hoặc một model có ngữ cảnh lớn so với model mặc định của bạn khi có tài liệu liên quan. So sánh một model bạn sẽ không bao giờ dùng với model yêu thích của bạn không cho bạn biết điều gì để hành động.