Whizi'de yapay zeka modellerini yan yana nasıl karşılaştırırsınız

Hızlı yanıt

Whizi'de yapay zeka modellerini yan yana karşılaştırmak için sohbet başlığındaki Compare düğmesine basın, her sütun için bir model seçin ve aynı istemi ikisine birden gönderin. Her sütun kendi bağlamını korur, böylece hiçbir yanıt diğerinden etkilenmez. Yan yana karşılaştırma bir Powerhouse özelliğidir ve her yanıt kendi modelinin kredi oranından ücretlendirilir.

Kısa cevap

Sohbet başlığındaki Compare düğmesine basın, her sütun için bir model seçin ve aynı istemi ikisine birden gönderin. Her sütun kendi gizli konuşmasını korur, bu yüzden hiçbir model diğerinin çıktısını görmez ve hiçbir yanıt diğerinden etkilenmez; karşılaştırmayı değerli kılan tam olarak budur. Sütunlar sırayla, önce sol sonra sağ, akış halinde gelir çünkü hesap başına aynı anda bir üretim çalışır.

Yan yana karşılaştırma bir Powerhouse özelliğidir ve aynı anda iki modeli çalıştırır. Her yanıt kendi modelinin kredi oranından ücretlendirilir, bu yüzden 10 kredilik bir modeli 20 kredilik bir modelle karşılaştırmak 30 krediye mal olur.

Bunu, bir tür iş için hangi modelin varsayılanınız olması gerektiğine karar vermek için kullanın. İki yanıtı karşılaştırmak değil de tek bir yanıtı iyileştirmek istiyorsanız başka bir yöntem izleyin: aynı konuşma içinde modeli değiştirin ve ikincisinden birincisini eleştirmesini isteyin.

Benchmark'lar sorunuzu neden yanıtlamaz

Yayınlanan benchmark'lar standartlaştırılmış görevlerdeki performansı ölçer. Sizin sorunuz daha dar ve daha kullanışlıdır: hangi model, kişisel olarak haftada yirmi kez yaptığınız işte daha iyidir. Bunlar farklı sorulardır ve ikincisinin yayınlanmış bir cevabı yoktur, çünkü kimsenin sizin iş yükünüz yoktur.

Bir istemi iki modele karşı çalıştırmak yaklaşık otuz saniye sürer ve doğrudan cevap verir. Önemli olan iki cevap almanız değil; aradaki farkın ne kadar büyük olduğunu öğrenmenizdir. Bazen çıktılar neredeyse aynıdır, bu da o görev için model seçimini düşünmeyi bırakmanız gerektiğini gösterir. Bazen biri kullanılamaz haldedir, bu da üzerine bir iş akışı kurmadan önce bilmeye değer bir şeydir.

Karşılaştırmanın yakaladığı diğer şey ise kendinden emin hatadır. İki model gerçek bir soruya önemli ölçüde farklı cevaplar verdiğinde, en az biri yanlıştır ve bunu sadece birini okuyarak bilemezdiniz. Bu sinyal, tek modelli bir iş akışında hiçbir fiyata elde edilemez.

Okumadan önce daha iyinin ne anlama geldiğine karar verin

Yan yana karşılaştırmadaki tuzak, hangi çıktının daha uzun, daha kendinden emin veya daha cilalı olduğunu tercih etmektir. Bunlar kalite değildir. Önce kriterinizi belirleyin, sonra okuyun.

GörevDaha iyi ne demekNeyi görmezden gelin
YazmaGönderilebilir olması için daha az düzenleme gerektirmesiUzunluk, kelime dağarcığı, coşku
Gerçek araştırmaİddiayı destekleyen ve doğrulanabilen kaynaklarAkıcılık ve kendinden eminlik
Çıkarım (extraction)Doğru şema, uydurulmuş alan yok, tutarlı etiketlerTablo çevresindeki metin kalitesi
MuhakemeAdımların tutması ve uç durumun ele alınmasıSonucun önyargınızla eşleşip eşleşmediği
KodHata yolunu ele alması, incelenebilir olmasıZekilik, kısalık
ÖzetlemeÖnemli olanı koruyup önemsizi atmasıKapsamlılık

Pratik bir yöntem: her iki çıktıyı okumadan önce iyi bir cevabın neyi içermesi gerektiğini tek bir cümleyle yazın. Sonra okuyun. Bu on saniye sürer ve güçlü olan, çoğunlukla bilinçsiz cilalanma yanlılığını önler.

Gerçek sorularda kazananı değil, anlaşmazlığı kontrol edin. İki model belirli bir sayı ve kaynak konusunda hemfikirse güven mantıklıdır. Farklılaştıklarında, doğrulanması gereken şey odur ve bu tüm alıştırmanın en değerli tek çıktısıdır.

Gerçek farkları ortaya çıkaran istemler

Bazı görevler modelleri keskin biçimde ayırırken bazıları ayırmaz. Bir karşılaştırmadan bir şey öğrenmek istiyorsanız belirli bir yeteneğe baskı yapan istemler kullanın.

  • Zorluk altında ton. Bir müşteriye, teslim tarihini kaçırdığımızı açıklayan, aşırı özür dilemeden ve bahane üretmeden sorumluluğu üstlenen bir not yaz. 120 kelimenin altında. Kayıt farkları burada hemen ortaya çıkar.
  • Katı çıkarım. Bu metindeki her tarihi, tutarı ve tarafı tam olarak bu anahtarlarla bir JSON dizisine çıkar. Bir alan yoksa null kullan. Tahmin yürütme. Format disiplinini ve uydurma eğilimini test eder.
  • Tuzaklı muhakeme. Sezgisel yolun yanlış olduğu bir oran veya oranlama sorusu gibi, makul ama yanlış bir cevabı olan bir problem verin. Modeller kısayolu alıp almamakta farklılık gösterir.
  • Uzun bağlam hatırlama. Uzun bir belge yükleyin ve ortasındaki bir şey hakkında soru sorun. Reklamı yapılan bağlamı değil, gerçekten kullanılabilir bağlamı ortaya çıkarır.
  • Cehaleti kabul etme. [Gerçekten belirsiz veya çok yeni bir şey] hakkında ne açıklandı? En iyi cevap net bir "bilmiyorum" ya da kaynaklı bir geri getirmedir. Burada uydurma diskalifiye edicidir.
  • Olumsuz kısıtlamayı takip etme. X'i hiçbir benzetme veya metafor kullanmadan açıkla. Olumsuz talimatlara uyum, beklediğinizden daha fazla değişir.

Karşılaştırmaları bulmacalar üzerinde değil, kendi gerçek işiniz üzerinde yapın. Üç aylık raporunuzda daha iyi olan bir model, bir mantık bilmecesinde daha iyi olan bir modelden daha kullanışlıdır.

Bir haftalık karşılaştırmayı bir yönlendirme haritasına dönüştürmek

Tek bir karşılaştırma ilginçtir. Bir haftalık karşılaştırma ise eyleme geçirilebilirdir. Rutin şudur:

  1. Beş gün boyunca, bir görev önemli olduğunda, onu tek bir model yerine iki modele karşı çalıştırın.
  2. Görev türünü, kazananı ve farkın ne kadar büyük olduğunu not edin. Üç kelime yeterlidir.
  3. Haftanın sonunda, bir modelin tekrar tekrar kazandığı yerlere ve çıktıların birbirinin yerine geçebildiği yerlere bakın.
  4. Varsayılanlarınızı buna göre belirleyin ve farkın tutarlı biçimde sıfır olduğu görevlerde karşılaştırmayı bırakın.

İnsanların genellikle bulduğu şey, karşılaştırmanın işlerinin azınlığında önemli olduğu, geri kalanında ise zaman kaybı olduğudur. Hızlı gerçek arama sorguları, basit yeniden yazımlar ve rutin biçimlendirme modelleri nadiren ayırır. Bir müşteri tarafından okunacak yazılar, bir kararı bilgilendirecek araştırmalar ve tanıdık olmayan bir şey hakkında muhakeme onları büyük ölçüde ayırır.

Bu sonuç asıl kazançtır: fark yaratmadığı yerlerde karşılaştırmayı bırakır ve sonucu değiştirdiği görevler için saklarsınız.

Yan yana karşısında sıralı

Ayırt edilmeye değer iki farklı teknik.

Yan yana, birbirinin çıktısını göremeyen iki modele karşı aynı istemi çalıştırır. Her sütun, [Compare] önekiyle adlandırılan ve kenar çubuğunun dışında tutulan kendi gizli konuşmasını korur, böylece takip soruları adil bir test olarak kalır: her iki model de bağımsız çok turlu bağlamı tutar. Bu, varsayılan bir model seçmek ve gerçek anlaşmazlığı yakalamak için doğru araçtır.

Sıralı ise bir cevap almak, ardından aynı konuşma içinde modeli değiştirmek ve yeni modelden onu eleştirmesini istemek anlamına gelir. Bir karşılaştırma yapılmasını değil, kusurun bulunmasını istediğinizde kullanın, çünkü ikinci model belirli argümanla doğrudan ilgilenebilir. Bkz. modelleri konuşma ortasında değiştirme.

Kaba kural: hangi modeli seçeceğinize karar vermek için yan yana, bir cevabı iyileştirmek için sıralı.

Kontrol listesi
  • İstemi karşılaştırmadan önce normal bir sohbette yazın ve iyileştirin
  • Okumadan önce bu görev için daha iyinin ne anlama geldiğine karar verin
  • Cilalanma yanlılığından kaçınmak için iyi bir cevabı tanımlayan tek bir cümle yazın, sonra okuyun
  • Gerçek sorularda anlaşmazlığı bulgu olarak ele alın ve gidip doğrulayın
  • Karşılaştırmaları bulmacalar üzerinde değil kendi gerçek işiniz üzerinde yapın
  • Kazananı ve fark büyüklüğünü bir hafta boyunca kaydedin, ardından varsayılanlarınızı bu örüntüden belirleyin
  • Farkın tutarlı biçimde sıfır olduğu görevlerde karşılaştırmayı bırakın

Sık sorulan sorular

Aynı anda kaç model karşılaştırabilirim?

Yan yana karşılaştırma bir Powerhouse özelliğidir ve aynı anda iki modeli çalıştırır, bu kasıtlıdır: iki sütun, gerçekten dikkatlice okuyabileceğiniz düzendir. Üç sütun genellikle göz gezdirmeye dönüşür ve göz gezdirmek amacı boşa çıkarır, çünkü bu alıştırmanın değeri, cevapların gerçekten nerede farklılaştığını fark etmektedir.

Yan yana karşılaştırma aylık mesajlarımın daha fazlasını mı kullanır?

Evet, iki katına mal olur: iki model her biri bir cevap üretir ve her yanıt kendi kredi oranından ücretlendirilir, bu yüzden 10 kredilik bir modeli 20 kredilik bir modelle karşılaştırmak 10 veya 20 yerine 30 kredi harcar. Yanlış bir cevabı veya kullanılamaz bir taslağı yayınlanmadan önce yakalamak genellikle buna değer. Verimli yaklaşım, kararlar ve teslim edilecekler üzerinde karşılaştırma yapmak, rutin aramalar ve hızlı yeniden yazımlar için ise tek bir model kullanmaktır.

Ya her iki cevap da eşit derecede iyiyse?

Bu gerçek ve kullanışlı bir sonuçtur: bu görevin model seçimine bağlı olmadığını söyler, bu yüzden buna dikkat harcamayı bırakın ve hangisi varsayılanınızsa onu kullanın. Çoğu iş yükü şu şekilde ayrılır: görevlerin çoğunluğunda modeller birbirinin yerine geçebilir, azınlığında ise fark büyüktür. Hangisinin hangisi olduğunu bulmak, bir hafta boyunca karşılaştırma yapmanın amacıdır.

Sadece daha iyi görünen cevabı seçmekten nasıl kaçınırım?

Okumadan önce kriterinize karar verin. Daha uzun, daha kendinden emin ve daha cilalı çıktılar, daha kötü olsalar bile sistematik olarak tercih edilir ve bu yanlılık büyük ölçüde bilinçsizdir. Bakmadan önce iyi bir cevabın neyi içereceği hakkında tek bir cümle yazmak, bunun çoğunu dengelemeye yeter. Gerçek işler için, cevabın nasıl okunduğuna değil, kaynakların iddiayı doğrulayıp desteklediğine göre karar verin.

Hangi iki modeli karşılaştırmalıyım?

O belirli görev için gerçekten arasında karar verdiğiniz iki modeli karşılaştırın; çoğu kişi için bu, yazma ve muhakeme için Claude'a karşı GPT'dir, ya da belgeler söz konusu olduğunda büyük bağlamlı bir model karşısında varsayılanınızdır. Hiç kullanmayacağınız bir modeli favorinizle karşılaştırmak, üzerine hareket edeceğiniz hiçbir şey söylemez.