Aynı istem, ChatGPT ve Claude tarafından yan yana yanıtlandı.

3 istemden birini seçin, iki modelin aynı anda yanıtlamasını izleyin ve gerçekten göndereceğiniz yanıtı saklayın. Burada hiçbir şey bir modeli çağırmıyor: yanıtlar sabit dökümler, dolayısıyla sayfa ücretsiz ve her seferinde aynı.

Bu nasıl çalışıyor

Her istem, gerçekte ölçtüğü tek şey üzerinden 100 üzerinden puanlanır ve kazanan her zaman aynı model olmaz. Mesele tam da bu: ChatGPT işi daha iyi yapılandırır, Claude neyin önemli olduğuna daha iyi karar verir, hangisini isteyeceğiniz ise önünüzdeki işe bağlıdır.

Bunlar, iki modelin kalite bakımından değil tür bakımından nasıl ayrıştığını göstermek için yazılmış sabit örnek yanıtlardır. Canlı model çıktısı değildir ve bir kıyaslama testi değildir.

Bu 40 sayfalık sözleşmeyi özetle

Doğruluk ve odak üzerinden değerlendirildi

ChatGPT (OpenAI), 92/100

İşte temel maddelerin dökümü:

  • Taraflar: Meridian Corp (müşteri) ve Halcyon Ltd (tedarikçi)
  • Süre: 24 ay, 60 gün önceden fesih bildirilmezse kendiliğinden yenilenir
  • Ücret: ayda 12.400 USD, yıllık %4 artışla
  • Sorumluluk: 12 aylık ücretle sınırlı
  • Fesih: her iki tarafça, 90 gün yazılı bildirimle

Madde madde bir tablo isterseniz söyleyin.

Claude Sonnet (Anthropic), 96/100

Bu, Meridian Corp ile Halcyon Ltd arasında ayda 12.400 USD bedelle, her yıl %4 artan 24 aylık bir hizmet sözleşmesi.

İmzadan önce üç şey dikkatinizi hak ediyor: süre bitiminden 60 gün önce fesih bildirmezseniz sözleşme kendiliğinden yenileniyor, sorumluluk bir yıllık ücretle sınırlı, ve 90 günlük fesih bildirimi olağandan uzun.

Geri kalanı standart metin.

Karar: Claude kazanıyor, 96 - 92. İkisi de bilgileri doğru verdi, ama Claude her şeyi eşit ağırlıkta sıralamak yerine neye dikkat etmeniz gerektiğini söyledi.

Bir toplantıyı köprüleri yakmadan reddet

Üslup ve gönderime hazırlık üzerinden değerlendirildi

ChatGPT (OpenAI), 88/100

Konu: Re: Ortaklık görüşmesi

Merhaba [İsim],

Bana ulaştığınız için çok teşekkür ederim! Ne yazık ki bunu şu anki programıma sığdıramayacağım. Beni düşündüğünüz için gerçekten minnettarım ve gelecekteki fırsatlar için kapıyı açık tutmayı çok isterim.

Projede başarılar dilerim!

Saygılarımla,
[Adınız]

Claude Sonnet (Anthropic), 95/100

Merhaba Dana,

Davet için teşekkürler. Perşembeyi pas geçeceğim, haftam zaten fazlasıyla dolu ve yarım hazırlıkla gelmektense hiç gelmemeyi tercih ederim.

İşine yararsa sunumu kendi başıma inceleyip cuma gününe kadar notlarımı gönderebilirim. Olmazsa bir sonraki turda görüşürüz.

Noura

Karar: Claude kazanıyor, 95 - 88. Doldurulacak boşluk yok, gerçek bir gerekçe var ve bir alternatif sunuluyor. Aynen böyle gönderebilirsiniz.

Bu notları bir lansman kontrol listesine çevir

Yapı ve sorumluluk üzerinden değerlendirildi

ChatGPT (OpenAI), 94/100

Lansman kontrol listesi, tarihe göre sıralı:

  1. Kapsamı dondur (Pzt), sorumlu: ürün yöneticisi
  2. Ödemelerde son QA turu (Sal), sorumlu: mühendislik
  3. Basın kiti ve ekran görüntüleri (Çar), sorumlu: tasarım
  4. Product Hunt görsellerini planla (Per), sorumlu: pazarlama
  5. Lansman günü kriz masası (Cum), herkes

Bunu durum sütunlu bir tablo olarak ister misiniz?

Claude Sonnet (Anthropic), 90/100

Bu notlarla cuma arasında beş şey duruyor: pazartesi kapsamı kilitleyin ki QA'nın elinde kararlı bir sürüm olsun, salı ödeme regresyonunu çalıştırın, çarşambaya kadar basın kitini tasarımdan alın, perşembe akşamı Product Hunt görsellerini planlayın ve cumayı lansmanın kendisi için boş bırakın.

Notlarda yerelleştirilmiş fiyatlandırma da geçiyor. Onu bu lansmandan çıkarırdım, taşıyıcı bir parça değil.

Karar: ChatGPT kazanıyor, 94 - 90. Sorumlular, tarihler ve doğrudan bir takip aracına yapıştırabileceğiniz numaralı bir liste.

Sorular

Bu, gerçek modelleri çağırıyor mu?

Hayır. Yanıtlar sabit dökümler, sayfanın anında açılmasının ve çalışmasının hiçbir şeye mal olmamasının nedeni bu. Kendi isteminizi iki modele aynı anda göndermek için Whizi'yi açın.

Hangi model daha iyi, ChatGPT mi Claude mu?

Baştan sona hiçbiri. Bu üç istemde Claude sözleşme özetini ve e-postayı kazanıyor çünkü neyin önemli olduğuna karar veriyor, ChatGPT ise kontrol listesini kazanıyor çünkü işi yapılandırıyor. Her şey için tek bir tanesini seçmek, bu sayfanın anlattığı hatanın ta kendisi.

Belirli bir karşılaştırmayı paylaşabilir miyim?

Evet. Paylaşılabilir bağlantıyı kopyalayın, sayfa gönderdiğiniz kişide de aynı istemle açılır.

Sonraki adım

ChatGPT ve Claude karşılaştırmasının tamamını okuyun ya da aynı işin tüm modellerdeki maliyetini Token maliyet hesaplayıcısı ile hesaplayın.