Gesaan yang sama, dijawab oleh ChatGPT dan Claude bersebelahan.
Pilih satu daripada 3 gesaan, lihat kedua-dua model menjawab serentak, dan simpan jawapan yang benar-benar akan anda hantar. Tiada apa-apa di sini memanggil model: jawapannya transkrip tetap, jadi halaman ini percuma dijalankan dan sama setiap kali.
Bagaimana ini berfungsi
Setiap gesaan dimarkahkan daripada 100 atas satu perkara yang benar-benar diuji oleh gesaan itu, dan pemenangnya bukan sentiasa model yang sama. Itulah maksudnya: ChatGPT lebih baik menyusun kerja, Claude lebih baik menimbang apa yang penting, dan mana satu yang anda mahu bergantung pada tugas di hadapan anda.
Ini jawapan contoh tetap, ditulis untuk menunjukkan bagaimana kedua-dua model berbeza dari segi jenis, bukan kualiti. Ia bukan keluaran model secara langsung dan bukan penanda aras.
Ringkaskan kontrak 40 halaman ini
Dinilai atas ketepatan dan fokus
ChatGPT (OpenAI), 92/100
Ini pecahan terma utamanya:
Pihak: Meridian Corp (pelanggan) dan Halcyon Ltd (pembekal)
Tempoh: 24 bulan, diperbaharui secara automatik melainkan dibatalkan 60 hari lebih awal
Yuran: USD 12,400 sebulan dengan kenaikan 4% setahun
Liabiliti: dihadkan kepada 12 bulan yuran
Penamatan: oleh mana-mana pihak, notis bertulis 90 hari
Beritahu saya jika anda mahu jadual klausa demi klausa.
Claude Sonnet (Anthropic), 96/100
Ini perjanjian perkhidmatan 24 bulan antara Meridian Corp dan Halcyon Ltd pada USD 12,400 sebulan, naik 4% setiap tahun.
Tiga perkara wajar diberi perhatian sebelum menandatangani: kontrak diperbaharui sendiri jika anda tidak membatalkannya 60 hari sebelum tamat tempoh, liabiliti dihadkan kepada setahun yuran, dan notis penamatan 90 hari lebih panjang daripada kebiasaan.
Selebihnya terma biasa.
Keputusan: Claude menang, 96 berbanding 92. Kedua-duanya betul fakta, tetapi Claude memberitahu apa yang perlu dirisaukan dan bukannya menyenaraikan semuanya sama rata.
Tolak mesyuarat tanpa memutuskan hubungan
Dinilai atas nada dan kesediaan menghantar
ChatGPT (OpenAI), 88/100
Subjek: Re: Perbincangan perkongsian
Hai [Nama],
Terima kasih banyak kerana menghubungi! Malangnya saya tidak dapat menyesuaikannya dengan jadual saya sekarang. Saya sangat menghargai anda terfikirkan saya, dan saya ingin membiarkan pintu terbuka untuk peluang akan datang.
Semoga projek ini berjalan lancar!
Yang benar, [Nama anda]
Claude Sonnet (Anthropic), 95/100
Hai Dana,
Terima kasih atas jemputan. Saya lepaskan yang Khamis, minggu saya sudah terlalu padat dan saya lebih rela tidak hadir daripada muncul separuh bersedia.
Kalau membantu, saya boleh menyemak dek itu sendiri dan menghantar nota sebelum Jumaat. Kalau tidak, jumpa pada pusingan berikutnya.
Noura
Keputusan: Claude menang, 95 berbanding 88. Tiada ruang untuk diisi, ada sebab sebenar, dan ada tawaran alternatif. Boleh dihantar persis begitu.
Tukar nota ini kepada senarai semak pelancaran
Dinilai atas struktur dan pemilik tugas
ChatGPT (OpenAI), 94/100
Senarai semak pelancaran, mengikut tarikh akhir:
Bekukan skop (Isn), pemilik: pengurus produk
Pusingan QA terakhir untuk pembayaran (Sel), pemilik: kejuruteraan
Kit akhbar dan tangkapan skrin (Rab), pemilik: reka bentuk
Jadualkan bahan Product Hunt (Kha), pemilik: pemasaran
Bilik gerakan pada hari pelancaran (Jum), semua orang
Mahu ini sebagai jadual dengan lajur status?
Claude Sonnet (Anthropic), 90/100
Lima perkara memisahkan nota ini daripada hari Jumaat: kunci skop pada Isnin supaya QA ada binaan yang stabil, jalankan regresi pembayaran pada Selasa, dapatkan kit akhbar daripada reka bentuk menjelang Rabu, jadualkan bahan Product Hunt pada Khamis malam, dan kosongkan Jumaat untuk pelancaran itu sendiri.
Nota itu turut menyebut harga tempatan. Saya akan keluarkannya daripada pelancaran ini, ia bukan tunjang.
Keputusan: ChatGPT menang, 94 berbanding 90. Ada pemilik tugas, tarikh akhir, dan senarai bernombor yang boleh terus ditampal ke penjejak tugas.
Soalan
Adakah ini memanggil model sebenar?
Tidak. Jawapannya transkrip tetap, sebab itulah halaman ini terbuka serta-merta dan tidak menelan kos untuk dijalankan. Untuk menghantar gesaan anda sendiri kepada kedua-dua model serentak, buka Whizi.
Model mana lebih baik, ChatGPT atau Claude?
Tiada satu pun mengatasi dalam segala hal. Pada tiga gesaan ini Claude menang pada ringkasan kontrak dan e-mel kerana ia menimbang apa yang penting, dan ChatGPT menang pada senarai semak kerana ia menyusun kerja. Memilih satu untuk segala-galanya ialah kesilapan yang dibincangkan halaman ini.
Bolehkah saya kongsi perbandingan tertentu?
Boleh. Salin pautan kongsi dan halaman akan terbuka pada gesaan yang sama untuk sesiapa yang anda hantar.