Cara membandingkan model AI berdampingan di Whizi

Jawaban singkat

Untuk membandingkan model AI berdampingan di Whizi, tekan Compare di header chat, pilih satu model untuk tiap kolom, lalu kirim satu prompt ke keduanya. Setiap kolom menyimpan konteksnya sendiri, sehingga satu jawaban tidak terpengaruh oleh jawaban lain. Perbandingan berdampingan adalah fitur Powerhouse, dan setiap jawaban dikenakan tarif kredit sesuai modelnya masing-masing.

Jawaban singkat

Tekan Compare di header chat, pilih satu model untuk tiap kolom, lalu kirim satu prompt ke keduanya. Setiap kolom menyimpan percakapan tersembunyinya sendiri, sehingga satu model tidak melihat hasil model lain dan satu jawaban tidak terpengaruh oleh jawaban lain, yang justru menjadi alasan perbandingan ini berguna. Kolom-kolom ditampilkan berurutan, kiri lalu kanan, karena hanya satu proses generasi yang berjalan per akun pada satu waktu.

Perbandingan berdampingan adalah fitur Powerhouse dan menjalankan dua model sekaligus. Setiap jawaban ditagih sesuai tarif kredit modelnya sendiri, jadi membandingkan model 10 kredit dengan model 20 kredit menghabiskan 30 kredit.

Gunakan ini untuk memutuskan model mana yang sebaiknya menjadi default Anda untuk suatu jenis pekerjaan. Jika Anda ingin satu jawaban diperbaiki, bukan dua jawaban dibandingkan, lakukan hal lain: ganti model dalam thread yang sama dan minta model kedua mengkritik model pertama.

Mengapa benchmark tidak menjawab pertanyaan Anda

Benchmark yang dipublikasikan mengukur performa pada tugas terstandar. Pertanyaan Anda lebih spesifik dan lebih berguna: model mana yang lebih baik untuk hal yang Anda kerjakan sendiri dua puluh kali seminggu. Itu pertanyaan yang berbeda, dan pertanyaan kedua ini tidak punya jawaban yang dipublikasikan karena tidak ada orang lain dengan beban kerja seperti Anda.

Menjalankan satu prompt pada dua model memakan waktu sekitar tiga puluh detik dan menjawabnya secara langsung. Yang penting bukan bahwa Anda mendapat dua jawaban, melainkan Anda jadi tahu seberapa besar kesenjangannya. Terkadang hasilnya hampir identik, yang menandakan Anda bisa berhenti memikirkan pilihan model untuk tugas itu. Terkadang salah satunya tidak layak pakai, yang penting diketahui sebelum Anda membangun alur kerja di atasnya.

Hal lain yang tertangkap oleh perbandingan adalah kesalahan yang disampaikan dengan percaya diri. Ketika dua model memberi jawaban yang berbeda secara substansial atas pertanyaan faktual, setidaknya satu di antaranya salah, dan Anda tidak akan mengetahuinya jika hanya membaca salah satu. Sinyal itu tidak tersedia dalam alur kerja satu model dengan harga berapa pun.

Tentukan arti "lebih baik" sebelum Anda membaca

Jebakan dalam perbandingan berdampingan adalah lebih menyukai hasil yang lebih panjang, lebih percaya diri, atau lebih rapi. Itu semua bukan kualitas. Tentukan dulu kriteria Anda, baru membaca.

TugasArti lebih baikYang harus diabaikan
MenulisLebih sedikit perlu disunting agar siap dikirimPanjang, kosakata, antusiasme
Riset faktualSumber yang valid dan mendukung klaimKelancaran dan rasa percaya diri
EkstraksiSkema benar, tidak ada bidang karangan, label konsistenKualitas prosa di sekitar tabel
PenalaranLangkah-langkahnya masuk akal dan kasus khusus ditanganiApakah kesimpulan cocok dengan dugaan awal Anda
KodeMenangani jalur kegagalan, mudah ditinjauKecerdikan, keringkasan
MeringkasMenyimpan yang penting dan membuang yang tidakKelengkapan

Trik praktis: sebelum membaca kedua hasil, tuliskan satu kalimat yang menggambarkan isi jawaban yang baik. Lalu baca. Ini hanya butuh sepuluh detik dan mencegah bias kerapian, yang kuat dan sebagian besar tidak disadari.

Untuk pertanyaan faktual, periksa perbedaannya, bukan pemenangnya. Ketika dua model sepakat pada angka dan sumber tertentu, tingkat keyakinan cukup wajar. Ketika keduanya berbeda, itulah yang perlu diverifikasi, dan itu adalah hasil paling berharga dari seluruh latihan ini.

Prompt yang mengungkap perbedaan nyata

Beberapa tugas memisahkan model secara tajam, sebagian lainnya tidak. Jika Anda ingin belajar sesuatu dari perbandingan, gunakan prompt yang menekan kemampuan tertentu.

  • Nada di situasi sulit. Write a note to a client explaining that we missed the deadline, taking responsibility without over-apologising and without excuses. Under 120 words. Perbedaan gaya bahasa langsung terlihat di sini.
  • Ekstraksi ketat. Extract every date, amount, and party from this text into a JSON array with exactly these keys. If a field is absent, use null. Do not infer. Menguji disiplin format dan kecenderungan mengarang.
  • Penalaran dengan jebakan. Beri masalah dengan jawaban salah yang tampak masuk akal, seperti soal rasio atau proporsi di mana jalan pintas intuitif ternyata keliru. Model berbeda-beda dalam mengambil jalan pintas itu.
  • Ingatan konteks panjang. Unggah dokumen panjang dan tanyakan sesuatu di bagian tengahnya. Mengungkap konteks yang benar-benar bisa dipakai, bukan konteks yang diiklankan.
  • Mengakui ketidaktahuan. What was announced about [something genuinely obscure or very recent]? Jawaban terbaik adalah "saya tidak tahu" yang jelas atau pengambilan data bersumber. Karangan di sini tidak bisa ditoleransi.
  • Mengikuti batasan negatif. Explain X without using any analogy or metaphor. Kepatuhan pada instruksi negatif bervariasi lebih dari yang Anda kira.

Jalankan perbandingan pada pekerjaan nyata Anda sendiri, bukan pada teka-teki. Model yang lebih baik untuk laporan kuartalan Anda lebih berguna daripada model yang lebih baik untuk teka-teki logika.

Mengubah seminggu perbandingan menjadi peta perutean

Satu perbandingan itu menarik. Seminggu penuh perbandingan itu bisa ditindaklanjuti. Rutinitasnya:

  1. Selama lima hari, setiap kali sebuah tugas benar-benar penting, jalankan pada dua model, bukan satu.
  2. Catat jenis tugas, pemenangnya, dan seberapa besar kesenjangannya. Tiga kata sudah cukup.
  3. Di akhir minggu, lihat di mana satu model menang berulang kali dan di mana hasilnya bisa saling menggantikan.
  4. Tetapkan default Anda dari situ, dan berhenti membandingkan pada tugas yang kesenjangannya konsisten nihil.

Yang biasanya ditemukan orang adalah bahwa perbandingan penting hanya pada sebagian kecil pekerjaan mereka dan buang-buang waktu untuk sisanya. Pencarian faktual cepat, penulisan ulang sederhana, dan pemformatan rutin jarang membedakan model. Tulisan yang akan dibaca pelanggan, riset yang akan menjadi dasar keputusan, dan penalaran tentang hal yang belum familiar sangat membedakan mereka.

Hasil itulah imbalannya: Anda berhenti membandingkan di tempat yang tidak ada bedanya dan tetap melakukannya untuk tugas yang mengubah hasil akhir.

Berdampingan versus berurutan

Dua teknik berbeda yang layak dibedakan.

Berdampingan menjalankan prompt yang sama pada dua model yang tidak bisa melihat hasil satu sama lain. Setiap kolom menyimpan percakapan tersembunyinya sendiri, diberi nama dengan awalan [Compare] dan disembunyikan dari sidebar, sehingga pertanyaan lanjutan tetap menjadi uji yang adil: kedua model memegang konteks multi giliran yang independen. Ini alat yang tepat untuk memilih model default dan menangkap perbedaan pendapat faktual.

Berurutan berarti mendapatkan satu jawaban, lalu berganti model dalam thread yang sama dan meminta model baru untuk mengkritiknya. Gunakan ini saat Anda ingin kelemahan ditemukan, bukan perbandingan dibuat, karena model kedua bisa langsung terlibat dengan argumen spesifik itu. Lihat beralih model di tengah percakapan.

Aturan kasar: berdampingan untuk memutuskan model mana, berurutan untuk memperbaiki jawaban.

Daftar Periksa
  • Tulis dan sempurnakan prompt di chat biasa sebelum membandingkan
  • Tentukan arti "lebih baik" untuk tugas ini sebelum membaca kedua hasil
  • Tulis satu kalimat yang menggambarkan jawaban yang baik, baru membaca, untuk menghindari bias kerapian
  • Untuk pertanyaan faktual, anggap perbedaan pendapat sebagai temuan dan verifikasi
  • Bandingkan pada pekerjaan nyata Anda sendiri, bukan pada teka-teki
  • Catat pemenang dan besar kesenjangan selama seminggu, lalu tetapkan default dari polanya
  • Berhenti membandingkan pada tugas yang kesenjangannya konsisten nihil

Pertanyaan Umum

Berapa banyak model yang bisa saya bandingkan sekaligus?

Perbandingan berdampingan adalah fitur Powerhouse, dan menjalankan dua model sekaligus, yang memang disengaja: dua kolom adalah tata letak yang benar-benar bisa dibaca dengan cermat. Tiga kolom cenderung membuat Anda hanya membaca sekilas, dan itu menggagalkan tujuannya, karena nilai dari latihan ini ada pada menyadari di mana jawaban-jawaban itu benar-benar berbeda.

Apakah perbandingan berdampingan menggunakan lebih banyak pesan bulanan saya?

Ya, biayanya dua kali lipat: dua model masing-masing menghasilkan satu jawaban, dan setiap jawaban ditagih sesuai tarif kreditnya sendiri, jadi membandingkan model 10 kredit dengan model 20 kredit menghabiskan 30 kredit, bukan 10 atau 20. Menangkap jawaban yang salah atau draf yang tidak layak sebelum dikirim biasanya sepadan dengan itu. Pendekatan yang efisien adalah membandingkan untuk keputusan dan hasil kerja penting, dan menggunakan satu model saja untuk pencarian rutin dan penulisan ulang cepat.

Bagaimana jika kedua jawaban sama-sama bagus?

Itu hasil yang nyata dan berguna: itu menandakan tugas ini tidak bergantung pada pilihan model, jadi berhenti mencurahkan perhatian di situ dan gunakan model default Anda. Sebagian besar beban kerja terbagi seperti ini, dengan mayoritas tugas di mana model bisa saling menggantikan dan sebagian kecil di mana kesenjangannya besar. Mengetahui mana yang mana adalah tujuan menjalankan perbandingan selama seminggu.

Bagaimana cara menghindari sekadar memilih jawaban yang terdengar lebih bagus?

Tentukan kriteria Anda sebelum membaca. Hasil yang lebih panjang, lebih percaya diri, dan lebih rapi secara sistematis lebih disukai bahkan ketika sebenarnya lebih buruk, dan bias itu sebagian besar tidak disadari. Menulis satu kalimat tentang isi jawaban yang baik, sebelum Anda melihatnya, sudah cukup untuk melawan sebagian besar bias itu. Untuk pekerjaan faktual, nilai berdasarkan apakah sumbernya valid dan mendukung klaim, bukan berdasarkan bagaimana jawabannya terbaca.

Dua model mana yang sebaiknya saya bandingkan?

Bandingkan dua model yang benar-benar sedang Anda pertimbangkan untuk tugas spesifik itu, yang bagi kebanyakan orang berarti Claude melawan GPT untuk menulis dan bernalar, atau model dengan konteks besar melawan model default Anda ketika ada dokumen yang terlibat. Membandingkan model yang tidak akan pernah Anda pakai dengan model favorit Anda tidak memberi tahu Anda apa pun yang bisa ditindaklanjuti.