Cara membandingkan model AI secara bersebelahan dalam Whizi

Jawapan Ringkas

Untuk membandingkan model AI secara bersebelahan dalam Whizi, tekan Compare pada pengepala sembang, pilih satu model untuk setiap lajur, dan hantar satu prompt kepada kedua-duanya. Setiap lajur mengekalkan konteksnya sendiri, jadi tiada jawapan yang dipengaruhi oleh yang lain. Bersebelahan ialah ciri Powerhouse, dan setiap jawapan dikenakan bayaran mengikut kadar kredit modelnya sendiri.

Jawapan ringkas

Tekan Compare pada pengepala sembang, pilih satu model untuk setiap lajur, dan hantar satu prompt kepada kedua-duanya. Setiap lajur mengekalkan perbualan tersembunyinya sendiri, jadi tiada model melihat output model lain dan tiada jawapan yang dipengaruhi oleh yang lain, itulah sebab sepenuhnya mengapa perbandingan ini bernilai. Lajur-lajur ini menstrim satu demi satu, kiri kemudian kanan, kerana hanya satu penjanaan berjalan bagi setiap akaun pada satu masa.

Perbandingan bersebelahan ialah ciri Powerhouse dan menjalankan dua model pada satu masa. Setiap jawapan dikenakan bayaran mengikut kadar kredit modelnya sendiri, jadi membandingkan model 10 kredit dengan model 20 kredit menelan kos 30 kredit.

Gunakannya untuk menentukan model mana yang patut menjadi lalai anda untuk sesuatu jenis kerja. Jika anda mahu satu jawapan diperbaiki dan bukannya dua jawapan dibandingkan, lakukan perkara lain sebaliknya: tukar model dalam bebenang yang sama dan minta model kedua mengkritik yang pertama.

Mengapa penanda aras tidak menjawab soalan anda

Penanda aras yang diterbitkan mengukur prestasi pada tugasan yang piawai. Soalan anda lebih khusus dan lebih berguna: model mana yang lebih baik dalam perkara yang anda sendiri lakukan dua puluh kali seminggu. Itu soalan yang berbeza, dan soalan kedua tiada jawapan yang diterbitkan kerana tiada siapa mempunyai beban kerja anda.

Menjalankan satu prompt terhadap dua model mengambil masa kira-kira tiga puluh saat dan menjawabnya secara langsung. Bahagian penting bukanlah anda mendapat dua jawapan, tetapi anda mengetahui sebesar mana jurang itu. Kadangkala output hampir sama, yang memberitahu anda untuk berhenti memikirkan pilihan model bagi tugas itu. Kadangkala satu daripadanya tidak boleh digunakan, yang berbaloi untuk diketahui sebelum anda membina aliran kerja berdasarkannya.

Perkara lain yang ditangkap oleh perbandingan ialah kesilapan yang yakin. Apabila dua model memberikan jawapan yang berbeza secara substansial kepada soalan berbentuk fakta, sekurang-kurangnya satu adalah salah, dan anda tidak akan mengetahuinya jika hanya membaca salah satu sahaja. Isyarat itu tidak wujud dalam aliran kerja satu model pada sebarang harga.

Tentukan maksud lebih baik sebelum anda membaca

Perangkap dalam perbandingan bersebelahan ialah lebih menyukai output mana-mana yang lebih panjang, lebih yakin, atau lebih lancar. Itu bukan kualiti. Tetapkan kriteria anda dahulu, kemudian baca.

TugasApa maksud lebih baikApa yang harus diabaikan
PenulisanMemerlukan sedikit penyuntingan untuk boleh dihantarPanjang, kosa kata, semangat
Penyelidikan berasaskan faktaSumber yang boleh disahkan dan menyokong dakwaanKelancaran dan keyakinan
PengekstrakanSkema yang betul, tiada medan yang direka, label yang konsistenKualiti prosa di sekeliling jadual
PenaakulanLangkah-langkah kukuh dan kes tepi ditanganiSama ada kesimpulan sepadan dengan jangkaan anda
KodMenangani laluan kegagalan, boleh disemakKebijaksanaan, keringkasan
PeringkasanMengekalkan perkara yang penting dan membuang yang tidakKesyumulan

Satu helah praktikal: sebelum membaca mana-mana output, tulis satu ayat menerangkan apa yang sepatutnya terkandung dalam jawapan yang baik. Kemudian baca. Ia mengambil masa sepuluh saat dan ia menghalang bias kelancaran, yang kuat dan kebanyakannya tidak disedari.

Untuk soalan berbentuk fakta, semak percanggahan berbanding pemenang. Apabila dua model bersetuju tentang satu nombor khusus dan satu sumber, keyakinan adalah munasabah. Apabila mereka berbeza pendapat, itulah perkara yang perlu disahkan, dan itulah output paling bernilai daripada keseluruhan latihan ini.

Prompt yang mendedahkan perbezaan sebenar

Sesetengah tugas memisahkan model dengan ketara dan sesetengah tidak. Jika anda mahu mempelajari sesuatu daripada perbandingan, gunakan prompt yang menekan keupayaan tertentu.

  • Nada dalam kesukaran. Tulis nota kepada pelanggan yang menerangkan bahawa kami terlepas tarikh akhir, bertanggungjawab tanpa meminta maaf secara berlebihan dan tanpa alasan. Kurang daripada 120 patah perkataan. Perbezaan dalam nada kelihatan serta-merta di sini.
  • Pengekstrakan ketat. Ekstrak setiap tarikh, jumlah, dan pihak daripada teks ini ke dalam array JSON dengan kunci-kunci ini dengan tepat. Jika medan tiada, gunakan null. Jangan buat andaian. Menguji disiplin format dan kecenderungan untuk mereka-reka.
  • Penaakulan dengan perangkap. Berikan masalah dengan jawapan salah yang munasabah, seperti soalan kadar atau perkadaran di mana laluan intuitif adalah salah. Model berbeza dari segi sama ada mereka mengambil jalan pintas.
  • Ingatan konteks panjang. Muat naik dokumen yang panjang dan tanya tentang sesuatu di bahagian tengah. Mendedahkan konteks sebenar yang boleh digunakan, bukan konteks yang diiklankan.
  • Mengakui ketidaktahuan. Apakah yang diumumkan tentang [sesuatu yang benar-benar kurang dikenali atau sangat terkini]? Jawapan terbaik ialah "saya tidak tahu" yang jelas atau capaian bersumber. Rekaan di sini adalah pendiskualifikasi.
  • Mengikut kekangan negatif. Terangkan X tanpa menggunakan sebarang analogi atau metafora. Pematuhan terhadap arahan negatif berbeza lebih daripada yang anda jangkakan.

Jalankan perbandingan pada kerja sebenar anda sendiri dan bukannya pada teka-teki. Model yang lebih baik dalam laporan suku tahunan anda lebih berguna daripada model yang lebih baik dalam teka-teki logik.

Bersebelahan berbanding berurutan

Dua teknik yang berbeza, wajar dibezakan.

Bersebelahan menjalankan prompt yang sama terhadap dua model yang tidak dapat melihat output satu sama lain. Setiap lajur mengekalkan perbualan tersembunyinya sendiri, dinamakan dengan awalan [Compare] dan dikekalkan di luar bar sisi, jadi soalan susulan kekal sebagai ujian yang adil: kedua-dua model memegang konteks berbilang giliran yang bebas. Ini adalah alat yang tepat untuk memilih model lalai dan untuk menangkap percanggahan fakta.

Berurutan bermaksud mendapatkan jawapan, kemudian menukar model dalam bebenang yang sama dan meminta model baharu mengkritiknya. Gunakannya apabila anda mahu kelemahan itu ditemui dan bukannya perbandingan dibuat, kerana model kedua boleh terlibat secara langsung dengan hujah tertentu. Lihat menukar model di tengah perbualan.

Peraturan kasar: bersebelahan untuk memutuskan model mana, berurutan untuk memperbaiki jawapan.

Senarai Semak
  • Tulis dan perhalusi prompt dalam sembang biasa sebelum membandingkan
  • Tentukan maksud lebih baik untuk tugas ini sebelum anda membaca mana-mana output
  • Tulis satu ayat menerangkan jawapan yang baik, kemudian baca, untuk mengelak bias kelancaran
  • Pada soalan berbentuk fakta, anggap percanggahan sebagai penemuan dan pergi sahkan
  • Bandingkan pada kerja sebenar anda sendiri, bukan pada teka-teki
  • Catatkan pemenang dan saiz jurang selama seminggu, kemudian tetapkan lalai berdasarkan corak itu
  • Berhenti membandingkan pada tugas di mana jurang itu sentiasa kosong

Soalan Lazim

Berapa banyak model boleh saya bandingkan pada satu masa?

Perbandingan bersebelahan ialah ciri Powerhouse, dan ia menjalankan dua model pada satu masa, yang memang disengajakan: dua lajur ialah susun atur yang benar-benar boleh anda baca dengan teliti. Tiga lajur cenderung menjadi imbasan pantas, dan imbasan pantas menggagalkan tujuannya, kerana nilai latihan ini terletak pada mengesan di mana jawapan itu benar-benar berbeza.

Adakah bersebelahan menggunakan lebih banyak mesej bulanan saya?

Ya, ia menelan kos dua kali ganda: dua model masing-masing menghasilkan satu jawapan, dan setiap jawapan dikenakan bayaran mengikut kadar kreditnya sendiri, jadi membandingkan model 10 kredit dengan model 20 kredit membelanjakan 30 kredit dan bukannya 10 atau 20. Menangkap jawapan yang salah atau draf yang tidak boleh digunakan sebelum ia dihantar biasanya berbaloi dengan kos itu. Pendekatan yang cekap ialah membandingkan pada keputusan dan hasil kerja, dan menggunakan satu model untuk carian rutin dan penulisan semula pantas.

Bagaimana jika kedua-dua jawapan sama baik?

Itu hasil yang nyata dan berguna: ia memberitahu anda bahawa tugas ini tidak bergantung kepada pilihan model, jadi berhenti membazir perhatian padanya dan gunakan mana-mana yang menjadi lalai anda. Kebanyakan beban kerja terbahagi begini, dengan majoriti tugas di mana model-model itu boleh ditukar ganti dan minoriti di mana jurangnya besar. Mengetahui yang mana satu adalah tujuan menjalankan perbandingan selama seminggu.

Bagaimana saya elakkan hanya memilih jawapan yang bunyinya lebih baik?

Tentukan kriteria anda sebelum membaca. Output yang lebih panjang, lebih yakin, dan lebih lancar secara sistematik lebih disukai walaupun ia lebih buruk, dan bias itu kebanyakannya tidak disedari. Menulis satu ayat tentang apa yang sepatutnya terkandung dalam jawapan yang baik, sebelum anda melihatnya, sudah memadai untuk menangkis kebanyakan bias itu. Untuk kerja berbentuk fakta, nilai berdasarkan sama ada sumber boleh disahkan dan menyokong dakwaan itu, bukan berdasarkan cara jawapan itu berbunyi.

Dua model mana yang patut saya bandingkan?

Bandingkan dua model yang benar-benar anda sedang putuskan untuk tugas tertentu itu, yang bagi kebanyakan orang ialah Claude berbanding GPT untuk penulisan dan penaakulan, atau model konteks besar berbanding lalai anda apabila dokumen terlibat. Membandingkan model yang anda tidak akan sekali-kali gunakan dengan kegemaran anda tidak memberitahu anda apa-apa yang boleh anda tindaki.