Kenapa satu model tidak mencukupi
Hujah biasa untuk menggunakan beberapa model AI ialah setiap satu lebih baik pada sesuatu, jadi anda patut pilih yang terbaik bagi setiap tugas. Benar, tetapi itu sebab yang paling kurang menarik.
Sebab yang lebih baik ialah model tidak boleh melihat titik butanya sendiri. Minta model menyemak kerjanya sendiri dan ia kebanyakannya akan mengesahkannya, kerana pemberat yang sama yang menghasilkan kesilapan itu juga menghasilkan keyakinan itu. Minta model berbeza, dilatih secara berbeza atas data berbeza dengan mod kegagalan berbeza, dan ia akan mengesan perkara yang model pertama tidak dapat. Ini bukan helah, ia sebab yang sama anda minta rakan sekerja membaca e-mel anda sebelum menghantarnya kepada klien.
Sebab kedua bersifat praktikal: kepimpinan model sentiasa berubah. Sesiapa yang terbaik dalam pengekodan suku tahun ini mungkin bukan suku tahun depan. Aliran kerja yang dibina atas satu penjual perlu dibina semula setiap kali kedudukan itu berubah. Aliran kerja yang dibina atas idea bahawa anda menukar model tidak menghadapi masalah sedemikian.
Apa yang berikut adalah empat corak, mengikut susunan berapa banyak nilai yang ditambah berbanding usaha. Anda tidak perlukan kesemua empat. Kebanyakan orang mendapat hampir segalanya daripada dua yang pertama.
Corak 1: draf, kemudian kritik dengan model berbeza
Corak bernilai tertinggi, dan yang hampir tiada siapa gunakan. Tulis dengan satu model, semak dengan satu lagi.
Ia berkesan kerana menjana dan menilai adalah kerja berbeza. Model yang menghasilkan teks sedang mengoptimumkan untuk kesinambungan yang koheren. Model yang menilai teks yang bukan ia tulis tiada kepentingan dalam hujah itu, jadi ia akan berkata perenggan ketiga tidak menyambung berbanding menutupinya.
Prompt itu penting secara besar-besaran di sini. Bertanya "apa pendapat anda tentang ini" mendapatkan anda pujian. Minta ini sebaliknya:
Anda tidak menulis teks di bawah dan anda tiada kepentingan di dalamnya. Semak ia sebagai penyunting skeptikal. Senaraikan, mengikut susunan: 1) sebarang dakwaan fakta yang salah, tidak disokong, atau terlalu kuat, 2) sebarang titik di mana hujah itu sebenarnya tidak menyambung, 3) perenggan tunggal paling lemah dan tepat sebabnya. Jangan tulis semula apa-apa. Jangan beritahu saya apa yang baik.
Tiga arahan di hujung itu melakukan kerja sebenar. "Jangan tulis semula" menghentikannya menghasilkan versi dalam suaranya sendiri, yang bukan apa yang anda minta. "Jangan beritahu saya apa yang baik" membuang pujian refleks yang mengisi kebanyakan maklum balas AI. "Anda tidak menulis ini" adalah pembingkaian yang berkesan secara mengejutkan, kerana ia menghentikan model daripada mempertahankan pilihan yang ia fikir miliknya.
Kemudian bawa kritikan itu kembali kepada model pertama dengan bahagian yang anda setuju. Anda adalah penyunting yang memutuskan nota mana untuk diterima, yang merupakan pembahagian kerja yang tepat.
Di mana ini berbaloi dua minit tambahan: apa sahaja yang pergi kepada klien, apa sahaja yang bersifat awam, apa sahaja di mana salah itu mahal. Di mana ia tidak: mesej slack, rangka draf pertama, senarai beli-belah.
Corak 2: semakan ketidaksepakatan
Ini perkara paling hampir dengan pengesan halusinasi boleh dipercayai yang tidak melibatkan pengesahan segalanya secara manual.
Tanya dua model berbeza soalan fakta yang sama, secara berasingan, dengan prompt yang sama. Kemudian bandingkan. Di mana mereka sepakat, anda mungkin selamat. Di mana mereka tidak sepakat, anda telah menjumpai lokasi tepat yang perlu disemak.
Itulah keseluruhan teknik itu, dan ia berkuasa kerana halusinasi biasanya tidak dikongsi. Apabila satu model mengarang statistik, nama kes, tandatangan fungsi, atau tarikh, model berbeza yang dilatih secara berbeza jarang mengarang yang sama. Persetujuan adalah bukti lemah bagi ketepatan. Ketidaksepakatan adalah bukti kuat bahawa sesuatu itu salah, dan ia menunjuk terus kepadanya.
Untuk apa sahaja dengan beberapa dakwaan, jadikan perbandingan itu melakukan kerja untuk anda:
Di bawah adalah dua jawapan kepada soalan yang sama, ditanda A dan B. Abaikan gaya dan panjang. Senaraikan setiap titik substantif di mana mereka tidak sepakat, termasuk perbezaan dalam nombor, tarikh, nama, dan betapa kuat sesuatu itu didakwa. Bagi setiap ketidaksepakatan, nyatakan mana yang lebih berkemungkinan betul dan sumber tunggal apa yang akan menyelesaikannya.
Anda berakhir dengan senarai pendek perkara untuk disemak berbanding dokumen panjang untuk disahkan fakta, dan senarai itu biasanya betul tentang di mana masalah itu berada.
Dua amaran. Pertama, model boleh berkongsi kesilapan jika ia biasa di internet, jadi ini menangkap rekaan berbanding maklumat salah yang meluas. Kedua, jangan langkau pengesahan kerana dua model bersetuju. Ini mengecilkan apa yang anda semak, ia tidak membuang keperluan untuk menyemak.
Guna ini pada: statistik, dakwaan undang-undang dan perubatan, fakta sejarah, butiran API, apa sahaja yang anda akan dipetik. Langkau ini pada: pendapat, kerja kreatif, dan apa sahaja di mana betul secara anggaran adalah memadai.
Corak 3: halakan mengikut tugas
Corak yang jelas, berbaloi dilakukan dengan betul. Hantar setiap jenis kerja kepada model yang paling baik pada perkara itu, berbanding menghantar segalanya kepada mana-mana yang anda ada terbuka.
| Tugas | Guna | Kerana |
|---|---|---|
| Draf pertama apa sahaja yang ditulis | Model penulisan paling kukuh | Anda sedang membeli masa penyuntingan yang lebih rendah |
| Semakan draf itu | Model berbeza | Mata segar, mod kegagalan berbeza |
| Apa sahaja tentang minggu ini | Model dengan carian langsung | Data latihan sentiasa ketinggalan |
| Dokumen atau pangkalan kod yang sangat panjang | Model konteks besar | Ia perlu muat sebelum ia boleh difahami |
| Logik keras, matematik, atau pepijat yang rumit | Model penaakulan dengan pemikiran lanjutan | Lebih perlahan dan jauh lebih tepat pada masalah berbilang langkah |
| Kerja berulang jumlah tinggi | Model murah dan pantas | Kualiti unggulan dibazirkan pada pengelasan dan penandaan |
| Apa sahaja sensitif | Mana-mana yang memenuhi peraturan data anda | Keupayaan tidak mengatasi kewajipan anda |
Satu tabiat yang berbaloi dibina: berhenti melalaikan. Kebanyakan orang menggunakan mana-mana model yang langganan mereka berikan untuk segalanya, termasuk tugas yang ia lemah, dan membuat kesimpulan bahawa AI teruk pada tugas tersebut. Sepuluh saat berfikir tentang model mana yang sesuai mengubah hasil lebih daripada sejam penalaan prompt.
Untuk versi lebih lengkap keputusan ini, lihat cara memilih model AI, dan apakah tetingkap konteks untuk sebab baris dokumen panjang wujud. Jurang yang baris itu meliputi adalah luas: Claude Sonnet 5 dan Gemini 3.1 Pro mengambil konteks 1M token manakala DeepSeek V3.2 berhenti pada 164K, mengikut indeks kos model Whizi dengan harga dan saiz konteks diambil 2026-08-20.
Corak 4: geganti dengan serah tugas bertulis
Bagi kerja yang merentasi beberapa peringkat, titik kegagalan ialah jurang antara peringkat. Anda menerangkan projek itu kepada satu model, sampai ke suatu tempat yang berguna, kemudian beralih kepada model lain dan sama ada menampal timbunan sejarah atau menerangkan segalanya semula dengan buruk.
Betulkan dengan meminta serah tugas secara eksplisit sebelum anda menukar:
Tulis taklimat serah tugas untuk pembantu lain yang belum melihat perbualan ini. Sertakan: apa yang kita cuba hasilkan, keputusan yang telah dibuat dan sebabnya, kekangan dan perkara untuk dielakkan, apa yang telah dicuba dan ditolak, dan tepat apa yang saya perlukan seterusnya. Jadilah cukup spesifik supaya ia boleh menyambung tanpa bertanya sebarang soalan kepada saya.
Ini berguna walaupun anda tidak menukar model. Ia cara paling bersih untuk terlepas daripada perbualan panjang yang telah menjadi perlahan dan kabur, kerana anda mengekalkan substans dan membuang bunyi terkumpul. Tampal taklimat itu ke dalam sembang baharu dan kualiti biasanya melonjak serta-merta.
Geganti yang realistik kelihatan seperti ini. Beri laporan 200 muka surat kepada model konteks besar dan minta ringkasan berstruktur dengan sepuluh petikan yang penting, dipetik. Bawa itu ke dalam model penulisan yang kukuh dan hasilkan nota klien. Jalankan laluan kritikan daripada corak satu dengan model ketiga. Jumlah masa, kira-kira lima belas minit, dan setiap peringkat menggunakan alat yang sesuai untuknya.
Bila untuk tidak kisah
Aliran kerja berbilang model mempunyai overhed, dan berpura-pura sebaliknya adalah bagaimana orang berakhir dengan proses rumit untuk menulis e-mel dua baris.
Guna satu model apabila: tugas itu kecil, kos salah itu rendah, anda meneroka berbanding menghasilkan, anda beriterasi dengan pantas dan geseran itu akan memecahkan aliran anda, atau kerja itu benar-benar kreatif dan pendapat kedua hanya mengeruhkan suara anda.
Guna dua atau lebih apabila: hasil itu pergi kepada orang lain, ketepatan fakta penting, tugas itu mempunyai peringkat berbeza yang memerlukan kekuatan berbeza, anda tersekat dan memerlukan sudut yang benar-benar berbeza, atau anda akan membuat keputusan berdasarkan apa yang model itu beritahu anda.
Peraturan yang munasabah: jika anda akan minta rakan sekerja melihatnya, minta model kedua. Jika anda tidak akan, jangan.
Menjadikannya praktikal
Semua ini mudah pada prinsipnya dan menjengkelkan pada praktiknya jika setiap model tinggal di sebalik langganan berbeza. Geseran itu nyata: tab berasingan, sejarah berasingan, menyalin konteks antara mereka, kehilangan pemformatan, dan rintangan kecil yang bermakna anda melangkau laluan kritikan pada hari anda paling memerlukannya.
Geseran itu tepat sebabnya corak di atas kurang digunakan. Setiap satu mengambil masa kira-kira dua minit; penjongkangan tab di sekelilingnya yang membunuh tabiat itu pada hari sibuk.
Inilah tujuan ruang kerja berbilang model. Dalam Whizi, model-model itu duduk dalam satu perbualan, jadi laluan kritikan adalah menukar model dan bertanya, bukan membuka produk lain dan menampal draf anda. Satu sejarah, satu carian merentas segala yang pernah anda tanya, satu bil. Lihat menukar model pertengahan perbualan dan membandingkan model bersebelahan untuk cara kedua-dua langkah itu sebenarnya berfungsi.
Jika anda lebih suka menyusunnya sendiri daripada langganan berasingan, corak ini masih berfungsi dan anda masih patut gunakannya. Satu-satunya perkara yang berubah ialah berapa kerap anda boleh bersusah payah. Beri harga kepada penyusunan itu dengan jujur pula: ChatGPT Plus dan Claude Pro masing-masing disenaraikan pada $20 sebulan setakat Ogos 2026, jadi persediaan dua model berkos $40 sebelum anda menambah penyedia ketiga. Jika anda sudah membayar untuk dua atau tiga pelan untuk menjadikan ini mungkin, jalankan kalkulator penjimatan dahulu, kerana itu biasanya cara yang lebih mahal untuk mendapatkan hasil yang sama.
Mula dengan corak satu. Ambil perkara seterusnya yang anda tulis yang orang lain akan baca, jalankan prompt kritikan melalui model berbeza, dan lihat apa yang ia jumpa. Tabiat tunggal itu bernilai lebih daripada selebihnya artikel ini.
- Draf dengan satu model dan kritik dengan yang berbeza sebelum apa-apa dihantar keluar
- Guna prompt kritikan yang melarang penulisan semula dan melarang pujian
- Tanya dua model soalan fakta yang sama dan semak setiap titik di mana mereka berbeza
- Halakan dokumen panjang, logik keras, dan soalan langsung kepada model yang sesuai untuknya
- Minta taklimat serah tugas bertulis sebelum menukar model atau memulakan sembang baharu
- Langkau semua ini untuk kerja kecil, berisiko rendah, atau penerokaan
Soalan Lazim
Kenapa guna lebih daripada satu model AI?
Kerana model tidak boleh melihat titik butanya sendiri. Model kedua, dilatih secara berbeza, menangkap kesilapan yang model pertama yakin tentangnya. Ia juga bermakna aliran kerja anda tidak pecah setiap kali makmal berbeza mengambil alih kepimpinan pada tugas tertentu.
Bagaimana saya menangkap halusinasi AI?
Tanya dua model berbeza soalan yang sama secara berasingan dan bandingkan. Fakta rekaan jarang direka dengan cara yang sama dua kali, jadi mana-mana titik di mana jawapan itu tidak sepakat adalah tempat anda patut sahkan. Persetujuan mengecilkan apa yang anda semak tetapi tidak membuang keperluan untuk menyemak.
Model mana yang patut menulis dan mana yang patut menyemak?
Draf dengan mana-mana model yang memerlukan penyuntingan paling sedikit untuk jenis kerja anda, biasanya model penulisan yang kukuh, dan semak dengan yang berbeza. Penyemak itu kurang penting berbanding fakta bahawa ia model berbeza dengan mod kegagalan berbeza.
Adakah menggunakan pelbagai model berbaloi dengan masa tambahan?
Bagi apa sahaja yang pergi kepada orang lain atau yang anda akan dipertanggungjawabkan, ya, dan laluan kritikan mengambil masa kira-kira dua minit. Untuk kerja pantas, berisiko rendah, atau penerokaan ia adalah overhed yang anda tidak perlukan. Jika anda akan minta rakan sekerja menyemaknya, minta model kedua.
Perlukah saya beberapa langganan untuk melakukan ini?
Tidak. Ruang kerja berbilang model memberi anda model utama pada satu pelan dan satu sejarah, yang membuang geseran yang menyebabkan orang melangkau langkah-langkah ini. Langganan berasingan juga berfungsi, ia hanya menjadikan tabiat baik lebih sukar dikekalkan.