Cara mengetahui sama ada model AI baharu benar-benar lebih baik untuk kerja anda

Jawapan Ringkas

Untuk menilai model AI, ujinya pada kerja anda sendiri berbanding membaca penanda aras pelancaran. Kumpulkan lima tugas sebenar dari dua minggu lepas, tuliskan apa yang terkandung dalam jawapan yang baik sebelum anda menjalankan apa-apa, jalankan kedua-dua model secara selari, dan nilai berdasarkan usaha penyuntingan berbanding cara output itu dibaca. Simpan log tersebut.

Kenapa penanda aras pelancaran tidak akan menjawab soalan anda

Setiap keluaran garis depan tiba dengan carta yang menunjukkannya mendahului dalam satu set penilaian piawai. Nombor tersebut adalah benar dan pada masa yang sama hampir tidak berguna untuk memutuskan apa yang perlu anda gunakan pada hari Isnin, atas tiga sebab.

Margin adalah kecil dan tugasnya bukan tugas anda. Perbezaan dua mata pada penanda aras penaakulan tidak memberitahu anda sama ada satu model menulis emel klien yang lebih baik atau mengekalkan skema dengan lebih boleh dipercayai merentasi dua ratus baris.

Penanda aras mengukur tugas yang mudah dinilai. Perkara yang mempunyai jawapan yang betul. Kebanyakan kerja profesional tidak mempunyai satu jawapan sedemikian: nada, struktur, pertimbangan tentang apa yang perlu ditinggalkan. Itulah tepatnya di mana model paling banyak berbeza dan di mana tiada apa yang diukur.

Perbandingan pelancaran dibuat oleh vendor. Bukan secara tidak jujur, semestinya, tetapi tiada siapa yang menerbitkan penilaian di mana model mereka berada di tempat kedua.

Soalan yang berbaloi dijawab adalah lebih khusus: pada tugas khusus yang anda lakukan dua puluh kali seminggu, yang manakah antara dua model ini lebih baik? Itu tiada jawapan yang diterbitkan, dan ia mengambil masa kira-kira sejam untuk mengetahuinya.

Apa yang sebenarnya cenderung berubah antara keluaran

Merentasi keluaran garis depan terkini, penambahbaikan yang penting dalam penggunaan harian secara konsisten berada dalam bidang yang sama, dan ia jarang menjadi yang ditonjolkan dalam pengumuman.

Apa yang bertambah baikBagaimana anda perasanAdakah penanda aras menunjukkannya
Kepatuhan arahanIa berhenti mengabaikan kekangan ketiga andaJarang
Arahan negatif"Jangan gunakan analogi" benar-benar dipatuhiTidak
Ingatan konteks panjangIa menemui perkara pada muka surat 140, bukan sekadar muka surat 3Sebahagian
Disiplin formatJadual mempunyai lajur yang anda minta, setiap kaliTidak
Ketidakpastian yang ditentukurIa berkata ia tidak tahu berbanding mereka-rekaTidak
Kawalan nadaKurang penulisan semula sebelum sesuatu boleh dihantarTidak
Kedalaman penaakulanIa menangkap kes tepi yang anda terlepasYa, inilah yang mereka ukur

Lima daripada tujuh perkara itu tidak kelihatan dalam carta penanda aras dan itulah sebab model baharu terasa lebih baik atau lebih buruk untuk digunakan. Kepatuhan arahan khususnya adalah perbezaan antara draf pertama yang anda sunting dengan draf pertama yang anda buang.

Penilaian sejam

Lakukan ini berbanding membaca liputan pelancaran. Jalankan kedua-dua model bersebelahan pada bahan anda sendiri.

  1. Kumpulkan lima tugas sebenar dari dua minggu lepas. Yang sebenar, dengan konteks sebenar anda ditampal, bukan gesaan mainan. Sertakan sekurang-kurangnya satu tugas penulisan, satu tugas output berstruktur, dan satu di mana anda memerlukan penaakulan tentang sesuatu yang tidak biasa.
  2. Tuliskan apa yang terkandung dalam jawapan yang baik untuk setiap satu, dalam satu ayat, sebelum anda menjalankan apa-apa. Ini adalah langkah yang menghalang anda daripada memilih mana-mana output yang lebih panjang dan lebih yakin, yang merupakan bias yang kuat dan sebahagian besarnya tidak disedari.
  3. Jalankan setiap tugas terhadap kedua-dua model secara selari supaya tiada jawapan yang dipengaruhi oleh yang lain.
  4. Nilai berdasarkan usaha penyuntingan, bermaksud berapa banyak kerja antara output dengan sesuatu yang akan anda hantar. Bukan berdasarkan cara ia dibaca.
  5. Catat saiz jurang, bukan sekadar pemenang. Keputusan yang boleh ditukar ganti memberitahu anda untuk berhenti memikirkan pemilihan model bagi tugas itu, yang sebenarnya berguna.
  6. Simpan log tersebut. Dalam tiga bulan, apabila keluaran seterusnya tiba, anda menjalankan semula lima tugas yang sama dan mendapat jawapan sebenar dalam dua puluh minit.

Perkara terakhir itu adalah yang berganda. Set penilaian yang disimpan adalah satu-satunya perkara yang menjadikan setiap keluaran seterusnya murah untuk dinilai.

Enam gesaan yang membezakan model garis depan

Soalan umum menghasilkan jawapan yang serupa daripada mana-mana model yang berkeupayaan. Jika anda mahu melihat perbezaan, kenakan tekanan pada keupayaan tertentu.

  • Nada di bawah kesukaran. Write a note telling a client we missed the deadline. Take responsibility without over-apologising and without excuses. Under 120 words. Perbezaan register kelihatan serta-merta.
  • Kekangan negatif. Explain [concept] without using any analogy or metaphor. Kepatuhan terhadap arahan negatif berbeza jauh lebih daripada yang anda jangkakan.
  • Pengekstrakan ketat. Extract every date, amount, and party into a JSON array with exactly these keys. If a field is absent use null. Do not infer. Menguji disiplin format dan kecenderungan untuk mengisi jurang.
  • Ingatan konteks panjang. Muat naik dokumen panjang dan tanya tentang sesuatu di tengah-tengahnya. Mendedahkan konteks yang boleh digunakan, yang bukan sama dengan konteks yang diiklankan.
  • Mengaku tidak tahu. Tanya tentang sesuatu yang benar-benar kabur atau sangat baharu. Jawapan terbaik ialah "saya tidak tahu" yang jelas atau pengambilan bersumber. Rekaan di sini adalah pendiskualifikasi tanpa mengira mana-mana penanda aras.
  • Kepatuhan berbilang kekangan. Berikan enam kekangan sekali gus dan kira berapa banyak yang kekal. Satu ujian tunggal ini meramalkan kepuasan harian lebih baik daripada apa-apa lagi dalam senarai ini.

Jawapannya biasanya "kedua-duanya, untuk perkara berlainan"

Orang mendekati keluaran mahukan keputusan muktamad, dan penemuan jujur selepas menjalankan penilaian hampir selalu berpecah. Satu model menang pada penulisan dan nada. Yang satu lagi menang pada struktur ketat dan kelajuan. Mereka cukup hampir pada penaakulan umum sehingga ia tidak memutuskan apa-apa.

Itu bukan penipuan, itulah hasil sebenar, dan ia mempunyai implikasi praktikal. Jika anda hanya boleh guna satu model, anda memilih kategori tugas mana untuk menjadi lebih lemah. Jika anda boleh guna kedua-duanya, soalan keluaran berhenti menjadi "patutkah saya bertukar" dan menjadi "tugas mana yang berpindah", yang merupakan keputusan yang jauh lebih kecil dan bertaruh rendah.

Ia juga mengubah apa maksud sesuatu keluaran kepada anda. Apabila model baharu mendarat dalam ruang kerja yang sudah mempunyai beberapa model, anda menjalankan semula lima tugas anda, laraskan penghalaan anda, dan teruskan. Tiada migrasi, tiada langganan yang dibatalkan, dan tiada sebulan menggunakan sesuatu yang lebih buruk kerana anda telah komited sebelum menguji.

Apa yang perlu dilakukan pada hari pelancaran

Jangan tukar lalai anda serta-merta. Tanggapan minggu pelancaran didominasi oleh keterbaruan dan oleh contoh mana-mana yang tersebar dahulu.

Jalankan semula set penilaian anda. Dua puluh minit jika anda menyimpan satu dari kali lepas.

Semak perkara membosankan. Tetingkap konteks, sama ada gesaan sedia ada anda masih berkelakuan sama, dan sama ada apa-apa yang anda bergantung padanya telah berubah. Model yang lebih baik secara umum boleh menjadi lebih buruk pada templat khusus anda, dan itu berbaloi diketahui sebelum anda memindahkan kerja pengeluaran ke atasnya.

Kemas kini penghalaan mengikut tugas, bukan menyeluruh. Pindahkan kategori di mana model baharu jelas menang dan tinggalkan yang lain.

Tunggu dua minggu untuk had keupayaan. Mod kegagalan model baharu muncul dalam kira-kira dua minggu penggunaan meluas, dan ia jarang berada dalam pengumuman.

Untuk rangka kerja umum lihat cara memilih model AI, dan untuk mekanik menjalankan dua model pada satu gesaan lihat membandingkan model bersebelahan.

Senarai Semak
  • Bina satu set lima tugas sebenar daripada kerja anda sendiri dan simpannya
  • Tuliskan apa yang terkandung dalam jawapan yang baik sebelum anda membaca mana-mana output
  • Jalankan kedua-dua model secara selari supaya tiada satu mempengaruhi yang lain
  • Nilai berdasarkan usaha penyuntingan, bukan cara output itu dibaca
  • Rekod saiz jurang, memandangkan keputusan yang boleh ditukar ganti adalah maklumat berguna
  • Uji kekangan negatif dan kepatuhan berbilang kekangan secara khusus
  • Tunggu dua minggu sebelum memindahkan kerja pengeluaran ke model baharu
  • Kemas kini penghalaan mengikut tugas berbanding bertukar secara menyeluruh

Soalan Lazim

Patutkah saya bertukar kepada model terbaharu?

Bukan pada hari pelancaran, dan bukan secara menyeluruh. Jalankan semula satu set kecil tugas sebenar anda sendiri terhadap kedua-duanya, nilai berdasarkan berapa banyak penyuntingan yang diperlukan setiap output, dan pindahkan hanya kategori di mana model baharu jelas menang. Lebih baharu secara konsisten lebih baik pada sesetengah perkara dan kadangkala lebih buruk pada yang lain, khususnya untuk gesaan sedia ada yang diselaraskan terhadap versi sebelumnya.

Kenapa penanda aras tidak sepadan dengan pengalaman saya?

Kerana ia mengukur apa yang boleh dinilai secara automatik, bermaksud tugas dengan jawapan yang betul. Kebanyakan kerja profesional tiada satu jawapan betul tunggal, dan kualiti yang memutuskan kepuasan harian, bermaksud kepatuhan arahan, kawalan nada, disiplin format, dan mengetahui bila hendak berkata "saya tidak tahu", sebahagian besarnya tidak diukur. Model boleh mendahului setiap carta yang diterbitkan dan masih lebih menjengkelkan untuk digunakan.

Berapa kerap saya patut menilai semula?

Setiap kali model yang anda gunakan mendapat keluaran ketara, yang buat masa ini bermaksud setiap beberapa bulan, ditambah sekali setiap suku tahun tanpa mengira. Menyimpan set tetap lima tugas sebenar menjadikan ini kerja dua puluh minit berbanding sepetang, dan itulah satu-satunya cara untuk perasan bahawa penghalaan yang anda tetapkan enam bulan lalu kini salah.

Bolehkah saya hanya guna model mana-mana yang menang keseluruhan?

Anda boleh, dan anda akan menerima hasil yang lebih lemah pada satu bahagian kerja anda yang boleh diramal. Penemuan konsisten apabila orang menilai pada tugas mereka sendiri ialah satu model menang pada penulisan dan nada manakala satu lagi menang pada struktur ketat dan kelajuan, dengan penaakulan umum cukup hampir sehingga tidak memutuskan apa-apa. Jika kedua-duanya tersedia untuk anda, pilihan menjadi mengikut tugas berbanding mengikut langganan.

Adakah penting produk mana yang saya gunakan untuk mengakses model itu?

Model itu adalah model itu, jadi kualiti output secara umum sama di mana sahaja anda mencapainya. Apa yang berbeza ialah sama ada anda boleh membandingkan, sama ada konteks berterusan apabila anda bertukar, dan sama ada keluaran baharu mengenakan migrasi kepada anda atau hanya satu lagi pilihan dalam pemilih. Ruang kerja dengan beberapa model menukar setiap keluaran daripada satu keputusan kepada satu pelarasan.