Mengapa benchmark peluncuran tidak menjawab pertanyaan Anda
Setiap rilis model terdepan datang dengan grafik yang menunjukkan keunggulannya pada serangkaian evaluasi standar. Angka-angka itu nyata, tapi juga hampir tidak berguna untuk memutuskan apa yang harus Anda pakai hari Senin, karena tiga alasan.
Selisihnya kecil dan tugasnya bukan tugas Anda. Perbedaan dua poin pada benchmark penalaran tidak memberi tahu apa pun tentang apakah satu model menulis email klien yang lebih baik atau menjaga skema lebih konsisten pada dua ratus baris data.
Benchmark mengukur tugas yang mudah dinilai. Hal-hal dengan jawaban yang pasti benar. Sebagian besar pekerjaan profesional tidak punya itu: nada bicara, struktur, pertimbangan tentang apa yang harus dihilangkan. Justru di situlah model paling berbeda dan tidak ada yang diukur.
Perbandingan saat peluncuran dibuat oleh vendor. Bukan berarti tidak jujur, tapi tidak ada yang mempublikasikan evaluasi ketika model mereka kalah.
Pertanyaan yang layak dijawab lebih sempit: dari tugas spesifik yang Anda kerjakan dua puluh kali seminggu, mana di antara keduanya yang lebih baik? Jawabannya tidak pernah dipublikasikan, dan hanya perlu sekitar satu jam untuk mengetahuinya.
Apa yang sebenarnya cenderung berubah antar rilis
Di berbagai rilis model terdepan terbaru, peningkatan yang benar-benar berarti dalam penggunaan sehari-hari selalu berada di area yang sama, dan itu jarang menjadi sorotan dalam pengumuman.
| Yang membaik | Cara Anda menyadarinya | Apakah terlihat di benchmark |
|---|---|---|
| Kepatuhan instruksi | Model berhenti mengabaikan batasan ketiga Anda | Jarang |
| Instruksi negatif | "Jangan gunakan analogi" benar-benar dipatuhi | Tidak |
| Ingatan konteks panjang | Model menemukan hal di halaman 140, bukan cuma halaman 3 | Sebagian |
| Disiplin format | Tabel punya kolom yang Anda minta, setiap saat | Tidak |
| Ketidakpastian yang terkalibrasi | Model bilang tidak tahu, bukan mengarang | Tidak |
| Kontrol nada bicara | Lebih sedikit revisi sebelum sesuatu siap dikirim | Tidak |
| Kedalaman penalaran | Model menangkap kasus tepi yang Anda lewatkan | Ya, ini yang mereka ukur |
Lima dari tujuh hal itu tidak terlihat dalam grafik benchmark, dan itulah alasan model baru terasa lebih baik atau lebih buruk untuk dipakai. Kepatuhan instruksi khususnya menjadi pembeda antara draf pertama yang Anda sunting dan draf pertama yang Anda buang.
Evaluasi satu jam
Lakukan ini alih-alih membaca liputan peluncuran. Jalankan kedua model berdampingan menggunakan materi Anda sendiri.
- Kumpulkan lima tugas nyata dari dua minggu terakhir. Yang nyata, dengan konteks asli Anda ditempelkan, bukan prompt mainan. Sertakan setidaknya satu tugas menulis, satu tugas keluaran terstruktur, dan satu tugas yang membutuhkan penalaran tentang hal yang belum familier.
- Tuliskan ciri jawaban yang baik untuk masing-masing, dalam satu kalimat, sebelum menjalankan apa pun. Langkah ini mencegah Anda condong ke keluaran mana pun yang lebih panjang dan lebih percaya diri, bias yang kuat dan sebagian besar tidak disadari.
- Jalankan setiap tugas pada kedua model secara paralel agar jawaban yang satu tidak dipengaruhi jawaban yang lain.
- Nilai berdasarkan usaha penyuntingan, yaitu seberapa banyak kerja antara keluaran dan sesuatu yang siap Anda kirim. Bukan berdasarkan cara tulisannya terdengar.
- Catat besar kesenjangannya, bukan hanya siapa pemenangnya. Hasil yang setara memberi tahu Anda untuk berhenti memikirkan pilihan model untuk tugas itu, yang sungguh berguna.
- Simpan catatannya. Tiga bulan kemudian, saat rilis berikutnya muncul, Anda menjalankan ulang lima tugas yang sama dan mendapat jawaban nyata dalam dua puluh menit.
Poin terakhir itulah yang manfaatnya berlipat ganda. Kumpulan evaluasi yang tersimpan adalah satu-satunya hal yang membuat setiap rilis berikutnya murah untuk dinilai.
Enam prompt yang membedakan model AI terdepan
Pertanyaan umum menghasilkan jawaban yang mirip dari model mampu mana pun. Jika ingin melihat perbedaan, berikan tekanan pada kemampuan yang spesifik.
- Nada bicara di situasi sulit.
Write a note telling a client we missed the deadline. Take responsibility without over-apologising and without excuses. Under 120 words.Perbedaan register langsung terlihat. - Batasan negatif.
Explain [concept] without using any analogy or metaphor.Kepatuhan pada instruksi negatif jauh lebih bervariasi dari perkiraan Anda. - Ekstraksi ketat.
Extract every date, amount, and party into a JSON array with exactly these keys. If a field is absent use null. Do not infer.Menguji disiplin format dan kecenderungan mengisi celah. - Ingatan konteks panjang. Unggah dokumen panjang dan tanyakan sesuatu di bagian tengah. Mengungkap konteks yang benar-benar bisa dipakai, yang tidak sama dengan konteks yang diiklankan.
- Mengakui ketidaktahuan. Tanyakan sesuatu yang benar-benar jarang diketahui atau sangat baru. Jawaban terbaik adalah "saya tidak tahu" yang jelas atau pengambilan bersumber. Karangan di sini mendiskualifikasi terlepas dari benchmark apa pun.
- Kepatuhan multi-batasan. Berikan enam batasan sekaligus dan hitung berapa banyak yang bertahan. Satu tes ini memprediksi kepuasan sehari-hari lebih baik daripada apa pun di daftar ini.
Jawabannya biasanya "keduanya, untuk hal berbeda"
Orang mendekati sebuah rilis dengan menginginkan vonis, dan temuan jujur setelah menjalankan evaluasi hampir selalu terbagi. Satu model unggul dalam tulisan dan nada bicara. Model lain unggul dalam struktur ketat dan kecepatan. Keduanya cukup setara dalam penalaran umum sehingga hal itu tidak menentukan apa pun.
Itu bukan akal-akalan, itu hasil sebenarnya, dan ada implikasi praktisnya. Jika Anda hanya bisa memakai satu model, Anda sedang memilih kategori tugas mana yang akan Anda kerjakan lebih buruk. Jika Anda bisa memakai keduanya, pertanyaan soal rilis berhenti menjadi "apakah saya harus pindah" dan menjadi "tugas mana yang berpindah", keputusan yang jauh lebih kecil dan lebih rendah risikonya.
Ini juga mengubah arti sebuah rilis bagi Anda. Ketika model baru muncul di ruang kerja yang sudah punya beberapa model, Anda menjalankan ulang lima tugas Anda, menyesuaikan routing, dan melanjutkan. Tidak ada migrasi, tidak ada langganan yang dibatalkan, dan tidak ada sebulan memakai sesuatu yang lebih buruk karena Anda sudah berkomitmen sebelum menguji.
Yang harus dilakukan pada hari rilis
Jangan langsung mengganti pengaturan default Anda. Kesan minggu peluncuran didominasi oleh kebaruan dan oleh contoh mana pun yang beredar lebih dulu.
Jalankan ulang kumpulan evaluasi Anda. Dua puluh menit jika Anda menyimpannya dari waktu sebelumnya.
Periksa hal-hal yang membosankan. Jendela konteks, apakah prompt Anda yang sudah ada masih berperilaku sama, dan apakah ada hal yang Anda andalkan telah berubah. Model yang lebih baik secara umum bisa lebih buruk pada template spesifik Anda, dan itu penting diketahui sebelum Anda memindahkan pekerjaan produksi ke model tersebut.
Perbarui routing per tugas, bukan sekaligus. Pindahkan kategori yang jelas dimenangkan model baru dan biarkan sisanya.
Tunggu dua minggu untuk mengetahui keterbatasannya. Pola kegagalan model baru muncul dalam sekitar dua minggu penggunaan luas, dan itu jarang ada di pengumuman.
Untuk kerangka umumnya lihat cara memilih model AI, dan untuk mekanisme menjalankan dua model pada satu prompt lihat membandingkan model berdampingan.
- Susun kumpulan lima tugas nyata dari pekerjaan Anda sendiri dan simpan
- Tuliskan ciri jawaban yang baik sebelum membaca salah satu keluaran
- Jalankan kedua model secara paralel agar tidak saling memengaruhi
- Nilai berdasarkan usaha penyuntingan, bukan cara tulisannya terdengar
- Catat besar kesenjangan, karena hasil yang setara adalah informasi berguna
- Uji secara khusus batasan negatif dan kepatuhan multi-batasan
- Tunggu dua minggu sebelum memindahkan pekerjaan produksi ke model baru
- Perbarui routing per tugas alih-alih mengganti semuanya sekaligus
Pertanyaan Umum
Apakah saya harus beralih ke model terbaru?
Tidak pada hari peluncuran, dan tidak sekaligus semuanya. Jalankan ulang kumpulan kecil tugas nyata Anda sendiri pada keduanya, nilai berdasarkan seberapa banyak penyuntingan yang dibutuhkan tiap keluaran, dan pindahkan hanya kategori yang jelas dimenangkan model baru. Model yang lebih baru memang secara andal lebih baik untuk beberapa hal dan kadang lebih buruk untuk hal lain, terutama untuk prompt yang sudah ada dan disetel untuk versi sebelumnya.
Kenapa benchmark tidak sesuai dengan pengalaman saya?
Karena benchmark mengukur apa yang bisa dinilai secara otomatis, artinya tugas dengan satu jawaban benar. Sebagian besar pekerjaan profesional tidak punya satu jawaban benar, dan kualitas yang menentukan kepuasan sehari-hari, yaitu kepatuhan instruksi, kontrol nada bicara, disiplin format, dan tahu kapan harus bilang "saya tidak tahu", sebagian besar tidak terukur. Sebuah model bisa memimpin di setiap grafik yang dipublikasikan tapi tetap lebih menjengkelkan untuk dipakai.
Seberapa sering saya harus mengevaluasi ulang?
Setiap kali model yang Anda pakai mendapat rilis signifikan, yang saat ini berarti setiap beberapa bulan, ditambah sekali per kuartal apa pun yang terjadi. Menyimpan kumpulan tetap berisi lima tugas nyata membuat ini menjadi pekerjaan dua puluh menit, bukan satu sore penuh, dan itu satu-satunya cara untuk menyadari bahwa routing yang Anda atur enam bulan lalu kini sudah salah.
Bisakah saya cukup memakai model mana pun yang menang secara keseluruhan?
Bisa, dan Anda akan menerima hasil yang lebih buruk pada sebagian pekerjaan Anda yang bisa diprediksi. Temuan konsisten ketika orang mengevaluasi pada tugas mereka sendiri adalah satu model unggul dalam tulisan dan nada bicara sementara model lain unggul dalam struktur ketat dan kecepatan, dengan penalaran umum yang cukup setara sehingga tidak menentukan apa pun. Jika keduanya tersedia untuk Anda, pilihannya menjadi per tugas, bukan per langganan.
Apakah penting produk mana yang saya pakai untuk mengakses model?
Model tetaplah model, jadi kualitas keluaran secara umum sama di mana pun Anda mengaksesnya. Yang berbeda adalah apakah Anda bisa membandingkan, apakah konteks terbawa saat Anda berpindah, dan apakah rilis baru mengharuskan Anda bermigrasi atau hanya menjadi opsi lain di pemilih model. Ruang kerja dengan beberapa model mengubah setiap rilis dari sebuah keputusan menjadi sekadar penyesuaian.