Kenapa AI memberi jawapan salah, dan cara menangkapnya sebelum ia mengenakan kos kepada anda

Jawapan Ringkas

AI memberi jawapan salah kerana ia menghasilkan teks yang sesuai dengan corak jawapan yang betul, dan tiada apa-apa dalam proses itu menyemak sama ada jawapan itu benar. Kesilapan berkumpul di sekitar fakta khusus, petikan, apa-apa selepas tarikh had latihan, pengiraan, dan soalan yang memimpin. Semakan paling pantas ialah bertanya kepada model kedua daripada syarikat berbeza.

Tiada apa-apa dalam proses itu menyemak jawapan itu benar

Apabila anda bertanya soalan kepada chatbot AI, ia tidak sedang mencari apa-apa. Ia menghasilkan teks, beberapa aksara pada satu masa, yang sesuai dengan corak bagaimana jawapan yang betul kepada soalan itu biasanya ditulis. Itulah keseluruhan kerja itu. Sesuai dengan corak dan benar adalah dua sasaran yang berbeza, dan tiada apa-apa dalam proses itu menyasarkan sasaran kedua.

Kebanyakan masa anda tidak perasan, kerana kedua-dua sasaran itu bertindih. Teks yang sistem ini pelajari ditulis kebanyakannya oleh orang yang kebanyakannya betul, jadi teks berbentuk jawapan biasanya teks yang betul juga. Pertindihan itu menipis di pinggir: fakta yang jarang, terkini, sangat khusus, atau hanya tiada dalam apa yang dibaca model itu. Di pinggir itu, menghasilkan bentuk jawapan yang betul masih mudah. Menghasilkan kandungan yang betul tidak. Apa yang anda dapat ialah ayat yang dibina seperti fakta, dengan nombor di tempat yang betul dan nama yang kelihatan boleh dipercayai dilekatkan, menerangkan sesuatu yang tidak pernah berlaku.

Ini juga menjelaskan kenapa soalan susulan yang jelas gagal. Bertanya "adakah anda pasti?" terasa seperti audit. Ia bukan satu. Persetujuan sesuai dengan corak balasan yang membantu, jadi tekanan cenderung menghasilkan persetujuan, dan model sering meminta maaf dan menggantikan jawapan yang betul dengan satu yang lebih lemah. Ujinya dalam dua minit: tanya sesuatu yang anda sudah tahu, terima jawapan yang betul, kemudian katakan "itu tidak kedengaran betul" dan lihat. Apa yang kembali ialah jentera yang sama menghasilkan teks yang bersetuju. Untuk versi asas bagaimana mana-mana ini dibina, apa AI sebenarnya merangkuminya tanpa matematik.

Lima tempat ia paling banyak silap

Kesilapan tidak tersebar rata di sepanjang segala-galanya yang mungkin anda tanya. Ia berkumpul. Mempelajari lima kelompok itu memberi anda penggera dalaman kecil yang berbunyi pada saat yang betul, yang bernilai lebih daripada rasa berhati-hati am yang berbunyi berterusan dan kemudian berhenti berbunyi langsung.

Di mana ia tergelincirRupanya seperti apaContoh satu baris
Fakta dan nombor khususAngka tepat tanpa apa-apa di belakangnyaMemberitahu anda kedai tempatan dibuka pada 1987 sedangkan ia dibuka pada 1994
Petikan, kata-kata, pautanTajuk yang berbunyi benar, URL yang kelihatan benar, tiada satu pun dimuatkanKajian oleh dua penyelidik sebenar, dalam jurnal sebenar, yang tidak pernah ditulis
Apa-apa selepas tarikh had latihannyaJawapan yang yakin tentang dunia yang berhenti beberapa bulan laluMemetik harga langganan tahun lepas untuk pelan yang berubah pada bulan Mac
Pengiraan dan mengiraKaedah yang betul, jumlah yang salahMenjumlahkan sebelas baris invois dan tersasar 40 dolar
Soalan yang membawa jawapannya sendiriPersetujuan yang berpakaian sebagai analisis"Kenapa X pilihan yang lebih baik?" mengembalikan hujah untuk X dan tidak pernah mempersoalkannya

Baris petikan itu membawa harga yang terkenal. Pada Jun 2023 seorang hakim persekutuan mendenda dua peguam New York dan firma mereka $5,000 kerana memfailkan brief yang dibina atas enam kes mahkamah yang direka ChatGPT, lengkap dengan nama, petikan, dan petikan yang dipetik (Mata v. Avianca). Baris terakhir, walau bagaimanapun, adalah yang anda sebabkan sendiri, dan ia paling biasa dalam penggunaan sebenar. Bertanya "kenapa X lebih baik daripada Y" hampir menjamin hujah untuk X, dan soalan yang mengandungi "sudah tentu" atau "bukankah benar bahawa" biasanya mendapat ya. Tanya ini sebaliknya: "Bandingkan X dan Y untuk situasi ini, kemudian beri saya hujah paling kukuh menentang mana-mana yang anda pilih." Merangka soalan supaya ia tidak menyeludup jawapan itu adalah separuh daripada apa yang orang panggil prompting, dan cara bercakap dengan AI merangkumi selebihnya. Satu lagi keanehan yang berbaloi diketahui awal. Dalam perbualan yang sangat panjang, atau selepas anda menampal dokumen yang sangat panjang, butiran dari permulaan boleh tergelincir daripada pandangan model itu, dan ia akan mengisi lubang itu berbanding memberitahu anda ia kehilangan benang itu. Itu adalah had kapasiti berbanding masalah kebenaran, dan apa itu tetingkap konteks menerangkan di mana siling itu berada.

Nada yakin itu bukan gertakan

Kebanyakan orang tiba di sini dengan andaian yang munasabah: perkara itu tahu sejauh mana ia pasti dan menyembunyikan keraguan untuk kelihatan cekap. Andaian itu salah, dan ia penting, kerana ia menghantar anda memburu isyarat keyakinan yang tidak pernah wujud.

Tiada meter keyakinan yang ditahan daripada anda. Sistem itu tidak duduk atas nombor peribadi yang membaca 62 peratus dan memilih untuk berbunyi seperti 100. Ia menghasilkan jawapan salah melalui proses yang sama, pada kelancaran yang sama, seperti jawapan yang betul. Itulah tepatnya kenapa nada tidak bernilai apa-apa sebagai isyarat di sini, dengan cara yang tidak berlaku pada manusia. Bahasa berhati-hati seperti "saya tidak pasti sepenuhnya, tetapi" juga adalah teks yang dijana. Ia muncul kerana ungkapan itu sesuai dengan soalan bentuk itu. Tiada amaran dalaman tercetus. Minta model menilai keyakinannya sendiri daripada sepuluh dan anda akan mendapat nombor, selalunya yang tinggi, duduk terus di sebelah petikan yang ia cipta. Penilaian itu dihasilkan oleh proses yang sama seperti petikan itu.

Jadi arahan seperti "hanya jawab jika anda pasti" atau "jangan cipta apa-apa" membantu kurang daripada yang orang harapkan. Menambah "katakan anda tidak tahu jika anda tidak tahu" kepada soalan penting masih berbaloi dilakukan, kerana model baharu menolak lebih rela daripada dahulu, tetapi anggap ia sebagai dorongan dan bukan jaminan. Versi yang boleh dipercayai bagi idea itu menunjuk ke luar: buat jawapan itu menunjukkan anda sesuatu yang boleh anda buka. Apabila aplikasi mencari web dan melampirkan pautan, anda boleh membaca halaman itu sendiri dan berhenti mempercayai kata-katanya untuk apa-apa. Apabila ia menjawab daripada ingatan sahaja, kata-katanya sahaja yang anda ada.

Empat semakan, mengikut turutan kos yang paling kecil

Anda tidak akan mengesahkan segala-galanya, dan mencuba akan berakhir dengan anda tidak mengesahkan apa-apa. Apa yang anda mahu ialah semakan yang berkos kurang daripada kesilapan itu sendiri. Empat ini berjalan daripada hampir percuma kepada agak menjengkelkan, dan bagi kebanyakan soalan yang pertama yang anda capai sudah mencukupi.

  1. Minta sumber, kemudian buka. Bukan "petik sumber anda" sebagai ritual. Klik sumber itu. Pautan yang mati, atau halaman langsung yang tidak mengandungi dakwaan itu, menyelesaikan soalan itu dalam kira-kira sepuluh saat.
  2. Tanya semula dalam sembang baharu. Soalan yang sama, perbualan baharu, tiada bolak-balik yang lepas. Jika nombor, nama, atau tarikh kembali berbeza, model itu sedang mengisi jurang berbanding mengingati apa-apa. Ini tidak berkos apa-apa dan menangkap sebahagian besar butiran yang dicipta.
  3. Tanya model berbeza. Semakan bernilai paling tinggi tunggal untuk soalan berfakta. Tampal soalan yang sama kepada penyedia kedua dan bandingkan butiran itu, bukan nadanya.
  4. Cari dengan cara biasa. Untuk apa-apa yang akan anda hantar, tandatangan, terbitkan, atau belanjakan wang, beri ia sembilan puluh saat dalam enjin carian. AI adalah laluan pertama yang cemerlang. Laluan pertama bukan pengesahan.

Perkara ketiga menjadikan tempatnya berbaloi. Dua model yang dibina oleh syarikat berbeza, dilatih pada data berbeza dengan kaedah berbeza, boleh kedua-duanya salah tentang soalan yang sama. Mereka sangat jarang mencipta butiran salah yang sama, kerana butiran khusus yang direka datang daripada jurang khusus dalam satu sistem tertentu. Apabila Claude dan ChatGPT secara berasingan memberikan anda angka yang sama, angka itu berkemungkinan benar. Apabila mereka tidak bersetuju, anda telah menemui ayat khusus yang berbaloi disemak, yang lebih baik daripada perasaan kabur bahawa sesuatu dalam jawapan itu tidak kena. Untuk semakan sesekali, peringkat percuma dua penyedia sudah cukup dan tidak berkos apa-apa. Ia berhenti percuma sebaik sahaja semakan silang menjadi tabiat, kerana capaian berbayar berjalan kira-kira 20 dolar sebulan bagi setiap penyedia, dan itulah jurang yang ditutup langganan berbilang model seperti Whizi. Menggunakan beberapa model bersama menerangkan aliran kerja itu.

Di mana ia penting, dan di mana ia benar-benar tidak

Tabiat pengesahan yang terpakai kepada segala-galanya runtuh dalam masa seminggu. Kebanyakan apa yang anda tanya bertaruhan rendah dan menyemak sendiri. Minta versi lebih pendek bagi e-mel anda sendiri dan anda boleh melihat sama ada ia lebih pendek dan sama ada ia masih menyatakan apa yang anda maksudkan. Perkara yang sama berlaku untuk sumbang saran, menamakan perkara, membuat kerangka, mendraf, menterjemah mesej yang akan anda baca sebelum menghantar, atau mengubah nota bersepah menjadi senarai. Anda adalah semakan itu, dan kesilapan itu muncul di hadapan anda serta-merta.

Dua soalan mengasingkan mana-mana tugas ke dalam bakul yang betul, dan ia mengambil masa kira-kira tiga saat untuk anda tanya sendiri.

  1. Jika ini salah, siapa yang mengetahuinya, dan bila? Anda, sepuluh saat dari sekarang semasa membacanya, atau klien, tiga bulan dari sekarang?
  2. Bolehkah saya membatalkannya? Memadam perenggan yang buruk adalah percuma. Memfailkan semula penyata cukai, membatalkan penghantaran sebut harga, atau membalikkan pembayaran bukan.

Jika mana-mana jawapan membuat anda berhenti sebentar, sahkan setiap dakwaan khusus sebelum anda bertindak. Ahli jelas bakul itu: nama ubat dan dos, tarikh akhir undang-undang dan pemfailan, angka cukai, terma kontrak, apa-apa yang menyentuh kesihatan atau status imigresen seseorang, dan kod yang menggerakkan wang atau mengendalikan data peribadi. Sinonim yang salah dalam e-mel membuatkan anda kelihatan sedikit pelik selama sehari. Dos yang salah atau tarikh akhir yang terlepas bukan sesuatu yang AI uruskan selepas itu. Adakah AI selamat digunakan merangkumi sisi itu dengan lebih mendalam, termasuk apa yang tidak patut anda tampal. Mula dengan satu tabiat: saat jawapan mengandungi nombor, nama, tarikh, atau pautan, anggap bahagian itu sahaja sebagai belum disahkan dan semaknya. Selebihnya biasanya baik-baik sahaja.

Senarai Semak
  • Anggap setiap nombor, nama, tarikh, dan pautan dalam jawapan sebagai belum disahkan sehingga anda menyemaknya.
  • Jangan gunakan "adakah anda pasti?" sebagai ujian, kerana tekanan menghasilkan persetujuan berbanding pembetulan.
  • Minta sumber, buka sumber itu, dan sahkan halaman itu benar-benar menyatakan apa yang jawapan itu dakwa.
  • Tanya semula soalan penting dalam sembang baharu dan lihat sama ada butirannya kekal sama.
  • Bawa soalan berfakta kepada model kedua daripada syarikat berbeza sebelum anda bergantung padanya.
  • Tulis semula soalan yang memimpin supaya ia tidak memberitahu model jawapan mana yang anda mahu.
  • Tanya siapa yang mengetahui jika ini salah dan sama ada anda boleh membatalkannya, kemudian sahkan mengikutnya.

Soalan Lazim

Apakah halusinasi AI?

Halusinasi ialah jawapan yang yakin dan tersusun rapi yang hanya tidak benar: statistik yang dicipta, petikan yang tidak wujud, ciri yang tidak pernah dimiliki produk. Namanya kurang tepat, kerana tiada apa-apa yang dibayangkan. Sistem itu menghasilkan teks yang sesuai dengan corak jawapan yang betul, dan pada ketika itu corak dan kebenaran tidak sejajar.

Kenapa AI mencipta perkara berbanding mengatakan ia tidak tahu?

Mengatakan "saya tidak tahu" hanyalah satu daripada banyak balasan yang sesuai dengan soalan, dan jawapan yang lancar biasanya lebih sesuai. Model itu tiada langkah berasingan yang menyemak fakta sebelum menghasilkannya, jadi tiada apa yang mencetuskan penolakan. Model baharu menolak lebih kerap daripada model lama, dan bertanya secara terus untuk "tiada idea" apabila ia tiada memang membantu sedikit.

Bolehkah anda mempercayai jawapan AI?

Percayai penaakulan, struktur, dan pendrafan, yang di situlah alat ini benar-benar kukuh. Jangan percayai butiran khusus tanpa menyemak: nombor, nama, tarikh, petikan, dan apa-apa yang terkini. Pembahagian itu ialah versi praktikal kepercayaan di sini, dan ia membolehkan anda menggunakan AI setiap hari tanpa terjejas.

Adakah bertanya "adakah anda pasti?" membetulkan jawapan yang salah?

Jarang, dan ia boleh menjadikannya lebih teruk. Model cenderung mengalah kepada tekanan, jadi mereka sering meninggalkan jawapan yang betul dan menggantikannya dengan yang lebih lemah. Sembang baharu dengan soalan yang sama adalah ujian yang jauh lebih baik, kerana jawapan kedua dihasilkan tanpa tekanan keraguan anda.

Bagaimana saya menyemak jawapan AI dengan pantas?

Buka mana-mana sumber yang ia berikan dan sahkan ia menyatakan apa yang didakwa. Jika tiada sumber, tanya soalan yang sama dalam sembang baharu dan lihat sama ada butirannya bertahan. Untuk apa-apa yang berfakta yang anda rancang untuk bertindak, bawa kepada model kedua daripada penyedia berbeza, kerana dua sistem jarang mencipta butiran yang sama.