Ke mana sebenarnya rahsia yang ditampal itu pergi
Tiada apa-apa di halaman ini tentang penggodam. Rahsia yang ditampal mencipta salinan melalui operasi biasa dan didokumenkan produk sembang, dan salinan itulah masalahnya.
Empat mekanisme melakukan kerja ini. Pertama, pengekalan: apa yang anda tampal menjadi sebahagian daripada perbualan yang disimpan, mengikut jadual yang didokumenkan. OpenAI, sebagai contoh, menjadualkan sembang yang dipadam untuk dibuang secara kekal dalam masa 30 hari, dan aktiviti Gemini Google berada di bawah tetapan padam automatik yang lalai kepada 18 bulan, yang mana cara memadam akaun Gemini anda merangkumi cara menukarnya. Kedua, tetapan lalai latihan: tingkat pengguna di OpenAI, Anthropic, dan Google boleh menggunakan perbualan untuk menambah baik model melainkan anda mematikan tetapan itu, manakala tingkat perniagaan dan API lalai kepada dimatikan. Ketiga, semakan: ketiga-tiga penyedia menyatakan bahawa perbualan yang ditanda boleh dibaca oleh manusia, yang mana ini amalan keselamatan rutin dan masih bermaksud seseorang boleh berakhir melihat apa yang anda tampal. Keempat, perkongsian: perbualan yang dikongsi sebagai pautan membawa segala-galanya di dalamnya, termasuk dokumen yang anda muat naik tiga mesej sebelum bahagian yang anda mahu tunjukkan kepada seseorang.
Tiada satu pun daripada ini adalah skandal. Kesemuanya bersama bermaksud satu perkara: kotak sembang adalah tempat teks disimpan, kadangkala dipelajari daripada, dan sekali-sekala dilihat. Tampal mengikutnya. Selebihnya halaman ini hanyalah ayat itu digunakan pada kes khusus, dan adakah AI selamat digunakan merangkumi soalan keselamatan yang lebih luas di sekelilingnya.
Senarai jangan sekali-kali: enam item yang boleh digantikan pemegang tempat secara percuma
Item-item ini tiada sebab sah untuk memasuki kotak sembang, kerana model tidak memerlukannya untuk membantu anda. Setiap satu daripadanya boleh digantikan dengan pemegang tempat tanpa mengubah jawapan yang anda dapat.
| Jangan sekali-kali tampal | Kenapa ia berbeza daripada data lain | Apa yang perlu dilakukan sebagai gantinya |
|---|---|---|
| Kata laluan, kunci API, token akses, kod dua faktor | Kelayakan masuk bernilai kepada sesiapa sahaja yang pernah melihatnya, dan menukar satu yang telah bocor adalah kerja yang boleh anda elakkan | Taip PASSWORD atau KEY di tempat ia sepatutnya berada; jawapan itu tidak akan berubah |
| Nombor kad, akaun, atau routing penuh | Penipuan pembayaran memerlukan tepat rentetan ini dan tiada apa-apa lagi | "kad saya" dan "akaun saya" berfungsi dengan baik dalam mana-mana soalan wang |
| Pengecam kerajaan: SSN, pasport, kad pengenalan negara, nombor cukai | Kecurian identiti dibina daripada ini, dan ia tidak boleh ditukar seperti kata laluan | Model tidak pernah memerlukan nombor sebenar untuk menerangkan borang atau proses |
| Data peribadi orang lain: nama dengan alamat, butiran kesihatan, rekod HR | Ia adalah maklumat mereka, dan undang-undang privasi di kebanyakan tempat menganggap perkongsiannya sebagai tindakan anda, bukan tindakan chatbot | Tukar nama sebenar kepada Orang A dan Orang B sebelum menampal |
| Dokumen di bawah NDA atau dasar kerahsiaan majikan | Soalan itu bersifat kontraktual, dan "saya menampalnya ke dalam chatbot" adalah pendedahan sama ada apa-apa yang buruk berlaku selepas itu atau tidak | Tanya soalan itu dengan struktur dokumen, tanpa butiran khusus yang dilindungi |
| Apa sahaja yang anda tidak akan e-mel kepada perunding luar tanpa kontrak | Ini adalah ujian yang menangkap segala-galanya yang terlepas pandang oleh baris di atas | Jika jawapannya tidak, sunting sehingga jawapannya ya |
Baris terakhir itu adalah keseluruhan jadual dimampatkan. Sembang AI adalah pihak luar yang anda belum menandatangani apa-apa dengannya, yang sedang membantu. Kalibrasi tepat seperti anda akan lakukan untuk itu.
Item yang tiada siapa fikirkan
Senarai tegas di atas mudah diikuti kerana item-itemnya kelihatan sensitif. Tampalan yang sebenarnya menjerat orang yang berhati-hati adalah yang tidak kelihatan sensitif.
- Tangkapan skrin. Mesej ralat yang anda mahu kongsi tiba bersama dulang notifikasi anda, tab terbuka anda, baris subjek e-mel daripada seseorang lain, dan peringatan kalendar di penjuru. Potong kepada perkara yang anda tanyakan sahaja.
- Fail kod dengan rahsia di dalamnya. GitGuardian mengira 23.8 juta rahsia baharu bocor dalam commit GitHub awam sepanjang 2024, dan fail config atau .env yang ditampal dengan kunci hidup di dalamnya adalah versi kotak sembang bagi kesilapan yang sama. Cari dalam fail untuk key, secret, token, dan password sebelum ia dimasukkan.
- Transkrip dan rakaman mesyuarat. Setiap orang dalam mesyuarat itu bercakap kepada orang dalam bilik itu, dan tiada seorang pun daripada mereka bersetuju untuk muat naik sembang. Ringkasan yang anda tulis sendiri tidak membawa masalah sedemikian.
- Hamparan dengan lajur pelanggan. Soalan itu tentang formula; tampalan itu merangkumi setiap e-mel pelanggan dalam helaian itu. Padam lajur pengenalan dahulu, atau tampal sepuluh baris struktur berbanding keseluruhan helaian.
- Kontrak dengan nama pihak lawan. Memahami satu klausa memerlukan klausa itu, dan hampir tidak pernah memerlukan siapa yang menandatanganinya. Meringkaskan dokumen dengan AI berfungsi sama baik pada fail yang telah disunting.
- Kalendar dan peti masuk yang dieksport. Satu fail, ratusan nama, masa, dan subjek orang lain. Tanya tentang masalah penjadualan, tampal bentuk minggu itu, simpan eksport itu.
Corak merentas keenam-enam ini: bahagian sensitif biasanya adalah konteks di sekeliling apa yang anda perlukan, dan memotong kepada apa yang anda perlukan membuangnya. Potongan itu mengambil masa tiga puluh saat.
Apa yang sebenarnya selamat
Maksud senarai jangan sekali-kali yang pendek ialah segala-galanya di luarnya boleh digunakan, dan kebanyakan tampalan harian tidak membawa isu langsung: draf dan nota anda sendiri, maklumat awam, soalan umum tidak kira betapa peribadinya topik itu, kod anda sendiri tanpa rahsia yang tertanam, dan mana-mana dokumen yang telah anda sunting kepada apa yang diperlukan soalan itu sahaja.
Tabiat yang membolehkan ini ialah penyuntingan sebelum menampal, dan sebabnya berfungsi ialah model menaakul berdasarkan struktur berbanding identiti. Ujilah sendiri sekali: minta surat kepada tuan rumah anda tentang pemanasan yang rosak dengan nama di dalamnya, kemudian dengan [TUAN RUMAH] menggantikannya, dan bandingkan. "Terangkan klausa kontrak ini" tidak bertambah baik apabila model tahu syarikat mana yang menandatangani. Dalam kes jarang di mana satu nama benar-benar penting, anda boleh menambahnya semula ke dalam output itu sendiri, berbanding alternatif tampalan yang belum disunting yang tidak boleh anda tarik balik.
Dua tetapan menyelesaikan kerja itu. Semak suis latihan aplikasi sembang anda sekali, kerana tetapan lalai pengguna tidak memihak kepada anda, dan ketahui angka pengekalan aplikasi anda. Apa yang sepatutnya diterbitkan penyedia kelihatan seperti halaman data Whizi: apa yang disimpan, untuk berapa lama, dan apa yang dibuang oleh pemadaman. Jawapan Whizi sendiri di sana: muat naik luput selepas sehingga 30 hari, dan kandungan anda tidak melatih model milik Whizi dan tidak dijual sebagai data latihan. Mana-mana alat yang anda gunakan setiap hari sepatutnya menjawab soalan yang sama di suatu tempat yang boleh anda petik. Jika anda memilih antara langganan tepat pada paksi ini, adakah langganan AI pihak ketiga selamat melalui piawaian yang sama merentas keseluruhan kategori itu.
Peraturan yang menggantikan keseluruhan halaman ini sebaik sahaja ia menjadi tabiat: jika anda tidak akan e-mel sesuatu kepada perunding luar tanpa kontrak, jangan tampalkannya. Segala-galanya yang lain, tampal dengan bebas dan tukar nama-namanya.
- Jauhkan kata laluan, kunci API, dan kod dua faktor daripada setiap sembang, pada setiap pelan, pada setiap penyedia.
- Gantikan nombor kad, nombor akaun, dan ID kerajaan dengan pemegang tempat; jawapan itu tidak akan berubah.
- Tukar nama orang lain kepada Orang A dan Orang B sebelum menampal apa-apa tentang mereka.
- Layan bahan NDA dan sulit majikan sebagai dilarang secara kontraktual, bukan sebagai keputusan pertimbangan.
- Potong tangkapan skrin kepada perkara tepat yang anda tanyakan.
- Cari dalam kod untuk key, secret, token, dan password sebelum menampal fail.
- Matikan latihan pada perbualan anda di mana aplikasi menawarkan tetapan itu.
- Ketahui angka pengekalan dan pemadaman aplikasi anda, dan utamakan alat yang menerbitkannya.
Soalan Lazim
Apakah yang tidak boleh sekali-kali anda beritahu chatbot AI?
Kelayakan masuk apa jua jenis (kata laluan, kunci API, kod dua faktor), nombor pembayaran dan akaun penuh, pengecam kerajaan, maklumat peribadi orang lain, dan apa sahaja yang dilindungi NDA atau dasar kerahsiaan majikan. Ujian yang merangkumi selebihnya: jika anda tidak akan e-mel sesuatu kepada perunding luar tanpa kontrak, jangan tampalkannya.
Adakah selamat menampal dokumen kerja ke dalam AI?
Kerja anda sendiri, disunting kepada apa yang diperlukan soalan itu, secara amnya selamat dan sangat berguna. Dua had tegas itu bersifat kontraktual berbanding teknikal: bahan di bawah NDA, dan apa sahaja yang dihadkan dasar majikan anda. Bagi segala-galanya yang lain, buang dahulu nama pihak lawan, data pelanggan, dan kelayakan masuk yang tertanam, dan model akan melakukan kerja yang sama pada versi yang telah disunting.
Bolehkah orang lain melihat apa yang saya taip ke dalam sembang AI?
Tidak secara sambil lewa, tetapi salinan itu nyata: perbualan dikekalkan di bawah dasar penyedia, tingkat pengguna mungkin menggunakannya untuk latihan melainkan anda menarik diri, perbualan yang ditanda boleh disemak oleh manusia, dan apa sahaja dalam perbualan yang anda kongsi melalui pautan turut serta. Senarai jangan sekali-kali wujud kerana empat salinan itu, dan setiap satu adalah tingkah laku penyedia yang didokumenkan.
Adakah memadam sembang benar-benar membuangnya?
Ia bergantung pada penyedia, dan itulah tepatnya sebab angka pengekalan patut berada pada halaman data yang boleh anda baca sebelum anda memerlukannya. Pemadaman biasanya membuang perbualan daripada akaun anda dengan segera dan daripada sistem mengikut jadual yang dinyatakan, dengan tingkap pengekalan undang-undang yang terhad. Semak dasar penyedia anda untuk jadual itu, dan utamakan alat yang menyatakan satu.
Adakah lebih selamat menampal teks sensitif ke dalam pelan berbayar?
Tingkat berbayar pada penyedia besar berkos kira-kira $20 sebulan dan biasanya membawa tetapan lalai latihan yang lebih ketat berbanding tingkat pengguna percuma, jadi arahnya betul, tetapi tiada satu tingkat pun mengubah senarai jangan sekali-kali. Kelayakan masuk yang ditampal ke dalam pelan perusahaan paling besar di dunia masih kelayakan masuk yang telah anda dedahkan. Naik taraf untuk tetapan lalainya; sunting tanpa mengira apa-apa.