Tetingkap konteks adalah keseluruhan ingatan kerja model
Tetingkap konteks adalah jumlah keseluruhan teks yang boleh dipegang oleh model dalam pandangan pada satu masa. Segala-galanya yang model tahu tentang perbualan semasa anda perlu muat di dalamnya: arahan anda, setiap mesej yang dihantar oleh mana-mana pihak, setiap fail yang anda muat naik, dan jawapan yang akan ditulisnya.
Gambaran mental yang berguna: model tidak mempunyai ingatan tentang perbualan anda langsung. Setiap kali anda menghantar mesej, keseluruhan perbualan setakat itu diserahkan kepadanya semula, ia membaca kesemuanya, dan menulis jawapan seterusnya. Tetingkap konteks adalah saiz meja yang perlu dimuatkan transkrip itu. Apabila meja itu penuh, sesuatu perlu dikeluarkan daripadanya.
Itulah sebab AI boleh kelihatan tajam untuk dua puluh mesej dan kemudian mula bercanggah dengan dirinya sendiri, melupakan kekangan yang anda tetapkan pada permulaan, atau meminta fail yang sudah anda berikan. Bahagian awal perbualan itu telah tergelincir dari meja.
Satu pembezaan yang perlu betul serta-merta, kerana ia menyebabkan banyak kekeliruan: tetingkap konteks bukan sama dengan ingatan. Produk seperti ChatGPT dan Claude mempunyai ciri ingatan berasingan yang menyimpan fakta tentang anda antara perbualan dan secara senyap memasukkannya ke dalam perbualan baharu. Itu adalah ciri produk yang dibina di atas model itu. Tetingkap konteks adalah sifat tegar model itu sendiri, dan tiada ciri ingatan menjadikannya lebih besar.
Satu token adalah kira-kira tiga suku daripada satu perkataan
Tetingkap konteks diukur dalam token berbanding perkataan, kerana model tidak membaca perkataan. Token adalah salah satu perkataan yang ditakrifkan glosari AI dalam satu ayat, bersama lima puluh sekian yang lain yang mengelilinginya. Ia membaca cebisan: perkataan biasa biasanya satu token, perkataan lebih panjang atau luar biasa berpecah kepada beberapa, dan tanda baca serta ruang juga dikira.
Penukaran kasar yang berbaloi diingati:
- 1 token adalah kira-kira 4 aksara Bahasa Inggeris, atau kira-kira tiga suku daripada satu perkataan.
- 1,000 token adalah kira-kira 750 perkataan, kira-kira satu setengah muka surat prosa biasa.
- Kod lebih padat. Jangkakan lebih dekat kepada satu token setiap tiga aksara kerana simbol, inden, dan pengecam luar biasa.
- Bahasa lain kurang cekap. Teks dalam bahasa yang kurang diwakili dalam tokenizer boleh mengambil dua atau tiga kali ganda token untuk maksud yang sama, yang berbaloi diketahui jika anda membayar setiap token.
Itu memberi anda cara untuk membayangkan nombor yang anda lihat dalam bahan pemasaran:
| Tetingkap konteks | Kira-kira bersamaan |
|---|---|
| 8,000 token | Artikel panjang |
| 32,000 token | Kertas penyelidikan pendek dengan nota |
| 128,000 token | Buku 300 muka surat |
| 200,000 token | Manual teknikal padat, atau pangkalan kod sederhana |
| 1,000,000 token | Beberapa buku, atau setahun transkrip mesyuarat |
Perkara penting yang jadual ini sembunyikan: had itu meliputi keseluruhan perbualan, bukan setiap mesej. Tetingkap 128,000 token tidak bermakna anda boleh menghantar 128,000 token berulang kali. Ia bermakna jumlah berjalan segala-galanya, termasuk jawapan model itu sendiri, perlu kekal di bawah nombor itu.
Kualiti merosot sebelum had yang diiklankan
Ini adalah bahagian yang paling penting dan paling kurang dibincangkan. Kualiti model tidak kekal rata sehingga hadnya kemudian jatuh dari cenuram. Ia merosot secara beransur-ansur, dan ia mula merosot jauh sebelum had itu.
Versi yang paling terdokumentasi bagi ini sering dipanggil kesan lost in the middle. Letak satu fakta khusus pada permulaan dokumen panjang dan model menemuinya. Letak pada penghujung dan model menemuinya. Tanam ia di tengah dan ketepatan jatuh: dalam eksperimen Lost in the Middle asal (Liu et al., 2023, dipautkan di bawah), memindahkan dokumen kunci daripada tepi input ke tengah merugikan model kira-kira 20 mata ketepatan. Perhatian tidak diagihkan sama rata merentas input panjang, dan tepi mendapat lebih daripadanya.
Ia menjadi lebih sukar lagi apabila tugas itu memerlukan gabungan beberapa fakta yang bertaburan merentas input panjang. Mencari satu jarum dalam timbunan jerami adalah masalah yang sudah selesai. Mencari empat jarum dan menaakul tentang hubungan antara mereka tidak, dan inilah tepat tugas yang digunakan orang untuk tetingkap konteks besar.
Jadi layan nombor yang diiklankan sebagai kapasiti maksimum, bukan julat kerja yang selesa. Peraturan praktikal daripada penggunaan sebenar: anda mendapat tingkah laku boleh dipercayai sehingga kira-kira separuh tetingkap yang diiklankan, dan anda patut sahkan apa-apa melangkaui itu berbanding mempercayainya. Jika model memberitahu anda kontrak 300 muka surat tidak mengandungi klausa penamatan, semak, terutamanya jika klausa itu berada di tengah.
Implikasi perbandingan: tetingkap satu juta token menjamin model boleh menerima dokumen lebih panjang daripada tetingkap 200,000 token, dan tidak menjamin apa-apa lagi. Sama ada ia menaakul dengan baik merentas kesemuanya adalah soalan berasingan, dan satu-satunya cara untuk tahu ialah menguji dengan dokumen di mana anda sudah tahu jawapannya.
Apa yang berlaku apabila anda kehabisan
Produk berbeza mengendalikan lambakan secara berbeza, dan mengetahui mana satu yang anda gunakan menerangkan banyak tingkah laku pelik.
| Tingkah laku | Apa yang anda lihat | Di mana ia berlaku |
|---|---|---|
| Ralat tegar | Permintaan ditolak dengan mesej tentang panjang | Kebanyakan penggunaan API langsung |
| Pemangkasan senyap | Mesej paling lama digugurkan tanpa memberitahu anda | Banyak antara muka sembang |
| Ringkasan bergulir | Mesej lama dimampatkan menjadi ringkasan | Semakin biasa dalam produk sembang |
| Pengambilan | Hanya bahagian relevan dokumen anda diambil setiap giliran | Alat dokumen dan pangkalan pengetahuan |
Pemangkasan senyap adalah yang menyebabkan masalah sebenar, kerana tiada apa yang mengumumkannya. Simptomnya adalah model yang tiba-tiba mengabaikan peraturan yang anda tetapkan pada permulaan, kembali kepada nada yang anda betulkan sejam lalu, atau bertanya soalan yang sudah anda jawab. Arahan itu semata-mata tidak lagi berada di meja.
Ringkasan bergulir lebih baik tetapi kehilangan maklumat. Ringkasan mengekalkan intipati dan menggugurkan butiran khusus, jadi kekangan "jangan gunakan perkataan sinergi" bertahan sebagai "pengguna mempunyai keutamaan gaya", yang langsung tidak membantu anda.
Tujuh taktik yang benar-benar berfungsi
Ini disusun mengikut betapa besar perbezaan yang dibuatnya berbanding usaha.
Mula sembang baharu apabila topik berubah. Tabiat bernilai tertinggi tunggal. Perbualan panjang membawa kos segala-galanya sebelumnya, termasuk tangen yang tidak lagi relevan, dan setiap tangen yang masih berada di meja mencairkan jawapan seterusnya.
Letak soalan anda selepas bahan panjang, bukan sebelum. Jika anda menampal dokumen kemudian bertanya, soalan itu hampir dengan tempat jawapan dijana, yang secara boleh diukur meningkatkan ketepatan pada input panjang. Tampal dahulu, tanya kemudian.
Sauh semula kekangan penting. Dalam mana-mana perbualan melebihi lima belas pertukaran, nyatakan semula peraturan yang penting dalam mesej di mana ia penting: "sebagai peringatan, Bahasa Inggeris British, tiada poin senarai, kurang daripada 400 perkataan". Ia mengambil satu baris daripada anda dan ia terselamat daripada pemangkasan.
Hantar halaman berkaitan, bukan keseluruhan buku. Jika anda memerlukan model untuk menyemak klausa indemniti, beri ia klausa indemniti dan jirannya. Ketepatan mengatasi isipadu: petikan fokus lebih murah untuk dihantar, dan model membacanya dengan lebih tepat berbanding keseluruhan buku.
Ringkaskan dan mula semula dengan sengaja. Apabila sesi kerja menjadi panjang, minta serahan berstruktur: keadaan semasa, keputusan yang dibuat, soalan terbuka, kekangan. Tampal itu ke dalam sembang baharu. Anda kekalkan substans dan buang bising, dan anda akan perasan model menjadi lebih tajam serta-merta.
Guna pengambilan untuk apa sahaja yang tidak muat. Jika bahan anda memang lebih besar daripada mana-mana tetingkap, pembetulannya ialah pengambilan: ambil cebisan berkaitan setiap soalan berbanding mencari tetingkap lebih besar. Itulah yang dilakukan alat dokumen di bawah bonet.
Awasi kemerosotan, bukan hanya ralat. Jika jawapan menjadi lebih kabur, lebih berhati-hati, atau mula mengabaikan arahan format, anda mungkin berada jauh dalam tetingkap. Mula semula sebelum menganggap model itu menjadi lebih teruk.
Berapa banyak tetingkap yang sebenarnya anda perlukan?
Padankan tetingkap dengan kerja itu berbanding mencari nombor terbesar. Untuk angka semasa pada mana-mana model khusus, jadual perbandingan tetingkap konteks menyenaraikan seluruh katalog dalam token dan muka surat.
| Kerja anda | Apa yang anda perlukan | Kenapa |
|---|---|---|
| E-mel, mendraf, soalan pantas | Apa sahaja yang moden | Anda tidak akan pernah hampir dengan had itu |
| Menyunting dokumen panjang | 100,000 ke atas | Dokumen itu ditambah perbualan anda tentangnya |
| Semakan kontrak dan dasar | 200,000 ke atas, dan sahkan | Dokumen itu ditambah penaakulan tentangnya, dengan amaran di atas |
| Menaakul merentas keseluruhan pangkalan kod | Yang terbesar tersedia | Kod padat token dan penaakulan merentas fail memerlukan keluasan |
| Menganalisis berbulan-bulan transkrip | Yang terbesar tersedia, atau pengambilan | Selalunya lebih baik dilayani oleh pengambilan berbanding daya kasar |
| Membina produk atas API | Lebih kecil daripada yang anda fikir, ditambah caching | Prompt panjang adalah pemacu utama kos dan latensi |
Bagi kebanyakan orang jawapan jujurnya ialah tetingkap konteks bukan faktor penentu antara langganan. Kualiti penulisan, ekosistem, dan harga lebih penting. Ia menjadi faktor penentu dalam tepat satu situasi: kerja anda kerap melibatkan memasukkan lebih banyak bahan daripada yang boleh dipegang tetingkap biasa, dan dalam kes itu saiz tetingkap menentukan sama ada kerja itu boleh dilakukan langsung.
Jika anda mahu menguji itu sendiri, pendekatan praktikal ialah menjalankan dokumen panjang yang sama melalui dua atau tiga model dan menyemak jawapan berbanding sesuatu yang sudah anda tahu. Ruang kerja seperti Whizi menjadikan itu mudah kerana GPT, Claude, Gemini, Grok, dan DeepSeek duduk di bawah satu langganan, dan tetingkap Gemini yang sangat besar hanya satu klik daripada sintesis teliti Claude. Lihat membandingkan model bersebelahan, atau baca cara memilih model AI untuk keputusan yang lebih luas.
- Anggarkan kiraan token dengan peraturan bahawa 1,000 token adalah kira-kira 750 perkataan
- Ingat bahawa prompt sistem, fail, hasil carian, dan jawapan semuanya menggunakan bajet yang sama
- Layan kira-kira separuh tetingkap yang diiklankan sebagai julat kerja yang boleh dipercayai
- Tampal bahan panjang dahulu dan tanya soalan anda selepasnya
- Nyatakan semula kekangan kritikal dalam perbualan panjang supaya ia terselamat daripada pemangkasan
- Mula sembang baharu dengan serahan bertulis berbanding memanjangkan yang lama
Soalan Lazim
Apakah tetingkap konteks dalam istilah mudah?
Ia adalah jumlah keseluruhan teks yang boleh dipegang model dalam pandangan sekaligus, meliputi arahan anda, keseluruhan perbualan setakat ini, sebarang fail yang dimuat naik, dan jawapan yang sedang ditulis. Apabila jumlah melebihi had, bahagian paling lama gugur keluar, itulah sebab sembang panjang mula melupakan perkara.
Adakah tetingkap konteks lebih besar sentiasa lebih baik?
Tidak. Tetingkap lebih besar membolehkan model menerima lebih banyak input, tetapi ketepatan merosot secara beransur-ansur apabila input membesar, terutamanya untuk fakta yang tertanam di tengah. Model dengan tetingkap satu juta token tidak automatik lebih baik pada dokumen panjang berbanding satu dengan 200,000, jadi uji dengan bahan di mana anda tahu jawapan yang betul.
Berapa banyak perkataan ialah 128,000 token?
Kira-kira 96,000 perkataan, atau kira-kira buku 300 muka surat. Penukaran umumnya ialah satu token adalah kira-kira empat aksara Bahasa Inggeris, jadi 1,000 token adalah sekitar 750 perkataan. Kod dan teks bukan Bahasa Inggeris menggunakan lebih banyak token untuk kandungan yang sama.
Kenapa ChatGPT lupa apa yang saya kata sebelum ini?
Kerana perbualan itu berkembang melebihi tetingkap konteks dan mesej paling lama digugurkan atau dimampatkan untuk memberi ruang. Kebanyakan antara muka sembang melakukan ini secara senyap. Menyatakan semula kekangan utama anda, atau memulakan sembang baharu dengan ringkasan pendek, membetulkannya serta-merta.
Adakah tetingkap konteks sama dengan ingatan AI?
Tidak. Tetingkap konteks adalah had tegar pada satu perbualan. Ingatan adalah ciri produk berasingan yang menyimpan fakta tentang anda antara perbualan dan memasukkannya ke dalam yang baharu. Ingatan tidak menambah kapasiti; fakta tersimpan yang dimasukkannya menggunakan sebahagian daripada tetingkap itu.