Apakah tetingkap konteks? Had AI yang menerangkan segala-galanya

Jawapan Ringkas

Tetingkap konteks adalah jumlah keseluruhan teks yang boleh dipegang oleh model dalam pandangan sekaligus: arahan anda, setiap mesej dalam perbualan, sebarang fail yang dimuat naik, dan jawapan yang sedang ditulis. Apabila jumlah itu melebihi had, bahagian paling lama gugur keluar. Kualiti juga merosot jauh sebelum had yang diiklankan.

Tetingkap konteks adalah keseluruhan ingatan kerja model

Tetingkap konteks adalah jumlah keseluruhan teks yang boleh dipegang oleh model dalam pandangan pada satu masa. Segala-galanya yang model tahu tentang perbualan semasa anda perlu muat di dalamnya: arahan anda, setiap mesej yang dihantar oleh mana-mana pihak, setiap fail yang anda muat naik, dan jawapan yang akan ditulisnya.

Gambaran mental yang berguna: model tidak mempunyai ingatan tentang perbualan anda langsung. Setiap kali anda menghantar mesej, keseluruhan perbualan setakat itu diserahkan kepadanya semula, ia membaca kesemuanya, dan menulis jawapan seterusnya. Tetingkap konteks adalah saiz meja yang perlu dimuatkan transkrip itu. Apabila meja itu penuh, sesuatu perlu dikeluarkan daripadanya.

Itulah sebab AI boleh kelihatan tajam untuk dua puluh mesej dan kemudian mula bercanggah dengan dirinya sendiri, melupakan kekangan yang anda tetapkan pada permulaan, atau meminta fail yang sudah anda berikan. Bahagian awal perbualan itu telah tergelincir dari meja.

Satu pembezaan yang perlu betul serta-merta, kerana ia menyebabkan banyak kekeliruan: tetingkap konteks bukan sama dengan ingatan. Produk seperti ChatGPT dan Claude mempunyai ciri ingatan berasingan yang menyimpan fakta tentang anda antara perbualan dan secara senyap memasukkannya ke dalam perbualan baharu. Itu adalah ciri produk yang dibina di atas model itu. Tetingkap konteks adalah sifat tegar model itu sendiri, dan tiada ciri ingatan menjadikannya lebih besar.

Satu token adalah kira-kira tiga suku daripada satu perkataan

Tetingkap konteks diukur dalam token berbanding perkataan, kerana model tidak membaca perkataan. Token adalah salah satu perkataan yang ditakrifkan glosari AI dalam satu ayat, bersama lima puluh sekian yang lain yang mengelilinginya. Ia membaca cebisan: perkataan biasa biasanya satu token, perkataan lebih panjang atau luar biasa berpecah kepada beberapa, dan tanda baca serta ruang juga dikira.

Penukaran kasar yang berbaloi diingati:

  • 1 token adalah kira-kira 4 aksara Bahasa Inggeris, atau kira-kira tiga suku daripada satu perkataan.
  • 1,000 token adalah kira-kira 750 perkataan, kira-kira satu setengah muka surat prosa biasa.
  • Kod lebih padat. Jangkakan lebih dekat kepada satu token setiap tiga aksara kerana simbol, inden, dan pengecam luar biasa.
  • Bahasa lain kurang cekap. Teks dalam bahasa yang kurang diwakili dalam tokenizer boleh mengambil dua atau tiga kali ganda token untuk maksud yang sama, yang berbaloi diketahui jika anda membayar setiap token.

Itu memberi anda cara untuk membayangkan nombor yang anda lihat dalam bahan pemasaran:

Tetingkap konteksKira-kira bersamaan
8,000 tokenArtikel panjang
32,000 tokenKertas penyelidikan pendek dengan nota
128,000 tokenBuku 300 muka surat
200,000 tokenManual teknikal padat, atau pangkalan kod sederhana
1,000,000 tokenBeberapa buku, atau setahun transkrip mesyuarat

Perkara penting yang jadual ini sembunyikan: had itu meliputi keseluruhan perbualan, bukan setiap mesej. Tetingkap 128,000 token tidak bermakna anda boleh menghantar 128,000 token berulang kali. Ia bermakna jumlah berjalan segala-galanya, termasuk jawapan model itu sendiri, perlu kekal di bawah nombor itu.

Apa sebenarnya yang memenuhi tetingkap anda?

Orang biasanya terkejut betapa pantas tetingkap itu penuh, kerana kebanyakan apa yang masuk ke dalamnya tidak kelihatan. Dalam sesi sembang biasa, model sedang membaca kesemua berikut pada setiap giliran:

  1. Prompt sistem. Arahan yang dihantar produk sebelum anda menaip apa-apa: cara berkelakuan, alat apa yang wujud, tarikh hari ini, peraturan keselamatan. Selalunya beribu-ribu token, dan anda tidak pernah melihatnya.
  2. Arahan tersuai atau ingatan anda. Apa sahaja yang disimpan produk itu tentang anda dan dimasukkan secara automatik.
  3. Setiap mesej sebelumnya, milik anda dan model itu, sepenuhnya. Jawapan panjang model itu juga dikira, dan biasanya ia penyumbang terbesar.
  4. Setiap fail yang dimuat naik, atau bahagian yang diekstrak daripadanya. PDF 40 muka surat adalah kira-kira 20,000 hingga 30,000 token.
  5. Hasil alat dan carian. Carian web yang menarik lima halaman boleh menambah lebih daripada keseluruhan perbualan anda setakat ini.
  6. Jawapan yang sedang dijana. Output berkongsi bajet yang sama dengan input.

Inilah sebab perbualan yang terasa pendek boleh hampir dengan hadnya. Anda menghantar lapan mesej pendek, tetapi model menulis lapan jawapan panjang, anda melampirkan dua dokumen, dan ia menjalankan tiga carian. Bahagian yang kelihatan daripada itu mungkin sepuluh peratus daripada jumlahnya.

Itu juga sebab pembetulan untuk perbualan yang keliru sering menjadi "mula sembang baharu". Anda bukan menetapkan semula mood model itu. Anda mengosongkan meja.

Kualiti merosot sebelum had yang diiklankan

Ini adalah bahagian yang paling penting dan paling kurang dibincangkan. Kualiti model tidak kekal rata sehingga hadnya kemudian jatuh dari cenuram. Ia merosot secara beransur-ansur, dan ia mula merosot jauh sebelum had itu.

Versi yang paling terdokumentasi bagi ini sering dipanggil kesan lost in the middle. Letak satu fakta khusus pada permulaan dokumen panjang dan model menemuinya. Letak pada penghujung dan model menemuinya. Tanam ia di tengah dan ketepatan jatuh: dalam eksperimen Lost in the Middle asal (Liu et al., 2023, dipautkan di bawah), memindahkan dokumen kunci daripada tepi input ke tengah merugikan model kira-kira 20 mata ketepatan. Perhatian tidak diagihkan sama rata merentas input panjang, dan tepi mendapat lebih daripadanya.

Ia menjadi lebih sukar lagi apabila tugas itu memerlukan gabungan beberapa fakta yang bertaburan merentas input panjang. Mencari satu jarum dalam timbunan jerami adalah masalah yang sudah selesai. Mencari empat jarum dan menaakul tentang hubungan antara mereka tidak, dan inilah tepat tugas yang digunakan orang untuk tetingkap konteks besar.

Jadi layan nombor yang diiklankan sebagai kapasiti maksimum, bukan julat kerja yang selesa. Peraturan praktikal daripada penggunaan sebenar: anda mendapat tingkah laku boleh dipercayai sehingga kira-kira separuh tetingkap yang diiklankan, dan anda patut sahkan apa-apa melangkaui itu berbanding mempercayainya. Jika model memberitahu anda kontrak 300 muka surat tidak mengandungi klausa penamatan, semak, terutamanya jika klausa itu berada di tengah.

Implikasi perbandingan: tetingkap satu juta token menjamin model boleh menerima dokumen lebih panjang daripada tetingkap 200,000 token, dan tidak menjamin apa-apa lagi. Sama ada ia menaakul dengan baik merentas kesemuanya adalah soalan berasingan, dan satu-satunya cara untuk tahu ialah menguji dengan dokumen di mana anda sudah tahu jawapannya.

Apa yang berlaku apabila anda kehabisan

Produk berbeza mengendalikan lambakan secara berbeza, dan mengetahui mana satu yang anda gunakan menerangkan banyak tingkah laku pelik.

Tingkah lakuApa yang anda lihatDi mana ia berlaku
Ralat tegarPermintaan ditolak dengan mesej tentang panjangKebanyakan penggunaan API langsung
Pemangkasan senyapMesej paling lama digugurkan tanpa memberitahu andaBanyak antara muka sembang
Ringkasan bergulirMesej lama dimampatkan menjadi ringkasanSemakin biasa dalam produk sembang
PengambilanHanya bahagian relevan dokumen anda diambil setiap giliranAlat dokumen dan pangkalan pengetahuan

Pemangkasan senyap adalah yang menyebabkan masalah sebenar, kerana tiada apa yang mengumumkannya. Simptomnya adalah model yang tiba-tiba mengabaikan peraturan yang anda tetapkan pada permulaan, kembali kepada nada yang anda betulkan sejam lalu, atau bertanya soalan yang sudah anda jawab. Arahan itu semata-mata tidak lagi berada di meja.

Ringkasan bergulir lebih baik tetapi kehilangan maklumat. Ringkasan mengekalkan intipati dan menggugurkan butiran khusus, jadi kekangan "jangan gunakan perkataan sinergi" bertahan sebagai "pengguna mempunyai keutamaan gaya", yang langsung tidak membantu anda.

Tujuh taktik yang benar-benar berfungsi

Ini disusun mengikut betapa besar perbezaan yang dibuatnya berbanding usaha.

Mula sembang baharu apabila topik berubah. Tabiat bernilai tertinggi tunggal. Perbualan panjang membawa kos segala-galanya sebelumnya, termasuk tangen yang tidak lagi relevan, dan setiap tangen yang masih berada di meja mencairkan jawapan seterusnya.

Letak soalan anda selepas bahan panjang, bukan sebelum. Jika anda menampal dokumen kemudian bertanya, soalan itu hampir dengan tempat jawapan dijana, yang secara boleh diukur meningkatkan ketepatan pada input panjang. Tampal dahulu, tanya kemudian.

Sauh semula kekangan penting. Dalam mana-mana perbualan melebihi lima belas pertukaran, nyatakan semula peraturan yang penting dalam mesej di mana ia penting: "sebagai peringatan, Bahasa Inggeris British, tiada poin senarai, kurang daripada 400 perkataan". Ia mengambil satu baris daripada anda dan ia terselamat daripada pemangkasan.

Hantar halaman berkaitan, bukan keseluruhan buku. Jika anda memerlukan model untuk menyemak klausa indemniti, beri ia klausa indemniti dan jirannya. Ketepatan mengatasi isipadu: petikan fokus lebih murah untuk dihantar, dan model membacanya dengan lebih tepat berbanding keseluruhan buku.

Ringkaskan dan mula semula dengan sengaja. Apabila sesi kerja menjadi panjang, minta serahan berstruktur: keadaan semasa, keputusan yang dibuat, soalan terbuka, kekangan. Tampal itu ke dalam sembang baharu. Anda kekalkan substans dan buang bising, dan anda akan perasan model menjadi lebih tajam serta-merta.

Guna pengambilan untuk apa sahaja yang tidak muat. Jika bahan anda memang lebih besar daripada mana-mana tetingkap, pembetulannya ialah pengambilan: ambil cebisan berkaitan setiap soalan berbanding mencari tetingkap lebih besar. Itulah yang dilakukan alat dokumen di bawah bonet.

Awasi kemerosotan, bukan hanya ralat. Jika jawapan menjadi lebih kabur, lebih berhati-hati, atau mula mengabaikan arahan format, anda mungkin berada jauh dalam tetingkap. Mula semula sebelum menganggap model itu menjadi lebih teruk.

Berapa banyak tetingkap yang sebenarnya anda perlukan?

Padankan tetingkap dengan kerja itu berbanding mencari nombor terbesar. Untuk angka semasa pada mana-mana model khusus, jadual perbandingan tetingkap konteks menyenaraikan seluruh katalog dalam token dan muka surat.

Kerja andaApa yang anda perlukanKenapa
E-mel, mendraf, soalan pantasApa sahaja yang modenAnda tidak akan pernah hampir dengan had itu
Menyunting dokumen panjang100,000 ke atasDokumen itu ditambah perbualan anda tentangnya
Semakan kontrak dan dasar200,000 ke atas, dan sahkanDokumen itu ditambah penaakulan tentangnya, dengan amaran di atas
Menaakul merentas keseluruhan pangkalan kodYang terbesar tersediaKod padat token dan penaakulan merentas fail memerlukan keluasan
Menganalisis berbulan-bulan transkripYang terbesar tersedia, atau pengambilanSelalunya lebih baik dilayani oleh pengambilan berbanding daya kasar
Membina produk atas APILebih kecil daripada yang anda fikir, ditambah cachingPrompt panjang adalah pemacu utama kos dan latensi

Bagi kebanyakan orang jawapan jujurnya ialah tetingkap konteks bukan faktor penentu antara langganan. Kualiti penulisan, ekosistem, dan harga lebih penting. Ia menjadi faktor penentu dalam tepat satu situasi: kerja anda kerap melibatkan memasukkan lebih banyak bahan daripada yang boleh dipegang tetingkap biasa, dan dalam kes itu saiz tetingkap menentukan sama ada kerja itu boleh dilakukan langsung.

Jika anda mahu menguji itu sendiri, pendekatan praktikal ialah menjalankan dokumen panjang yang sama melalui dua atau tiga model dan menyemak jawapan berbanding sesuatu yang sudah anda tahu. Ruang kerja seperti Whizi menjadikan itu mudah kerana GPT, Claude, Gemini, Grok, dan DeepSeek duduk di bawah satu langganan, dan tetingkap Gemini yang sangat besar hanya satu klik daripada sintesis teliti Claude. Lihat membandingkan model bersebelahan, atau baca cara memilih model AI untuk keputusan yang lebih luas.

Senarai Semak
  • Anggarkan kiraan token dengan peraturan bahawa 1,000 token adalah kira-kira 750 perkataan
  • Ingat bahawa prompt sistem, fail, hasil carian, dan jawapan semuanya menggunakan bajet yang sama
  • Layan kira-kira separuh tetingkap yang diiklankan sebagai julat kerja yang boleh dipercayai
  • Tampal bahan panjang dahulu dan tanya soalan anda selepasnya
  • Nyatakan semula kekangan kritikal dalam perbualan panjang supaya ia terselamat daripada pemangkasan
  • Mula sembang baharu dengan serahan bertulis berbanding memanjangkan yang lama

Soalan Lazim

Apakah tetingkap konteks dalam istilah mudah?

Ia adalah jumlah keseluruhan teks yang boleh dipegang model dalam pandangan sekaligus, meliputi arahan anda, keseluruhan perbualan setakat ini, sebarang fail yang dimuat naik, dan jawapan yang sedang ditulis. Apabila jumlah melebihi had, bahagian paling lama gugur keluar, itulah sebab sembang panjang mula melupakan perkara.

Adakah tetingkap konteks lebih besar sentiasa lebih baik?

Tidak. Tetingkap lebih besar membolehkan model menerima lebih banyak input, tetapi ketepatan merosot secara beransur-ansur apabila input membesar, terutamanya untuk fakta yang tertanam di tengah. Model dengan tetingkap satu juta token tidak automatik lebih baik pada dokumen panjang berbanding satu dengan 200,000, jadi uji dengan bahan di mana anda tahu jawapan yang betul.

Berapa banyak perkataan ialah 128,000 token?

Kira-kira 96,000 perkataan, atau kira-kira buku 300 muka surat. Penukaran umumnya ialah satu token adalah kira-kira empat aksara Bahasa Inggeris, jadi 1,000 token adalah sekitar 750 perkataan. Kod dan teks bukan Bahasa Inggeris menggunakan lebih banyak token untuk kandungan yang sama.

Kenapa ChatGPT lupa apa yang saya kata sebelum ini?

Kerana perbualan itu berkembang melebihi tetingkap konteks dan mesej paling lama digugurkan atau dimampatkan untuk memberi ruang. Kebanyakan antara muka sembang melakukan ini secara senyap. Menyatakan semula kekangan utama anda, atau memulakan sembang baharu dengan ringkasan pendek, membetulkannya serta-merta.

Adakah tetingkap konteks sama dengan ingatan AI?

Tidak. Tetingkap konteks adalah had tegar pada satu perbualan. Ingatan adalah ciri produk berasingan yang menyimpan fakta tentang anda antara perbualan dan memasukkannya ke dalam yang baharu. Ingatan tidak menambah kapasiti; fakta tersimpan yang dimasukkannya menggunakan sebahagian daripada tetingkap itu.