Apa itu context window? Batas AI yang menjelaskan segalanya

Penjelasan sederhana soal context window dan token, kenapa AI lupa di tengah percakapan, kenapa jendela yang lebih besar belum tentu lebih baik, dan cara bekerja di dalam batasnya.

Penjelasan sederhananya

Context window adalah jumlah total teks yang bisa dilihat model dalam satu waktu. Semua yang model ketahui tentang percakapan Anda sekarang harus muat di dalamnya: instruksi Anda, setiap pesan dari kedua pihak, setiap berkas yang Anda unggah, dan jawaban yang sedang ia tulis.

Gambaran yang membantu: model sebenarnya sama sekali tidak mengingat percakapan Anda. Setiap kali Anda mengirim pesan, seluruh percakapan sejauh ini diserahkan lagi kepadanya dalam keadaan segar, ia membaca semuanya, lalu menulis balasan berikutnya. Context window adalah luas meja tempat transkrip itu harus muat. Saat mejanya penuh, ada yang harus disingkirkan.

Itulah sebabnya AI bisa terasa tajam selama dua puluh pesan lalu mulai membantah dirinya sendiri, melupakan aturan yang Anda tetapkan di awal, atau meminta berkas yang sudah Anda berikan. Ia tidak bingung. Bagian awal percakapan itu tergeser jatuh dari meja.

Satu perbedaan yang perlu Anda pahami sejak awal, karena sering bikin keliru: context window bukan hal yang sama dengan memori. Produk seperti ChatGPT dan Claude punya fitur memori terpisah yang menyimpan fakta tentang Anda antar percakapan lalu menyelipkannya diam-diam ke percakapan baru. Itu fitur produk yang dibangun di atas model. Context window adalah sifat keras model itu sendiri, dan tidak ada fitur memori yang bisa memperbesarnya.

Token, dan cara memperkirakannya

Context window diukur dalam token, bukan kata, karena model tidak membaca kata. Ia membaca potongan: kata umum biasanya satu token, kata panjang atau tidak lazim pecah jadi beberapa, dan tanda baca serta spasi ikut dihitung.

Perkiraan kasar yang layak diingat:

  • 1 token kira-kira 4 karakter teks Inggris, atau sekitar tiga perempat kata.
  • 1.000 token kira-kira 750 kata, sekitar satu setengah halaman prosa biasa.
  • Kode lebih padat. Perkirakan sekitar satu token per tiga karakter karena banyak simbol, indentasi, dan nama variabel yang tak lazim.
  • Bahasa lain kurang efisien. Teks dalam bahasa yang jarang terwakili di tokenizer bisa butuh dua sampai tiga kali lipat token untuk makna yang sama, dan itu penting kalau Anda membayar per token.

Ini memberi Anda cara membayangkan angka-angka yang muncul di materi pemasaran:

Context windowKira-kira setara
8.000 tokenSatu artikel panjang
32.000 tokenMakalah riset pendek plus catatan
128.000 tokenBuku setebal 300 halaman
200.000 tokenManual teknis padat, atau basis kode ukuran menengah
1.000.000 tokenBeberapa buku, atau transkrip rapat setahun

Yang disembunyikan tabel ini: batas itu berlaku untuk seluruh percakapan, bukan tiap pesan. Jendela 128.000 token tidak berarti Anda bisa mengirim 128.000 token berulang kali. Artinya total berjalan dari segalanya, termasuk balasan model sendiri, harus tetap di bawah angka itu.

Apa yang sebenarnya memenuhi jendela Anda

Orang biasanya kaget melihat betapa cepat jendela itu penuh, karena sebagian besar isinya tidak terlihat. Dalam sesi obrolan biasa, model membaca semua hal berikut di setiap giliran:

  1. System prompt. Instruksi yang dikirim produknya sebelum Anda mengetik apa pun: cara bersikap, alat apa yang tersedia, tanggal hari ini, aturan keamanan. Sering ribuan token, dan Anda tidak pernah melihatnya.
  2. Instruksi kustom atau memori Anda. Apa pun yang disimpan produk tentang Anda dan disisipkan otomatis.
  3. Setiap pesan sebelumnya, milik Anda dan milik model, secara utuh. Jawaban panjang model juga dihitung, dan biasanya justru itu penyumbang terbesar.
  4. Setiap berkas yang diunggah, atau bagian yang berhasil diekstrak. PDF 40 halaman kira-kira 20.000 sampai 30.000 token.
  5. Hasil alat dan pencarian. Satu pencarian web yang menarik lima halaman bisa menambah lebih banyak daripada seluruh percakapan Anda sejauh ini.
  6. Balasan yang sedang dibuat. Keluaran memakai anggaran yang sama dengan masukan.

Inilah alasan percakapan yang terasa pendek bisa nyaris menyentuh batasnya. Anda mengirim delapan pesan singkat, tapi model menulis delapan jawaban panjang, Anda melampirkan dua dokumen, dan ia menjalankan tiga pencarian. Bagian yang terlihat mungkin cuma sepuluh persen dari totalnya.

Itu juga alasan kenapa solusi untuk percakapan yang mulai kacau begitu sering berupa "mulai obrolan baru". Anda tidak sedang menyetel ulang suasana hati model. Anda sedang membersihkan mejanya.

Ukuran yang diiklankan versus ukuran yang berguna

Ini bagian yang paling penting tapi paling jarang dibahas. Kualitas model tidak bertahan datar sampai batasnya lalu jatuh mendadak. Ia menurun perlahan, dan penurunannya mulai jauh sebelum batas tercapai.

Versi paling terdokumentasi dari gejala ini sering disebut efek lost in the middle. Taruh satu fakta spesifik di awal dokumen panjang dan model menemukannya. Taruh di akhir, model juga menemukannya. Kubur di tengah 200 halaman, dan akurasi pengambilannya turun jelas. Perhatian model tidak tersebar merata di sepanjang masukan panjang, dan bagian tepi mendapat porsi lebih besar.

Makin sulit lagi kalau tugasnya menuntut menggabungkan beberapa fakta yang tersebar di masukan panjang. Mencari satu jarum di tumpukan jerami sudah jadi soal yang terpecahkan. Mencari empat jarum lalu menalar hubungan di antaranya belum, dan justru itulah yang orang harapkan dari context window besar.

Jadi perlakukan angka yang diiklankan sebagai kapasitas maksimum, bukan rentang kerja yang nyaman. Aturan praktis dari pemakaian nyata: Anda mendapat perilaku yang andal sampai kira-kira setengah dari jendela yang diiklankan, dan apa pun di luar itu sebaiknya Anda verifikasi, bukan Anda percaya begitu saja. Kalau model bilang kontrak 300 halaman Anda tidak memuat klausul pemutusan, periksa sendiri, apalagi kalau klausul itu kemungkinan ada di bagian tengah.

Implikasinya untuk perbandingan: model dengan jendela satu juta token tidak otomatis lebih baik menangani dokumen panjang dibanding model dengan 200.000. Ia hanya lebih baik dalam menerimanya. Apakah ia menalar dengan baik di seluruh isinya adalah pertanyaan terpisah, dan satu-satunya cara tahu adalah menguji dengan dokumen yang jawabannya sudah Anda ketahui.

Apa yang terjadi saat jendelanya habis

Tiap produk menangani kelebihan muatan dengan cara berbeda, dan mengetahui Anda sedang memakai yang mana menjelaskan banyak perilaku aneh.

PerilakuYang Anda lihatTerjadi di mana
Galat langsungPermintaan ditolak dengan pesan soal panjangKebanyakan pemakaian API langsung
Pemotongan diam-diamPesan terlama dibuang tanpa pemberitahuanBanyak antarmuka obrolan
Ringkasan berjalanPesan lama dipadatkan jadi ringkasanMakin umum di produk obrolan
Pengambilan bagianHanya bagian dokumen yang relevan diambil tiap giliranAlat dokumen dan basis pengetahuan

Pemotongan diam-diam adalah yang benar-benar bikin masalah, karena tidak ada yang mengumumkannya. Gejalanya: model tiba-tiba mengabaikan aturan yang Anda tetapkan di awal, kembali ke nada yang sudah Anda koreksi sejam lalu, atau menanyakan hal yang sudah Anda jawab. Tidak ada yang rusak pada modelnya. Instruksi itu sekadar tidak lagi ada di atas meja.

Ringkasan berjalan lebih baik, tapi tetap kehilangan detail. Ringkasan menyimpan inti dan membuang hal spesifik, sehingga aturan "jangan pernah pakai kata sinergi" bertahan sebagai "pengguna punya preferensi gaya", yang sama sekali tidak menolong Anda.

Taktik praktis yang benar-benar berhasil

Urutannya berdasarkan seberapa besar dampaknya dibanding usaha yang dibutuhkan.

Mulai obrolan baru saat topiknya berganti. Ini kebiasaan paling berharga. Percakapan panjang menanggung beban semua yang terjadi sebelumnya, termasuk selingan yang sudah tidak relevan. Percakapan panjang bukan berarti lebih paham, ia hanya lebih mahal dan lebih encer.

Taruh pertanyaan Anda setelah materi panjang, bukan sebelumnya. Kalau Anda menempel dokumen lalu bertanya, pertanyaan itu berada dekat dengan titik jawaban dihasilkan, dan itu terbukti meningkatkan akurasi pada masukan panjang. Tempel dulu, tanya kemudian.

Tegaskan ulang aturan yang penting. Dalam percakapan yang melewati sekitar lima belas giliran, sebut lagi aturan yang penting di pesan tempat aturan itu berlaku: "sebagai pengingat, bahasa Indonesia baku, tanpa poin-poin, di bawah 400 kata". Biayanya satu baris, dan ia selamat dari pemotongan.

Kirim halaman yang relevan, bukan seluruh bukunya. Kalau Anda perlu model memeriksa klausul ganti rugi, berikan klausul itu beserta bagian sekitarnya. Ketepatan mengalahkan volume, lebih cepat, lebih murah, dan lebih akurat.

Ringkas lalu mulai ulang dengan sengaja. Saat sesi kerja jadi panjang, minta serah terima yang terstruktur: kondisi saat ini, keputusan yang sudah diambil, pertanyaan yang belum terjawab, aturan yang berlaku. Tempel itu ke obrolan baru. Anda menyimpan isinya dan membuang kebisingannya, dan Anda akan langsung merasakan model jadi lebih tajam.

Pakai pengambilan bagian untuk apa pun yang tidak muat. Kalau materi Anda memang lebih besar dari jendela mana pun, jawabannya bukan jendela yang lebih besar, melainkan mengambil potongan yang relevan per pertanyaan. Itulah yang dilakukan alat dokumen di balik layar.

Awasi penurunan kualitas, bukan cuma pesan galat. Kalau jawaban jadi lebih kabur, makin sering berhati-hati, atau mulai mengabaikan instruksi format, kemungkinan Anda sudah jauh masuk ke dalam jendela. Mulai dari awal sebelum menyimpulkan modelnya jadi lebih buruk.

Sebesar apa jendela yang sebenarnya Anda butuhkan?

Cocokkan jendelanya dengan pekerjaan Anda, jangan berburu angka terbesar.

Pekerjaan AndaYang Anda butuhkanAlasan
Email, menulis draf, tanya cepatModel modern apa punAnda tidak akan mendekati batasnya
Menyunting dokumen panjang100.000 ke atasDokumennya plus percakapan tentangnya
Meninjau kontrak dan kebijakan200.000 ke atas, lalu verifikasiDokumennya plus penalarannya, dengan catatan di atas
Menalar seluruh basis kodeYang terbesar tersediaKode padat token dan penalaran lintas berkas butuh keleluasaan
Menganalisis transkrip berbulan-bulanTerbesar, atau pakai pengambilan bagianSering lebih pas ditangani pengambilan bagian daripada gaya borongan
Membangun produk di atas APILebih kecil dari dugaan Anda, plus cachingPrompt panjang penyebab utama biaya sekaligus lambatnya respons

Bagi kebanyakan orang, jawaban jujurnya: context window bukan faktor penentu saat memilih langganan. Kualitas tulisan, ekosistem, dan harga lebih menentukan. Ia jadi faktor penentu tepat dalam satu situasi: pekerjaan Anda rutin memasukkan materi yang lebih besar dari jendela biasa, dan dalam kasus itu selisihnya bukan sekadar sedikit, melainkan beda antara mungkin dan mustahil.

Kalau Anda ingin mengujinya sendiri, cara praktisnya adalah menjalankan dokumen panjang yang sama di dua atau tiga model lalu mencocokkan jawabannya dengan hal yang sudah Anda ketahui. Ruang kerja seperti Whizi memudahkan itu karena GPT, Claude, Gemini, Grok, dan DeepSeek ada di balik satu langganan, dan jendela Gemini yang sangat besar hanya satu klik dari sintesis Claude yang cermat. Lihat membandingkan model berdampingan, atau baca cara memilih model AI untuk keputusan yang lebih luas.

Daftar Periksa
  • Perkirakan jumlah token dengan patokan 1.000 token kira-kira 750 kata
  • Ingat bahwa system prompt, berkas, hasil pencarian, dan balasan memakai anggaran yang sama
  • Anggap sekitar setengah dari jendela yang diiklankan sebagai rentang kerja yang andal
  • Tempel materi panjang lebih dulu, baru ajukan pertanyaan Anda
  • Sebut ulang aturan penting dalam percakapan panjang agar selamat dari pemotongan
  • Mulai obrolan baru dengan catatan serah terima tertulis alih-alih memanjangkan yang lama

Pertanyaan Umum

Apa itu context window dengan bahasa sederhana?

Itu jumlah total teks yang bisa dilihat model sekaligus, mencakup instruksi Anda, seluruh percakapan sejauh ini, berkas yang diunggah, dan balasan yang sedang ditulis. Saat totalnya melewati batas, bagian terlama terbuang, dan itulah sebabnya obrolan panjang mulai melupakan banyak hal.

Apakah context window yang lebih besar selalu lebih baik?

Tidak. Jendela lebih besar membuat model bisa menerima masukan lebih banyak, tapi akurasinya menurun bertahap seiring masukan membesar, terutama untuk fakta yang terkubur di bagian tengah. Model dengan jendela satu juta token tidak otomatis lebih baik pada dokumen panjang dibanding yang 200.000, jadi ujilah dengan materi yang jawabannya sudah Anda tahu.

128.000 token itu berapa kata?

Kira-kira 96.000 kata, atau sekitar buku setebal 300 halaman. Konversi umumnya, satu token kira-kira empat karakter teks Inggris, jadi 1.000 token sekitar 750 kata. Kode dan teks non-Inggris memakai lebih banyak token untuk isi yang sama.

Kenapa ChatGPT lupa apa yang saya tulis sebelumnya?

Karena percakapannya tumbuh melewati context window dan pesan terlama dibuang atau dipadatkan untuk memberi ruang. Kebanyakan antarmuka obrolan melakukannya diam-diam. Menyebut ulang aturan penting Anda, atau memulai obrolan baru dengan ringkasan singkat, langsung mengatasinya.

Apakah context window sama dengan memori AI?

Tidak. Context window adalah batas keras untuk satu percakapan. Memori adalah fitur produk terpisah yang menyimpan fakta tentang Anda antar percakapan lalu menyisipkannya ke percakapan baru. Memori tidak memperbesar jendela, ia justru memakai sebagiannya.