Giải thích một cách dễ hiểu
Cửa sổ ngữ cảnh là tổng lượng văn bản mà một mô hình có thể giữ trong tầm nhìn cùng một lúc. Mọi thứ mô hình biết về cuộc trò chuyện hiện tại của bạn đều phải nằm gọn bên trong đó: các hướng dẫn của bạn, mọi tin nhắn cả hai bên đã gửi, mọi tệp bạn tải lên, và cả câu trả lời nó sắp viết ra.
Một hình dung hữu ích: mô hình hoàn toàn không có ký ức gì về cuộc trò chuyện của bạn. Mỗi lần bạn gửi một tin nhắn, toàn bộ cuộc trò chuyện từ đầu tới giờ được đưa lại cho nó từ đầu, nó đọc hết, rồi viết câu trả lời tiếp theo. Cửa sổ ngữ cảnh là kích thước cái bàn mà bản ghi đó phải nằm vừa lên. Khi bàn đầy, phải có thứ gì đó bị đẩy xuống.
Đó là lý do một AI có thể tỏ ra sắc sảo suốt hai mươi tin nhắn rồi bắt đầu tự mâu thuẫn, quên mất một ràng buộc bạn đặt ra từ đầu, hoặc đòi một tệp mà bạn đã đưa cho nó rồi. Nó không hề bối rối. Phần đầu của cuộc trò chuyện đã trượt khỏi bàn.
Có một phân biệt cần nắm ngay, vì nó gây rất nhiều nhầm lẫn: cửa sổ ngữ cảnh không giống bộ nhớ. Những sản phẩm như ChatGPT và Claude có một tính năng bộ nhớ riêng, lưu lại các thông tin về bạn giữa các cuộc trò chuyện rồi lặng lẽ chèn chúng vào cuộc trò chuyện mới. Đó là một tính năng sản phẩm được xây bên trên mô hình. Cửa sổ ngữ cảnh là một thuộc tính cứng của chính mô hình, và không tính năng bộ nhớ nào làm nó lớn thêm.
Token, và cách ước lượng chúng
Cửa sổ ngữ cảnh được đo bằng token chứ không phải bằng từ, vì mô hình không đọc theo từ. Chúng đọc theo mẩu: các từ thông dụng thường là một token, các từ dài hoặc hiếm bị tách thành vài token, và dấu câu cùng khoảng trắng cũng được tính.
Những quy đổi ước chừng đáng nhớ:
- 1 token bằng khoảng 4 ký tự tiếng Anh, tức khoảng ba phần tư một từ.
- 1.000 token tương đương khoảng 750 từ, tức khoảng một trang rưỡi văn xuôi thường.
- Mã nguồn thì dày hơn. Hãy tính gần một token cho mỗi ba ký tự, vì có nhiều ký hiệu, thụt lề và tên định danh khác thường.
- Các ngôn ngữ khác kém hiệu quả hơn. Văn bản ở những ngôn ngữ ít xuất hiện trong bộ tách token có thể tốn gấp hai hoặc ba lần số token cho cùng một ý nghĩa, điều đáng biết nếu bạn trả tiền theo token.
Nhờ đó bạn có cách hình dung những con số bạn thấy trong tài liệu quảng cáo:
| Cửa sổ ngữ cảnh | Tương đương khoảng |
|---|---|
| 8.000 token | Một bài viết dài |
| 32.000 token | Một bài nghiên cứu ngắn kèm ghi chú |
| 128.000 token | Một cuốn sách 300 trang |
| 200.000 token | Một sổ tay kỹ thuật dày, hoặc một kho mã cỡ vừa |
| 1.000.000 token | Vài cuốn sách, hoặc bản ghi họp của cả một năm |
Điều quan trọng mà bảng này che mất: giới hạn tính cho toàn bộ cuộc trò chuyện, không phải cho từng tin nhắn. Một cửa sổ 128.000 token không có nghĩa là bạn có thể gửi 128.000 token lặp đi lặp lại. Nó có nghĩa là tổng cộng dồn của mọi thứ, kể cả các câu trả lời của chính mô hình, phải nằm dưới con số đó.
Thứ gì thực sự làm đầy cửa sổ của bạn
Người ta thường bất ngờ vì cửa sổ đầy nhanh đến vậy, bởi phần lớn thứ nhét vào đó là vô hình. Trong một phiên trò chuyện điển hình, mô hình đang đọc tất cả những thứ sau ở mỗi lượt:
- Prompt hệ thống. Các hướng dẫn mà sản phẩm gửi trước cả khi bạn gõ gì: cách hành xử, có những công cụ nào, ngày hôm nay, các quy tắc an toàn. Thường là hàng nghìn token, và bạn không bao giờ nhìn thấy.
- Hướng dẫn tùy chỉnh hoặc bộ nhớ của bạn. Bất cứ thứ gì sản phẩm đã lưu về bạn và tự động chèn vào.
- Mọi tin nhắn trước đó, của bạn và của mô hình, đầy đủ. Những câu trả lời dài của mô hình cũng được tính, và thường chúng mới là phần chiếm chỗ nhiều nhất.
- Mọi tệp đã tải lên, hoặc phần nội dung được trích ra từ chúng. Một tệp PDF 40 trang rơi vào khoảng 20.000 đến 30.000 token.
- Kết quả từ công cụ và tìm kiếm. Một lượt tìm kiếm web kéo về năm trang có thể thêm nhiều hơn cả cuộc trò chuyện của bạn tính tới lúc đó.
- Câu trả lời đang được sinh ra. Đầu ra dùng chung ngân sách với đầu vào.
Đó là lý do một cuộc trò chuyện tưởng như ngắn lại có thể sắp chạm giới hạn. Bạn gửi tám tin nhắn ngắn, nhưng mô hình viết tám câu trả lời dài, bạn đính kèm hai tài liệu, và nó chạy ba lượt tìm kiếm. Phần nhìn thấy được có lẽ chỉ chiếm mười phần trăm tổng số.
Đó cũng là lý do cách khắc phục cho một cuộc trò chuyện rối loạn thường là "mở một cuộc trò chuyện mới". Bạn không đang khởi động lại tâm trạng của mô hình. Bạn đang dọn sạch cái bàn.
Kích thước quảng cáo so với kích thước dùng được
Đây là phần quan trọng nhất mà lại ít được nói tới nhất. Chất lượng của một mô hình không giữ nguyên cho tới sát giới hạn rồi mới rơi thẳng đứng. Nó suy giảm dần dần, và bắt đầu suy giảm từ rất lâu trước giới hạn.
Phiên bản được ghi nhận rõ nhất của hiện tượng này thường được gọi là hiệu ứng lạc ở giữa. Đặt một dữ kiện cụ thể ở đầu một tài liệu dài thì mô hình tìm ra. Đặt ở cuối thì mô hình cũng tìm ra. Chôn nó vào giữa 200 trang thì độ chính xác khi truy hồi giảm thấy rõ. Sự chú ý không được phân bổ đều trên một đầu vào dài, và hai đầu mút được ưu ái hơn.
Còn khó hơn nữa khi nhiệm vụ đòi hỏi kết hợp nhiều dữ kiện nằm rải rác trong một đầu vào dài. Tìm một cây kim trong đống rơm là bài toán đã giải xong. Tìm bốn cây kim rồi lập luận về mối liên hệ giữa chúng thì chưa, mà đó lại đúng là việc người ta dùng cửa sổ ngữ cảnh lớn để làm.
Vậy hãy coi con số được quảng cáo là sức chứa tối đa, không phải khoảng làm việc thoải mái. Một quy tắc thực dụng rút ra từ thực tế: bạn có hành vi đáng tin cậy tới khoảng một nửa cửa sổ được quảng cáo, và mọi thứ vượt quá mức đó nên được kiểm chứng thay vì tin ngay. Nếu một mô hình nói với bạn rằng bản hợp đồng 300 trang không có điều khoản chấm dứt, hãy kiểm tra lại, nhất là khi điều khoản đó nằm ở giữa.
Hệ quả cho việc so sánh là: một mô hình có cửa sổ một triệu token không tự động giỏi hơn ở tài liệu dài so với một mô hình 200.000 token. Nó giỏi hơn ở việc tiếp nhận chúng. Còn việc nó có suy luận tốt trên toàn bộ chỗ đó hay không là một câu hỏi riêng, và cách duy nhất để biết là thử với một tài liệu mà bạn đã biết sẵn đáp án.
Chuyện gì xảy ra khi bạn dùng hết
Các sản phẩm xử lý phần tràn theo những cách khác nhau, và biết mình đang dùng loại nào sẽ giải thích được rất nhiều hành vi kỳ lạ.
| Hành vi | Bạn thấy gì | Xảy ra ở đâu |
|---|---|---|
| Báo lỗi thẳng | Yêu cầu bị từ chối kèm thông báo về độ dài | Phần lớn khi dùng API trực tiếp |
| Cắt bỏ âm thầm | Các tin nhắn cũ nhất bị bỏ mà không báo bạn | Nhiều giao diện chat |
| Tóm tắt cuốn chiếu | Tin nhắn cũ bị nén thành một bản tóm tắt | Ngày càng phổ biến ở các sản phẩm chat |
| Truy hồi | Chỉ phần liên quan trong tài liệu được lấy ra mỗi lượt | Công cụ tài liệu và cơ sở tri thức |
Cắt bỏ âm thầm mới là thứ gây rắc rối thật, vì chẳng có gì báo cho bạn biết. Triệu chứng là một mô hình đột nhiên phớt lờ một quy tắc bạn đặt từ đầu, quay lại giọng văn bạn đã chỉnh cách đây một tiếng, hoặc hỏi một câu bạn đã trả lời rồi. Mô hình không hỏng hóc gì. Chỉ là những hướng dẫn đó không còn nằm trên bàn nữa.
Tóm tắt cuốn chiếu thì tốt hơn nhưng vẫn mất mát. Một bản tóm tắt giữ lại ý chính và bỏ đi chi tiết, nên ràng buộc "đừng bao giờ dùng từ cộng hưởng" sống sót dưới dạng "người dùng có một số sở thích về văn phong", thứ chẳng giúp gì cho bạn.
Những chiến thuật thực sự có tác dụng
Chúng được xếp theo mức hiệu quả so với công sức bỏ ra.
Mở cuộc trò chuyện mới khi đổi chủ đề. Đây là thói quen có giá trị cao nhất. Một cuộc trò chuyện dài phải gánh chi phí của tất cả những gì trước đó, kể cả những đoạn lạc đề không còn liên quan. Cuộc trò chuyện dài không hiểu bạn hơn, chúng chỉ tốn kém hơn và loãng hơn.
Đặt câu hỏi sau khối tài liệu dài, không phải trước. Nếu bạn dán một tài liệu rồi mới hỏi, câu hỏi nằm gần chỗ câu trả lời được sinh ra, và điều đó cải thiện độ chính xác trên các đầu vào dài một cách đo đếm được. Dán trước, hỏi sau.
Neo lại những ràng buộc quan trọng. Trong bất kỳ cuộc trò chuyện nào vượt quá khoảng mười lăm lượt trao đổi, hãy nhắc lại các quy tắc quan trọng ngay trong tin nhắn cần đến chúng: "nhắc lại nhé, tiếng Anh Anh, không dùng gạch đầu dòng, dưới 400 từ". Nó tốn của bạn một dòng và nó sống sót qua việc bị cắt bỏ.
Gửi những trang liên quan, đừng gửi cả cuốn sách. Nếu bạn cần mô hình soi điều khoản bồi thường, hãy đưa cho nó điều khoản đó cùng vài đoạn xung quanh. Sự chính xác thắng khối lượng, nó nhanh hơn, rẻ hơn và đúng hơn.
Hãy tóm tắt và khởi động lại một cách có chủ đích. Khi một phiên làm việc trở nên dài, hãy yêu cầu một bản bàn giao có cấu trúc: tình trạng hiện tại, các quyết định đã chốt, các câu hỏi còn bỏ ngỏ, các ràng buộc. Dán nó vào một cuộc trò chuyện mới. Bạn giữ được phần nội dung và bỏ đi phần nhiễu, và bạn sẽ thấy mô hình sắc sảo hơn ngay lập tức.
Dùng truy hồi cho mọi thứ không vừa cửa sổ. Nếu tài liệu của bạn thực sự lớn hơn mọi cửa sổ hiện có, câu trả lời không phải là một cửa sổ to hơn, mà là lấy ra đúng những mẩu liên quan cho từng câu hỏi. Đó chính là cách các công cụ tài liệu hoạt động bên dưới.
Hãy để ý sự suy giảm, không chỉ để ý lỗi. Nếu các câu trả lời trở nên mơ hồ hơn, rào đón nhiều hơn, hoặc bắt đầu phớt lờ hướng dẫn về định dạng, nhiều khả năng bạn đang ở sâu trong cửa sổ. Hãy bắt đầu lại từ đầu trước khi vội kết luận rằng mô hình đã kém đi.
Bạn thực sự cần cửa sổ lớn đến đâu?
Hãy khớp cửa sổ với công việc thay vì đi săn con số lớn nhất.
| Công việc của bạn | Bạn cần gì | Vì sao |
|---|---|---|
| Email, soạn thảo, hỏi nhanh | Bất cứ mô hình hiện đại nào | Bạn sẽ không bao giờ tới gần giới hạn |
| Biên tập tài liệu dài | Từ 100.000 trở lên | Tài liệu cộng cuộc trò chuyện về nó |
| Rà soát hợp đồng và quy chế | Từ 200.000 trở lên, và phải kiểm chứng | Tài liệu cộng phần lập luận, kèm lưu ý ở trên |
| Suy luận trên cả một kho mã | Loại lớn nhất hiện có | Mã dày token và cần nhìn rộng qua nhiều tệp |
| Phân tích bản ghi của nhiều tháng | Loại lớn nhất, hoặc dùng truy hồi | Thường truy hồi hợp hơn là ép sức mạnh thô |
| Xây sản phẩm trên một API | Nhỏ hơn bạn tưởng, kèm bộ nhớ đệm | Prompt dài là nguyên nhân chính của cả chi phí lẫn độ trễ |
Với phần lớn mọi người, câu trả lời trung thực là cửa sổ ngữ cảnh không phải yếu tố quyết định khi chọn giữa các gói đăng ký. Chất lượng viết, hệ sinh thái và giá cả quan trọng hơn. Nó chỉ trở thành yếu tố quyết định trong đúng một tình huống: công việc của bạn thường xuyên phải nạp vào nhiều tài liệu hơn sức chứa của một cửa sổ thông thường, và khi đó khác biệt không hề nhỏ, đó là khác biệt giữa làm được và không làm được.
Nếu bạn muốn tự kiểm chứng, cách thực tế là chạy cùng một tài liệu dài qua hai hoặc ba mô hình rồi đối chiếu câu trả lời với thứ bạn đã biết sẵn. Một không gian làm việc như Whizi giúp việc đó dễ dàng vì GPT, Claude, Gemini, Grok và DeepSeek nằm sau một gói đăng ký, và cửa sổ rất lớn của Gemini chỉ cách khả năng tổng hợp cẩn thận của Claude đúng một cú nhấp. Hãy xem so sánh các mô hình cạnh nhau, hoặc đọc cách chọn mô hình AI cho quyết định rộng hơn.
- Ước lượng số token bằng quy tắc 1.000 token tương đương khoảng 750 từ.
- Nhớ rằng prompt hệ thống, tệp đính kèm, kết quả tìm kiếm và câu trả lời đều tiêu chung một ngân sách.
- Coi khoảng một nửa cửa sổ được quảng cáo là khoảng làm việc đáng tin cậy.
- Dán khối tài liệu dài trước rồi mới đặt câu hỏi sau.
- Nhắc lại các ràng buộc quan trọng trong những cuộc trò chuyện dài để chúng sống sót qua việc bị cắt bỏ.
- Mở một cuộc trò chuyện mới kèm bản bàn giao viết sẵn thay vì kéo dài một cuộc trò chuyện cũ.
Câu hỏi thường gặp
Cửa sổ ngữ cảnh là gì, nói cho đơn giản?
Đó là tổng lượng văn bản mà một mô hình có thể giữ trong tầm nhìn cùng lúc, gồm các hướng dẫn của bạn, toàn bộ cuộc trò chuyện từ đầu tới giờ, mọi tệp đã tải lên và cả câu trả lời đang được viết ra. Khi tổng số vượt quá giới hạn, những phần cũ nhất bị loại bỏ, và đó là lý do các cuộc trò chuyện dài bắt đầu quên.
Cửa sổ ngữ cảnh lớn hơn có luôn tốt hơn không?
Không. Cửa sổ lớn hơn cho phép mô hình tiếp nhận nhiều đầu vào hơn, nhưng độ chính xác suy giảm dần khi đầu vào phình ra, nhất là với những dữ kiện bị chôn ở giữa. Một mô hình cửa sổ một triệu token không tự động giỏi hơn ở tài liệu dài so với mô hình 200.000, nên hãy thử bằng tài liệu mà bạn biết trước đáp án đúng.
128.000 token là bao nhiêu từ?
Khoảng 96.000 từ, tức chừng một cuốn sách 300 trang. Quy đổi chung là một token bằng khoảng bốn ký tự tiếng Anh, nên 1.000 token vào khoảng 750 từ. Mã nguồn và văn bản không phải tiếng Anh tốn nhiều token hơn cho cùng một nội dung.
Vì sao ChatGPT quên mất điều tôi nói trước đó?
Vì cuộc trò chuyện đã phình ra vượt cửa sổ ngữ cảnh, và các tin nhắn cũ nhất bị bỏ đi hoặc bị nén lại để lấy chỗ. Phần lớn giao diện chat làm việc này một cách âm thầm. Nhắc lại các ràng buộc quan trọng, hoặc mở một cuộc trò chuyện mới kèm bản tóm tắt ngắn, sẽ khắc phục ngay lập tức.
Cửa sổ ngữ cảnh có giống bộ nhớ của AI không?
Không. Cửa sổ ngữ cảnh là một giới hạn cứng cho một cuộc trò chuyện. Bộ nhớ là một tính năng sản phẩm riêng, lưu các thông tin về bạn giữa các cuộc trò chuyện rồi chèn chúng vào cuộc mới. Bộ nhớ không làm cửa sổ lớn thêm, nó chiếm một phần của cửa sổ.