Câu trả lời ngắn gọn
Whizi không hiển thị lỗi vượt giới hạn ngữ cảnh. Không có dòng chữ nào trong sản phẩm nhắc đến context window hay giới hạn token, vì một cuộc trò chuyện vượt quá khả năng của model sẽ được cắt bớt cho vừa trước khi gửi yêu cầu, thay vì bị từ chối. Không có gì báo cho bạn biết điều đó đã xảy ra. Nếu model có vẻ như quên mất phần giữa của một cuộc trò chuyện dài, thì đó chính là lý do.
Có bốn thứ thực sự từ chối thẳng bạn, và mỗi thứ đều tự nêu rõ tên mình:
| Thông báo | Mã HTTP | Nguyên nhân |
|---|---|---|
This message is {count} characters, over the 100,000 character limit. Attach a shorter file, or ask about one section at a time. | 400 message_too_long | Một tin nhắn, kể cả văn bản trích xuất từ file của bạn, vượt quá 100,000 ký tự |
This conversation has {count} messages, over the 100 message limit. | 400 too_many_messages | Một yêu cầu duy nhất mang theo bản ghi hơn 100 tin nhắn |
Request is too large. | 413 request_too_large | Toàn bộ nội dung JSON của yêu cầu vượt quá giới hạn dung lượng của route |
That system prompt is missing or over the 32,000 character limit. | 400 invalid_system_prompt | System prompt vượt quá 32,000 ký tự |
Phần {count} trong chuỗi giới hạn ký tự được điền bằng con số thật của bạn, có định dạng dấu phân cách hàng nghìn. Mã hiển thị bên cạnh mỗi chuỗi là thứ xuất hiện trong network trace, ngay cả khi giao diện chỉ cho bạn thấy câu chữ.
Nếu bạn thấy một thông báo nêu tên độ dài ngữ cảnh hay số lượng token, thông báo đó không đến từ Whizi. Hãy chuyển thẳng đến mục cuối.
Ngân sách mà mọi model nhận được, và điều gì xảy ra khi vượt quá
Mọi model trong danh mục đều nhận cùng một ngân sách cho một lượt: 40,000 token đầu vào và 20,000 token đầu ra. Trợ lý CPA Canada là ngoại lệ duy nhất, với 55,000 token đầu vào và 40,000 token đầu ra.
Khi một cuộc trò chuyện vượt quá ngân sách đó, backend sẽ âm thầm cắt bớt lịch sử cho vừa ngân sách token của model thay vì từ chối. Không có toast, không có banner và không có mã lỗi nào cho việc này.
Số lượng token mà Whizi dùng để cắt bớt chỉ là một ước tính, không phải một tokenizer thật. Nó có thể đếm thiếu so với tokenizer thật tới 1.66 lần với dữ liệu JSON, vì vậy một hệ số dự phòng 1.8 lần được áp dụng cho đầu vào để bao quát trường hợp xấu nhất đã đo được.
Chuyển sang model có context lớn hơn không gửi được nhiều hơn
Đây là cách sửa sai lầm phổ biến nhất. Ngân sách đầu vào 40,000 token là cố định: nó giống hệt nhau trên một model có window một triệu token và trên một model có window 200,000 token. Chuyển một cuộc trò chuyện dài từ model window lớn này sang model window lớn khác không thay đổi gì về lượng nội dung được gửi đi.
Kích thước context window chỉ thay đổi ngân sách theo một chiều duy nhất: giảm xuống. Bất kỳ model nào có window dưới 93,000 token sẽ nhận một ngân sách nhỏ hơn, tỷ lệ thuận, thay vì ngân sách cố định, với đầu ra bị giới hạn ở 40 phần trăm window và giữ lại một biên an toàn 1,000 token. Có 31 model trong danh mục bị giới hạn kiểu này, và window nhỏ nhất trong số đó là 6,144 token.
Vậy nên công tắc thực sự có ích lại ngược với cách mọi người hay thử: chuyển từ một model nhỏ, bị giới hạn sang một model bình thường. Chuyển giữa hai model có window lớn là một thay đổi không ảnh hưởng gì đến độ dài. Cách chuyển model giữa chừng hoạt động được nói rõ trong chuyển model giữa chừng cuộc trò chuyện.
Một chi tiết đứng sau con số 93,000, đáng biết nếu bạn đang tìm hiểu vì sao một model từ chối một thứ nhỏ: OpenRouter tính cả đầu vào cộng với đầu ra tối đa được yêu cầu vào window của model, chứ không chỉ tính riêng đầu vào.
Một file tải lên dài sẽ bị cắt, và nó cho bạn biết điều đó
File tải lên thường là lý do khiến một tin nhắn vượt quá 100,000 ký tự, vì file PDF, Word và bảng tính được trích xuất thành văn bản ngay trong trình duyệt của bạn, và văn bản đó tính vào cùng giới hạn như bất cứ thứ gì bạn gõ.
Khi văn bản trích xuất không vừa, nó sẽ bị cắt bớt thay vì bị từ chối, và hai dòng chữ sẽ xuất hiện. Toast hiển thị Your upload was too large, so only the first part of it was sent. Ask about a smaller section for full coverage. Bản thân tin nhắn mang theo dấu hiệu [Attachment truncated: the upload was larger than one message can carry, so the content past this point was not included.] tại điểm cắt, để model biết bản sao của nó dừng ở đâu.
Nếu tin nhắn bị từ chối thay vì bị cắt, bạn sẽ nhận được chuỗi message_too_long từ bảng đầu tiên. Cách khắc phục chính là điều lỗi đó tự nêu ra: đính kèm một file ngắn hơn, hoặc hỏi về từng phần một.
Còn một hành vi nữa dễ bị hiểu nhầm là quên: chỉ tin nhắn gần nhất của người dùng có đính kèm mới được chuyển tiếp file đính kèm cho model. Một ảnh hay PDF bạn đính kèm mười lượt trước không được gửi lại ở mỗi lượt sau đó. Nếu bạn cần model xem lại nó, hãy đính kèm lại. Whizi chấp nhận những gì và cách trích xuất hoạt động ra sao được nói trong các loại file được hỗ trợ.
Một lưu ý về chi phí, vì độ dài làm thay đổi giá trị của một lượt. Ở chế độ Auto, một tin nhắn dài hơn khoảng 6,000 ký tự sẽ được định tuyến đến bậc dài với giá 4 credit, dựa trên lý luận rằng một tin nhắn dài như vậy là một tài liệu được dán vào chứ không phải một câu hỏi. Một câu hỏi ngắn được định tuyến đến bậc nhanh với giá 1 credit. Thang credit được nói rõ trong cách credit hoạt động.
File ghim trong dự án được tính vào prompt ở mọi lượt
Một file được ghim trong dự án đi kèm như văn bản prompt ở mọi lượt trong dự án đó, chứ không chỉ một lần, đó là lý do vì sao ảnh bị cố tình loại khỏi các loại file có thể ghim.
Các giới hạn ở đây là riêng: mỗi file được ghim đóng góp tối đa 32,000 ký tự văn bản trích xuất, và toàn bộ khối dự án bị giới hạn ở 120,000 ký tự, trải trên tối đa 10 file được ghim. Hướng dẫn tùy chỉnh của dự án có thể lên tới 32,000 ký tự.
File và hướng dẫn được ghim được dựng lại vào prompt ở mọi lượt trong dự án đó, nằm trong cùng ngân sách đầu vào với cuộc trò chuyện. Nếu một cuộc trò chuyện trong dự án có vẻ mất mạch nhanh hơn bình thường, hãy bỏ ghim những file bạn không hỏi tới.
Nếu bạn thực sự thấy lỗi độ dài ngữ cảnh
Vậy thì nó đến từ nhà cung cấp model, không phải từ Whizi, và đến tay bạn qua cơ chế truyền thẳng (passthrough). Bất kỳ lỗi ngược dòng nào không phải rate limit đều được trả về dưới dạng HTTP 502 với mã provider_error, mang theo thông báo của nhà cung cấp, bị cắt còn tối đa 300 ký tự. Khi nội dung lỗi của nhà cung cấp hoàn toàn không thể phân tích được, bạn sẽ nhận The model provider rejected the request. thay vào đó.
Một lời từ chối vì độ dài từ nhà cung cấp sẽ nêu tên một độ dài ngữ cảnh và một số lượng token. Những con số đó là kết quả nhà cung cấp đếm yêu cầu của bạn so với một window nhỏ hơn ngân sách mà Whizi đã gửi, và đó chính xác là điều đội hỗ trợ cần để xem xét.
Không có tùy chỉnh giao diện nào thay đổi được điều này. Hãy chuyển sang model khác để có câu trả lời của bạn, và gửi cho đội hỗ trợ đúng nguyên văn thông báo kèm các con số.
Còn hai chuỗi thông báo nữa mà mọi người hay nhầm là vấn đề độ dài. Generation failed mid-stream. và The model stream was interrupted. là lỗi kết nối giữa chừng khi trả lời, không phải từ chối vì độ dài. Hãy thử lại những trường hợp đó. Too many requests. Please wait and try again. là một giới hạn tốc độ ở mức 10 tin nhắn mỗi phút, cũng không liên quan gì đến độ dài.
- Whizi không có lỗi vượt giới hạn ngữ cảnh: nó âm thầm cắt bớt cuộc trò chuyện
- Mọi model đều nhận ngân sách cố định 40,000 token đầu vào và 20,000 token đầu ra cho mỗi lượt
- Trợ lý CPA Canada là ngoại lệ duy nhất, với 55,000 đầu vào và 40,000 đầu ra
- Một window dưới 93,000 token sẽ hạ thấp ngân sách đó, không bao giờ nâng lên
- Một tin nhắn bị giới hạn ở 100,000 ký tự, tính cả văn bản trích xuất từ file
- Một yêu cầu mang theo tối đa 100 tin nhắn trong bản ghi
- Chỉ tin nhắn gần nhất có đính kèm mới chuyển tiếp file đính kèm của nó
- Một file được ghim trong dự án đi kèm như văn bản prompt ở mọi lượt trong dự án đó
- Ở chế độ Auto, một tin nhắn dài hơn khoảng 6,000 ký tự được định tuyến đến bậc dài với giá 4 credit
- Một tin nhắn nêu tên độ dài ngữ cảnh là đến từ nhà cung cấp: hãy đổi model và báo cho đội hỗ trợ
Câu hỏi thường gặp
Whizi có lỗi vượt giới hạn ngữ cảnh không?
Không phải kiểu lỗi ngữ cảnh. Các thông báo về độ dài mà Whizi thực sự hiển thị là các con số đếm, không phải window: 100,000 ký tự trong một tin nhắn, 100 tin nhắn trong một yêu cầu, 32,000 ký tự trong system prompt, và một lỗi 413 Request is too large. trên toàn bộ nội dung yêu cầu. Nếu thông báo trước mặt bạn nêu tên một số lượng token hay một độ dài ngữ cảnh, nó đến tay bạn qua cơ chế truyền thẳng 502 của nhà cung cấp và thuộc về nhà cung cấp model.
Vì sao model quên mất điều tôi đã nói trước đó trong cuộc trò chuyện?
Vì nó đã bị cắt khỏi yêu cầu trước khi yêu cầu được gửi đi. Backend âm thầm cắt bớt lịch sử cho vừa ngân sách token của model thay vì từ chối, nên không có lỗi nào để đọc và không có tùy chỉnh nào để tắt việc này. Bắt đầu một cuộc trò chuyện mới khi chủ đề thay đổi là câu trả lời thực tế.
Chuyển sang model có context window lớn hơn có giúp tôi gửi được nhiều hơn không?
Không. Ngân sách đầu vào cố định ở mức 40,000 token trên mọi model trong danh mục, nên một window một triệu token và một window 200,000 token đều nhận được lượng nội dung như nhau từ cuộc trò chuyện của bạn.
"Vượt quá giới hạn 100,000 ký tự" nghĩa là gì?
Một tin nhắn đã vượt quá giới hạn 100,000 ký tự cho mỗi tin nhắn và bị từ chối với HTTP 400 và mã message_too_long. Văn bản trích xuất từ một file PDF, Word hay bảng tính đính kèm tính vào cùng giới hạn đó, nên file tải lên thường là nguyên nhân chứ không phải việc gõ chữ. Cách khắc phục nằm ngay trong thông báo: đính kèm một file ngắn hơn, hoặc hỏi về từng phần một trong cùng cuộc trò chuyện.
"Vượt quá giới hạn 100 tin nhắn" nghĩa là gì?
Một yêu cầu duy nhất mang theo bản ghi hơn 100 tin nhắn, và bị từ chối với HTTP 400 và mã too_many_messages. Đây là giới hạn cho những gì một yêu cầu có thể mang theo, chứ không phải giới hạn cho việc một cuộc trò chuyện có thể dài bao nhiêu. Bắt đầu một cuộc trò chuyện mới cho chủ đề tiếp theo là câu trả lời thực tế, và nó cũng giúp model có cái nhìn rõ ràng hơn về điều bạn đang hỏi.
Làm sao để tóm tắt một tài liệu dài hơn giới hạn cho phép?
Chia tài liệu ra và làm việc từng phần một trong cùng một cuộc trò chuyện, đây cũng chính là điều mà chuỗi message_too_long khuyên bạn nên làm. Hãy yêu cầu tóm tắt từng phần, rồi tóm tắt lại các bản tóm tắt đó. Nếu một phần vẫn vượt quá 100,000 ký tự sau khi văn bản của file được trích xuất, hãy chia nhỏ phần đó thêm lần nữa.
Tôi có thể trả tiền để có ngân sách ngữ cảnh lớn hơn không?
Không. Ngân sách này là thuộc tính của model trong danh mục chứ không phải của gói của bạn, và không có tùy chỉnh nào ở bất cứ đâu có thể nâng nó lên. Điều mà một gói cao hơn mang lại là quyền truy cập vào nhiều model hơn và một hạn mức hàng tháng lớn hơn, chứ không phải nhiều không gian hơn trong một lượt. Bảng ánh xạ gói được nói rõ trong tài liệu tham khảo model.