Những gì không bao giờ nên dán vào chat AI (và những gì thật ra vẫn ổn)

Trả lời nhanh

Đừng bao giờ dán mật khẩu, khóa API, mã xác thực hai lớp, số thẻ hay số tài khoản đầy đủ, hoặc số giấy tờ tùy thân do chính phủ cấp vào một cuộc chat AI, và hãy đối xử với dữ liệu cá nhân của người khác, việc của khách hàng thuộc diện NDA, và ảnh chụp màn hình chưa che thông tin theo đúng cách đó. Bản nháp của riêng bạn, tài liệu đã che thông tin và các câu hỏi chung chung đều ổn. Lý do nằm ở việc lưu trữ và các mặc định huấn luyện, không phải chuyện bị hack.

Một bí mật đã dán vào thật ra đi đâu

Không có gì trên trang này nói về hacker cả. Một bí mật bị dán vào tạo ra các bản sao thông qua chính cách vận hành bình thường, đã được ghi rõ của các sản phẩm chat, và các bản sao đó mới là vấn đề.

Bốn cơ chế làm việc này. Thứ nhất, lưu trữ: những gì bạn dán trở thành một phần của một cuộc trò chuyện được lưu lại, theo một lịch trình đã công bố. Chẳng hạn, OpenAI đặt lịch xóa vĩnh viễn các cuộc chat đã xóa trong vòng 30 ngày, còn hoạt động Gemini của Google nằm dưới một thiết lập tự động xóa mặc định là 18 tháng, và cách xóa tài khoản Gemini có nói cách đổi thiết lập đó. Thứ hai, mặc định huấn luyện: các gói dành cho người dùng cá nhân tại OpenAI, Anthropic và Google có thể dùng cuộc trò chuyện để cải thiện mô hình trừ khi bạn tắt thiết lập này, trong khi các gói doanh nghiệp và API mặc định tắt sẵn. Thứ ba, rà soát: cả ba nhà cung cấp đều nêu rõ rằng các cuộc trò chuyện bị gắn cờ có thể được con người đọc, đây là quy trình an toàn thường quy nhưng vẫn có nghĩa là một con người có thể xem thứ bạn đã dán vào. Thứ tư, chia sẻ: một cuộc trò chuyện được chia sẻ dưới dạng liên kết mang theo mọi thứ bên trong nó, kể cả tài liệu bạn đã tải lên ba tin nhắn trước phần bạn muốn cho ai đó xem.

Không điều nào trong số này là một vụ bê bối. Tất cả gộp lại chỉ có nghĩa một điều: một ô chat là nơi chữ được giữ lại, đôi khi được học từ đó, và thỉnh thoảng bị nhìn thấy. Hãy dán theo đúng tinh thần đó. Phần còn lại của trang này chỉ là câu đó được áp dụng vào những trường hợp cụ thể, và dùng AI có an toàn không nói về câu hỏi an toàn rộng hơn xoay quanh chuyện này.

Danh sách cấm: sáu thứ mà một chỗ giữ chỗ thay thế được miễn phí

Những thứ này không có lý do chính đáng nào để đi vào một ô chat, vì mô hình không cần chúng để giúp bạn. Mỗi thứ trong số đó đều có thể được thay bằng một chỗ giữ chỗ mà không làm thay đổi câu trả lời bạn nhận được.

Đừng bao giờ dánVì sao nó khác các dữ liệu khácNên làm gì thay vào đó
Mật khẩu, khóa API, token truy cập, mã xác thực hai lớpMột thông tin đăng nhập có giá trị với bất kỳ ai từng nhìn thấy nó, và việc đổi lại một thứ bạn đã làm lộ là công sức bạn có thể tránh đượcGõ PASSWORD hoặc KEY vào chỗ đó; câu trả lời sẽ không đổi
Số thẻ, số tài khoản hay số định tuyến đầy đủGian lận thanh toán cần đúng những chuỗi số này và không gì khác"thẻ của tôi" và "tài khoản của tôi" vẫn dùng tốt trong mọi câu hỏi về tiền bạc
Giấy tờ tùy thân do chính phủ cấp: số an sinh xã hội, hộ chiếu, căn cước, mã số thuếĐánh cắp danh tính được dựng lên từ những thứ này, và chúng không đổi lại được như một mật khẩuMô hình không bao giờ cần con số thật để giải thích một biểu mẫu hay một quy trình
Dữ liệu cá nhân của người khác: tên kèm địa chỉ, chi tiết sức khỏe, hồ sơ nhân sựĐó là thông tin của họ, và luật riêng tư ở phần lớn nơi coi việc chia sẻ nó là hành động của bạn, không phải của chatbotĐổi tên thật thành Người A và Người B trước khi dán
Tài liệu thuộc NDA hoặc chính sách bảo mật của công tyĐây là vấn đề mang tính hợp đồng, và "tôi đã dán nó vào một chatbot" là một hành vi tiết lộ dù sau đó có chuyện gì xấu xảy ra hay khôngĐặt câu hỏi theo cấu trúc của tài liệu, bỏ đi các chi tiết được bảo vệ
Bất cứ thứ gì bạn sẽ không gửi email cho một chuyên gia tư vấn bên ngoài khi chưa có hợp đồngĐây là phép thử bắt được mọi thứ mà các dòng phía trên có thể bỏ sótNếu câu trả lời là không, hãy che thông tin cho tới khi câu trả lời là có

Dòng cuối cùng chính là cả bảng thu gọn lại. Một cuộc chat AI là một bên ngoài bạn chưa ký bất cứ giấy tờ gì cùng, đang cố giúp bạn. Hãy cân chỉnh đúng như cách bạn làm với một bên như vậy.

Những thứ chẳng ai nghĩ tới

Danh sách cấm kỵ ở trên dễ tuân theo vì những thứ trong đó trông rõ ràng là nhạy cảm. Những thứ dán vào mà thật sự bẫy được cả người cẩn thận lại là những thứ không trông như vậy.

  • Ảnh chụp màn hình. Thông báo lỗi bạn định chia sẻ đi kèm với khay thông báo của bạn, các tab đang mở, một dòng tiêu đề email của người khác, và một lời nhắc lịch ở góc màn hình. Hãy cắt gọn chỉ còn đúng thứ bạn đang hỏi.
  • Tệp mã nguồn có bí mật bên trong. GitGuardian đếm được 23.8 triệu bí mật mới bị rò rỉ trong các commit công khai trên GitHub năm 2024, và một tệp cấu hình hay .env dán vào có sẵn một khóa còn hiệu lực chính là phiên bản trong ô chat của cùng một sai lầm đó. Hãy tìm trong tệp các từ key, secret, token và password trước khi đưa nó vào.
  • Bản ghi và bản chép lời cuộc họp. Mọi người trong cuộc họp đó đã nói chuyện với những người có mặt trong phòng, và không ai trong số họ đồng ý cho nó bị tải lên một cuộc chat. Những bản tóm tắt do chính bạn viết ra không mang vấn đề đó.
  • Bảng tính có cột khách hàng. Câu hỏi là về công thức; bản dán lại kèm theo mọi email khách hàng trong bảng. Hãy xóa các cột nhận dạng trước, hoặc dán mười dòng chỉ để thể hiện cấu trúc thay vì cả bảng tính.
  • Hợp đồng có tên đối tác. Hiểu một điều khoản cần đúng điều khoản đó, và gần như không bao giờ cần biết ai đã ký. Tóm tắt tài liệu bằng AI hoạt động tốt y hệt trên một tệp đã che thông tin.
  • Lịch và hộp thư đã xuất ra. Một tệp, hàng trăm tên, giờ giấc và tiêu đề của người khác. Hãy hỏi về vấn đề sắp xếp lịch, dán hình dạng của tuần đó, giữ lại tệp xuất ra.

Mẫu hình chung ở cả sáu thứ này: phần nhạy cảm thường nằm ở bối cảnh xung quanh thứ bạn cần, và cắt gọn xuống đúng thứ bạn cần sẽ loại bỏ nó. Việc cắt gọn đó chỉ mất ba mươi giây.

Những gì thật ra vẫn ổn

Điểm hay của một danh sách cấm ngắn là mọi thứ nằm ngoài nó đều dùng được, và phần lớn việc dán hằng ngày chẳng có vấn đề gì cả: bản nháp và ghi chú của riêng bạn, thông tin công khai, các câu hỏi chung chung dù chủ đề có riêng tư đến đâu, mã nguồn của riêng bạn không có bí mật nhúng bên trong, và bất kỳ tài liệu nào bạn đã che thông tin xuống chỉ còn đúng những gì câu hỏi cần.

Thói quen giúp mọi chuyện suôn sẻ là che thông tin trước khi dán, và lý do nó hiệu quả là vì mô hình suy luận dựa trên cấu trúc chứ không phải danh tính. Hãy tự thử một lần: yêu cầu viết thư cho chủ nhà về chuyện hệ thống sưởi bị hỏng, có kèm tên thật, rồi thử lại với [CHỦ NHÀ] thay vào chỗ đó, và so sánh. "Giải thích điều khoản hợp đồng này" không hề tốt hơn khi mô hình biết công ty nào đã ký. Trong trường hợp hiếm hoi mà một cái tên thật sự quan trọng, bạn có thể tự thêm nó vào lại trong kết quả, thay vì chọn cách dán chưa che thông tin mà bạn không thể rút lại được.

Hai thiết lập hoàn tất công việc này. Kiểm tra công tắc huấn luyện của ứng dụng chat bạn dùng một lần, vì các mặc định dành cho người dùng cá nhân không có lợi cho bạn, và biết rõ con số lưu trữ của ứng dụng đó. Những gì một nhà cung cấp nên công bố trông giống như trang dữ liệu của Whizi: những gì được lưu, trong bao lâu, và việc xóa loại bỏ những gì. Câu trả lời của chính Whizi ở đó: tệp tải lên hết hạn sau tối đa 30 ngày, và nội dung của bạn không dùng để huấn luyện các mô hình do Whizi sở hữu và không được bán làm dữ liệu huấn luyện. Bất kỳ công cụ nào bạn dùng hằng ngày cũng nên trả lời được đúng những câu hỏi đó ở một nơi bạn trích dẫn được. Nếu bạn đang chọn giữa các gói đăng ký chính theo trục này, gói đăng ký AI bên thứ ba có an toàn không đi qua cùng một tiêu chuẩn đó trên toàn bộ danh mục.

Quy tắc thay thế cả trang này một khi nó trở thành thói quen: nếu bạn sẽ không gửi nó qua email cho một chuyên gia tư vấn bên ngoài khi chưa có hợp đồng, đừng dán nó vào. Mọi thứ còn lại, cứ dán thoải mái và đổi tên đi là được.

Danh sách kiểm tra
  • Giữ mật khẩu, khóa API và mã xác thực hai lớp tránh xa mọi cuộc chat, trên mọi gói, ở mọi nhà cung cấp.
  • Thay số thẻ, số tài khoản và giấy tờ tùy thân bằng chỗ giữ chỗ; câu trả lời sẽ không đổi.
  • Đổi tên người khác thành Người A và Người B trước khi dán bất cứ điều gì về họ.
  • Coi tài liệu thuộc NDA và bảo mật công ty là cấm về mặt hợp đồng, không phải chuyện tùy bạn cân nhắc.
  • Cắt gọn ảnh chụp màn hình chỉ còn đúng thứ bạn đang hỏi.
  • Tìm trong mã nguồn các từ key, secret, token và password trước khi dán một tệp.
  • Tắt huấn luyện trên các cuộc trò chuyện của bạn ở bất cứ đâu ứng dụng cho phép.
  • Biết rõ con số lưu trữ và xóa dữ liệu của ứng dụng bạn dùng, và ưu tiên các công cụ công bố những con số đó.

Câu hỏi thường gặp

Bạn không bao giờ nên nói gì với một chatbot AI?

Bất kỳ thông tin đăng nhập nào (mật khẩu, khóa API, mã xác thực hai lớp), số thanh toán và số tài khoản đầy đủ, giấy tờ tùy thân do chính phủ cấp, thông tin cá nhân của người khác, và bất cứ điều gì thuộc phạm vi NDA hay chính sách bảo mật của công ty. Phép thử bao trùm phần còn lại: nếu bạn sẽ không gửi nó qua email cho một chuyên gia tư vấn bên ngoài khi chưa có hợp đồng, đừng dán nó vào.

Dán tài liệu công việc vào AI có an toàn không?

Việc của chính bạn, đã che thông tin xuống chỉ còn những gì câu hỏi cần, nhìn chung ổn và cực kỳ hữu ích. Hai giới hạn cứng ở đây mang tính hợp đồng chứ không phải kỹ thuật: tài liệu thuộc NDA, và bất cứ điều gì chính sách công ty bạn hạn chế. Với mọi thứ còn lại, hãy xóa tên đối tác, dữ liệu khách hàng và thông tin đăng nhập nhúng sẵn trước, rồi mô hình vẫn làm được đúng việc đó trên phiên bản đã che thông tin.

Người khác có thể thấy những gì tôi gõ vào một cuộc chat AI không?

Không phải một cách tình cờ, nhưng các bản sao là có thật: các cuộc trò chuyện được lưu lại theo chính sách của nhà cung cấp, các gói dành cho người dùng cá nhân có thể dùng chúng để huấn luyện trừ khi bạn từ chối, các cuộc trò chuyện bị gắn cờ có thể được con người rà soát, và bất cứ thứ gì trong một cuộc trò chuyện bạn chia sẻ qua liên kết cũng đi theo liên kết đó. Danh sách cấm tồn tại chính vì bốn bản sao này, và mỗi bản sao đều là hành vi đã được nhà cung cấp ghi rõ.

Xóa một cuộc chat có thật sự loại bỏ nó không?

Còn tùy nhà cung cấp, và đó chính xác là lý do các con số lưu trữ nên nằm trên một trang dữ liệu bạn đọc được trước khi cần tới nó. Việc xóa thường loại bỏ cuộc trò chuyện khỏi tài khoản của bạn ngay lập tức và khỏi hệ thống theo một lịch trình đã nêu rõ, với một số khoảng lưu trữ hạn chế theo luật. Hãy kiểm tra chính sách của nhà cung cấp bạn dùng để biết lịch trình đó, và ưu tiên các công cụ có nêu rõ lịch trình.

Dán văn bản nhạy cảm vào một gói trả phí có an toàn hơn không?

Các gói trả phí ở những nhà cung cấp lớn có giá khoảng $20 một tháng và thường đi kèm mặc định huấn luyện chặt chẽ hơn các gói miễn phí dành cho người dùng cá nhân, nên hướng đi đó là đúng, nhưng không gói nào thay đổi được danh sách cấm. Một thông tin đăng nhập dán vào gói doanh nghiệp xịn nhất trên đời vẫn là một thông tin đăng nhập bạn đã tiết lộ. Hãy nâng cấp vì các mặc định đó; nhưng vẫn phải che thông tin dù thế nào đi nữa.