AI聊天绝对不能贴什么信息(以及哪些其实没问题)

快速解答

永远不要把密码、API密钥、双重验证码、完整的卡号或账号,或者证件号贴进AI聊天,别人的个人信息、保密协议下的客户工作内容,以及没做脱敏的截图,都要一视同仁地对待。你自己的草稿、已经脱敏的文档,以及一般性的问题都没问题。原因在于数据保留和训练默认设置,不是黑客攻击。

贴进去的秘密到底去了哪里

这个页面讲的完全和黑客无关。一个贴进去的秘密,会通过聊天产品那些普通的、有文档记录的运作方式产生副本,而问题就出在这些副本上。

干这活儿的机制一共有四个。第一,数据保留:你贴的东西会成为一段被存下来的对话的一部分,按照有文档记录的时间表处理。比如OpenAI会把已删除的对话安排在30天内永久移除,谷歌Gemini的活动记录则默认18个月自动删除,怎么删除你的Gemini账号讲了怎么改这个设置。第二,训练默认设置:OpenAI、Anthropic和谷歌的消费者档位默认会用对话来改进模型,除非你自己去关掉这个开关,而商业档位和API档位默认是关的。第三,审查:三家厂商都声明,被标记的对话可能会被人读到,这是常规的安全做法,但也确实意味着可能有人会看到你贴的东西。第四,分享:以链接形式分享出去的对话,会带上里面的一切,包括你在想给别人看的那部分之前三条消息上传的文档。

这几条单独看都算不上什么丑闻。但合在一起说明了一件事:聊天输入框是一个文字会被保存下来、有时会被拿去训练、偶尔还会被人看到的地方。贴东西的时候按这个来。这个页面剩下的部分,就是把这句话套用到一个个具体的场景上,而AI安全吗讲的是围绕这个问题更广泛的安全议题。

绝不能贴清单:六样东西都能用占位符免费替代

这些东西没有任何正当理由出现在聊天输入框里,因为模型帮你不需要用到它们。每一样都可以用一个占位符替代,而且不会改变你得到的答案。

绝不能贴为什么它和其他数据不一样该怎么做
密码、API密钥、访问令牌、双重验证码一个凭证只要被任何人看到过,就有价值,而重置一个已经泄露的凭证是本可以避免的额外工作在该填的地方打上“密码”或“密钥”这样的字样,答案不会变
完整的卡号、账号或路由号支付欺诈需要的恰恰就是这些字符串,别的都不需要在任何和钱有关的问题里,写“我的卡”“我的账户”就够用
政府颁发的身份号码:社会安全号、护照号、身份证号、税号身份盗窃就是靠这些东西拼出来的,而且它们不像密码那样能重置模型解释一份表格或者一个流程,从来都不需要真实的号码
别人的个人信息:姓名配地址、健康细节、人事记录这是别人的信息,大多数地方的隐私法都把分享它算作你的行为,不是聊天机器人的行为贴之前把真实姓名换成“甲”“乙”这样的代称
受保密协议或雇主保密政策约束的文档这是一个合同层面的问题,“我把它贴进了聊天机器人”本身就构成了一次披露,不管之后有没有出什么事只问文档的结构性问题,去掉受保护的具体内容
任何你不会在没签合同的情况下发给外部顾问的东西这是能兜住上面几行漏掉的一切的检验标准如果答案是不会,就一直脱敏到答案变成会为止

最后一行压缩了整张表。AI聊天就是一个你没和它签过任何东西、却在帮你忙的外部对象。按你平时对待这种情况的分寸来把握就对了。

没人会想到的那几样

上面那份硬性清单很好遵守,因为上面的东西看起来就很敏感。真正让细心的人栽跟头的,是那些看起来不敏感的东西。

  • 截图。 你本来只想分享那条报错信息,结果连带着把通知栏、打开的标签页、别人发来的邮件标题,还有角落里的日历提醒都一起截了进去。把图裁到你要问的那一块就行。
  • 藏着密钥的代码文件。 GitGuardian统计,2024年公开的GitHub提交里新泄露了2,380万个密钥,把一份带着有效密钥的配置文件或.env文件贴进聊天窗口,是同一个错误的另一种版本。贴之前先在文件里搜一遍key、secret、token和password。
  • 会议记录和录音。 那场会议里的每个人,说的话都是讲给房间里的人听的,没有一个人同意过被上传进聊天。你自己写的会议纪要不会有这个问题。
  • 带客户列的表格。 你问的是公式的事,贴过去的却是表里每一位客户的邮箱。先删掉能识别身份的那几列,或者只贴十行结构示例,别贴整张表。
  • 带交易对方名字的合同。 理解一个条款需要的是条款本身,几乎从不需要知道是谁签的。用AI总结文档在脱敏过的文件上效果完全一样。
  • 导出的日历和收件箱。 一个文件里装着上百个别人的名字、时间和主题。问你的排期问题,贴出一周的大致形状,把导出文件留在自己手里。

这六样东西有一个共同的规律:敏感的部分通常是你真正需要的东西周围那圈背景,把范围裁到你真正需要的东西,就顺带去掉了它。这一裁只要三十秒。

哪些其实没问题

一份简短的绝不能贴清单,意义就在于清单之外的一切都可以用,而日常大部分的粘贴操作根本没有任何问题:你自己的草稿和笔记、公开信息、不管话题多私人的一般性问题、不带内嵌密钥的自己的代码,以及任何你已经脱敏到只剩问题需要的部分的文档。

让这一切成立的习惯,是贴之前先脱敏,之所以管用,是因为模型推理靠的是结构,不是具体身份。自己试一次就知道:先让它帮你写一封给房东的信,讲暖气坏了,名字保留原样;再写一遍,把名字换成[房东],两相比较。“解释一下这条合同条款”不会因为模型知道是哪两家公司签的而回答得更好。极少数情况下名字确实要紧,你可以在拿到输出之后自己把名字加回去,总好过贴一份没脱敏、还收不回来的原文。

还有两个设置要处理好。去查一次你的聊天应用的训练开关,因为消费者档位的默认设置通常对你不利,另外要弄清楚你这个应用的数据保留时长。厂商该公开的东西,大概就是Whizi的数据页面这个样子:存了什么、存多久、删除之后会去掉什么。Whizi在那个页面上的答案是:上传的内容最多30天后过期,你的内容不会用来训练Whizi自有的模型,也不会作为训练数据出售。你每天在用的任何工具,都应该在某个你能引用的地方回答同样这几个问题。如果你正打算在这个维度上比较几个订阅,第三方AI订阅安全吗用同一套标准把整个品类都过了一遍。

一旦养成习惯,这整个页面就能浓缩成一条规矩:如果你不会在没签合同的情况下把它发给外部顾问,就不要贴。除此之外的一切,随便贴,把名字换掉就行。

操作清单
  • 不管是哪个厂商、哪个方案,密码、API密钥和双重验证码都不要进任何聊天。
  • 把卡号、账号和证件号换成占位符;答案不会变。
  • 涉及别人的内容,贴之前先把名字换成“甲”“乙”这样的代称。
  • 把NDA和雇主保密材料当成合同层面的硬性禁区,而不是一个凭感觉判断的事。
  • 把截图裁到你要问的那一块,别的都裁掉。
  • 贴代码文件之前,先搜一遍key、secret、token和password。
  • 只要应用提供这个设置,就把对话训练的开关关掉。
  • 弄清楚你用的应用数据保留和删除的具体时长,优先选公开这些数字的工具。

常见问题

绝对不能告诉AI聊天机器人的是什么?

任何形式的凭证(密码、API密钥、双重验证码)、完整的支付和账号信息、政府颁发的身份号码、别人的个人信息,以及任何受NDA或雇主保密政策约束的内容。剩下的用这个检验标准来判断:如果你不会在没签合同的情况下把它发给外部顾问,就不要贴。

把工作文档贴进AI安全吗?

你自己的工作内容,脱敏到只剩问题需要的部分,通常没问题,而且非常有用。两条硬性限制都是合同层面的,不是技术层面的:受NDA约束的材料,以及雇主政策限制的内容。除此之外,先去掉交易对方的名字、客户数据和内嵌的凭证,模型在脱敏版本上照样能把活儿干好。

别人能看到我在AI聊天里打的字吗?

不会是随随便便就能看到,但那些副本是真实存在的:对话会按厂商的政策被保留,消费者档位除非你自己关掉,否则可能会拿去训练,被标记的对话可能会被人审查,而以链接形式分享出去的对话,会带上里面的一切。绝不能贴清单存在的原因,正是这四种副本,每一种都是厂商有文档记录的行为。

删除一段聊天真的会把它去掉吗?

这要看厂商,而这正是为什么数据保留时长应该写在一个你用得上之前就能读到的数据页面上。删除通常会很快把这段对话从你的账户里去掉,再按照写明的时间表从系统里去掉,同时可能有有限的法律留存期。查一下你用的厂商的政策看具体时间表,优先选写清楚这个时间表的工具。

把敏感文字贴进付费方案会更安全吗?

大厂商的付费档位大约是每月$20,训练默认设置通常比免费的消费者档位更严格,方向是对的,但任何档位都不会改变绝不能贴清单。一个凭证就算贴进全世界最企业级的方案,依然是一个你已经披露出去的凭证。升级是为了更好的默认设置;不管升不升级,都要脱敏。