机制是什么,不讲术语
当你问AI聊天机器人一个问题时,它并不是在查什么东西。它是在一次几个字符地生成文字,让这些文字符合“这类问题的正确答案通常是怎么写的”这个规律。它干的全部就是这件事。符合规律和说的是真的,是两个不同的靶子,而这个过程里没有任何一步瞄准第二个。
大多数时候你察觉不到,因为这两个靶子是重合的。这些系统学习的文本,大多出自大体上说得对的人之手,所以长得像答案的文字通常也就是正确的文字。重合在边缘处变薄:那些罕见的、新近的、非常具体的,或者干脆不在模型读过的东西里的事实。在这些边缘上,生成一个正确答案的“形状”仍然很容易。生成它的内容则不然。你拿到的,是一个像事实一样搭起来的句子,数字填在该在的位置上,还配了一个看起来可信的名字,描述的却是一件从未发生过的事。
这也解释了为什么那个最顺手的追问不管用。问一句“你确定吗”感觉像是在审计。它不是。附和是符合“乐于助人的回复”这个规律的,所以施压往往换来附和,模型常常会道歉,然后用一个更差的答案替掉原本正确的那个。两分钟就能验证:问一件你本来就知道的事,接受那个正确答案,然后说“这听着不对吧”,看看会怎样。回来的还是同一套机器在生成顺着你说的文字,而不是第二个独立意见。想从最底层弄清这些东西是怎么造出来的,AI到底是什么讲清了这一点,而且不用数学。
它最常出错的五个地方
错误并不是均匀地分布在你可能问的所有事情上。它们扎堆。学会这五个扎堆的地方,你脑子里就会有一个小警报,在该响的时候响,这比一种笼统的、一直响到最后干脆不响的警惕感有用得多。
| 它在哪里失手 | 表现是什么样 | 一句话的例子 |
|---|---|---|
| 具体事实和数字 | 一个精确却毫无依据的数值 | 说本地某家店1987年开业,其实是1994年 |
| 引用、原话、链接 | 像真的标题、像真的网址,但一个都打不开 | 两位真实研究者在一本真实期刊上发表的、从未存在过的研究 |
| 训练截止之后的一切 | 对一个几个月前就停住的世界侃侃而谈 | 报出去年的订阅价格,而该方案三月就改了 |
| 算术和计数 | 方法对,总数错 | 把十一行发票加起来,结果差了40美元 |
| 自带答案的问题 | 附和被包装成了分析 | 问“为什么X是更好的选择”,就只给X的理由,从不质疑前提 |
最后一行是你自己造成的,也是实际使用中最常见的一种。问“为什么X比Y好”几乎必然换来一份支持X的说辞,而带着“难道不是”“肯定是吧”这类字眼的问题,通常会得到一个是。改成这样问:“针对这个情况比较X和Y,然后给出反对你所选那一项的最有力论证。”把问题问得不夹带答案,就是人们所说的提示词功夫的一半,怎么跟AI说话讲了另一半。还有一个值得早点知道的怪毛病。在一段很长的对话里,或者在你贴进一份很长的文档之后,开头的细节可能会滑出模型的视野,而它会把这个洞补上,而不是告诉你它跟丢了。这是容量限制,不是真假问题,什么是上下文窗口讲清了这个天花板在哪里。
那种自信的口吻并不是虚张声势
大多数人来到这里时都带着一个听起来合理的假设:这东西知道自己有几分把握,只是藏起了怀疑,好显得胜任。这个假设是错的,而且很重要,因为它会让你去找一个根本不存在的置信信号。
并没有一个被瞒着你的置信度表。系统并不是私底下握着一个62%的数字,却选择说得像100%。它生成错误答案的过程,和生成正确答案的过程完全相同,流畅程度也完全相同。这正是口吻在这里毫无信号价值的原因,而在人身上并非如此。像“我不完全确定,不过”这样的含糊说法,同样是生成出来的文字。它出现,是因为这种措辞符合这类问题的规律,而不是因为它内部有什么东西触发了警报。让一个模型给自己的把握打个十分制的分,你会拿到一个数字,还常常是个高分,而它旁边就紧挨着一条它编出来的引用。那个分数和那条引用,出自同一个过程。
所以像“只在你确定时才回答”或者“不要编造任何东西”这样的指令,帮助没有人们指望的那么大。在重要问题上加一句“不知道就说不知道”仍然值得做,因为新一代模型比过去更愿意拒答,但把它当成一个轻推,而不是一份保证。这个想法可靠的版本是朝外看的:让答案给你一个你能亲自打开的东西。当应用联网搜索并附上链接时,你可以自己去读那个页面,不必再听信它的任何说法。而当它只凭记忆作答时,你手上就只有它的说法。
四个核查,按代价从低到高排
你不可能什么都去核实,硬要那么干的结果是你什么都不核实。你要的是一个代价低于犯错代价的核查。下面这四个从几乎免费到略微烦人,对大多数问题来说,你顺手抓起的第一个就够了。
- 要出处,然后真的打开它。 不是把“请注明出处”当成一句仪式。去点开。一个打不开的链接,或者一个打得开却根本没有那句话的页面,大约十秒就能给出结论。
- 换一段新对话再问一遍。 同样的问题,新的对话,不带之前的任何来回。如果数字、人名或日期变了,说明模型是在补洞,而不是在回忆什么。这不花钱,却能抓出相当高比例的编造细节。
- 问另一个模型。 对事实类问题而言,这是性价比最高的核查。把同一个问题贴给第二家服务商,比较的是具体内容,不是口吻。
- 老老实实搜一下。 凡是你要发出去、签下去、公开发表或要花钱的事,给它九十秒的搜索时间。AI是一次出色的初筛。初筛不等于核实。
第三条配得上它的位置。两个由不同公司打造、用不同数据以不同方法训练出来的模型,可能在同一个问题上都错。但它们极少编出同一个错误细节,因为一个捏造的具体信息,来自某一套系统里特有的那些窟窿。当Claude和ChatGPT各自独立地给了你同一个数字,这个数字多半是真的。当它们不一致时,你就精确定位到了那句值得核查的话,这比“总觉得这答案哪里不对”强多了。偶尔核查一下,两家服务商的免费版就够用,不花一分钱。等交叉核对变成习惯之后就不再免费了,因为每家服务商的付费权限大约是每月20美元,而像Whizi这样的多模型订阅补的正是这个缺口。如何把多个AI模型配合起来用讲了完整的流程。
哪些地方重要,哪些地方其实无所谓
一个对什么都适用的核实习惯,一周之内就会垮掉。你问的大部分事情风险都很低,而且自带检验。让它把你自己的邮件缩短,你一眼就能看出它是不是更短了、意思还在不在。头脑风暴、起名字、列提纲、写草稿、翻译一条你发出前会读一遍的消息、把乱糟糟的笔记整理成清单,都是这样。你自己就是那道检查,错误当场就摆在你眼前。
两个问题就能把任何任务归到正确的那一类,问自己大约三秒钟。
- 如果这错了,谁会发现,什么时候发现? 是你,十秒钟后读的时候,还是一位客户,三个月之后?
- 我能撤回吗? 删掉一段糟糕的文字不花钱。重报一次税、把已发出的报价收回来、把一笔付款退回去,就不是了。
只要有一个答案让你迟疑,那就在行动前核实每一条具体说法。这一类里明确包括:药名和剂量、法律和申报期限、报税数字、合同条款、任何涉及他人健康或移民身份的事,以及会转移资金或处理个人数据的代码。邮件里用错一个近义词,只会让你一天里显得有点怪。搞错剂量或错过期限,可不是AI事后替你去处理的。用AI安全吗更深入地讲了另一面,包括哪些东西你永远不该贴进去。先从一个习惯开始:只要一个答案里出现了数字、人名、日期或链接,就单把那一部分当作未经证实,去核一核。剩下的通常都没问题。
- 在你核实之前,把答案里的每一个数字、人名、日期和链接都当作未经证实。
- 别再拿“你确定吗”当测试,因为施压换来的是附和而不是纠正。
- 要出处,打开它,确认那个页面真的写着答案里说的话。
- 重要的问题换一段新对话再问一遍,看看具体信息是否一致。
- 在依赖事实类答案之前,先拿去问另一家公司的第二个模型。
- 把带倾向的问题重写一遍,别让它告诉模型你想要哪个答案。
- 先问“这错了谁会发现”和“我能不能撤回”,再决定核实到什么程度。
常见问题
什么是AI幻觉?
幻觉是指一个自信、结构完整,但根本不是真的答案:一个编出来的统计数字、一条并不存在的引用、一个产品从未有过的功能。这个名字起得不太好,因为并没有什么东西在想象。系统生成了符合“正确答案该有的样子”的文字,而在那一次,样子和真相没有对上。
AI为什么宁可编,也不说自己不知道?
说“我不知道”只是众多能接上这个问题的回复之一,而一个流畅的答案通常更贴合。模型没有一个独立步骤会在生成之前核对事实,所以也就没有什么东西能触发拒答。新一代模型比旧的更常拒答,而在提问时直接加一句“不知道就说不知道”,确实略微有点用。
AI的答案可信吗?
可以信它的推理、结构和起草,这些正是这类工具真正强的地方。不要在没核实的情况下相信那些具体内容:数字、人名、日期、原话、引用出处,以及任何新近的事。这个划分就是信任在这里的实用版本,它让你能天天用AI而不至于吃亏。
追问“你确定吗”能修好一个错误答案吗?
很少,而且可能更糟。模型倾向于迁就你的质疑,所以它们常常放弃一个正确答案,换上一个更差的。换一段新对话问同样的问题是好得多的测试,因为第二个答案是在没有你的怀疑施压的情况下生成的。
怎样快速核查一个AI答案?
打开它给你的任何出处,确认上面写的就是它声称的内容。如果没有出处,就在新对话里再问一遍同样的问题,看看细节还站不站得住。凡是你要据此行动的事实,都拿去问另一家服务商的第二个模型,因为两套系统很少捏造出同一个细节。