为什么一个模型不够用
大家常说的多用几个AI模型的理由是:每个模型各有所长,所以该按任务挑最合适的那个。这话没错,但它是最没意思的理由。
更好的理由是:模型看不见自己的盲区。 让一个模型检查自己写的东西,它多半会给自己背书,因为造成错误的那套权重,同时也造出了那份自信。换一个模型,它用不同的数据、以不同的方式训练,出错的路数也不一样,就能发现前一个发现不了的问题。这不是什么花招,道理和你把邮件发给客户前先请同事看一眼是一样的。
第二个理由很现实:模型的领先位置一直在换。这个季度编程最强的,下个季度未必还是。绑死在一家厂商上的流程,排名一变就得重搭一遍。而建立在“随时换模型”这个前提上的流程,就没有这个麻烦。
下面是四套方法,按投入产出比从高到低排列。你不需要四套全用。大多数人光靠前两套就拿到了几乎全部收益。
方法一:一个模型起草,另一个模型挑错
这是价值最高的一套,也是几乎没人用的一套。用一个模型写,用另一个模型审。
它管用,是因为“生成”和“评判”本来就是两种活。正在产出文字的模型,追求的是把话顺下去。而评判一段不是自己写的文字的模型,对这套论证没有任何立场包袱,所以它会直说第三段推不出结论,而不是把它糊弄过去。
这里提示词的写法极其关键。问一句“你觉得这写得怎么样”,换来的只会是一堆恭维。请改用下面这段:
下面这段文字不是你写的,你对它没有任何立场。请以一位挑剔的编辑身份复审。按顺序列出:1)任何错误的、没有依据的或说得太满的事实性说法;2)任何论证其实推不出结论的地方;3)最弱的那一段,以及它到底弱在哪里。不要改写任何内容。不要告诉我哪里写得好。
最后那三条指令才是真正起作用的部分。“不要改写”能拦住它按自己的语气重写一版,那并不是你要的东西。“不要告诉我哪里写得好”能去掉那种条件反射式的夸奖,AI反馈里大半的水分都在那儿。“这不是你写的”是个意外好用的设定,因为它能让模型不再维护那些它以为属于自己的选择。
然后把你认可的那部分意见带回第一个模型。你才是那个决定采纳哪些意见的编辑,这正是最合理的分工。
什么时候值得多花这两分钟:要发给客户的、要公开的、写错了代价很大的。什么时候不值得:一条工作群消息、一份初步提纲、一张购物清单。
方法二:分歧检查
在不逐条人工核实的前提下,这是最接近可靠幻觉探测器的做法。
用同一段提示词,分别独立地把同一个事实性问题问给两个不同的模型,然后对比。两边一致的地方,你大概率没问题。两边不一致的地方,就是需要核实的确切位置。
整套技巧就这么简单,而它之所以强,是因为幻觉通常不会重合。当一个模型编出一个数据、一个判例名、一个函数签名或一个日期时,另一个训练方式不同的模型很少会编出一模一样的。答案一致只是正确性的弱证据。答案不一致则是“有问题”的强证据,而且它直接指出了问题在哪。
如果内容里有好几条说法,就让对比这一步替你干活:
下面是针对同一个问题的两个回答,分别标记为A和B。忽略文风和长度。列出它们在实质内容上所有不一致的地方,包括数字、日期、人名的差异,以及某个说法被说得有多绝对。对每一处分歧,指出哪一方更可能正确,以及查一份什么资料就能定论。
这样一来,你手里就是一份需要核实的短清单,而不是一整份要逐字查证的文档,而且这份清单指出的问题位置通常都对。
两点提醒。第一,如果某个错误在互联网上很常见,两个模型可能会一起犯错,所以这招抓的是凭空编造,不是广泛流传的错误信息。第二,别因为两个模型说法一致就跳过核实。它只是缩小了你要查的范围,并没有免掉核实这件事。
适合用它的场景:统计数据、法律和医疗方面的说法、历史事实、API细节,以及任何将来会被人拿来引用的内容。可以跳过的:观点、创作类内容,以及那些大致正确就够用的东西。
方法三:按任务分派模型
这是最显而易见的一套,但值得认真做。把每一类活派给最擅长它的模型,而不是一股脑丢给你手边正好开着的那个。
| 任务 | 该用什么 | 原因 |
|---|---|---|
| 各类文字的初稿 | 写作能力最强的模型 | 你买的是更少的返工时间 |
| 复审这份初稿 | 换一个模型 | 视角新鲜,出错路数不同 |
| 涉及本周的事情 | 能联网搜索的模型 | 训练数据永远滞后 |
| 超长文档或整个代码库 | 大上下文模型 | 装得下,才谈得上读懂 |
| 硬逻辑、数学或棘手的bug | 支持深度思考的推理模型 | 慢一些,但多步问题上准确得多 |
| 大批量重复性工作 | 便宜又快的模型 | 分类和打标签用顶配模型是浪费 |
| 涉及敏感信息的内容 | 符合你数据规定的那个 | 能力再强也不能凌驾于合规要求之上 |
唯一值得养成的习惯是:别再用默认那一个。 大多数人不管什么活都用订阅送的那个模型,包括它并不擅长的活,然后得出结论说AI做不了这些事。花十秒想想该用哪个模型,对结果的改善超过花一小时打磨提示词。
方法四:接力,并写好交接说明
对于跨越多个阶段的工作,最容易出问题的地方是阶段与阶段之间的缝隙。你给一个模型讲清楚了项目,做出了点成果,然后换到另一个模型,要么贴上一大堵历史记录,要么把来龙去脉再含糊地讲一遍。
解决办法是在切换之前,明确要一份交接说明:
请为另一个没看过这段对话的助手写一份交接说明。包含:我们要产出什么、已经做了哪些决定以及为什么、有哪些限制和要避免的东西、试过并被否掉的方案,以及我接下来具体需要什么。写得足够具体,让它不用再问我任何问题就能接着做。
就算你不换模型,这一招也有用。它是从一段又慢又含糊的长对话里脱身的最干净方式,因为你留下了实质内容,扔掉了积累的噪音。把这份说明贴进一个全新对话,质量通常立刻就上来了。
一次真实的接力大概长这样。把一份两百页的报告交给大上下文模型,要一份结构化摘要,外加十段关键原文引用。把这些拿到写作能力强的模型里,产出给客户的说明。再用第三个模型跑一遍方法一里的复审。全程大约十五分钟,每个环节用的都是称手的工具。
什么时候不必这么折腾
多模型工作流是有额外开销的,假装没有的结果,就是有人为了写一封两行的邮件搭出一整套复杂流程。
这些情况用一个模型就好:任务很小、出错代价很低、你在探索而不是在产出、你正在快速迭代而多余的步骤会打断节奏,或者这活确实是创作性的,第二个意见只会把你的声音搅浑。
这些情况用两个或更多:产出要交给别人看、事实准确性很重要、任务有几个需要不同强项的明确阶段、你卡住了需要一个真正不同的角度,或者你即将根据模型说的话做出决定。
一条还算靠谱的准则:如果这事你会请同事看一眼,那就再问一个模型。 如果你不会,那就不用。
怎么让它真正落地
以上道理都不难,难的是每个模型都躲在一份单独的订阅后面时,实操起来非常烦人。这些摩擦是真实存在的:分开的标签页、分开的历史记录、在它们之间来回复制上下文、格式丢失,以及那一点点阻力,让你偏偏在最需要复审的那天把它跳过了。
正是这些摩擦,让上面这几套方法被严重低估。它们并不难,只是烦到足以让你在忙的时候直接跳过。
这就是多模型工作区存在的意义。在Whizi里,各个模型都在同一段对话中,所以做一次复审只是换个模型再问一句,而不是打开另一个产品再把稿子贴过去。一份历史记录,一次搜索就能翻遍你问过的所有内容,一张账单。想知道这两步具体怎么操作,可以看对话中途切换模型和并排对比模型。
如果你更愿意自己用几份独立订阅拼出这一套,这些方法照样管用,你也照样该用。唯一不同的是你还愿意坚持多久。如果你已经在为两三个方案付费来实现这件事,先跑一下省钱计算器,因为那通常是达到同样效果的更贵的路。
从方法一开始。挑你接下来要写的、会被别人读到的那份东西,换一个模型跑一遍那段复审提示词,看看它能挑出什么。光是养成这一个习惯,就比这篇文章其余部分加起来更值钱。
- 任何东西发出去之前,先用一个模型起草,再用另一个模型复审。
- 使用那段禁止改写、禁止夸奖的复审提示词。
- 把同一个事实性问题问给两个模型,逐一核查它们说法不一致的地方。
- 把超长文档、硬逻辑和时效性问题分派给合适的模型。
- 换模型或另开新对话之前,先要一份书面交接说明。
- 小事、低风险或纯探索性的工作,这一整套都可以跳过。
常见问题
为什么要用不止一个AI模型?
因为模型看不见自己的盲区。第二个训练方式不同的模型,能抓住第一个信心满满却搞错的地方。另外,这也意味着每当某个实验室在某类任务上反超时,你的工作流不必推倒重来。
怎么发现AI的幻觉?
把同一个问题独立地问给两个不同的模型,然后对比。编造出来的事实很少会被以同样的方式编两次,所以两个回答不一致的地方,就是你该去核实的地方。答案一致能缩小核实范围,但不能免掉核实。
该用哪个模型写,哪个模型审?
起草用那个针对你这类工作最不需要返工的模型,通常是写作能力强的那个,复审换另一个。审稿的是哪一个模型没那么重要,重要的是它是一个出错路数不同的模型。
多用几个模型,值得多花这些时间吗?
只要东西是给别人看的,或者你要为它负责,那就值得,而且复审这一步大约只要两分钟。对于快速的、低风险的或探索性的工作,这就是不必要的开销。判断标准是:这事你会请同事看一眼吗,会的话就再问一个模型。
要做到这些,是不是得订好几个服务?
不用。一个多模型工作区让你在一份方案、一份历史记录里用上主流模型,去掉了那些让人跳过这些步骤的摩擦。分别订阅当然也行,只是把好习惯坚持下去会更难。