如何在Whizi中并排比较AI模型

快速解答

要在Whizi中并排比较AI模型,在聊天头部按下"比较"(Compare),为每一列选择一个模型,然后把同一个提示发送给两边。每一列都保留各自的上下文,因此一个答案不会被另一个牵着走。并排比较是Powerhouse功能,每个回答都按各自模型的积分费率计费。

简短回答

在聊天头部按下"比较"(Compare),为每一列选择一个模型,然后把同一个提示发送给两边。每一列都保留各自的隐藏对话,因此一个模型看不到另一个模型的输出,任何一个回答都不会被另一个牵着走,这正是这种比较之所以有意义的全部原因。两栏会先后依次生成,先左后右,因为每个账号一次只能运行一次生成。

并排比较是Powerhouse功能,一次运行两个模型。每个回答都按各自模型的积分费率计费,所以用一个10积分的模型对比一个20积分的模型,总共要花30积分。

用它来决定某类工作应该默认用哪个模型。如果你想改进一个回答,而不是比较两个回答,那就换一种做法:在同一个对话里切换模型,让第二个模型来批评第一个模型的回答。

为什么跑分回答不了你的问题

已发布的跑分衡量的是模型在标准化任务上的表现。你的问题更具体也更有用:在你自己每周要做二十次的那件事上,哪个模型更强。这是两个不同的问题,第二个问题没有现成答案,因为没有人和你的工作量一样。

把同一个提示发给两个模型,大约花三十秒,就能直接回答这个问题。重要的不是你得到了两个答案,而是你搞清楚了差距有多大。有时候两个输出几乎一样,这说明这类任务不用再纠结选哪个模型。有时候一个根本不能用,这一点最好在你把整套工作流建立在它上面之前就知道。

比较还能抓住另一件事:自信满满的错误。当两个模型对同一个事实性问题给出实质不同的答案时,至少有一个是错的,而你只看其中一个回答是发现不了的。这种信号,在单模型的工作流里,无论花多少钱都得不到。

先定义好"更好"是什么意思,再去看结果

并排比较的陷阱,是偏爱那个更长、更自信、看起来更精致的输出。这些都不是质量。先定好你的评判标准,再去看结果。

任务"更好"意味着什么应该忽略什么
写作需要更少编辑就能直接发出去长度、用词、热情程度
事实类调研来源能核实并支持这个说法流畅度和自信程度
信息提取schema正确,没有编造字段,标签一致表格周围文字的质量
推理步骤站得住脚,边界情况有被考虑到结论是否符合你原本的预期
代码处理了失败路径,便于审查是否聪明、是否简洁
摘要保留了重点,去掉了不重要的部分是否面面俱到

一个实用技巧:在读任何一个输出之前,先写一句话,描述一个好答案应该包含什么。然后再去读。这只要十秒钟,却能防住那种很强、而且大多是无意识的"精致偏好"。

对于事实类问题,要关注的是分歧本身,而不是谁赢了。当两个模型在一个具体数字和一个来源上意见一致时,可信度就比较高。当它们出现分歧时,那正是需要去核实的地方,也是整个练习里最有价值的产出。

能暴露真实差异的提示词

有些任务能明显区分模型,有些则不能。如果你想从比较中学到东西,就用那些会给某项具体能力施加压力的提示词。

  • 压力下的语气。 写一封给客户的邮件,说明我们错过了截止日期,要承担责任,但不要过度道歉,也不要找借口。控制在120词以内。 语域上的差异在这里会立刻显现出来。
  • 严格提取。 从这段文字里提取每一个日期、金额和当事方,整理成一个JSON数组,字段必须严格用这几个键。如果某个字段不存在,用null。不要推测。 测试的是格式纪律,以及编造内容的倾向。
  • 带陷阱的推理。 给一个有貌似合理但错误答案的问题,比如一道比率或比例题,直觉路径是错的那种。模型之间的差异在于是否会抄这个"近路"。
  • 长上下文回忆。 上传一份很长的文档,问中间部分的内容。这能揭示真正可用的上下文长度,而不是宣传里说的那个数字。
  • 承认不知道。 关于[某个真正冷门或非常新的事情],官方宣布了什么? 最好的答案是清楚地说"我不知道",或者是一个有来源的检索结果。在这里编造内容是不合格的。
  • 遵守否定式约束。 解释X,但不要用任何类比或比喻。 对否定式指令的服从程度,差异会比你想象的大。

拿你自己真实的工作去做比较,而不是拿谜题去做。一个在你的季度报告上表现更好的模型,比一个在逻辑谜题上表现更好的模型更有用。

把一周的比较变成一张路由地图

单次比较很有意思。一周的比较才有实际用处。具体做法:

  1. 连续五天,每当有一件重要的任务,就把它同时发给两个模型,而不是只发给一个。
  2. 记下任务类型、赢家,以及差距有多大。三个字就够了。
  3. 到了周末,看看哪个模型反复获胜,哪些任务里两边的输出可以互换。
  4. 据此设置你的默认模型,并且不再比较那些差距一直为零的任务。

人们通常会发现,比较只在少部分工作上有意义,在剩下的工作上纯属浪费时间。快速的事实查询、简单的改写、常规的排版格式,很少能区分出模型的高下。而要给客户看的文字、会影响决策的调研,以及涉及陌生领域的推理,则会明显拉开差距。

这个结果才是回报:在没有差别的地方,你不再比较;在会改变结果的任务上,你继续比较。

并排比较与依次切换

两种不同的技巧,值得区分开来。

并排比较把同一个提示发给两个互相看不到对方输出的模型。每一列都保留各自的隐藏对话,用[Compare]前缀命名,并且不出现在侧边栏里,所以追问也能保持公平:两个模型各自维持独立的多轮上下文。这是选择默认模型、以及发现事实分歧的合适工具。

依次切换指的是先拿到一个回答,然后在同一个对话里切换模型,让新的模型来批评它。当你想找出问题所在,而不是做一次比较时,用这个方法,因为第二个模型可以直接针对具体论点展开讨论。参见在对话中途切换模型

大致的原则是:选哪个模型,用并排比较;改进一个答案,用依次切换。

操作清单
  • 在比较之前,先在普通对话里把提示词写好、改好
  • 在看任何一个输出之前,先定好这个任务"更好"是什么意思
  • 先写一句话描述一个好答案,再去读,避免精致偏好
  • 遇到事实性问题,把分歧本身当作发现,去核实它
  • 拿你自己真实的工作去比较,不要用谜题
  • 把胜出者和差距大小记录一周,再据此设置默认模型
  • 在差距一直为零的任务上,停止比较

常见问题

我一次能比较几个模型?

并排比较是Powerhouse功能,一次运行两个模型,这是刻意设计的:两栏是你真正能仔细读下去的版面。三栏往往会变成走马观花,而走马观花恰恰违背了初衷,因为这项练习的价值就在于发现答案真正不同的地方。

并排比较会不会用掉更多我每月的消息额度?

会,它的费用是双倍的:两个模型各自生成一个回答,每个回答都按各自的积分费率计费,所以用一个10积分的模型对比一个20积分的模型,花掉的是30积分,而不是10或20。在一个错误答案或者不能用的草稿上线之前抓住它,通常值这个价。高效的做法是把比较用在重要决策和交付物上,日常查询和快速改写就用单一模型。

如果两个答案一样好怎么办?

这也是一个真实且有用的结果:它说明这类任务不依赖于模型选择,所以别再为它花心思,用你的默认模型就行。大多数工作量都是这样分布的:大部分任务里模型可以互换,少部分任务里差距很大。搞清楚哪些是哪些,正是坚持比较一周的意义所在。

怎么避免只挑那个"听起来更好"的答案?

在看结果之前先定好评判标准。更长、更自信、更精致的输出总是会被系统性地偏爱,哪怕它其实更差,而这种偏见基本上是无意识的。在动手看之前,先写一句话描述一个好答案应该包含什么,这就足以抵消它的大部分影响。对于事实类工作,评判标准应该是来源能否核实并支持这个说法,而不是答案读起来怎么样。

我该比较哪两个模型?

比较你在这项具体任务上真正在两者之间犹豫的那两个模型,对大多数人来说,这是写作和推理上的Claude对GPT,或者涉及文档时的大上下文模型对你的默认模型。拿一个你永远不会用的模型去对比你最喜欢的模型,得不到任何你会据此行动的结论。