简短回答
在聊天头部按下"比较"(Compare),为每一列选择一个模型,然后把同一个提示发送给两边。每一列都保留各自的隐藏对话,因此一个模型看不到另一个模型的输出,任何一个回答都不会被另一个牵着走,这正是这种比较之所以有意义的全部原因。两栏会先后依次生成,先左后右,因为每个账号一次只能运行一次生成。
并排比较是Powerhouse功能,一次运行两个模型。每个回答都按各自模型的积分费率计费,所以用一个10积分的模型对比一个20积分的模型,总共要花30积分。
用它来决定某类工作应该默认用哪个模型。如果你想改进一个回答,而不是比较两个回答,那就换一种做法:在同一个对话里切换模型,让第二个模型来批评第一个模型的回答。
为什么跑分回答不了你的问题
已发布的跑分衡量的是模型在标准化任务上的表现。你的问题更具体也更有用:在你自己每周要做二十次的那件事上,哪个模型更强。这是两个不同的问题,第二个问题没有现成答案,因为没有人和你的工作量一样。
把同一个提示发给两个模型,大约花三十秒,就能直接回答这个问题。重要的不是你得到了两个答案,而是你搞清楚了差距有多大。有时候两个输出几乎一样,这说明这类任务不用再纠结选哪个模型。有时候一个根本不能用,这一点最好在你把整套工作流建立在它上面之前就知道。
比较还能抓住另一件事:自信满满的错误。当两个模型对同一个事实性问题给出实质不同的答案时,至少有一个是错的,而你只看其中一个回答是发现不了的。这种信号,在单模型的工作流里,无论花多少钱都得不到。
先定义好"更好"是什么意思,再去看结果
并排比较的陷阱,是偏爱那个更长、更自信、看起来更精致的输出。这些都不是质量。先定好你的评判标准,再去看结果。
| 任务 | "更好"意味着什么 | 应该忽略什么 |
|---|---|---|
| 写作 | 需要更少编辑就能直接发出去 | 长度、用词、热情程度 |
| 事实类调研 | 来源能核实并支持这个说法 | 流畅度和自信程度 |
| 信息提取 | schema正确,没有编造字段,标签一致 | 表格周围文字的质量 |
| 推理 | 步骤站得住脚,边界情况有被考虑到 | 结论是否符合你原本的预期 |
| 代码 | 处理了失败路径,便于审查 | 是否聪明、是否简洁 |
| 摘要 | 保留了重点,去掉了不重要的部分 | 是否面面俱到 |
一个实用技巧:在读任何一个输出之前,先写一句话,描述一个好答案应该包含什么。然后再去读。这只要十秒钟,却能防住那种很强、而且大多是无意识的"精致偏好"。
对于事实类问题,要关注的是分歧本身,而不是谁赢了。当两个模型在一个具体数字和一个来源上意见一致时,可信度就比较高。当它们出现分歧时,那正是需要去核实的地方,也是整个练习里最有价值的产出。
能暴露真实差异的提示词
有些任务能明显区分模型,有些则不能。如果你想从比较中学到东西,就用那些会给某项具体能力施加压力的提示词。
- 压力下的语气。
写一封给客户的邮件,说明我们错过了截止日期,要承担责任,但不要过度道歉,也不要找借口。控制在120词以内。语域上的差异在这里会立刻显现出来。 - 严格提取。
从这段文字里提取每一个日期、金额和当事方,整理成一个JSON数组,字段必须严格用这几个键。如果某个字段不存在,用null。不要推测。测试的是格式纪律,以及编造内容的倾向。 - 带陷阱的推理。 给一个有貌似合理但错误答案的问题,比如一道比率或比例题,直觉路径是错的那种。模型之间的差异在于是否会抄这个"近路"。
- 长上下文回忆。 上传一份很长的文档,问中间部分的内容。这能揭示真正可用的上下文长度,而不是宣传里说的那个数字。
- 承认不知道。
关于[某个真正冷门或非常新的事情],官方宣布了什么?最好的答案是清楚地说"我不知道",或者是一个有来源的检索结果。在这里编造内容是不合格的。 - 遵守否定式约束。
解释X,但不要用任何类比或比喻。对否定式指令的服从程度,差异会比你想象的大。
拿你自己真实的工作去做比较,而不是拿谜题去做。一个在你的季度报告上表现更好的模型,比一个在逻辑谜题上表现更好的模型更有用。
把一周的比较变成一张路由地图
单次比较很有意思。一周的比较才有实际用处。具体做法:
- 连续五天,每当有一件重要的任务,就把它同时发给两个模型,而不是只发给一个。
- 记下任务类型、赢家,以及差距有多大。三个字就够了。
- 到了周末,看看哪个模型反复获胜,哪些任务里两边的输出可以互换。
- 据此设置你的默认模型,并且不再比较那些差距一直为零的任务。
人们通常会发现,比较只在少部分工作上有意义,在剩下的工作上纯属浪费时间。快速的事实查询、简单的改写、常规的排版格式,很少能区分出模型的高下。而要给客户看的文字、会影响决策的调研,以及涉及陌生领域的推理,则会明显拉开差距。
这个结果才是回报:在没有差别的地方,你不再比较;在会改变结果的任务上,你继续比较。
并排比较与依次切换
两种不同的技巧,值得区分开来。
并排比较把同一个提示发给两个互相看不到对方输出的模型。每一列都保留各自的隐藏对话,用[Compare]前缀命名,并且不出现在侧边栏里,所以追问也能保持公平:两个模型各自维持独立的多轮上下文。这是选择默认模型、以及发现事实分歧的合适工具。
依次切换指的是先拿到一个回答,然后在同一个对话里切换模型,让新的模型来批评它。当你想找出问题所在,而不是做一次比较时,用这个方法,因为第二个模型可以直接针对具体论点展开讨论。参见在对话中途切换模型。
大致的原则是:选哪个模型,用并排比较;改进一个答案,用依次切换。
- 在比较之前,先在普通对话里把提示词写好、改好
- 在看任何一个输出之前,先定好这个任务"更好"是什么意思
- 先写一句话描述一个好答案,再去读,避免精致偏好
- 遇到事实性问题,把分歧本身当作发现,去核实它
- 拿你自己真实的工作去比较,不要用谜题
- 把胜出者和差距大小记录一周,再据此设置默认模型
- 在差距一直为零的任务上,停止比较
常见问题
我一次能比较几个模型?
并排比较是Powerhouse功能,一次运行两个模型,这是刻意设计的:两栏是你真正能仔细读下去的版面。三栏往往会变成走马观花,而走马观花恰恰违背了初衷,因为这项练习的价值就在于发现答案真正不同的地方。
并排比较会不会用掉更多我每月的消息额度?
会,它的费用是双倍的:两个模型各自生成一个回答,每个回答都按各自的积分费率计费,所以用一个10积分的模型对比一个20积分的模型,花掉的是30积分,而不是10或20。在一个错误答案或者不能用的草稿上线之前抓住它,通常值这个价。高效的做法是把比较用在重要决策和交付物上,日常查询和快速改写就用单一模型。
如果两个答案一样好怎么办?
这也是一个真实且有用的结果:它说明这类任务不依赖于模型选择,所以别再为它花心思,用你的默认模型就行。大多数工作量都是这样分布的:大部分任务里模型可以互换,少部分任务里差距很大。搞清楚哪些是哪些,正是坚持比较一周的意义所在。
怎么避免只挑那个"听起来更好"的答案?
在看结果之前先定好评判标准。更长、更自信、更精致的输出总是会被系统性地偏爱,哪怕它其实更差,而这种偏见基本上是无意识的。在动手看之前,先写一句话描述一个好答案应该包含什么,这就足以抵消它的大部分影响。对于事实类工作,评判标准应该是来源能否核实并支持这个说法,而不是答案读起来怎么样。
我该比较哪两个模型?
比较你在这项具体任务上真正在两者之间犹豫的那两个模型,对大多数人来说,这是写作和推理上的Claude对GPT,或者涉及文档时的大上下文模型对你的默认模型。拿一个你永远不会用的模型去对比你最喜欢的模型,得不到任何你会据此行动的结论。