同一个提示词,由 ChatGPT 和 Claude 并排作答。

从 3 个提示词里挑一个,看两个模型同时作答,然后留下你真正会发出去的那一份。这里没有任何东西调用模型:回答是固定的记录,所以页面免费,而且每次都一样。

这是怎么算的

每个提示词都按它真正考察的那一件事打 100 分制,赢的并不总是同一个模型。这正是重点:ChatGPT 更会把活儿理清楚,Claude 更会判断什么才重要,你需要哪一个,取决于眼前这件活儿。

这些是固定的示例回答,写出来是为了说明两个模型的差别在类型上而不在质量上。它们不是模型实时生成的输出,也不是一项基准测试。

把这份 40 页的合同总结一下

按准确度和抓重点评分

ChatGPT (OpenAI), 92/100

以下是关键条款的梳理:

  • 当事方:Meridian Corp(客户)与 Halcyon Ltd(供应商)
  • 期限:24 个月,除非提前 60 天取消,否则自动续约
  • 费用:每月 12,400 美元,每年上调 4%
  • 责任:以 12 个月费用为上限
  • 终止:任一方均可,需提前 90 天书面通知

如果需要逐条列表,告诉我一声。

Claude Sonnet (Anthropic), 96/100

这是 Meridian Corp 与 Halcyon Ltd 之间为期 24 个月的服务合同,每月 12,400 美元,每年上涨 4%。

签字前有三点值得你留意:不在期满前 60 天取消,合同就会自动续约;责任上限是一年的费用;90 天的终止通知期比通常更长。

其余都是套话。

结论: Claude 获胜,96 比 92。两边的事实都没错,但 Claude 告诉你该担心什么,而不是把所有条款一视同仁地罗列出来。

婉拒一场会议,但别把路走死

按语气和能否直接发出评分

ChatGPT (OpenAI), 88/100

主题:回复:合作事宜

[姓名],你好:

非常感谢你的来信!很遗憾,我目前的日程实在安排不开。真的很感激你想到我,也很希望为将来的机会留一扇门。

祝项目一切顺利!

此致敬礼,
[你的名字]

Claude Sonnet (Anthropic), 95/100

Dana,你好:

谢谢邀请。周四我就不去了,这周已经排得太满,与其准备得半吊子去露个面,不如干脆缺席。

如果有用,我可以自己把材料看一遍,周五前把意见发给你。不然就下一轮再约。

Noura

结论: Claude 获胜,95 比 88。没有待填的空位,有真实理由,还给了替代方案。原样就能发出去。

把这些笔记变成一份发布清单

按条理和责任到人评分

ChatGPT (OpenAI), 94/100

发布清单,按截止时间排序:

  1. 冻结范围(周一),负责人:产品经理
  2. 支付功能最后一轮测试(周二),负责人:研发
  3. 媒体资料包和截图(周三),负责人:设计
  4. 排期 Product Hunt 素材(周四),负责人:市场
  5. 发布当天作战室(周五),全员

要不要做成带状态列的表格?

Claude Sonnet (Anthropic), 90/100

这些笔记离周五还差五件事:周一锁定范围,让测试拿到稳定的构建;周二跑支付回归;周三之前从设计那边拿到媒体资料包;周四晚上排好 Product Hunt 的素材;周五空出来留给发布本身。

笔记里还提到分地区定价。这次发布我会砍掉它,它不是承重的部分。

结论: ChatGPT 获胜,94 比 90。有负责人、有截止日期,还是一份编好号、能直接粘进任务系统的清单。

常见问题

这个页面会调用真正的模型吗?

不会。回答是固定的记录,所以页面立刻就能打开,运行也不花钱。想把自己的提示词同时发给两个模型,请打开 Whizi。

ChatGPT 和 Claude 哪个更好?

没有哪个全面更好。在这三个提示词上,Claude 拿下了合同总结和邮件,因为它能判断什么重要;ChatGPT 拿下了清单,因为它能把活儿理清楚。只挑一个用到底,正是这个页面要说的那个错误。

我能分享某一次具体的对比吗?

可以。复制分享链接,收到的人打开时会停在同一个提示词上。

下一步

读完整的ChatGPT 与 Claude 对比,或者用token 费用计算器算算同一件活儿在所有模型上各要多少钱。