简短的答案
在文本推理、数学和代码上,DeepSeek和西方的前沿模型确实能掰手腕,而通过API跑起来的成本只是零头。这不是吹捧,正是R1发布时整个行业都在看它的原因,也是此后各家定价一直承压的原因。
而在模型之外的一切上,ChatGPT领先,而且差距不小。图像和音频理解、语音、对你上传文件的代码执行、连接器、自定义助手、开发者工具链、高负载下的稳定性、文档、生态。如果你要挑的是一个日常助手而不是一个用来搭产品的模型,这个差距比跑分重要得多。
所以诚实的问法不是“哪个更好”,而是“你买的是一个模型,还是一整套产品”。DeepSeek卖的是一个很好的模型,而且非常便宜。OpenAI卖的是一套产品,里面装着一个很好的模型。这是两笔不同的买卖。
先搞清楚,你说的是哪一个DeepSeek
几乎所有关于DeepSeek的糊涂争论,都是两个人在说不同的东西。它有三种截然不同的用法,成本、隐私和你能拿输出做什么,三者都不一样。
| 应用和网页版 | DeepSeek API | 开放权重 | |
|---|---|---|---|
| 成本 | 免费 | 每token极低 | 你自己的算力 |
| 数据去哪 | DeepSeek的服务器 | DeepSeek的服务器 | 你跑在哪就在哪 |
| 能否自建部署 | 不能 | 不能 | 能 |
| 能否微调 | 不能 | 不能 | 能 |
| 话题限制 | 有,涉及政治敏感话题 | 有 | 更少,但训练层面的行为仍在 |
| 适合 | 先试试看 | 便宜地跑生产环境的文本和代码 | 对隐私敏感或受监管的场景 |
第三列是大家最容易忘、也最有意思的一列。DeepSeek以宽松许可发布了模型权重,这意味着模型可以下载、跑在你自己的硬件上、由你所在司法辖区内的服务商托管,也可以做改造。西方的前沿实验室没有一家对自己最好的模型这么做。
实际后果是:一个不能把数据发给中国公司的团队,仍然可以自己跑权重、或者通过在别处托管这些权重的服务商来用DeepSeek。如果你看到某国政府封禁了DeepSeek,他们指的几乎总是应用和托管的API,而不是权重本身。
DeepSeek确实有竞争力的地方
推理和数学。 推理这条线是DeepSeek最拿手的部分。在需要多步推导的难题、竞赛数学和逻辑谜题上,它的水平和那些跑起来贵得多的模型在同一档。如果你的问题有一个可以验证的标准答案,不妨先在这里试。
代码。 在实现功能、重构、调试和讲解陌生代码上都很扎实。在超大代码库的整体推理上不算最强,那种场景更吃超长上下文窗口,但论每一美元能换来多少能力,它领先一大截。
推理过程可见。 推理模型会把思考过程展示出来,这对复核真的有用。答案错了的时候,你通常能看出是哪一步走偏了。当你是在核查输出而不是盲信输出时,这一点比听上去值钱得多。
成本。 这是最抢眼的一条。按每百万token算,DeepSeek的API价格一直稳定在西方旗舰模型的十分之一左右,配合缓存有时还更低。对任何需要跑量的场景来说,这不是小钱,而是一个功能做不做得起的分界线。
把效率当成设计目标。 DeepSeek研究里最有意思的部分在架构上:混合专家路由、稀疏注意力,以及那些不靠前沿级预算也能拿到前沿级结果的训练方法。这些工作都公开发表了,也明显影响了其他所有人的定价和做法。
ChatGPT明显领先的地方
多模态。 给ChatGPT一张截图、一张白板照片、一张图表或一张扫描的发票,它都能处理得不错。DeepSeek的文本模型就是文本模型。如果你的工作涉及图像,光这一条就足以定胜负。
工具调用和代码执行。 ChatGPT可以针对你上传的数据跑代码、画出图表、再把文件交给你。这套流程,加上接入办公工具的连接器,属于产品能力,任何单独的模型都替代不了。
稳定性和承载能力。 DeepSeek的托管服务出现过明显的性能下降和高负载下暂停注册的时期。如果你在做客户依赖的东西,可用性的历史记录和质量一样重要。
生态。 SDK、文档完善的函数调用、各种集成、社区里对冷门问题的解答,以及一批已经熟悉这套工具的人才。凌晨两点撞上一个古怪的边缘情况时,有人写过它的概率要高得多。
行为的一致性。 在长对话里遵循复杂的格式要求和角色设定,ChatGPT更稳。DeepSeek漂移得更明显,这在智能体类的任务里很快就会暴露,因为同一个提示词要跑上千次。
语音、图像生成以及其他。 文本之外的生成能力是人们付费的重要理由,而这基本不在DeepSeek的产品范围内。
把成本账认真算一遍
如果你只是用聊天界面,这一节意义不大:DeepSeek的应用免费,ChatGPT的订阅大约20美元。可以直接跳过。
但只要你在做开发,每token的差价会迅速滚起来。拿一个现实的客服助手负载来说:每次请求2000个输入token、500个输出token,每月5万次请求。那就是1亿输入token和2500万输出token。按西方旗舰模型的价格跑,每月账单相当可观。同样的负载放在DeepSeek上,花的钱可能接近一顿午饭。哪怕在DeepSeek自己引发的全行业降价之后,这个差距依然很大。
有三件事会改变这道算术题,也正是大家最容易忽略的:
- 推理模型会生成大量你看不见的token。 扩展思考的长度可能是可见输出的好几倍。单价便宜乘上多得多的token,未必还便宜。要算总token数,而不是每token的价格。
- 对任何带固定系统提示词的场景,缓存价格比标价更重要。 重复输入上的大幅折扣,可能比一个略低的标价更划算。
- 能通过你评测的最便宜的模型才是赢家,而不是最好的那个。用真实输入和已知正确答案搭一个小测试集,两边都跑一遍。大多数生产负载并不需要前沿模型,而这一点只有量过才知道。
团队可以考虑一个合理的模式:把大部分流量导到便宜的模型,遇到置信度低或风险高的任务再升级到贵的那个。当你没有被某一家的API锁死时,这套东西做起来要容易得多。
隐私、司法辖区与内容限制
这件事值得就事论事地讲,而不是拿来吓人,因为具体细节决定了它到底影不影响你。
数据去了哪里。 DeepSeek的托管服务在中国境内的服务器上处理和存储数据,它的隐私政策里也是这么写的。相比多数西方框架,中国法律给予主管部门对境内数据更宽的访问权限。这重不重要,完全取决于你发过去的是什么。问个菜谱没有风险。客户合同、患者数据、未发布的代码,或者任何受GDPR和客户数据处理协议约束的内容,就是另一回事了。
监管方面的反应。 已有多个国家的政府和监管机构以数据处理为由,限制在公务设备上或在本辖区内使用DeepSeek应用。如果你所在的组织有采购或安全审查流程,托管服务大概率过不了,而且这个结论关乎司法辖区,而不是模型质量。
内容限制。 托管服务在政治敏感话题上会拒答或绕开,尤其是那些在中国境内比较敏感的话题。跑开放权重能减轻这一点,因为拒答层有一部分在服务端,但有些行为是训练进去的,不会完全消失。如果你的工作涉及历史、地缘政治,或者任何对不同政府做比较的内容,请先测一测再依赖它。
真正有效的解决办法。 通过一家在你所在辖区托管这些权重的服务商来用开放权重,或者干脆自己跑。成本和质量上的优势都留着,数据驻留的问题也就不存在了。这正是开放权重具有战略意义、而不只是一个善意姿态的原因。
关于各家主流服务商如何处理对话数据、保留期和训练退出选项,更完整的比较可以看我们的AI订阅成本指南,那篇覆盖了掏钱这一侧;其余部分请以各家最新的政策页面为准。
谁该用哪一个
| 如果你是 | 用 | 原因 |
|---|---|---|
| 普通日常用户 | ChatGPT | 模型之外的那套产品才是价值主体 |
| 对成本敏感、要跑量做开发 | DeepSeek API | 文本和代码便宜一个数量级 |
| 在受监管行业 | 自建的DeepSeek开放权重,或西方模型 | 数据驻留就是全部问题所在 |
| 大量处理数学或逻辑 | 两个都测 | DeepSeek在这里确实强,试错成本也低 |
| 要处理图片、音频或文件 | ChatGPT | DeepSeek的文本模型覆盖不了 |
| 在生产环境跑智能体循环 | 先用ChatGPT,再做优化 | 前期指令遵循的一致性比价格更值钱 |
| 做研究或试验 | 都用 | 试一试DeepSeek的成本几乎为零 |
多数团队最后落到的模式并不是二选一,而是:跑量的活儿交给一个便宜又够用的模型,难题和面向客户的部分交给前沿模型,中间加一条分流规则。这是个合理的架构,也是为什么哪怕你喜欢某家服务商,也值得避免被单一服务商绑死。
如果你想把DeepSeek的推理能力和GPT、Claude、Gemini比一比,又不想开四个账号、也不想把内容发到托管在中国的接口上,Whizi把它们都放进了一份订阅里。把同一个提示词丢给两个模型,留下更好的那个答案,具体怎么操作可以看并排比较模型。
- 先确定你说的是应用、API还是开放权重,它们在每个维度上都不一样
- 使用托管服务之前,先确认你的数据在法律上能否离开你所在的辖区
- 统计包含隐藏推理在内的总token数,而不只是每token的价格
- 用一小组带已知正确答案的真实输入,把两边都测一遍
- 如果你的工作涉及图片、音频或语音,直接把DeepSeek排除掉
- 考虑把便宜的流量和难题分给不同模型,而不是非要二选一
常见问题
DeepSeek比ChatGPT好吗?
在文本推理、数学和代码上,DeepSeek很有竞争力,而API成本只是零头。在多模态、工具调用、稳定性以及围绕模型搭起来的一整套东西上,ChatGPT明显领先。谁赢,取决于你买的是一个模型还是一整套产品。
用DeepSeek安全吗?
托管的应用和API在中国境内的服务器上处理数据,已有多个国家限制其在公务场景中的使用。对个人的、不敏感的问题来说,这是个小问题。但涉及客户数据、受监管数据或专有代码时就是真问题,答案是自己跑开放权重,或者通过你所在辖区的服务商来跑。
DeepSeek真的是开源的吗?
模型权重以宽松许可发布,所以你可以下载、运行、托管和改造它们。但训练数据和完整的训练流程没有公开,所以准确的说法是“开放权重”,而不是严格意义上的开源。即便如此,它也比任何西方前沿模型开放得多。
DeepSeek为什么便宜这么多?
主要靠架构效率。混合专家路由让每个token只激活模型的一部分,后续版本又加入了稀疏注意力,压低了长输入的成本。这些研究该实验室都公开发表了,由此带来的价格压力把整个行业都往下压了一截。
能不能在不把数据发到中国的前提下用DeepSeek?
可以。因为权重是公开的,你可以把模型跑在自己的硬件上,或者用一家在你所在地区托管它的服务商。成本和质量的优势都还在,数据驻留的问题也就不存在了。