簡短的答案
在文字推理、數學和程式碼上,DeepSeek確實能和西方前沿模型一較高下,而且透過API執行的成本只是零頭。這不是炒作,這正是R1推出時整個產業為之側目、也是之後每家供應商的定價都持續承壓的原因。
在模型本身以外的一切,ChatGPT遙遙領先。圖片和音訊理解、語音、在你的檔案上執行程式碼、連接器、自訂助理、開發者工具、高負載下的可靠性、文件,還有生態系。如果你在選的是一個日常助理而不是一個要拿來開發的模型,這個差距比基準測試分數更重要。同樣的產品對模型分野,也出現在Grok對比ChatGPT的比較裡。
所以誠實的問法不是「哪個更好」,而是「你在買一個模型,還是在買一個產品?」DeepSeek用很便宜的價格賣一個很好的模型。OpenAI賣的是一個內含很好模型的產品。這是兩種不同的購買。
首先,你問的是哪一個DeepSeek?
幾乎每一場搞混的DeepSeek爭論,都是兩個人在討論不同的東西。用DeepSeek有三種截然不同的方式,在成本、隱私,以及你能對輸出做什麼上都不一樣。
| App和網站 | DeepSeek API | 開放權重 | |
|---|---|---|---|
| 成本 | 免費 | 每token非常低 | 你自己的運算資源 |
| 資料去向 | DeepSeek的伺服器 | DeepSeek的伺服器 | 你在哪裡執行就在哪裡 |
| 能不能自架 | 不能 | 不能 | 可以 |
| 能不能微調 | 不能 | 不能 | 可以 |
| 主題限制 | 有,涉及政治敏感議題 | 有 | 減少,但訓練層級的行為仍然存在 |
| 適合 | 試用看看 | 便宜的正式環境文字和程式碼 | 隱私敏感或受監管的工作 |
第三欄是大家最常忘記的,也是最有意思的一欄。DeepSeek以寬鬆授權釋出模型權重,代表這個模型可以被下載、在你自己的硬體上執行、由你所在司法管轄區的供應商代管,還可以被調整。沒有任何一家西方前沿實驗室對自己最好的模型這麼做。
實際的結果是:一個不能把資料傳給中國公司的團隊,仍然可以透過自己執行這些權重,或透過一家在別處代管這些權重的供應商來使用DeepSeek。如果你看到某個政府封鎖了DeepSeek,他們幾乎都是指App和代管的API,而不是權重本身。
DeepSeek確實有競爭力的地方
推理和數學。推理是DeepSeek表現最強的部分。在困難的多步驟問題、競賽數學和邏輯謎題上,它的表現和執行成本高得多的模型處於同一水準。如果你的問題有可驗證的正確答案,值得先在這裡測試看看。
程式碼。在實作、重構、除錯和解釋不熟悉的程式碼上表現扎實。在大型程式碼庫的推理上不是最強的,那種情境更吃重超大的上下文窗口,但以每一分錢能換到的表現來說,優勢很大。
可見的推理過程。推理模型會把思考過程展現出來,這在審查時真的很有用。當答案出錯時,你通常能看出是哪一步出了問題,這比聽起來更有價值,尤其是當你在查核輸出而不是盲目相信它的時候。
成本。這是最大的亮點。DeepSeek V3.2的標價是每百萬輸入token $0.269、每百萬輸出token $0.40,相較之下GPT-5.5是$5和$30,換算下來一則標準答案大約是$0.0005,對比$0.02(Whizi模型成本指數,2026年8月)。快取折扣還會把差距拉得更大。對任何規模化執行的用途來說,這不是一筆小小的節省,而是一項功能能不能成立的分水嶺。
把效率當成設計目標。DeepSeek研究裡有意思的部分在架構上:專家混合路由、稀疏注意力,以及不靠前沿預算就能拿到前沿成果的訓練技巧。這些研究已經公開發表,也明顯影響了其他每一家的定價和開發方式。
ChatGPT明顯領先的地方
多模態工作。給ChatGPT一張截圖、一張白板照片、一張圖表,或一張掃描發票,它都處理得很好。DeepSeek的文字模型就是文字模型。如果你的工作涉及圖片,這一點光靠自己就足以定勝負。
工具使用和程式碼執行。ChatGPT可以針對你上傳的資料執行程式碼、產生圖表,再把檔案交給你。這種工作流程,加上串接工作場所工具的連接器,是一種產品能力,沒有任何單獨的模型能取代它。
可靠性和承載量。DeepSeek的代管服務曾出現過明顯的效能下降期,以及高負載下的暫停註冊。如果你打造的東西有客戶要依賴它,正常運行時間的紀錄就和品質一樣重要。
生態系。SDK、文件完整的函式呼叫、各種整合、社群對冷門問題的解答,還有一批早已熟悉這套工具的求職者。當你在凌晨兩點碰上一個奇怪的邊界情況時,有人已經寫過相關文章的機率要高得多。
行為的一致性。在長篇對話裡,ChatGPT更可靠地遵循複雜的格式和角色指示。DeepSeek的偏移比較多,這在同一則提示詞要跑上千次的代理式工作負載裡很快就會顯現出來。
語音、圖片產出,以及其他一切。文字以外的產生能力,是大家付費的一大理由,而這在DeepSeek的產品裡幾乎沒有。
成本比較,好好算一遍
如果你用的是聊天介面,這一節幾乎不重要:DeepSeek的App免費,ChatGPT Plus每月$20。可以跳過。
如果你在打造任何東西,每token的差異會快速累積。拿一個實際的客服助理工作量來算:每個請求2,000個輸入token、500個輸出token,每月50,000個請求。那就是1億個輸入token和2,500萬個輸出token。按GPT-5.5的標價(每百萬輸入token $5、每百萬輸出token $30),這個月要花$1,250。按DeepSeek V3.2的價格($0.269和$0.40),同樣的工作量大約只要$37,差距超過30倍。就算在DeepSeek自己引發整個產業降價之後,這個差距仍然很大。
有三件事會改變這個算法,也是大家最常漏看的地方:
- 推理模型會產生大量你看不到的token。擴展思考的token數量可能是可見輸出的好幾倍。每token便宜乘上多出很多倍的token數,不一定便宜。要衡量的是token總量,而不只是每token的價格。
- 快取定價比標價更重要,只要你有固定的系統提示詞就是如此。重複輸入的大幅折扣,能打敗一個看起來較便宜的標價。
- 通過你評測的最便宜模型才是贏家。不是最好的模型。用已知正確答案的真實輸入建一個小型測試集,兩邊都跑一遍。大多數正式環境的工作量並不需要前沿模型,而這一點只有靠測量才會知道。
對團隊來說一個合理的模式是:把大量流量導向便宜模型,只有在信心不足或任務風險高時才升級到昂貴模型。當你不被綁在單一廠商的API上時,這套架構會好搭建得多。
隱私、司法管轄權和審查
這個議題值得用事實來處理,而不是當成恐嚇故事,因為細節決定了這件事到底會不會影響到你。
資料流向哪裡。DeepSeek的代管服務在中國境內的伺服器上處理和儲存資料,它的隱私政策也這麼寫明。中國法律讓當局能取得境內資料的權限,比多數西方法規框架都更廣。這是否重要完全取決於你傳的是什麼。一個食譜問題不算風險。客戶合約、病患資料、未發布的程式碼,或任何受GDPR或客戶資料處理協議規範的東西,就是另一回事了。聊天機器人隱私比較把每家主要供應商的政策並排列出。
監管回應。已有多個政府和監管機構以資料處理為由,限制在官方裝置上或在其管轄範圍內使用DeepSeek的App。如果你的組織有採購或安全審查流程,可以預期代管服務會過不了關,而且這個決定通常是因為司法管轄權,而不是模型品質。
內容限制。代管服務在政治敏感議題上,尤其是在中國境內敏感的議題上,會拒答或迴避。執行開放權重能減少這種情況,因為拒答機制有一部分在服務端而不是模型本身,但有些行為是訓練進去的,不會完全消失。如果你的工作涉及歷史、地緣政治,或任何比較政府體制的內容,先測試過再依賴它。
真正有效的變通方法。透過一家在你所在司法管轄區代管的供應商使用開放權重,或自己執行。你保留了成本和品質上的優勢,資料存放地的問題也不復存在。這正是開放權重在策略上真正重要的原因,遠遠超過它有時被解讀成的善意姿態。
想更完整地比較主要供應商如何處理聊天資料、保存期限和訓練退出選項,我們的AI訂閱成本指南涵蓋了購買面的考量,其餘部分則以各家目前的政策頁面為準。
誰該用哪一個
| 如果你是 | 用 | 因為 |
|---|---|---|
| 一般日常使用者 | ChatGPT | 圍繞模型打造的產品才是價值的主要來源 |
| 對成本敏感且要規模化開發 | DeepSeek API | 文字和程式碼按標價算便宜超過30倍 |
| 身處受監管產業 | DeepSeek開放權重、自架,或西方模型 | 資料存放地就是整個問題所在 |
| 做大量數學或邏輯運算 | 兩者都測試 | DeepSeek在這裡確實很強,而且試用成本很低 |
| 處理圖片、音訊或檔案 | ChatGPT | DeepSeek的文字模型不涵蓋這些 |
| 在正式環境跑代理循環 | ChatGPT,之後再優化 | 指示遵循的一致性一開始比價格更重要 |
| 做研究或實驗 | 兩者都用 | 試用DeepSeek的成本幾乎是零 |
多數團隊最後定下來的模式,不是二選一。而是用一個便宜又能幹的模型處理大量工作,用一個前沿模型處理困難案例和任何面向客戶的工作,中間再加一條路由規則。這是合理的架構,也是為什麼就算你喜歡某家廠商,還是值得避免被單一廠商鎖住。
如果你想在不開四個帳號、也不把任何東西送進一個代管在中國的端點的情況下,把DeepSeek的推理能力拿去和GPT、Claude、Gemini比一比,Whizi一份訂閱就把它們全部包含在內,而且成本差距也延續下來:一則DeepSeek V3.2訊息花1個點數,對比GPT-5.5的20個點數。把同一則提示詞餵給兩個模型,留下較好的答案,並排比較模型說明了這在實務上怎麼運作。
- 先確定你說的是App、API還是開放權重,因為它們在每個面向上都不一樣
- 使用代管服務前,先確認你的資料能不能合法離開你的司法管轄區
- 衡量包含隱藏推理在內的token總量,而不只是每token的價格
- 用一小組已知正確答案的真實輸入,同時測試兩者
- 如果你的工作涉及圖片、音訊或語音,立刻把DeepSeek排除
- 考慮把便宜的流量和困難案例分別導向不同模型,而不是只選一個
常見問題
DeepSeek比ChatGPT好嗎?
在文字推理、數學和程式碼上,DeepSeek具競爭力,按標價算一則標準API答案大約$0.0005,對比GPT-5.5的$0.02。在多模態工作、工具使用、可靠性,以及圍繞模型打造的一切上,ChatGPT明顯領先。誰贏取決於你是在買一個模型,還是在買一個產品。
使用DeepSeek安全嗎?
代管的App和API在中國境內的伺服器上處理資料,已有多個政府限制在官方用途上使用它。對個人、非敏感的問題來說,這只是個小疑慮。對客戶資料、受監管資料或專有程式碼來說,這是個真實的疑慮,解法是自己執行開放權重,或透過你所在司法管轄區的供應商執行。
DeepSeek真的是開源的嗎?
模型權重以寬鬆授權公開發布,所以你可以下載、執行、代管和調整它們。訓練資料和完整的訓練流程並未公開,所以嚴格來說「開放權重」才是準確的說法,而不是開源。但它仍然比任何一個西方前沿模型都更開放得多。
為什麼DeepSeek這麼便宜?
主要是架構效率。專家混合路由每個token只啟用部分模型,後續版本又加入稀疏注意力,降低了長輸入的成本。這個實驗室已經公開發表相關研究,由此帶來的價格壓力也把整個產業的價格往下拉。
我能在不把資料送到中國的情況下使用DeepSeek嗎?
可以。因為權重是公開發布的,你可以在自己的硬體上執行這個模型,或使用一家在你所在地區代管它的供應商。你保留了成本和品質上的優勢,資料存放地的問題也不復存在。