Die kurze Antwort
Bei Textlogik, Mathematik und Code ist DeepSeek wirklich konkurrenzfähig mit den westlichen Spitzenmodellen, und über eine API kostet der Betrieb nur einen Bruchteil. Das ist kein Hype. Es ist der Grund, warum die Branche aufhorchte, als R1 erschien, und warum die Preise aller Anbieter seitdem unter Druck stehen.
Bei allem, was nicht das reine Modell ist, liegt ChatGPT vorn, und zwar deutlich. Bild- und Audioverständnis, Sprachmodus, Code-Ausführung auf deinen Dateien, Connectors, eigene Assistenten, das Entwickler-Tooling, die Stabilität unter Last, die Dokumentation, das Ökosystem. Wenn du einen Alltagsassistenten suchst und nicht ein Modell, auf dem du aufbaust, wiegt dieser Abstand schwerer als jeder Benchmark-Wert.
Die ehrliche Frage lautet also nicht "welches ist besser". Sie lautet: Kaufst du ein Modell oder ein Produkt? DeepSeek verkauft ein sehr gutes Modell sehr günstig. OpenAI verkauft ein Produkt mit einem sehr guten Modell darin. Das sind zwei verschiedene Käufe.
Zuerst: Welches DeepSeek meinst du überhaupt?
Fast jede verworrene DeepSeek-Diskussion entsteht daraus, dass zwei Leute über verschiedene Dinge reden. Es gibt drei klar getrennte Wege, es zu nutzen, und sie unterscheiden sich bei den Kosten, beim Datenschutz und darin, was du mit dem Ergebnis machen darfst.
| App und Website | Die DeepSeek-API | Die offenen Gewichte | |
|---|---|---|---|
| Kosten | Kostenlos | Sehr niedrig pro Token | Deine eigene Rechenleistung |
| Wohin deine Daten gehen | Auf DeepSeeks Server | Auf DeepSeeks Server | Dorthin, wo du sie betreibst |
| Selbst hosten möglich | Nein | Nein | Ja |
| Fine-Tuning möglich | Nein | Nein | Ja |
| Themenbeschränkungen | Ja, bei politisch heiklen Themen | Ja | Geringer, aber antrainiertes Verhalten bleibt |
| Gut für | Ausprobieren | Günstige Text- und Code-Produktion | Datenschutzkritische oder regulierte Arbeit |
Die dritte Spalte wird am häufigsten vergessen, dabei ist sie die interessanteste. DeepSeek veröffentlicht die Modellgewichte unter einer freizügigen Lizenz. Das Modell lässt sich also herunterladen, auf eigener Hardware betreiben, bei einem Anbieter in deinem eigenen Rechtsraum hosten und anpassen. Kein westliches Spitzenlabor macht das mit seinen besten Modellen.
Die praktische Folge: Ein Team, das keine Daten an ein chinesisches Unternehmen schicken darf, kann DeepSeek trotzdem nutzen, indem es die Gewichte selbst betreibt oder einen Anbieter wählt, der sie anderswo hostet. Wenn du liest, dass eine Regierung DeepSeek verboten hat, sind fast immer die App und die gehostete API gemeint, nicht die Gewichte.
Wo DeepSeek wirklich mithält
Reasoning und Mathematik. Die Reasoning-Modelle sind DeepSeeks stärkste Arbeit. Bei schweren mehrstufigen Aufgaben, Wettbewerbsmathematik und Logikrätseln liegt es auf einem Niveau mit Modellen, deren Betrieb ein Vielfaches kostet. Wenn dein Problem eine überprüfbar richtige Antwort hat, lohnt sich der erste Test genau hier.
Code. Solide bei Implementierung, Refactoring, Debugging und beim Erklären von fremdem Code. Nicht die erste Wahl, wenn es um das Verständnis großer Codebasen geht, wo ein sehr großes Kontextfenster mehr hilft, aber pro Dollar mit großem Abstand stark.
Sichtbares Nachdenken. Die Reasoning-Modelle legen ihren Gedankengang so offen, dass er für die Prüfung wirklich brauchbar ist. Wenn die Antwort falsch ist, siehst du meist, welcher Schritt schiefging. Das ist mehr wert, als es klingt, sobald du Ergebnisse prüfst, statt ihnen einfach zu vertrauen.
Kosten. Das ist die Schlagzeile. Pro Million Token liegt die DeepSeek-API durchgängig rund eine Größenordnung unter den westlichen Flaggschiff-Preisen, mit Caching teilweise noch darunter. Bei allem, was in Volumen läuft, ist das keine kleine Ersparnis, sondern der Unterschied zwischen einem Feature, das sich rechnet, und einem, das es nicht tut.
Effizienz als Designziel. Der spannende Teil von DeepSeeks Forschung ist architektonisch: Mixture-of-Experts-Routing, Sparse Attention und Trainingsmethoden, die Spitzenergebnisse ohne Spitzenbudgets erreichen. Diese Arbeit ist veröffentlicht, und sie hat sichtbar beeinflusst, wie alle anderen ihre Modelle bauen und bepreisen.
Wo ChatGPT klar vorn liegt
Multimodale Arbeit. Gib ChatGPT einen Screenshot, ein Whiteboard-Foto, ein Diagramm oder eine eingescannte Rechnung, und es kommt gut damit zurecht. DeepSeeks Textmodelle sind Textmodelle. Wenn zu deiner Arbeit Bilder gehören, entscheidet das die Frage schon allein.
Tool-Nutzung und Code-Ausführung. ChatGPT kann Code auf deinen hochgeladenen Daten ausführen, ein Diagramm erzeugen und dir die fertige Datei zurückgeben. Dieser Workflow und die Connectors in Arbeits-Tools sind eine Produktfähigkeit, und kein Modell allein ersetzt sie.
Zuverlässigkeit und Kapazität. DeepSeeks gehosteter Dienst hatte sichtbare Phasen mit Leistungseinbrüchen und gestoppten Anmeldungen unter Last. Wenn du etwas baust, auf das sich Kunden verlassen, zählt die Verfügbarkeitshistorie so viel wie die Qualität.
Ökosystem. SDKs, gut dokumentiertes Function Calling, Integrationen, Community-Antworten auf obskure Probleme und ein Bewerberfeld, das die Tools bereits kennt. Wenn du um 2 Uhr nachts auf einen seltsamen Sonderfall stößt, ist die Chance deutlich höher, dass jemand darüber geschrieben hat.
Konsistentes Verhalten. ChatGPT hält sich über lange Gespräche hinweg zuverlässiger an komplexe Format- und Rollenvorgaben. DeepSeek driftet stärker ab, was in agentischen Workloads schnell auffällt, wo derselbe Prompt tausendfach läuft.
Sprachmodus, Bildausgabe und der ganze Rest. Erzeugung jenseits von Text ist ein großer Teil dessen, wofür Leute zahlen, und gehört bei DeepSeek praktisch nicht zum Angebot.
Der Kostenvergleich, richtig gerechnet
Wenn du eine Chat-Oberfläche nutzt, spielt dieser Abschnitt kaum eine Rolle: DeepSeeks App ist kostenlos, das ChatGPT-Abo liegt bei rund $20. Spring ruhig weiter.
Wenn du etwas baust, summiert sich der Unterschied pro Token schnell. Nimm einen realistischen Support-Assistenten: 2.000 Eingabe-Token und 500 Ausgabe-Token pro Anfrage, 50.000 Anfragen im Monat. Das sind 100 Millionen Eingabe-Token und 25 Millionen Ausgabe-Token. Zu westlichen Flaggschiff-Preisen ergibt das eine spürbare Monatsrechnung. Bei DeepSeek landet dieselbe Last eher im Bereich eines Mittagessens. Selbst nach den Preissenkungen, die DeepSeek in der ganzen Branche ausgelöst hat, ist der Abstand groß geblieben.
Drei Dinge verändern diese Rechnung, und genau die werden übersehen:
- Reasoning-Modelle erzeugen viele Token, die du nie zu sehen bekommst. Erweitertes Nachdenken kann ein Mehrfaches der sichtbaren Ausgabe sein. Günstig pro Token mal sehr viel mehr Token ist nicht automatisch günstig. Miss die Gesamtzahl der Token, nicht den Preis pro Token.
- Cache-Preise zählen mehr als der Listenpreis, sobald du einen stabilen System-Prompt hast. Ein großer Rabatt auf wiederholte Eingaben schlägt einen etwas niedrigeren Grundpreis.
- Es gewinnt das günstigste Modell, das deinen Test besteht. Nicht das beste Modell. Bau ein kleines Testset aus echten Eingaben mit bekannten guten Ausgaben und lass es gegen beide laufen. Die meisten Produktiv-Workloads brauchen kein Spitzenmodell, und das findest du nur durch Messen heraus.
Ein sinnvolles Muster für Teams: Leite den Großteil des Traffics an das günstige Modell und eskaliere zum teuren, wenn die Sicherheit niedrig oder die Aufgabe heikel ist. Das lässt sich viel leichter bauen, wenn du nicht an die API eines einzigen Anbieters gebunden bist.
Datenschutz, Rechtsraum und Zensur
Das gehört sachlich behandelt und nicht als Gruselgeschichte, denn erst die Details entscheiden, ob es dich überhaupt betrifft.
Wohin die Daten gehen. DeepSeeks gehosteter Dienst verarbeitet und speichert Daten auf Servern in China, und die Datenschutzerklärung sagt das auch so. Chinesisches Recht gibt Behörden breiteren Zugriff auf im Inland gespeicherte Daten, als die meisten westlichen Rahmenwerke es tun. Ob das zählt, hängt völlig davon ab, was du sendest. Eine Frage nach einem Rezept ist kein Risiko. Mandantenverträge, Patientendaten, unveröffentlichter Code oder alles, was unter die DSGVO oder einen Auftragsverarbeitungsvertrag fällt, sind eine andere Sache.
Reaktion der Aufsicht. Mehrere Regierungen und Behörden haben die DeepSeek-App auf Dienstgeräten oder in ihrem Zuständigkeitsbereich eingeschränkt und begründen das mit dem Umgang mit Daten. Wenn deine Organisation eine Beschaffungs- oder Sicherheitsprüfung hat, rechne damit, dass der gehostete Dienst durchfällt, und damit, dass es dabei um den Rechtsraum geht und nicht um die Modellqualität.
Inhaltliche Beschränkungen. Der gehostete Dienst lehnt bei politisch heiklen Themen ab oder weicht aus, besonders bei Themen, die innerhalb Chinas sensibel sind. Der Betrieb der offenen Gewichte reduziert das, weil die Ablehnungsschicht teilweise im Serving-Stack sitzt, aber ein Teil des Verhaltens ist antrainiert und verschwindet nicht vollständig. Wenn deine Arbeit Geschichte, Geopolitik oder Vergleiche zwischen Regierungen berührt, teste es, bevor du dich darauf verlässt.
Der Umweg, der wirklich funktioniert. Nutze die offenen Gewichte über einen Anbieter, der sie in deinem eigenen Rechtsraum hostet, oder betreibe sie selbst. Die Vorteile bei Kosten und Qualität bleiben, und die Frage nach dem Speicherort erledigt sich. Genau deshalb sind offene Gewichte strategisch wichtig und nicht bloß eine nette Geste.
Einen ausführlicheren Vergleich, wie die großen Anbieter mit Chat-Daten, Speicherfristen und dem Opt-out aus dem Training umgehen, findest du in unserem Ratgeber zu KI-Abokosten, der die Kaufseite abdeckt. Für alles Weitere sind die aktuellen Richtlinienseiten der Anbieter die maßgebliche Quelle.
Wer was nutzen sollte
| Wenn du | Nimm | Weil |
|---|---|---|
| ein normaler Alltagsnutzer bist | ChatGPT | Das Produkt rund um das Modell ist der größte Teil des Werts |
| kostenbewusst bist und in Volumen baust | DeepSeek-API | Für Text und Code eine Größenordnung günstiger |
| in einer regulierten Branche arbeitest | DeepSeek als offene Gewichte, selbst gehostet, oder ein westliches Modell | Der Speicherort der Daten ist die ganze Frage |
| viel Mathematik oder Logik machst | Teste beide | DeepSeek ist hier wirklich stark und günstig auszuprobieren |
| mit Bildern, Audio oder Dateien arbeitest | ChatGPT | DeepSeeks Textmodelle decken das nicht ab |
| eine Agenten-Schleife produktiv betreibst | ChatGPT, dann optimieren | Verlässliches Befolgen von Anweisungen schlägt am Anfang den Preis |
| forschst oder experimentierst | Beide | Der Aufwand, DeepSeek auszuprobieren, ist praktisch null |
Das Muster, bei dem die meisten Teams landen, ist nicht entweder oder. Es ist ein günstiges, fähiges Modell für die Massenarbeit, ein Spitzenmodell für die harten Fälle und alles Kundenseitige, und eine Routing-Regel dazwischen. Das ist eine vernünftige Architektur, und deshalb lohnt es sich, die Bindung an einen einzigen Anbieter zu vermeiden, selbst wenn du diesen Anbieter magst.
Wenn du DeepSeeks Reasoning gegen GPT, Claude und Gemini testen willst, ohne vier Konten anzulegen und ohne etwas an einen gehosteten chinesischen Endpunkt zu schicken: Whizi enthält alle in einem Abo. Schick denselben Prompt durch zwei Modelle, behalte die bessere Antwort, und lies unter Modelle nebeneinander vergleichen, wie das in der Praxis abläuft.
- Kläre zuerst, ob du die App, die API oder die offenen Gewichte meinst, denn sie unterscheiden sich in jedem Punkt
- Prüfe, ob deine Daten deinen Rechtsraum rechtlich verlassen dürfen, bevor du den gehosteten Dienst nutzt
- Miss die Gesamtzahl der Token inklusive verstecktem Nachdenken, nicht nur den Preis pro Token
- Teste beide an einer kleinen Menge echter Eingaben mit bekannten guten Antworten
- Schließe DeepSeek sofort aus, wenn zu deiner Arbeit Bilder, Audio oder Sprache gehören
- Überlege, günstigen Traffic auf ein Modell und harte Fälle auf ein anderes zu routen, statt dich auf eines festzulegen
Häufige Fragen
Ist DeepSeek besser als ChatGPT?
Bei Textlogik, Mathematik und Code hält DeepSeek mit, zu einem Bruchteil der API-Kosten. Bei multimodaler Arbeit, Tool-Nutzung, Zuverlässigkeit und allem, was um das Modell herum gebaut ist, liegt ChatGPT klar vorn. Wer gewinnt, hängt davon ab, ob du ein Modell kaufst oder ein Produkt.
Ist DeepSeek sicher in der Nutzung?
Die gehostete App und die API verarbeiten Daten auf Servern in China, was mehrere Regierungen für den dienstlichen Gebrauch eingeschränkt haben. Für private, unkritische Fragen ist das ein kleines Thema. Für Mandantendaten, regulierte Daten oder eigenen Code ist es ein echtes, und die Lösung lautet: die offenen Gewichte selbst betreiben oder über einen Anbieter in deinem eigenen Rechtsraum.
Ist DeepSeek wirklich Open Source?
Die Modellgewichte sind unter einer freizügigen Lizenz veröffentlicht, du kannst sie also herunterladen, betreiben, hosten und anpassen. Die Trainingsdaten und die vollständige Trainingspipeline sind nicht veröffentlicht, deshalb ist "offene Gewichte" der treffendere Begriff als Open Source im strengen Sinn. Offener als jedes westliche Spitzenmodell ist es trotzdem bei Weitem.
Warum ist DeepSeek so viel günstiger?
Vor allem durch architektonische Effizienz. Mixture-of-Experts-Routing aktiviert pro Token nur einen Teil des Modells, und spätere Versionen haben Sparse Attention ergänzt, die lange Eingaben billiger macht. Das Labor hat diese Forschung veröffentlicht, und der daraus entstandene Preisdruck hat die ganze Branche nach unten gezogen.
Kann ich DeepSeek nutzen, ohne Daten nach China zu schicken?
Ja. Weil die Gewichte veröffentlicht sind, kannst du das Modell auf eigener Hardware betreiben oder einen Anbieter nutzen, der es in deiner Region hostet. Die Vorteile bei Kosten und Qualität bleiben, und die Frage nach dem Speicherort der Daten erledigt sich.