Modelle, Apps und APIs
Die meisten Diskussionen über ChatGPT vs Claude vs Gemini vergleichen die falsche Ebene. Hinter jedem Namen stecken drei Produkte: eine Modellfamilie, eine Consumer-App und eine Entwickler-API. Wer gewinnt, hängt davon ab, welche Ebene du kaufst. Auf der App-Ebene liegen die drei preislich fast gleichauf. Auf der Modellebene nicht.
Auf der API-Ebene ist der Abstand messbar. Listenpreise von OpenRouter vom 20. August 2026, erfasst im Whizi-Kostenindex: GPT-5.5 kostet $5 pro Million Eingabe-Tokens und $30 pro Million Ausgabe-Tokens, Claude Sonnet 5 kostet $2 rein und $10 raus, Gemini 3.5 Flash $1.50 rein und $9 raus. Für eine Standardantwort (1000 Tokens rein, 500 raus) sind das $0.02 bei GPT-5.5, $0.007 bei Sonnet 5 und $0.006 bei Gemini 3.5 Flash. Bei gleicher Antwortlänge kostet GPT-5.5 rund das Dreifache der beiden anderen Flaggschiffe.
Auf der App-Ebene laufen die Flaggschiff-Tarife zusammen. ChatGPT Plus kostet $20 im Monat, Claude Pro kostet $20 ($17 im Monat bei Jahreszahlung), und Gemini Advanced ist in Google AI Pro auf derselben $20-Stufe aufgegangen. OpenAI verkauft außerdem ChatGPT Go für $8 mit gedeckelter Alltagsnutzung. Eine Abo-Entscheidung fällt deshalb selten über den Preis. Sie fällt darüber, welches Modell deine echten Aufgaben mit der geringsten Nacharbeit erledigt.
Dieser Leitfaden vergleicht nach Aufgabe und benennt pro Anwendungsfall einen Sieger. Wenn du deine Auswahlliste über die großen drei hinaus noch zusammenstellst, beginne bei den ChatGPT-Alternativen. Wenn die Entscheidung schon zwischen diesen dreien läuft, ist die Routing-Tabelle unten die Kurzfassung und das Prompt-Protokoll weiter unten der Beweis.
Fähigkeiten im Vergleich: Bildverständnis, Tools, langer Kontext
Drei Fakten rahmen 2026 jede Diskussion über Fähigkeiten ein. Kontextfenster trennen die Spitzenmodelle nicht mehr: GPT-5.5, Claude Sonnet 5 und Gemini 3.5 Flash haben im Whizi-Kostenindex alle 1M Tokens, genug für jeweils rund 1900 Manuskriptseiten. Alle drei sind multimodal, Bilder und PDFs sind also selbstverständlich. Was sie weiterhin trennt, ist der Preis, bei den Flaggschiffen um den Faktor drei. Damit verschiebt sich die eigentliche Frage von "Kann es das?" zu "Wie gut, und zu welchem Preis?".
| Fähigkeit | ChatGPT (GPT-5.5) | Claude (Sonnet 5) | Gemini (3.5 Flash) | Was du testen solltest |
|---|---|---|---|---|
| Kontextfenster | 1M Tokens | 1M Tokens | 1M Tokens | Verstecke eine Angabe auf Seite 300 eines langen PDFs und frage sie mit Seitenangabe ab |
| Kosten pro Standardantwort | $0.02 | $0.007 | $0.006 | Multipliziere das mit deinem echten Monatsvolumen, bevor du dich festlegst |
| Whizi-Credits pro Nachricht | 20 | 10 | 8 | Wie weit ein Kontingent bei deinem Standardmodell reicht |
| Schreiben und Redigieren | Strukturierte Entwürfe, Gliederungen, schnelle Varianten | Sieger: Ton, Redaktion langer Texte, sorgfältige Synthese | Der schwächste der drei bei der Stimme | Derselbe unfertige Entwurf, dieselbe Zielgruppe, danach zählst du deine eigenen Korrekturen |
| Code und Fehlersuche | Sieger bei sauberer Reproduktion: schrittweise Fixes plus Tests | Sieger für Reviews und Refactoring-Pläne bei großen Diffs | Der günstigste Weg, ein ganzes Repo in einem Prompt zu lesen | Ein Fehlerbericht, ein fehlschlagender Test, ein Dateiauszug; bewerte die kleinste sichere Änderung |
Eine Funktionsliste entscheidet trotzdem nichts für sich allein. Gemini 3.5 Flash nimmt dieselbe Million Tokens an wie Sonnet 5, für 8 Whizi-Credits statt Sonnets 10, und kann eine tonempfindliche Überarbeitung dennoch so gründlich vergeigen, dass es dich eine Stunde Redigieren kostet. Teste an deiner eigenen Arbeit. Das Protokoll unten braucht eine echte Aufgabe und drei Tabs.
Das Beste je nach Anwendungsfall
Das beste KI-Modell 2026 ist eine Routing-Regel, keine Marke. Lege pro Aufgabe einen Standard fest und fordere ihn heraus, sobald die Aufgabe ihre Form ändert. Das ist das Routing, das der Rest dieser Seite belegt.
| Aufgabe | Sieger | Herausforderer | Die entscheidende Zahl |
|---|---|---|---|
| Polierte Texte und Redaktion | Claude | ChatGPT | Sonnet 5 zu $0.007 pro Standardantwort, 10 Credits in Whizi |
| Fehlersuche aus einer sauberen Reproduktion | ChatGPT | Claude | GPT-5.5 zu $0.02 pro Antwort, das teuerste der drei |
| Code-Review und Refactoring-Pläne | Claude | ChatGPT | Dasselbe 1M-Fenster wie GPT-5.5 zu etwa einem Drittel der Kosten pro Antwort |
| Lange Dokumente und gemischte Medien | Gemini | Claude | $1.50 pro Million Eingabe-Tokens, der niedrigste Eingabepreis der Flaggschiffe |
| Recherche-Synthese aus einem Quellenpaket | Claude | Gemini | Ein 1M-Token-Fenster fasst rund 1900 Seiten Quellen |
| Günstiges Alltagsvolumen | Gemini | ChatGPT | Gemini 3.5 Flash zu $0.006 pro Antwort, Gemini 3.7 Flash zu $0.0013 |
Alle Zahlen stammen aus dem Whizi-Kostenindex, Listenpreise vom 20. August 2026, gerechnet auf eine Standardantwort mit 1000 Tokens Eingabe und 500 Tokens Ausgabe.
Schreiben
Claude gewinnt beim Schreiben. Es ist das Modell für ein rohes Memo, eine tonempfindliche Kundenmail oder einen Entwurf mit 3000 Wörtern, der neu strukturiert werden muss, ohne dass die Stimme verloren geht. ChatGPT gewinnt den Schritt davor: Gliederungen, Frameworks, zwanzig Überschriftenvarianten und das Umwandeln unsortierter Notizen in einen Entwurf, auf den du reagieren kannst. Gemini verliert diese Kategorie an der Stimme, und es hört auf zu verlieren, sobald der Text auf einem großen Quellenpaket aufsetzt, denn 500 Seiten Hintergrund kosten dort weniger als bei beiden Rivalen. Die Zwei-Modell-Variante des Duells zwischen Google und OpenAI steht in Gemini vs ChatGPT.
Nutze diesen Schreib-Prompt, um Ergebnisse zu vergleichen: "Schreib den Entwurf unten für eine skeptische Betriebsleiterin um. Halte die Aussagen faktisch, entferne generische KI-Formulierungen, bewahre die konkreten Beispiele und liefere: 1) den finalen Entwurf, 2) drei Änderungen, die du gemacht hast, 3) zwei Aussagen, die ich vor der Veröffentlichung prüfen sollte."
Bewerte die Ergebnisse nach Nacharbeitszeit, nicht nach dem ersten Eindruck. Sieger ist der Entwurf, den du nach den wenigsten Korrekturen veröffentlichen kannst und dessen Fakten du trotzdem noch traust. In unserem Routing ist das Claude, und der Abstand ist groß genug, dass 10 Credits pro Nachricht gegenüber dem einen Credit von ChatGPT Luna für finale Prosa der richtige Tausch bleiben.
Programmieren
Beim Coden entscheidet eine einzige Bedingung. ChatGPT gewinnt, wenn du eine saubere Reproduktion hast: Es arbeitet sich Schritt für Schritt vom fehlschlagenden Test zum kleinsten Fix vor und schreibt die Regressionstests, ohne dass man zweimal fragen muss. Claude gewinnt, wenn Urteilsvermögen statt Mechanik gefragt ist: ein großer Diff im Review, ein geplantes Refactoring oder die Erklärung, warum ein Fix riskant ist. Claude vs ChatGPT schlüsselt die Zwei-Modell-Entscheidung genauer auf.
Nutze diesen Programmier-Prompt: "Du prüfst einen Bugfix. Fasse zuerst die wahrscheinliche Grundursache aus der Reproduktion zusammen. Schlage dann die kleinste sichere Änderung vor. Liste danach die Tests auf, die vor dem Fix fehlschlagen und danach bestehen würden. Schreib keinen unbeteiligten Code um. Hier sind der Fehlerbericht, der relevante Code und die Testausgabe."
Gemini wird hier Dritter, mit einer echten Nische: Für $1.50 pro Million Eingabe-Tokens ist es der günstigste Weg, eine ganze Codebasis vor ein 1M-Token-Fenster zu legen und zu fragen, wo eine Änderung landet. Was auch immer deinen Test gewinnt, die Regel bleibt: Keine von einer KI geschriebene Änderung geht ohne Tests und menschliches Review live. Das Modell mit dem kleinsten vorgeschlagenen Diff ist das, das dich in der Woche darauf am wenigsten kostet.
Recherche
Bei Recherche zählt Nachvollziehbarkeit mehr als selbstsichere Prosa, und Claude gewinnt die Synthese aus einem festen Quellenpaket: Es trennt sauberer als die anderen beiden, was aus der Quelle stammt und was es gefolgert hat, und genau das ist die Aufgabe. Gemini ist der Herausforderer, wenn das Paket riesig oder gemischt ist, denn ein 1M-Token-Fenster fasst rund 1900 Seiten und sein Eingabepreis ist der niedrigste der drei. ChatGPT wird Dritter bei der Quellendisziplin und Erster darin, eine fertige Recherche in ein strukturiertes Ergebnis zu verwandeln.
Nutze diesen Recherche-Prompt: "Beantworte die Frage nur mit den Quellen, die ich liefere. Erstelle eine Tabelle mit Aussage, Quelle, Sicherheit und Anmerkungen. Schreib dann eine Synthese in 250 Wörtern. Schließe mit offenen Fragen und damit, welche Belege die Schlussfolgerung ändern würden."
Disqualifiziere jedes Modell, das die Anweisung "nur die Quellen, die ich gebe" bricht. Ein Modell, das klammheimlich Außenwissen in ein belegtes Briefing schmuggelt, ist für Entscheidungen unbrauchbar, was auch immer seine Benchmark-Werte sagen. Schick dasselbe Paket einmal durch alle drei. Wenn dieser Fehler passiert, ist er offensichtlich.
Dokumente
Gemini gewinnt die Dokumentarbeit, und der Grund ist inzwischen der Preis, nicht die Kapazität. Alle drei Flaggschiffe lesen ein 1M-Token-Fenster, ungefähr 1900 Manuskriptseiten, aber dieses Fenster zu füllen kostet $1.50 pro Million Eingabe-Tokens bei Gemini 3.5 Flash, $2 bei Claude Sonnet 5 und $5 bei GPT-5.5. Gib jedem Modell jeden Morgen einen Vertrag mit 400 Seiten, und dieselbe Lektüre kostet bei GPT-5.5 mehr als das Dreifache. Claude ist der Herausforderer, wenn das Ergebnis wichtiger ist als die Aufnahme, denn dichtes Material kommt dort als lesbare Prosa wieder heraus. Unterhalb der Flaggschiff-Ebene schwanken die Fenstergrößen weiterhin (Claude Haiku 4.5 hat 200K), prüfe also das konkrete Modell und nicht die Marke.
Schreib nicht "fasse das zusammen" und hör da auf. Verlange die Gliederung, die genannten Entitäten, die Entscheidungen, die Risiken und die Widersprüche, mit Seitenangaben, wenn dein Workflow sie unterstützt, und lass das Modell danach markieren, wobei es sich unsicher ist. Ein Long-Context-Modell, das die Seite nicht nennen kann, hat die Mitte nicht gelesen. Der Vergleich der Kontextfenster erklärt, warum die Mitte einer Million Tokens genau die Stelle ist, an der die Erinnerung nachlässt.
Entscheidungstabelle
Die vollständige Entscheidungstabelle, mit der Begründung dazu. Beginne beim Sieger, gib dem Herausforderer einen echten Versuch mit derselben Eingabe, und behalte, wer dein Bewertungsraster übersteht.
| Wenn deine Aufgabe ist... | Beginne mit | Fordere heraus mit | Warum |
|---|---|---|---|
| Erster Entwurf eines Plans oder einer strukturierten Antwort | ChatGPT | Claude | Am schnellsten vom leeren Blatt zu einem Entwurf, auf den du reagieren kannst |
| Einen Artikel, ein Memo oder ein Kundenergebnis polieren | Claude | ChatGPT | Gewinnt bei Ton und Redaktion; 10 Credits pro Nachricht in Whizi |
| Analyse oder Extraktion aus großen Dokumenten | Gemini | Claude | Niedrigster Eingabepreis ($1.50 pro Million Tokens) auf einem 1M-Fenster |
| Code-Review oder Refactoring-Planung | Claude | ChatGPT | Sorgfältiges Review großer Diffs zu etwa einem Drittel der Kosten pro Antwort von GPT-5.5 |
| Fehlersuche mit Logs und Tests | ChatGPT | Claude | Stärkstes schrittweises Denken aus einer sauberen Reproduktion |
| Gemischte Bilder, Dokumente und Text | Gemini | ChatGPT | Die günstigste multimodale Aufnahme der drei |
| Recherche-Synthese aus einem Quellenpaket | Claude | Gemini | Am besten darin, Quelle von Schlussfolgerung zu trennen |
| Alltagsvolumen mit knappem Budget | Gemini 3.5 Flash oder GPT-5.6 Luna | Alle drei | $0.006 und $0.0008 pro Standardantwort |
Die Tabelle entscheidet nur, wer den ersten Versuch bekommt. Wer den Job behält, entscheidet dein Bewertungsraster an deiner Aufgabe.
Wiederverwendbares A/B/C-Prompt-Testprotokoll
Der sauberste Weg, "ChatGPT vs Claude vs Gemini" zu beantworten, ist, mit dem Debattieren aufzuhören und denselben Prompt über alle drei laufen zu lassen. Nutze dieses Protokoll für jeden wichtigen Workflow, bevor du dich auf ein Standardmodell festlegst.
- Wähle eine echte Aufgabe. Nimm keinen Spielzeug-Prompt. Nimm etwas, das du diese Woche wirklich erledigen musst: eine Vertriebsmail, ein Code-Review, eine Marktrecherche-Synthese, eine PDF-Extraktion oder eine Support-Antwort.
- Stelle ein festes Eingabepaket zusammen. Nimm für jedes Modell denselben Quelltext, dieselben Vorgaben, dieselbe Zielgruppe, dasselbe Wunschformat und denselben Qualitätsmaßstab. Wenn ein Modell mehr Kontext bekommt als die anderen, ist der Test unfair.
- Lege ein Bewertungsraster fest, bevor du die Antworten liest. Bewerte jedes Ergebnis von 1 bis 5 nach Genauigkeit, Nutzen, Formattreue, Überarbeitungszeit, Risiko und Kalibrierung der Sicherheit.
- Lass denselben Prompt in jedem Modell laufen, ohne den Wortlaut zu ändern. Wenn der erste Prompt fehlerhaft ist, überarbeite ihn einmal und starte ihn überall neu.
- Mach eine zweite Runde als Gegenprobe. Frag jedes Modell: "Was könnte an dieser Antwort falsch sein? Welche Annahmen hast du getroffen? Was sollte ich prüfen?"
- Lege eine Workflow-Regel fest. Zum Beispiel: "Claude für finale Texte, ChatGPT für Umsetzungspläne, Gemini für lange Dokumente und Whizi, wenn die Aufgabe wichtig genug für einen Vergleich ist."
Copy-Paste-Test-Prompt: "Ich vergleiche KI-Modelle für diesen Workflow. Erledige die Aufgabe unten nur mit dem bereitgestellten Kontext. Halte dich exakt an das Ausgabeformat. Füge nach der Antwort hinzu: Annahmen, Risiken, Prüf-Checkliste und einen Vorschlag, wie sich der Prompt verbessern lässt. Aufgabe: [Aufgabe einfügen]. Kontext: [Kontext einfügen]. Ausgabeformat: [Format einfügen]."
Kosten: ein Abo oder mehrere
Die Abo-Rechnung, Stand August 2026: ChatGPT Plus, Claude Pro und Google AI Pro liegen jeweils bei rund $20 im Monat, alle drei direkt kommen also nah an $60. Die Kombinationen, die der günstigste Weg, ChatGPT und Claude zusammen zu nutzen durchrechnet, landen bei etwa $28 im Monat (ChatGPT Go plus Claude Pro) oder $40 (Plus plus Claude Pro), und keine der beiden enthält Gemini.
Whizis Argument für Konsolidierung ist ein Tarif, der alle drei Familien trägt. Starter für $15.99 im Monat ($10.99 bei jährlicher Abrechnung) enthält ChatGPT Luna für 1 Credit pro Nachricht plus Gemini Flash, und der ehrliche Haken ist, dass Starter überhaupt kein Claude-Modell mitbringt: Die Claude-Zeilen sitzen in den höheren Tarifen, wo Sonnet 5 zehn Credits pro Nachricht kostet und Opus 5 zwanzig. Wenn Claude das eine Modell ist, das du den ganzen Tag nutzt, bekommst du für die pauschalen $20 von Claude Pro mehr Claude, als Whizi Starter je liefern wird. Genau da schlägt ein direktes Abo die Konsolidierung.
Lass deinen eigenen Stack durch den Sparrechner für KI-Abos laufen und vergleiche das Ergebnis dann mit den Whizi-Tarifen. Am Ende steht eine Zahl: was du heute zahlst, was ein konsolidierter Tarif kostet und welche Modelle du beim Wechsel tatsächlich verlierst.
Lass denselben Prompt über mehrere Modelle laufen
Das Urteil, ohne Ausweichen: Claude fürs Schreiben und für Code-Reviews, ChatGPT für die Fehlersuche und strukturierte Entwürfe, Gemini für lange Dokumente und günstiges Volumen. Diese Standards gelten, bis dein eigener A/B/C-Test etwas anderes sagt, und der Test steht über dieser Seite.
In Whizi kannst du einen Prompt in allen drei Familien nebeneinander laufen lassen und siehst den Preis pro Nachricht schon vor dem Absenden: 1 Credit für ChatGPT Luna, 8 für Gemini 3.5 Flash, 10 für Claude Sonnet 5, 20 für GPT-5.5. Keine App eines einzelnen Anbieters veröffentlicht diesen Vergleich, weil kein Anbieter die Modelle seiner Konkurrenz bepreist.
Wenn du so weit bist, starte den Vergleich in Whizi, fang mit der Aufgabe an, die du am häufigsten wiederholst, und lass die Bewertungen dein Routing festlegen.
- Kläre, welche Ebene du kaufst: Die $20-Apps liegen fast gleichauf, die APIs unterscheiden sich um den Faktor drei im Preis.
- Nutze beim Testen von ChatGPT, Claude und Gemini dieselbe Aufgabe, denselben Kontext und dasselbe Ausgabeformat.
- Bewerte die Ergebnisse nach Genauigkeit, Formattreue, Bearbeitungszeit und Risiko, und schreibe das Bewertungsraster vorher auf.
- Nutze ChatGPT, Claude und Gemini als Routing-System, statt einen allgemeingültigen Sieger zu erzwingen.
- Rechne deine laufenden KI-Ausgaben im Sparrechner zusammen, bevor du ein zweites $20-Abo verlängerst.
Häufige Fragen
Was ist besser: ChatGPT, Claude oder Gemini?
Es teilt sich nach Aufgabe auf: Claude gewinnt bei polierten Texten und beim Code-Review, ChatGPT bei der Fehlersuche aus einer sauberen Reproduktion und bei strukturierten Entwürfen, Gemini bei langen Dokumenten und multimodaler Arbeit zum niedrigsten Preis. Pro Standardantwort kostet Gemini 3.5 Flash $0.006, Claude Sonnet 5 $0.007 und GPT-5.5 $0.02.
Was ist das beste KI-Modell zum Schreiben?
Claude. Es hält den Ton über lange Überarbeitungen und redigiert, ohne die Stimme platt zu bügeln, deshalb bekommt es in unserem Routing die finale Prosa. ChatGPT ist die bessere erste Station für Gliederungen und Varianten, und Gemini verdient sich die Schreibaufgabe nur dann, wenn der Entwurf auf Hunderten Seiten Quellmaterial aufsetzt.
Was ist das beste KI-Modell zum Programmieren?
ChatGPT, wenn du eine saubere Reproduktion hast, Claude für Reviews und Refactoring-Pläne. Gib beiden denselben Fehlerbericht und denselben fehlschlagenden Test, verlange die kleinste sichere Änderung plus Regressionstests, und behalte das Modell, das weniger Code anfasst. Geminis Nische beim Coden ist es, eine ganze Codebasis günstig in seinem 1M-Token-Fenster zu lesen.
Soll ich für mehrere KI-Abos zahlen?
Nicht zum vollen Preis. Drei direkte Abos kommen zusammen auf fast $60 im Monat und überschneiden sich bei den meisten Aufgaben. Entweder nimmst du das eine Modell, das deine häufigste Aufgabe gewinnt, oder du konsolidierst: Whizi Starter kostet $15.99 im Monat ($10.99 bei jährlicher Abrechnung), und Claude beginnt im Pro-Tarif.