Die kurze Antwort
Drück im Chat-Header auf Vergleichen, wähl für jede Spalte ein Modell und schick einen Prompt an beide. Jede Spalte führt ihr eigenes verborgenes Gespräch, sodass kein Modell die Ausgabe des anderen sieht und keine Antwort von der anderen beeinflusst wird, was der ganze Grund ist, warum der Vergleich überhaupt etwas wert ist. Die Spalten streamen nacheinander, links dann rechts, weil pro Konto jeweils eine Generierung läuft.
Der Side-by-Side-Vergleich ist eine Powerhouse-Funktion und läuft mit zwei Modellen gleichzeitig. Jede Antwort wird zum Credit-Satz ihres eigenen Modells abgerechnet, sodass der Vergleich eines 10-Credit-Modells mit einem 20-Credit-Modell 30 Credits kostet.
Nutze es, um zu entscheiden, welches Modell dein Standard für eine bestimmte Art von Arbeit sein sollte. Wenn du stattdessen eine Antwort verbessern statt zwei Antworten vergleichen willst, mach das andere: wechsle innerhalb desselben Threads das Modell und bitte das zweite, das erste zu kritisieren.
Warum Benchmarks deine Frage nicht beantworten
Veröffentlichte Benchmarks messen Leistung bei standardisierten Aufgaben. Deine Frage ist enger und nützlicher: welches Modell bei der Sache besser ist, die du persönlich zwanzigmal die Woche machst. Das sind unterschiedliche Fragen, und die zweite hat keine veröffentlichte Antwort, weil niemand deine Arbeitslast hat.
Einen Prompt gegen zwei Modelle laufen zu lassen dauert etwa dreißig Sekunden und beantwortet sie direkt. Der wichtige Teil ist nicht, dass du zwei Antworten bekommst, sondern dass du herausfindest, wie groß die Lücke ist. Manchmal sind die Ausgaben nahezu identisch, was dir sagt, bei dieser Aufgabe aufzuhören, über die Modellwahl nachzudenken. Manchmal ist eine unbrauchbar, was gut zu wissen ist, bevor du einen Workflow darauf aufbaust.
Das andere, was der Vergleich aufdeckt, ist selbstbewusster Fehler. Wenn zwei Modelle bei einer Faktenfrage inhaltlich unterschiedliche Antworten geben, liegt mindestens eines falsch, und das hättest du nicht gewusst, wenn du nur eines gelesen hättest. Dieses Signal gibt es in einem Ein-Modell-Workflow zu keinem Preis.
Entscheide vor dem Lesen, was besser bedeutet
Die Falle beim Side-by-Side-Vergleich ist, die Ausgabe zu bevorzugen, die länger, selbstbewusster oder polierter ist. Das ist keine Qualität. Leg zuerst dein Kriterium fest, dann lies.
| Aufgabe | Was besser bedeutet | Was zu ignorieren ist |
|---|---|---|
| Schreiben | Braucht weniger Überarbeitung, um versandfertig zu sein | Länge, Wortschatz, Begeisterung |
| Faktenrecherche | Quellen, die die Behauptung auflösen und stützen | Sprachfluss und Selbstbewusstsein |
| Extraktion | Korrektes Schema, keine erfundenen Felder, konsistente Labels | Textqualität rund um die Tabelle |
| Schlussfolgern | Die Schritte halten und der Grenzfall wird behandelt | Ob die Schlussfolgerung deiner Vorannahme entspricht |
| Code | Behandelt den Fehlerpfad, ist überprüfbar | Cleverness, Kürze |
| Zusammenfassen | Behält das Wichtige, lässt den Rest weg | Vollständigkeit |
Ein praktischer Trick: Bevor du eine der beiden Ausgaben liest, schreib einen Satz auf, der beschreibt, was eine gute Antwort enthalten würde. Dann lies. Das dauert zehn Sekunden und verhindert den Polier-Bias, der stark und weitgehend unbewusst ist.
Bei Faktenfragen prüfe die Uneinigkeit statt des Siegers. Stimmen zwei Modelle bei einer konkreten Zahl und einer Quelle überein, ist Vertrauen angemessen. Wo sie auseinandergehen, ist das genau die Sache, die es zu verifizieren gilt, und das ist das mit Abstand wertvollste Ergebnis der ganzen Übung.
Prompts, die echte Unterschiede aufdecken
Manche Aufgaben trennen Modelle scharf, manche nicht. Wenn du aus einem Vergleich etwas lernen willst, nutze Prompts, die auf eine bestimmte Fähigkeit Druck ausüben.
- Ton unter Schwierigkeit.
Schreib eine Nachricht an einen Kunden, in der du erklärst, dass wir den Termin verpasst haben, Verantwortung übernimmst, ohne dich zu sehr zu entschuldigen und ohne Ausreden. Unter 120 Wörter.Unterschiede im Register zeigen sich hier sofort. - Strikte Extraktion.
Extrahiere jedes Datum, jeden Betrag und jede Partei aus diesem Text in ein JSON-Array mit genau diesen Schlüsseln. Fehlt ein Feld, nutze null. Nichts erschließen.Testet Formatdisziplin und die Neigung zu erfinden. - Schlussfolgern mit Falle. Gib ein Problem mit einer plausiblen falschen Antwort, etwa eine Verhältnis- oder Prozentfrage, bei der der intuitive Weg falsch ist. Modelle unterscheiden sich darin, ob sie die Abkürzung nehmen.
- Langer-Kontext-Erinnerung. Lade ein langes Dokument hoch und frag nach etwas aus der Mitte. Zeigt echten nutzbaren Kontext statt beworbenen Kontext.
- Unwissenheit zugeben.
Was wurde über [etwas wirklich Obskures oder ganz Aktuelles] angekündigt?Die beste Antwort ist ein klares "Ich weiß es nicht" oder ein belegter Abruf. Erfindung ist hier disqualifizierend. - Einer negativen Einschränkung folgen.
Erklär X ohne jede Analogie oder Metapher.Die Befolgung negativer Anweisungen variiert mehr, als man erwarten würde.
Lass Vergleiche an deiner echten Arbeit laufen, nicht an Rätseln. Ein Modell, das bei deinem Quartalsbericht besser ist, ist nützlicher als eines, das bei einem Logikrätsel besser ist.
Aus einer Woche Vergleiche eine Routing-Karte machen
Ein einzelner Vergleich ist interessant. Eine Woche davon ist umsetzbar. Die Routine:
- Lass fünf Tage lang jede Aufgabe, die zählt, gegen zwei Modelle statt eines laufen.
- Notiere den Aufgabentyp, den Sieger und wie groß die Lücke war. Drei Wörter reichen.
- Schau am Ende der Woche, wo ein Modell wiederholt gewonnen hat und wo die Ausgaben austauschbar waren.
- Setz deine Standards danach und hör auf, bei Aufgaben zu vergleichen, wo die Lücke durchgehend null war.
Typischerweise stellt sich heraus, dass der Vergleich bei einer Minderheit der Arbeit zählt und beim Rest Zeitverschwendung ist. Schnelle Faktenrecherchen, einfache Umformulierungen und Routine-Formatierung trennen die Modelle selten. Texte, die von einem Kunden gelesen werden, Recherche, die eine Entscheidung beeinflusst, und Schlussfolgern über Unbekanntes trennen sie stark.
Dieses Ergebnis ist der Gewinn: du hörst auf zu vergleichen, wo es keinen Unterschied macht, und behältst es für die Aufgaben, bei denen es das Ergebnis ändert.
Side by Side versus sequenziell
Zwei unterschiedliche Techniken, die zu unterscheiden sich lohnt.
Side by Side lässt denselben Prompt gegen zwei Modelle laufen, die die Ausgabe des jeweils anderen nicht sehen können. Jede Spalte führt ihr eigenes verborgenes Gespräch, benannt mit einem [Compare]-Präfix und aus der Seitenleiste herausgehalten, sodass Folgefragen ein fairer Test bleiben: beide Modelle halten unabhängigen mehrstufigen Kontext. Das ist das richtige Werkzeug, um ein Standardmodell zu wählen und Faktenuneinigkeit aufzudecken.
Sequenziell bedeutet, eine Antwort zu bekommen, dann im selben Thread das Modell zu wechseln und das neue zu bitten, sie zu kritisieren. Nutze es, wenn du den Fehler gefunden haben willst statt einen Vergleich gemacht zu haben, weil das zweite Modell sich direkt mit dem konkreten Argument befassen kann. Siehe Modelle mitten im Gespräch wechseln.
Grobe Regel: Side by Side, um zu entscheiden, welches Modell, sequenziell, um eine Antwort zu verbessern.
- Schreib und verfeinere den Prompt zuerst in einem normalen Chat, bevor du vergleichst
- Entscheide, was besser für diese Aufgabe bedeutet, bevor du eine der Ausgaben liest
- Schreib einen Satz, der eine gute Antwort beschreibt, dann lies, um den Polier-Bias zu vermeiden
- Behandle bei Faktenfragen Uneinigkeit als das Ergebnis und verifiziere sie
- Vergleiche an deiner echten Arbeit, nicht an Rätseln
- Protokolliere eine Woche lang Sieger und Lückengröße und setz Standards aus dem Muster
- Hör auf zu vergleichen bei Aufgaben, wo die Lücke durchgehend null ist
Häufige Fragen
Wie viele Modelle kann ich gleichzeitig vergleichen?
Der Side-by-Side-Vergleich ist eine Powerhouse-Funktion und läuft mit zwei Modellen gleichzeitig, was Absicht ist: zwei Spalten sind das Layout, das man tatsächlich sorgfältig lesen kann. Drei Spalten werden tendenziell zum Überfliegen, und Überfliegen untergräbt den Zweck, da der Wert der Übung darin liegt, zu bemerken, wo die Antworten sich wirklich unterscheiden.
Verbraucht Side by Side mehr von meinen monatlichen Nachrichten?
Ja, es kostet doppelt: zwei Modelle produzieren je eine Antwort, und jede Antwort wird zum eigenen Credit-Satz abgerechnet, sodass der Vergleich eines 10-Credit-Modells mit einem 20-Credit-Modell 30 statt 10 oder 20 Credits verbraucht. Eine falsche Antwort oder einen unbrauchbaren Entwurf zu erwischen, bevor er rausgeht, ist das meist wert. Der effiziente Ansatz ist, bei Entscheidungen und Ergebnissen zu vergleichen und für Routine-Nachschlagen und schnelle Umformulierungen ein einzelnes Modell zu nutzen.
Was, wenn beide Antworten gleich gut sind?
Das ist ein echtes und nützliches Ergebnis: es sagt dir, dass diese Aufgabe nicht von der Modellwahl abhängt, also hör auf, Aufmerksamkeit darauf zu verwenden, und nutz, was auch immer dein Standard ist. Die meisten Arbeitslasten teilen sich so auf, mit einer Mehrheit an Aufgaben, bei denen die Modelle austauschbar sind, und einer Minderheit, bei der die Lücke groß ist. Herauszufinden, welche welche ist, ist der Sinn, Vergleiche eine Woche lang laufen zu lassen.
Wie vermeide ich, einfach die Antwort zu wählen, die besser klingt?
Entscheide dein Kriterium vor dem Lesen. Längere, selbstbewusstere und poliertere Ausgaben werden systematisch bevorzugt, selbst wenn sie schlechter sind, und dieser Bias ist weitgehend unbewusst. Einen Satz darüber zu schreiben, was eine gute Antwort enthalten würde, bevor du hinschaust, reicht, um die meisten davon auszugleichen. Bei Faktenarbeit urteile danach, ob die Quellen die Behauptung auflösen und stützen, statt danach, wie die Antwort klingt.
Welche zwei Modelle sollte ich vergleichen?
Vergleiche die zwei, zwischen denen du für diese konkrete Aufgabe tatsächlich entscheidest, was für die meisten Leute Claude gegen GPT beim Schreiben und Schlussfolgern ist, oder ein Modell mit großem Kontext gegen deinen Standard, wenn Dokumente im Spiel sind. Ein Modell, das du nie nutzen würdest, gegen deinen Favoriten zu vergleichen, sagt dir nichts, wonach du handeln wirst.