Det korte svar
Tryk på Sammenlign i chatoverskriften, vælg en model til hver kolonne, og send én prompt til begge. Hver kolonne holder sin egen skjulte samtale, så ingen af modellerne ser den andens svar, og ingen af svarene bliver farvet af det andet, hvilket er selve grunden til, at sammenligningen er noget værd. Kolonnerne streamer efter hinanden, venstre og så højre, fordi der kun kører én generering pr. konto på samme tid.
Side om side sammenligning er en Powerhouse-funktion og kører to modeller på samme tid. Hvert svar afregnes efter den enkelte models egen kreditpris, så en sammenligning mellem en model til 10 kreditter og en til 20 kreditter koster 30 kreditter.
Brug det til at afgøre, hvilken model der skal være din standard til en bestemt type opgave. Hvis du vil have ét svar forbedret i stedet for to svar sammenlignet, skal du gøre noget andet: skift model i den samme tråd, og bed den anden model kritisere den første.
Hvorfor benchmarks ikke besvarer dit spørgsmål
Publicerede benchmarks måler præstationen på standardiserede opgaver. Dit spørgsmål er mere specifikt og mere nyttigt: hvilken model er bedst til det, du personligt gør tyve gange om ugen. Det er to forskellige spørgsmål, og det andet har intet publiceret svar, fordi ingen andre har din arbejdsbyrde.
At køre én prompt mod to modeller tager omkring tredive sekunder og besvarer det direkte. Det vigtige er ikke, at du får to svar, det er, at du finder ud af, hvor stor forskellen er. Nogle gange er svarene næsten identiske, hvilket fortæller dig, at du kan stoppe med at bekymre dig om modelvalg til den opgave. Nogle gange er et af svarene ubrugeligt, og det er værd at vide, før du bygger en arbejdsgang på det.
Det andet, en sammenligning fanger, er selvsikker fejl. Når to modeller giver væsentligt forskellige svar på et faktuelt spørgsmål, er mindst et af dem forkert, og det ville du ikke have vidst, hvis du kun havde læst det ene. Det signal findes ikke i en arbejdsgang med kun én model, uanset prisen.
Beslut hvad bedre betyder, før du læser
Fælden i side om side sammenligning er at foretrække, hvad end svar der er længst, mest sikkert klingende eller mest polerede. Det er ikke kvalitet. Vælg dit kriterium først, og læs bagefter.
| Opgave | Hvad bedre betyder | Hvad du skal ignorere |
|---|---|---|
| Skrivning | Kræver mindre redigering for at være klar til afsendelse | Længde, ordforråd, entusiasme |
| Faktuel research | Kilder der bekræfter og understøtter påstanden | Sproglig sikkerhed og selvtillid |
| Udtræk | Korrekt skema, ingen opfundne felter, konsistente labels | Prosakvaliteten omkring tabellen |
| Ræsonnement | Trinene holder, og kantsagen er adresseret | Om konklusionen matcher din forudfattede mening |
| Kode | Håndterer fejlstien og er let at gennemgå | Kløgtighed, kortfattethed |
| Opsummering | Bevarer det vigtige og fjerner det, der ikke er | Fuldstændighed |
Et praktisk trick: skriv, før du læser noget af svarene, en sætning om, hvad et godt svar bør indeholde. Læs derefter. Det tager ti sekunder og forhindrer den polering-bias, som er stærk og for det meste ubevidst.
Til faktuelle spørgsmål skal du fokusere på uenigheden i stedet for vinderen. Når to modeller er enige om et konkret tal og en kilde, er det rimeligt at have tillid til det. Når de er uenige, er det det, du bør gå og verificere, og det er det mest værdifulde resultat af hele øvelsen.
Prompts der afslører reelle forskelle
Nogle opgaver skiller modeller skarpt ad, og andre gør ikke. Hvis du vil lære noget af en sammenligning, skal du bruge prompts, der lægger pres på en specifik evne.
- Tone under besvær.
Skriv en besked til en kunde, hvor du forklarer, at vi ikke nåede deadline, og tag ansvar uden at overundskylde og uden bortforklaringer. Under 120 ord.Forskelle i tonen viser sig med det samme her. - Striks udtræk.
Udtræk hver dato, hvert beløb og hver part fra denne tekst til et JSON-array med præcis disse nøgler. Hvis et felt ikke findes, brug null. Gæt ikke.Tester formatdisciplin og tendensen til at opfinde noget. - Ræsonnement med en fælde. Giv et problem med et plausibelt forkert svar, for eksempel et spørgsmål om en rate eller et forhold, hvor den intuitive løsning er forkert. Modeller er forskellige i, om de tager genvejen.
- Genkaldelse af lang kontekst. Upload et langt dokument, og spørg om noget i midten. Afslører den reelle brugbare kontekst, ikke den annoncerede.
- At indrømme uvidenhed.
Hvad blev annonceret om [noget virkelig obskurt eller helt nyt]?Det bedste svar er et klart "det ved jeg ikke" eller en kildebaseret opslagsreference. Opfindelse her diskvalificerer svaret. - At følge en negativ begrænsning.
Forklar X uden at bruge nogen analogi eller metafor.Efterlevelse af negative instruktioner varierer mere end man skulle tro.
Kør sammenligninger på dit eget rigtige arbejde i stedet for på gåder. En model, der er bedre til din kvartalsrapport, er mere nyttig end en, der er bedre til en logisk gåde.
Sådan bliver en uges sammenligninger et routingkort
En enkelt sammenligning er interessant. En uge med dem kan bruges til noget. Rutinen:
- I fem dage, når en opgave betyder noget, skal du køre den mod to modeller i stedet for én.
- Noter opgavetypen, vinderen, og hvor stor forskellen var. Tre ord er nok.
- Ved ugens slutning skal du se, hvor en model vandt gentagne gange, og hvor svarene var udskiftelige.
- Sæt dine standarder derfra, og stop med at sammenligne på de opgaver, hvor forskellen konsekvent var nul.
Det, folk typisk finder ud af, er, at sammenligning betyder noget for en mindre del af deres arbejde og er spild af tid på resten. Hurtige faktaopslag, simple omskrivninger og rutinemæssig formatering skiller sjældent modellerne fra hinanden. Skrivning der skal læses af en kunde, research der skal informere en beslutning, og ræsonnement om noget ukendt skiller dem meget.
Det resultat er belønningen: du stopper med at sammenligne, hvor det ikke gør nogen forskel, og fortsætter med det for de opgaver, hvor det ændrer udfaldet.
Side om side versus sekventielt
To forskellige teknikker, det er værd at holde ude fra hinanden.
Side om side kører den samme prompt mod to modeller, der ikke kan se hinandens svar. Hver kolonne holder sin egen skjulte samtale, navngivet med et [Sammenlign]-præfiks og holdt ude af sidepanelet, så opfølgende spørgsmål forbliver en fair test: begge modeller holder deres egen uafhængige flertrins-kontekst. Det er det rigtige værktøj til at vælge en standardmodel og til at fange faktuel uenighed.
Sekventiel betyder at få et svar, derefter skifte model i den samme tråd og bede den nye model kritisere det. Brug det, når du vil have fejlen fundet i stedet for en sammenligning lavet, fordi den anden model kan gå direkte ind i det specifikke argument. Se skift model midt i samtalen.
Grov tommelfingerregel: side om side til at vælge model, sekventiel til at forbedre et svar.
- Skriv og forfin prompten i en almindelig chat, før du sammenligner
- Beslut, hvad bedre betyder for denne opgave, før du læser et af svarene
- Skriv en sætning, der beskriver et godt svar, og læs derefter for at undgå polering-bias
- Ved faktuelle spørgsmål skal du behandle uenighed som selve fundet og gå og verificere det
- Sammenlign på dit eget rigtige arbejde, ikke på gåder
- Log vinderen og størrelsen af forskellen i en uge, og sæt derefter dine standarder fra mønsteret
- Stop med at sammenligne på de opgaver, hvor forskellen konsekvent er nul
Ofte stillede spørgsmål
Hvor mange modeller kan jeg sammenligne på samme tid?
Side om side sammenligning er en Powerhouse-funktion, og den kører to modeller på samme tid, hvilket er bevidst: to kolonner er det layout, du faktisk kan læse omhyggeligt. Tre kolonner har en tendens til at blive til skimning, og skimning underminerer hele formålet, fordi værdien af øvelsen ligger i at bemærke, hvor svarene reelt afviger fra hinanden.
Bruger side om side flere af mine månedlige beskeder?
Ja, det koster det dobbelte: to modeller producerer hver et svar, og hvert svar afregnes efter sin egen kreditpris, så en sammenligning mellem en model til 10 kreditter og en til 20 kreditter bruger 30 kreditter i stedet for 10 eller 20. At fange et forkert svar eller et ubrugeligt udkast, før det bliver leveret, er det normalt værd. Den effektive metode er at sammenligne på beslutninger og leverancer og bruge en enkelt model til rutineopslag og hurtige omskrivninger.
Hvad hvis begge svar er lige gode?
Det er et reelt og nyttigt resultat: det fortæller dig, at denne opgave ikke afhænger af modelvalg, så stop med at bruge opmærksomhed på det, og brug den model, der er din standard. De fleste arbejdsbyrder deler sig på denne måde, med en majoritet af opgaver, hvor modellerne kan bruges i stedet for hinanden, og en minoritet, hvor forskellen er stor. At finde ud af hvad der er hvad, er selve pointen med at køre sammenligninger i en uge.
Hvordan undgår jeg bare at vælge det svar, der lyder bedst?
Beslut dit kriterium, før du læser. Længere, mere sikre og mere polerede svar bliver systematisk foretrukket, selv når de er dårligere, og den bias er for det meste ubevidst. At skrive en sætning om, hvad et godt svar bør indeholde, før du kigger, er nok til at modvirke det meste af det. Til faktuelt arbejde skal du dømme på, om kilderne bekræfter og understøtter påstanden, i stedet for på, hvordan svaret læses.
Hvilke to modeller bør jeg sammenligne?
Sammenlign de to, du reelt vælger imellem til den specifikke opgave, hvilket for de fleste er Claude mod GPT til skrivning og ræsonnement, eller en model med stor kontekst mod din standard, når dokumenter er involveret. At sammenligne en model, du aldrig ville bruge, med din favorit, fortæller dig ikke noget, du vil handle på.