Så jämför du AI-modeller sida vid sida i Whizi

Snabbt svar

För att jämföra AI-modeller sida vid sida i Whizi trycker du på Compare i chattens rubrikrad, väljer en modell för varje kolumn och skickar en prompt till båda. Varje kolumn har sin egen kontext, så inget svar påverkas av det andra. Sida vid sida är en Powerhouse-funktion, och varje svar debiteras enligt sin egen modells kreditpris.

Det korta svaret

Tryck på Compare i chattens rubrikrad, välj en modell för varje kolumn och skicka en prompt till båda. Varje kolumn har sin egen dolda konversation, så ingen modell ser den andras svar och inget svar förankras i det andra, vilket är hela poängen med jämförelsen. Kolumnerna strömmar en efter en, vänster sedan höger, eftersom bara en generering körs per konto samtidigt.

Sida vid sida-jämförelse är en Powerhouse-funktion och körs med två modeller åt gången. Varje svar debiteras enligt sin egen modells kreditpris, så att jämföra en modell på 10 krediter mot en på 20 krediter kostar 30 krediter.

Använd funktionen för att avgöra vilken modell som bör vara ditt standardval för en viss typ av arbete. Om du vill förbättra ett svar snarare än jämföra två, gör istället det andra: byt modell inom samma tråd och be den andra kritisera den första.

Varför benchmarks inte svarar på din fråga

Publicerade benchmarks mäter prestanda på standardiserade uppgifter. Din fråga är smalare och mer användbar: vilken modell är bäst på det du själv gör tjugo gånger i veckan. Det är olika frågor, och den andra har inget publicerat svar eftersom ingen annan har din arbetsbelastning.

Att köra en prompt mot två modeller tar ungefär trettio sekunder och besvarar frågan direkt. Det viktiga är inte att du får två svar, utan att du får veta hur stor skillnaden är. Ibland är svaren nästan identiska, vilket säger dig att sluta fundera på modellval för den uppgiften. Ibland är ett oanvändbart, vilket är bra att veta innan du bygger ett arbetsflöde på det.

Det andra jämförelsen fångar upp är självsäkra fel. När två modeller ger väsentligt olika svar på en faktafråga är minst en fel, och du hade inte vetat det av att bara läsa en av dem. Den signalen finns inte i ett arbetsflöde med bara en modell, oavsett pris.

Bestäm vad bättre betyder innan du läser

Fällan i en sida vid sida-jämförelse är att föredra det svar som är längre, mer självsäkert eller mer putsat. Det är inte kvalitet. Välj ditt kriterium först, läs sedan.

UppgiftVad bättre betyderVad du ska ignorera
SkrivandeBehöver mindre redigering för att kunna skickasLängd, ordval, entusiasm
FaktaresearchKällor som håller och stödjer påståendetFlyt och självsäkerhet
ExtraktionRätt schema, inga påhittade fält, konsekventa etiketterProsakvalitet runt tabellen
ResonemangStegen håller och specialfallet hanterasOm slutsatsen matchar din egen uppfattning
KodHanterar felvägen, är granskningsbarFiness, kortfattadhet
SammanfattningBehåller det viktiga och släpper det oviktigaFullständighet

Ett praktiskt knep: innan du läser något av svaren, skriv en mening som beskriver vad ett bra svar borde innehålla. Läs sedan. Det tar tio sekunder och förhindrar putsbiaset, som är starkt och till stor del omedvetet.

Vid faktafrågor: kontrollera oenigheten snarare än vinnaren. Där två modeller är överens om ett specifikt tal och en källa är tilltron rimlig. Där de går isär är det just det du ska verifiera, och det är det enskilt mest värdefulla resultatet av hela övningen.

Prompter som avslöjar riktiga skillnader

Vissa uppgifter skiljer modeller tydligt åt och andra inte. Om du vill lära dig något av en jämförelse, använd prompter som sätter press på en specifik förmåga.

  • Tonläge under svårighet. Skriv ett meddelande till en kund som förklarar att vi missade deadlinen, ta ansvar utan att överbe om ursäkt och utan ursäkter. Under 120 ord. Skillnader i register syns direkt här.
  • Strikt extraktion. Extrahera varje datum, belopp och part från denna text till en JSON-array med exakt dessa nycklar. Om ett fält saknas, använd null. Gissa inte. Testar formatdisciplin och tendensen att hitta på.
  • Resonemang med en fälla. Ge ett problem med ett trovärdigt fel svar, till exempel en ränte- eller proportionsfråga där den intuitiva vägen är fel. Modeller skiljer sig i om de tar genvägen.
  • Minne över lång kontext. Ladda upp ett långt dokument och fråga om något i mitten. Visar verklig användbar kontext, inte den annonserade.
  • Att erkänna okunskap. Vad meddelades om [något genuint obskyrt eller väldigt färskt]? Det bästa svaret är ett tydligt "jag vet inte" eller en källbaserad hämtning. Att hitta på svar här diskvalificerar.
  • Följa en negativ instruktion. Förklara X utan att använda någon analogi eller metafor. Efterlevnad av negativa instruktioner varierar mer än man kanske tror.

Kör jämförelser på ditt eget riktiga arbete snarare än på pusselfrågor. En modell som är bättre på din kvartalsrapport är mer användbar än en som är bättre på en logikgåta.

Att göra en veckas jämförelser till en routingkarta

En enskild jämförelse är intressant. En vecka av dem är handlingsbar. Rutinen:

  1. Kör under fem dagar varje gång en uppgift spelar roll den mot två modeller istället för en.
  2. Notera uppgiftstyp, vinnare och hur stor skillnaden var. Tre ord räcker.
  3. Titta i slutet av veckan på var en modell vann upprepade gånger och var svaren var utbytbara.
  4. Sätt dina standardval utifrån det, och slutat jämför på uppgifter där skillnaden konsekvent var noll.

Vad man vanligen upptäcker är att jämförelsen spelar roll för en minoritet av arbetet och är slöseri med tid på resten. Snabba faktauppslag, enkla omskrivningar och rutinformattering skiljer sällan modellerna. Skrivande som ska läsas av en kund, research som ska ligga till grund för ett beslut och resonemang om något obekant skiljer dem mycket.

Det resultatet är vinsten: du slutar jämföra där det inte gör någon skillnad och behåller det för uppgifterna där det förändrar utfallet.

Sida vid sida jämfört med sekventiellt

Två olika tekniker, värda att skilja åt.

Sida vid sida kör samma prompt mot två modeller som inte kan se varandras svar. Varje kolumn har sin egen dolda konversation, namngiven med ett [Compare]-prefix och hålls utanför sidofältet, så att uppföljningsfrågor förblir ett rättvist test: båda modellerna har oberoende flerturskontext. Det är rätt verktyg för att välja en standardmodell och för att fånga faktaoenighet.

Sekventiellt innebär att få ett svar och sedan byta modell i samma tråd och be den nya kritisera det. Använd det när du vill hitta felet snarare än göra en jämförelse, eftersom den andra modellen kan gå direkt in på det specifika argumentet. Se byte av modell mitt i en konversation.

Enkel tumregel: sida vid sida för att avgöra vilken modell, sekventiellt för att förbättra ett svar.

Checklista
  • Skriv och finslipa prompten i en vanlig chatt innan du jämför
  • Bestäm vad bättre betyder för uppgiften innan du läser något av svaren
  • Skriv en mening som beskriver ett bra svar, läs sedan, för att undvika putsbiaset
  • Vid faktafrågor: behandla oenighet som fyndet och gå och verifiera det
  • Jämför på ditt eget riktiga arbete, inte på pusselfrågor
  • Logga vinnaren och skillnadens storlek under en vecka, sätt sedan standardval utifrån mönstret
  • Sluta jämföra på uppgifter där skillnaden konsekvent är noll

Vanliga frågor

Hur många modeller kan jag jämföra samtidigt?

Sida vid sida-jämförelse är en Powerhouse-funktion och körs med två modeller åt gången, vilket är medvetet: två kolumner är den layout du faktiskt kan läsa noggrant. Tre kolumner tenderar att bli skumläsning, och skumläsning motverkar syftet, eftersom värdet i övningen ligger i att upptäcka var svaren verkligen skiljer sig.

Använder sida vid sida fler av mina meddelanden per månad?

Ja, det kostar dubbelt: två modeller ger varsitt svar, och varje svar debiteras enligt sin egen kreditkurs, så att jämföra en modell på 10 krediter mot en på 20 krediter kostar 30 krediter i stället för 10 eller 20. Att fånga ett felaktigt svar eller ett oanvändbart utkast innan det skickas är oftast värt det. Det effektiva sättet är att jämföra på beslut och leverabler, och använda en enda modell för rutinuppslag och snabba omskrivningar.

Vad om båda svaren är lika bra?

Det är ett verkligt och användbart resultat: det säger dig att uppgiften inte beror på modellval, så sluta lägga uppmärksamhet på det och använd den du har som standard. De flesta arbetsbelastningar fördelar sig så här, med en majoritet av uppgifter där modellerna är utbytbara och en minoritet där skillnaden är stor. Att ta reda på vilket som gäller är poängen med att köra jämförelser i en vecka.

Hur undviker jag att bara välja svaret som låter bäst?

Bestäm ditt kriterium innan du läser. Längre, mer självsäkra och mer putsade svar föredras systematiskt även när de är sämre, och biaset är till stor del omedvetet. Att skriva en mening om vad ett bra svar borde innehålla, innan du tittar, räcker för att motverka det mesta av det. Vid faktaarbete, döm efter om källorna håller och stödjer påståendet snarare än hur svaret läses.

Vilka två modeller ska jag jämföra?

Jämför de två du faktiskt väljer mellan för den specifika uppgiften, vilket för de flesta är Claude mot GPT för skrivande och resonemang, eller en modell med stor kontext mot din standard när dokument är inblandade. Att jämföra en modell du aldrig skulle använda mot din favorit säger dig inget du kommer agera på.