Varför lanseringsbenchmarks inte svarar på din fråga
Varje ny toppmodell kommer med ett diagram som visar den i ledningen på en uppsättning standardiserade tester. Siffrorna är äkta, men de är också nästan värdelösa för att avgöra vad du bör använda på måndag, av tre skäl.
Marginalerna är små och uppgifterna är inte dina. En skillnad på två poäng på ett resonemangstest säger ingenting om huruvida en modell skriver ett bättre kundmejl eller håller ett schema mer tillförlitligt genom tvåhundra rader.
Benchmarks mäter det som är lätt att poängsätta. Saker med ett rätt svar. Det mesta professionella arbetet har inte det: ton, struktur, omdöme om vad som ska utelämnas. Just där skiljer modellerna sig mest åt, och där mäts ingenting.
Lanseringsjämförelser görs av leverantören. Inte nödvändigtvis oärligt, men ingen publicerar utvärderingen där deras modell kom på andra plats.
Frågan som är värd att besvara är smalare: på just de uppgifter du gör tjugo gånger i veckan, vilken av de här två är bättre? Det finns inget publicerat svar på det, men det tar ungefär en timme att ta reda på.
Det som faktiskt brukar förändras mellan lanseringar
Genom de senaste lanseringarna av ledande modeller ligger förbättringarna som spelar roll i det dagliga arbetet konsekvent inom samma områden, och de är sällan de som lyfts fram i lanseringen.
| Vad förbättrades | Hur du märker det | Om benchmarken visar det |
|---|---|---|
| Följsamhet mot instruktioner | Den slutar ignorera ditt tredje villkor | Sällan |
| Negativa instruktioner | "Använd inte liknelser" följs faktiskt | Nej |
| Minne för lång kontext | Den hittar det som står på sidan 140, inte bara sidan 3 | Delvis |
| Formateringsdisciplin | Tabellen har kolumnerna du bad om, varje gång | Nej |
| Kalibrerad osäkerhet | Den säger att den inte vet i stället för att hitta på | Nej |
| Tonkontroll | Färre omskrivningar innan något är skickbart | Nej |
| Resonemangsdjup | Den fångar undantagsfallet du missade | Ja, det är det de mäter |
Fem av de sju är osynliga i ett benchmarkdiagram, och det är skälet till att en ny modell känns bättre eller sämre att arbeta med. Följsamhet mot instruktioner är i synnerhet skillnaden mellan ett förstautkast du redigerar och ett du kastar bort.
Utvärderingen på en timme
Gör det här i stället för att läsa lanseringsbevakningen. Kör båda modellerna sida vid sida på ditt eget material.
- Samla fem verkliga uppgifter från de senaste två veckorna. Riktiga, med din faktiska kontext klistrad in, inte konstgjorda prompter. Ta med minst en skrivuppgift, en uppgift med strukturerad utdata och en där du behövde resonera om något okänt.
- Skriv ner vad ett bra svar innehåller för varje uppgift, i en mening, innan du kör något. Det här steget hindrar dig från att föredra vilket svar som helst bara för att det är längre och mer självsäkert, en stark och till stor del omedveten fördom.
- Kör varje uppgift mot båda modellerna parallellt, så att inget svar förankras av det andra.
- Betygsätt utifrån redigeringsarbetet, det vill säga hur mycket arbete som skiljer utdatan från något du skulle skicka. Inte hur den låter.
- Notera skillnadens storlek, inte bara vinnaren. Utbytbara resultat säger dig att sluta fundera på modellval för just den uppgiften, vilket är genuint användbart.
- Spara loggen. Om tre månader, när nästa lansering kommer, kör du om samma fem uppgifter och får ett riktigt svar på tjugo minuter.
Den sista punkten är den som ackumuleras. En sparad utvärderingsuppsättning är det enda som gör varje efterföljande lansering billig att bedöma.
Sex prompter som skiljer ledande modeller åt
Allmänna frågor ger liknande svar från alla kapabla modeller. Om du vill se en skillnad måste du sätta press på en specifik förmåga.
- Ton under press.
Skriv ett meddelande som berättar för en kund att vi missade deadline. Ta ansvar utan att överurskulda och utan ursäkter. Under 120 ord.Skillnader i register syns omedelbart. - Negativt villkor.
Förklara [begrepp] utan att använda någon liknelse eller metafor.Följsamheten mot negativa instruktioner varierar långt mer än man tror. - Strikt extraktion.
Extrahera varje datum, belopp och part till en JSON-array med exakt dessa nycklar. Om ett fält saknas, använd null. Gissa inte.Testar formatdisciplin och tendensen att fylla i luckor. - Minne för lång kontext. Ladda upp ett långt dokument och fråga om något i mitten. Visar användbar kontext, vilket inte är samma sak som annonserad kontext.
- Att erkänna okunskap. Fråga om något genuint obskyrt eller mycket nytt. Det bästa svaret är ett tydligt "jag vet inte" eller en källbelagd hämtning. Att hitta på information här diskvalificerar oavsett benchmark.
- Efterlevnad av flera villkor. Ge sex villkor samtidigt och räkna hur många som överlever. Det här enda testet förutsäger den dagliga nöjdheten bättre än något annat på listan.
Svaret är oftast "båda, för olika saker"
Man kommer till en lansering och vill ha en dom, och det ärliga resultatet efter utvärderingen är nästan alltid delat. En modell vinner på skrivande och ton. Den andra vinner på strikt struktur och hastighet. De är tillräckligt nära i allmänt resonemang för att det inte avgör något.
Det är inte en genväg, det är det faktiska resultatet, och det har en praktisk konsekvens. Om du bara kan använda en modell väljer du vilken kategori av uppgifter du blir sämre på. Om du kan använda båda slutar lanseringsfrågan vara "ska jag byta" och blir "vilka uppgifter flyttas", vilket är ett mycket mindre och lägre riskbeslut.
Det förändrar också vad en lansering betyder för dig. När nya modeller landar i en arbetsyta som redan har flera kör du om dina fem uppgifter, justerar routningen och kör vidare. Det blir ingen migrering, ingen uppsagd prenumeration och ingen månad av att använda något sämre bara för att du bestämde dig innan du testade.
Vad du ska göra på lanseringsdagen
Byt inte dina standardinställningar direkt. Intrycken under lanseringsveckan domineras av nyhetsvärde och av vilka exempel som spreds först.
Kör om din utvärderingsuppsättning. Tjugo minuter om du sparade en från förra gången.
Kontrollera det tråkiga. Kontextfönster, om dina befintliga prompter fortfarande beter sig likadant och om något du litade på har ändrats. En modell som är bättre generellt kan vara sämre för din specifika mall, och det är värt att veta innan du flyttar produktionsarbete till den.
Uppdatera routningen per uppgift, inte allt på en gång. Flytta kategorierna där den nya modellen tydligt vann och lämna resten.
Vänta två veckor på begränsningarna. En ny modells felbeteenden dyker upp inom cirka två veckor av bred användning, och de finns sällan med i lanseringen.
För det generella ramverket, se hur man väljer en AI-modell, och för hur man kör två modeller på samma prompt, se att jämföra modeller sida vid sida.
- Bygg en uppsättning med fem verkliga uppgifter från ditt eget arbete och spara den
- Skriv ner vad ett bra svar innehåller innan du läser något av svaren
- Kör båda modellerna parallellt så att inget förankrar det andra
- Betygsätt utifrån redigeringsarbetet, inte hur svaret låter
- Notera skillnadens storlek, eftersom utbytbara resultat också är användbar information
- Testa negativa villkor och efterlevnad av flera villkor specifikt
- Vänta två veckor innan du flyttar produktionsarbete till en ny modell
- Uppdatera routningen per uppgift i stället för att byta allt på en gång
Vanliga frågor
Ska jag byta till den senaste modellen?
Inte på lanseringsdagen, och inte allt på en gång. Kör om en liten uppsättning av dina egna verkliga uppgifter mot båda, betygsätt utifrån hur mycket redigering varje svar behöver, och flytta bara de kategorier där den nya modellen tydligt vinner. Nyare är pålitligt bättre på vissa saker och ibland sämre på andra, särskilt för befintliga prompter finjusterade mot föregående version.
Varför matchar inte benchmarks min egen upplevelse?
Eftersom de mäter det som kan poängsättas automatiskt, det vill säga uppgifter med ett rätt svar. Det mesta professionella arbetet har inget enskilt rätt svar, och egenskaperna som avgör den dagliga nöjdheten, det vill säga följsamhet mot instruktioner, tonkontroll, formateringsdisciplin och att veta när man ska säga "jag vet inte", är till stor del omätta. En modell kan leda varje publicerat diagram och fortfarande vara mer besvärlig att arbeta med.
Hur ofta bör jag utvärdera om?
Varje gång en modell du använder får en betydande lansering, vilket för närvarande betyder några gånger om året, plus en gång i kvartalet oavsett. Att behålla en fast uppsättning med fem verkliga uppgifter gör det till ett tjugominutersjobb i stället för en eftermiddag, och det är det enda sättet att märka att routningen du satte för sex månader sedan nu är fel.
Kan jag bara använda den modell som vinner överlag?
Du kan, och då accepterar du sämre resultat på en förutsägbar del av ditt arbete. Det konsekventa resultatet när man utvärderar på sina egna uppgifter är att en modell vinner på skrivande och ton medan en annan vinner på strikt struktur och hastighet, med allmänt resonemang tillräckligt nära för att inte avgöra något. Om båda är tillgängliga för dig blir valet per uppgift i stället för per prenumeration.
Spelar det roll vilken produkt jag når modellen genom?
Modellen är modellen, så kvaliteten på svaren är i stort sett densamma oavsett var du når den. Det som skiljer är om du kan jämföra, om kontexten följer med när du byter, och om en ny lansering kostar dig en migrering eller bara blir ett nytt alternativ i väljaren. En arbetsyta med flera modeller gör varje lansering till en justering i stället för ett beslut.