Hvorfor lancerings-benchmarks ikke svarer på dit spørgsmål
Hver ny topmodel ankommer med et diagram, der viser den i front på en række standardiserede evalueringer. De tal er reelle, og de er også tæt på nytteløse, når du skal beslutte, hvad du skal bruge på mandag, af tre grunde.
Marginerne er små, og opgaverne er ikke dine. En forskel på to point på et ræsonnement-benchmark siger ingenting om, hvorvidt en model skriver en bedre kunde-e-mail eller holder et skema mere pålideligt over to hundrede rækker.
Benchmarks måler de opgaver, der er nemme at bedømme. Ting med et rigtigt svar. Det meste professionelle arbejde har ikke ét: tone, struktur, dømmekraft om hvad man skal udelade. Det er præcis dér, modeller adskiller sig mest, og hvor intet bliver målt.
Lanceringssammenligninger bliver lavet af leverandøren. Ikke nødvendigvis uhæderligt, men ingen udgiver den evaluering, hvor deres model kom nummer to.
Det spørgsmål, der er værd at besvare, er mere snævert: på de specifikke opgaver, du gør tyve gange om ugen, hvilken af disse to er bedre? Det findes der ikke noget udgivet svar på, og det tager omkring en time at finde ud af.
Hvad der faktisk plejer at ændre sig mellem udgivelser
Tværs over nylige topmodel-udgivelser er de forbedringer, der betyder noget i daglig brug, konsekvent inden for de samme områder, og de er sjældent dem, der bliver fremhævet i annonceringen.
| Hvad blev forbedret | Hvordan du bemærker det | Om benchmarket viser det |
|---|---|---|
| Instruktionsoverholdelse | Den stopper med at ignorere din tredje betingelse | Sjældent |
| Negative instruktioner | "Brug ikke analogier" bliver faktisk overholdt | Nej |
| Genkaldelse i lang kontekst | Den finder tingen på side 140, ikke bare side 3 | Delvist |
| Formateringsdisciplin | Tabellen har de kolonner, du bad om, hver gang | Nej |
| Kalibreret usikkerhed | Den siger, den ikke ved det, i stedet for at opfinde | Nej |
| Tonekontrol | Færre omskrivninger før noget kan sendes | Nej |
| Ræsonnementsdybde | Den fanger edge case'en, du overså | Ja, det er den, de måler |
Fem af de syv er usynlige i et benchmark-diagram og er grunden til, at en ny model føles bedre eller værre at arbejde med. Instruktionsoverholdelse er især forskellen mellem et førsteudkast, du redigerer, og et førsteudkast, du kasserer.
Testen på en time
Gør dette i stedet for at læse lanceringsdækning. Kør begge modeller side om side på dit eget materiale.
- Saml fem rigtige opgaver fra de sidste to uger. Rigtige, med din faktiske kontekst indsat, ikke legeprompter. Inkluder mindst en skriveopgave, en opgave med struktureret output, og en hvor du havde brug for ræsonnement om noget uvant.
- Skriv ned hvad et godt svar indeholder for hver, i én sætning, før du kører noget. Det er det trin, der forhindrer dig i at foretrække hvilket svar som helst der er længst og mest overbevist, hvilket er en stærk og stort set ubevidst bias.
- Kør hver opgave mod begge modeller parallelt, så det ene svar ikke bliver forankret af det andet.
- Bedøm efter redigeringsarbejde, altså hvor meget arbejde der er mellem outputtet og noget, du ville sende. Ikke efter hvordan det læses.
- Notér forskellens størrelse, ikke bare vinderen. Ombyttelige resultater fortæller dig, at du kan stoppe med at tænke over modelvalg for den opgave, hvilket er reelt nyttigt.
- Behold loggen. Om tre måneder, når den næste udgivelse lander, kører du de samme fem opgaver igen og får et rigtigt svar på tyve minutter.
Det sidste punkt er det, der akkumuleres. Et gemt evalueringssæt er det eneste, der gør hver efterfølgende udgivelse billig at vurdere.
Seks prompter, der skiller topmodeller fra hinanden
Generelle spørgsmål giver lignende svar fra enhver kompetent model. Hvis du vil se en forskel, skal du lægge pres på en specifik evne.
- Tone under svære forhold.
Skriv en besked, der fortæller en kunde, at vi har misset deadlinen. Tag ansvar uden at overundskylde og uden bortforklaringer. Under 120 ord.Registerforskelle viser sig med det samme. - Negativ betingelse.
Forklar [koncept] uden at bruge nogen analogi eller metafor.Overholdelse af negative instruktioner varierer langt mere end du ville forvente. - Streng udtrækning.
Udtræk hver dato, beløb og part i et JSON-array med præcis disse nøgler. Hvis et felt mangler, brug null. Antag ikke.Tester formatdisciplin og tendensen til at udfylde huller. - Genkaldelse i lang kontekst. Upload et langt dokument, og spørg om noget i midten. Afslører brugbar kontekst, hvilket ikke er det samme som annonceret kontekst.
- At indrømme ukendskab. Spørg om noget genuint obskurt eller meget nyt. Det bedste svar er et klart "det ved jeg ikke" eller en kilde-baseret hentning. Fabrikation her er diskvalificerende uanset benchmark.
- Overholdelse af flere betingelser samtidig. Giv seks betingelser på én gang, og tæl hvor mange der overlever. Denne enkelte test forudsiger daglig tilfredshed bedre end noget andet på listen.
Svaret er som regel "begge, til forskellige ting"
Folk går til en udgivelse med et ønske om en dom, og det ærlige resultat efter at have kørt evalueringen er næsten altid delt. Den ene model vinder på skrivning og tone. Den anden vinder på streng struktur og hastighed. De er tætte nok på generelt ræsonnement, at det ikke afgør noget.
Det er ikke et fusk, det er det faktiske resultat, og det har en praktisk konsekvens. Hvis du kun kan bruge én model, vælger du hvilken kategori af opgaver du er dårligere til. Hvis du kan bruge begge, stopper udgivelsesspørgsmålet med at være "skal jeg skifte" og bliver "hvilke opgaver flytter sig", hvilket er en meget mindre og lavere-risiko beslutning.
Det ændrer også, hvad en udgivelse betyder for dig. Når nye modeller lander i et arbejdsområde, der allerede har flere, kører du dine fem opgaver igen, justerer din routing og fortsætter. Der er ingen migrering, ingen opsagt abonnement, og ingen måned med at bruge noget værre, fordi du forpligtede dig, inden du testede.
Hvad du skal gøre på udgivelsesdagen
Skift ikke dine standardvalg med det samme. Indtryk fra den første lanceringsuge er domineret af nyhedens tiltrækning og af hvilke eksempler der cirkulerede først.
Kør dit evalueringssæt igen. Tyve minutter, hvis du gemte et fra sidste gang.
Kontrollér de kedelige ting. Kontekstvindue, om dine eksisterende prompter stadig opfører sig samme måde, og om noget du stolede på, har ændret sig. En model, der generelt er bedre, kan være værre til din specifikke skabelon, og det er værd at vide, før du flytter produktionsarbejde over på den.
Opdatér routing per opgave, ikke i bulk. Flyt de kategorier, hvor den nye model klart vandt, og lad resten være.
Vent fjorten dage på begrænsningerne. Fejltilstandene for en ny model kommer til syne inden for omkring to uger med udbredt brug, og de er sjældent i annonceringen.
For den generelle ramme se hvordan man vælger en AI-model, og for mekanikken i at køre to modeller på én prompt se sammenligning af modeller side om side.
- Byg et sæt af fem rigtige opgaver fra dit eget arbejde, og behold det
- Skriv ned hvad et godt svar indeholder, før du læser noget af outputtet
- Kør begge modeller parallelt, så det ene ikke forankrer det andet
- Bedøm efter redigeringsarbejde, ikke efter hvordan outputtet læses
- Notér forskellens størrelse, da ombyttelige resultater er nyttig information
- Test negative betingelser og overholdelse af flere betingelser samtidig specifikt
- Vent fjorten dage, før du flytter produktionsarbejde til en ny model
- Opdatér routing per opgave i stedet for at skifte i bulk
Ofte stillede spørgsmål
Skal jeg skifte til den nyeste model?
Ikke på lanceringsdagen, og ikke i bulk. Kør et lille sæt af dine egne rigtige opgaver mod begge igen, bedøm efter hvor meget redigering hvert output kræver, og flyt kun de kategorier, hvor den nye model klart vinder. Nyere er pålideligt bedre til nogle ting og til tider værre til andre, især for eksisterende prompter, der er justeret mod den forrige version.
Hvorfor matcher benchmarks ikke min oplevelse?
Fordi de måler det, der kan bedømmes automatisk, hvilket betyder opgaver med et rigtigt svar. Det meste professionelle arbejde har ikke ét enkelt rigtigt svar, og de kvaliteter, der afgør daglig tilfredshed, altså instruktionsoverholdelse, tonekontrol, formateringsdisciplin, og at vide hvornår man skal sige "det ved jeg ikke", er stort set umålte. En model kan føre på hvert udgivet diagram og stadig være mere irriterende at arbejde med.
Hvor ofte skal jeg evaluere igen?
Når en model du bruger får en betydelig udgivelse, hvilket i øjeblikket betyder hver få måneder, plus én gang i kvartalet uanset hvad. At holde et fast sæt af fem rigtige opgaver gør dette til en tyve minutters opgave i stedet for en eftermiddag, og det er den eneste måde at bemærke, at den routing du satte for seks måneder siden nu er forkert.
Kan jeg bare bruge den model, der vinder overordnet?
Du kan, og du vil acceptere dårligere resultater på en forudsigelig del af dit arbejde. Det konsekvente resultat, når folk evaluerer på deres egne opgaver, er, at den ene model vinder på skrivning og tone, mens en anden vinder på streng struktur og hastighed, med generelt ræsonnement tæt nok på ikke at afgøre noget. Hvis begge er tilgængelige for dig, bliver valget per opgave i stedet for per abonnement.
Betyder det noget, hvilket produkt jeg tilgår modellen igennem?
Modellen er modellen, så outputkvaliteten er stort set den samme, uanset hvor du når den. Hvad der er forskelligt, er om du kan sammenligne, om konteksten følger med, når du skifter, og om en ny udgivelse koster dig en migrering eller bare er en anden mulighed i vælgeren. Et arbejdsområde med flere modeller gør hver udgivelse til en justering i stedet for en beslutning.