Hoe je bepaalt of een nieuw AI-model echt beter is voor jouw werk

Kort antwoord

Om een AI-model te evalueren, test je het op je eigen werk in plaats van launchbenchmarks te lezen. Verzamel vijf echte taken uit de afgelopen twee weken, schrijf op wat een goed antwoord bevat voordat je iets uitvoert, draai beide modellen parallel en beoordeel op redigeerinspanning in plaats van hoe de uitvoer leest. Bewaar het logboek.

Waarom de launchbenchmarks je vraag niet beantwoorden

Elke nieuwe topmodelrelease komt met een grafiek die laat zien dat het voorloopt op een set gestandaardiseerde evaluaties. Die cijfers zijn echt en tegelijk bijna nutteloos om te bepalen wat jij maandag moet gebruiken, om drie redenen.

De marges zijn klein en de taken zijn niet die van jou. Een verschil van twee punten op een redeneerbenchmark zegt niets over of het ene model een betere klant-e-mail schrijft of een schema betrouwbaarder aanhoudt over tweehonderd rijen.

Benchmarks meten de taken die makkelijk te scoren zijn. Dingen met een juist antwoord. Het meeste professionele werk heeft dat niet: toon, structuur, oordeel over wat je weglaat. Juist daar verschillen modellen het meest en daar wordt niets gemeten.

Launchvergelijkingen worden gemaakt door de leverancier. Niet per se oneerlijk, maar niemand publiceert de evaluatie waarin hun model tweede werd.

De vraag die het waard is om te beantwoorden is smaller: op de specifieke taken die jij twintig keer per week doet, welke van deze twee is beter? Daar bestaat geen gepubliceerd antwoord op, en het kost ongeveer een uur om erachter te komen.

Wat er eigenlijk verandert tussen releases

Bij recente topmodelreleases zitten de verbeteringen die er in het dagelijks gebruik toe doen steeds op dezelfde plekken, en het zijn zelden de verbeteringen die in de aankondiging worden uitgelicht.

Wat verbeterdeHoe je het merktOf de benchmark het laat zien
InstructienalevingHet negeert je derde beperking niet meerZelden
Negatieve instructies"Gebruik geen analogieën" wordt echt opgevolgdNee
Recall over lange contextHet vindt het punt op pagina 140, niet alleen pagina 3Deels
OpmaakdisciplineDe tabel heeft steeds de kolommen die je vroegNee
Gekalibreerde onzekerheidHet zegt dat het iets niet weet in plaats van te verzinnenNee
TooncontroleMinder herschrijvingen voordat iets verstuurbaar isNee
RedeneerdiepteHet herkent het randgeval dat jij misteJa, dit is degene die ze meten

Vijf van die zeven zijn onzichtbaar in een benchmarkgrafiek en zijn de reden dat een nieuw model beter of slechter aanvoelt om mee te werken. Instructienaleving in het bijzonder is het verschil tussen een eerste versie die je redigeert en een eerste versie die je weggooit.

De evaluatie van een uur

Doe dit in plaats van launchberichtgeving te lezen. Draai beide modellen naast elkaar op je eigen materiaal.

  1. Verzamel vijf echte taken uit de afgelopen twee weken. Echte, met je werkelijke context erin geplakt, geen speelgoedprompts. Neem minstens één schrijftaak op, één taak met gestructureerde uitvoer, en één waarbij je moest redeneren over iets onbekends.
  2. Schrijf voor elke taak in één zin op wat een goed antwoord bevat, voordat je iets uitvoert. Dit is de stap die voorkomt dat je de voorkeur geeft aan welke uitvoer dan ook langer en zelfverzekerder is, wat een sterke en grotendeels onbewuste vertekening is.
  3. Draai elke taak op beide modellen parallel zodat geen van beide antwoorden wordt verankerd door het andere.
  4. Beoordeel op redigeerinspanning, dus hoeveel werk er zit tussen de uitvoer en iets dat je zou versturen. Niet op hoe het leest.
  5. Noteer de omvang van het verschil, niet alleen de winnaar. Onderling verwisselbare resultaten vertellen je dat je voor die taak kunt stoppen met nadenken over modelkeuze, wat echt nuttig is.
  6. Bewaar het logboek. Over drie maanden, als de volgende release verschijnt, draai je dezelfde vijf taken opnieuw en heb je in twintig minuten een echt antwoord.

Dat laatste punt is degene die zich opstapelt. Een bewaarde evaluatieset is het enige dat elke volgende release goedkoop maakt om te beoordelen.

Zes prompts die topmodellen van elkaar onderscheiden

Algemene vragen leveren vergelijkbare antwoorden op van elk capabel model. Wil je een verschil zien, zet dan druk op een specifieke vaardigheid.

  • Toon onder druk. Schrijf een bericht waarin je een klant vertelt dat we de deadline hebben gemist. Neem verantwoordelijkheid zonder overdreven te verontschuldigen en zonder excuses. Onder 120 woorden. Registerverschillen komen meteen naar voren.
  • Negatieve beperking. Leg [concept] uit zonder een analogie of metafoor te gebruiken. De naleving van negatieve instructies varieert veel meer dan je zou verwachten.
  • Strikte extractie. Haal elke datum, elk bedrag en elke partij eruit in een JSON-array met precies deze sleutels. Als een veld ontbreekt gebruik null. Leid niets af. Test opmaakdiscipline en de neiging om gaten in te vullen.
  • Recall over lange context. Upload een lang document en vraag naar iets in het midden. Onthult bruikbare context, wat niet hetzelfde is als geadverteerde context.
  • Onwetendheid toegeven. Vraag naar iets werkelijk obscuurs of heel recents. Het beste antwoord is een duidelijk "ik weet het niet" of een herleide bron. Verzinsels hierbij diskwalificeren, ongeacht welke benchmark dan ook.
  • Naleving van meerdere beperkingen. Geef zes beperkingen tegelijk en tel hoeveel er standhouden. Deze ene test voorspelt tevredenheid in het dagelijks gebruik beter dan wat dan ook op de lijst.

Het antwoord is meestal "beide, voor verschillende dingen"

Mensen benaderen een release met de wens voor een verdict, en de eerlijke uitkomst na het uitvoeren van de evaluatie is bijna altijd verdeeld. Het ene model wint op schrijven en toon. Het andere wint op strikte structuur en snelheid. Ze liggen dicht genoeg bij elkaar op algemeen redeneren dat dat niets beslist.

Dat is geen ontwijking, het is het werkelijke resultaat, en het heeft een praktische implicatie. Als je maar één model kunt gebruiken, kies je in welke taakcategorie je slechter bent. Als je beide kunt gebruiken, verandert de vraag bij een release van "moet ik overstappen" naar "welke taken verschuiven", wat een veel kleinere en minder risicovolle beslissing is.

Het verandert ook wat een release voor jou betekent. Als nieuwe modellen landen in een werkruimte die er al meerdere heeft, draai je je vijf taken opnieuw, pas je je routering aan en ga je verder. Er is geen migratie, geen opgezegd abonnement, en geen maand waarin je iets slechters gebruikt omdat je je had vastgelegd voordat je testte.

Wat te doen op releasedag

Verander je standaardinstellingen niet meteen. Indrukken uit de eerste launchweek worden gedomineerd door nieuwigheid en door welke voorbeelden het eerst rondgingen.

Draai je evaluatieset opnieuw. Twintig minuten als je er een had bewaard van de vorige keer.

Controleer de saaie dingen. Contextvenster, of je bestaande prompts zich nog hetzelfde gedragen, en of iets waarop je vertrouwde is veranderd. Een model dat in het algemeen beter is, kan slechter zijn op jouw specifieke sjabloon, en dat is de moeite waard om te weten voordat je productiewerk erop overzet.

Werk de routering per taak bij, niet in één keer voor alles. Verplaats de categorieën waar het nieuwe model duidelijk won en laat de rest staan.

Wacht twee weken op de beperkingen. De faalmodi van een nieuw model komen naar boven binnen ongeveer twee weken van breed gebruik, en ze staan zelden in de aankondiging.

Voor het algemene kader zie hoe je een AI-model kiest, en voor de mechanica van het naast elkaar draaien van twee modellen op één prompt zie modellen naast elkaar vergelijken.

Checklist
  • Bouw een set van vijf echte taken uit je eigen werk en bewaar die
  • Schrijf op wat een goed antwoord bevat voordat je een van beide uitvoeren leest
  • Draai beide modellen parallel zodat geen van beide het andere verankert
  • Beoordeel op redigeerinspanning, niet op hoe de uitvoer leest
  • Noteer de omvang van het verschil, want onderling verwisselbare resultaten zijn nuttige informatie
  • Test specifiek negatieve beperkingen en naleving van meerdere beperkingen
  • Wacht twee weken voordat je productiewerk naar een nieuw model verplaatst
  • Werk de routering per taak bij in plaats van in één keer over te schakelen

Veelgestelde vragen

Moet ik overstappen naar het nieuwste model?

Niet op de dag van de release, en niet in één keer voor alles. Draai een kleine set van je eigen echte taken opnieuw op beide, beoordeel hoeveel redigeerwerk elke uitvoer nodig heeft, en verplaats alleen de categorieën waarin het nieuwe model duidelijk wint. Nieuwer is betrouwbaar beter in sommige dingen en soms slechter in andere, vooral bij bestaande prompts die zijn afgestemd op de vorige versie.

Waarom komen benchmarks niet overeen met mijn ervaring?

Omdat ze meten wat automatisch te scoren is, wat betekent taken met een juist antwoord. Het meeste professionele werk heeft geen enkel juist antwoord, en de kwaliteiten die de dagelijkse tevredenheid bepalen, zoals instructienaleving, tooncontrole, opmaakdiscipline en weten wanneer je "ik weet het niet" moet zeggen, zijn grotendeels ongemeten. Een model kan elke gepubliceerde grafiek aanvoeren en toch vervelender zijn om mee te werken.

Hoe vaak moet ik opnieuw evalueren?

Wanneer een model dat je gebruikt een significante release krijgt, wat momenteel elke paar maanden betekent, plus sowieso eens per kwartaal. Een vaste set van vijf echte taken bewaren maakt hiervan een klus van twintig minuten in plaats van een middag, en het is de enige manier om te merken dat de routering die je zes maanden geleden instelde nu fout zit.

Kan ik gewoon het model gebruiken dat overall wint?

Dat kan, en dan accepteer je slechtere resultaten op een voorspelbaar deel van je werk. De consistente uitkomst wanneer mensen evalueren op hun eigen taken is dat het ene model wint op schrijven en toon, terwijl het andere wint op strikte structuur en snelheid, met algemeen redeneren dicht genoeg bij elkaar om niets te beslissen. Als je beide tot je beschikking hebt, wordt de keuze per taak in plaats van per abonnement.

Maakt het uit via welk product ik het model benader?

Het model is het model, dus de uitvoerkwaliteit is grotendeels hetzelfde waar je het ook bereikt. Wat verschilt is of je kunt vergelijken, of context meegaat als je overschakelt, en of een nieuwe release je een migratie kost of gewoon een extra optie in het kiezer is. Een werkruimte met meerdere modellen verandert elke release van een beslissing in een aanpassing.