Hoe je AI-modellen naast elkaar vergelijkt in Whizi

Kort antwoord

Om AI-modellen naast elkaar te vergelijken in Whizi, druk je op Compare in de chatheader, kies je een model per kolom en stuur je één prompt naar beide. Elke kolom houdt zijn eigen context bij, zodat het ene antwoord het andere niet beïnvloedt. Naast elkaar vergelijken is een Powerhouse-functie en elk antwoord wordt gefactureerd tegen het credit-tarief van zijn eigen model.

Het korte antwoord

Druk op Compare in de chatheader, kies een model per kolom en stuur één prompt naar beide. Elke kolom houdt zijn eigen verborgen gesprek bij, zodat geen van beide modellen het antwoord van het andere ziet en geen van de antwoorden het andere beïnvloedt, wat precies de reden is waarom de vergelijking iets waard is. De kolommen worden na elkaar gestreamd, eerst links dan rechts, omdat er per account één generatie tegelijk draait.

Naast elkaar vergelijken is een Powerhouse-functie en draait twee modellen tegelijk. Elk antwoord wordt gefactureerd tegen het credit-tarief van zijn eigen model, dus een model van 10 credits vergelijken met een van 20 credits kost 30 credits.

Gebruik het om te beslissen welk model je standaard moet zijn voor een bepaald soort werk. Als je liever één antwoord verbetert dan twee antwoorden vergelijkt, doe dan iets anders: wissel van model binnen dezelfde thread en vraag het tweede om het eerste te bekritiseren.

Waarom benchmarks je vraag niet beantwoorden

Gepubliceerde benchmarks meten prestaties op gestandaardiseerde taken. Jouw vraag is smaller en nuttiger: welk model is beter in het soort werk dat jij persoonlijk twintig keer per week doet. Dat zijn verschillende vragen, en de tweede heeft geen gepubliceerd antwoord omdat niemand jouw workload heeft.

Eén prompt tegen twee modellen laten draaien duurt ongeveer dertig seconden en beantwoordt de vraag direct. Het belangrijke is niet dat je twee antwoorden krijgt, maar dat je erachter komt hoe groot het verschil is. Soms zijn de antwoorden bijna identiek, wat je vertelt dat je voor die taak kunt stoppen met nadenken over modelkeuze. Soms is er een onbruikbaar, wat het waard is te weten voordat je er een workflow op bouwt.

Het andere dat vergelijking blootlegt, is een zelfverzekerde fout. Wanneer twee modellen inhoudelijk verschillende antwoorden geven op een feitelijke vraag, heeft minstens één het mis, en dat had je niet geweten als je slechts één antwoord had gelezen. Dat signaal is bij geen enkele prijs beschikbaar in een workflow met één model.

Bepaal wat beter betekent voordat je leest

De valkuil bij vergelijking naast elkaar is de voorkeur geven aan welk antwoord ook langer, zelfverzekerder of gepolijster is. Dat is geen kwaliteit. Kies eerst je criterium, lees daarna pas.

TaakWat beter betekentWat te negeren
SchrijvenHeeft minder redactie nodig om verzendklaar te zijnLengte, woordkeuze, enthousiasme
Feitelijk onderzoekBronnen die kloppen en de bewering ondersteunenVlotheid en zelfverzekerdheid
ExtractieCorrect schema, geen verzonnen velden, consistente labelsKwaliteit van de proza rond de tabel
RedenerenDe stappen kloppen en het randgeval wordt behandeldOf de conclusie overeenkomt met je eigen vermoeden
CodeBehandelt het foutpad, is beoordeelbaarSlimheid, beknoptheid
SamenvattenBehoudt wat ertoe doet en laat de rest vallenVolledigheid

Een praktische truc: schrijf voordat je een van beide antwoorden leest één zin op die beschrijft wat een goed antwoord zou moeten bevatten. Lees daarna. Het kost tien seconden en voorkomt de polijstbias, die sterk en grotendeels onbewust is.

Bij feitelijke vragen let je op de onenigheid, niet op de winnaar. Waar twee modellen het eens zijn over een specifiek getal en een bron, is vertrouwen redelijk. Waar ze uiteenlopen, is dat het ding om te gaan verifiëren, en het is de enige meest waardevolle opbrengst van de hele oefening.

Prompts die echte verschillen blootleggen

Sommige taken scheiden modellen scherp en andere niet. Als je iets wilt leren van een vergelijking, gebruik dan prompts die druk zetten op een specifieke vaardigheid.

  • Toon onder druk. Schrijf een bericht aan een klant waarin je uitlegt dat we de deadline hebben gemist, waarbij je verantwoordelijkheid neemt zonder overmatig te verontschuldigen en zonder excuses. Onder de 120 woorden. Verschillen in register komen hier onmiddellijk naar boven.
  • Strikte extractie. Haal elke datum, elk bedrag en elke partij uit deze tekst in een JSON-array met precies deze sleutels. Als een veld ontbreekt, gebruik null. Leid niets af. Test formaatdiscipline en de neiging om dingen te verzinnen.
  • Redeneren met een valkuil. Geef een probleem met een plausibel fout antwoord, zoals een percentage- of verhoudingsvraag waarbij de intuïtieve route onjuist is. Modellen verschillen in of ze de kortere weg nemen.
  • Herinnering over lange context. Upload een lang document en vraag naar iets in het midden. Onthult de echt bruikbare context, niet de geadverteerde context.
  • Onwetendheid toegeven. Wat werd er aangekondigd over [iets echt obscuurs of heel recents]? Het beste antwoord is een duidelijk "ik weet het niet" of een op bronnen gebaseerde raadpleging. Verzinsels zijn hier diskwalificerend.
  • Een negatieve beperking volgen. Leg X uit zonder enige analogie of metafoor te gebruiken. De naleving van negatieve instructies varieert meer dan je zou verwachten.

Voer vergelijkingen uit op je eigen echte werk in plaats van op puzzels. Een model dat beter is in jouw kwartaalrapport is nuttiger dan een dat beter is in een logisch raadsel.

Van een week vergelijkingen naar een routeringskaart

Eén vergelijking is interessant. Een week aan vergelijkingen is bruikbaar. De routine:

  1. Voer een taak vijf dagen lang, telkens als het ertoe doet, uit tegen twee modellen in plaats van één.
  2. Noteer het soort taak, de winnaar en hoe groot het verschil was. Drie woorden zijn genoeg.
  3. Bekijk aan het eind van de week waar het ene model herhaaldelijk won en waar de antwoorden uitwisselbaar waren.
  4. Stel je standaardinstellingen daarop in en stop met vergelijken op de taken waar het verschil steevast nihil was.

Wat mensen doorgaans ontdekken, is dat vergelijking ertoe doet bij een minderheid van hun werk en tijdverspilling is voor de rest. Snelle feitelijke opzoekingen, eenvoudige herschrijvingen en routinematige opmaak scheiden de modellen zelden. Schrijfwerk dat door een klant wordt gelezen, onderzoek dat een beslissing zal onderbouwen, en redeneren over iets onbekends scheiden ze juist sterk.

Dat resultaat is de opbrengst: je stopt met vergelijken waar het geen verschil maakt en houdt het aan voor de taken waar het de uitkomst verandert.

Naast elkaar versus opeenvolgend

Twee verschillende technieken, het waard om te onderscheiden.

Naast elkaar stuurt dezelfde prompt naar twee modellen die elkaars antwoord niet kunnen zien. Elke kolom houdt zijn eigen verborgen gesprek bij, genoemd met een [Compare]-voorvoegsel en buiten de zijbalk gehouden, zodat vervolgvragen een eerlijke test blijven: beide modellen houden onafhankelijke context over meerdere beurten aan. Dit is het juiste gereedschap om een standaardmodel te kiezen en om feitelijke onenigheid op te sporen.

Opeenvolgend betekent een antwoord krijgen, daarna van model wisselen binnen dezelfde thread en het nieuwe vragen het te bekritiseren. Gebruik het wanneer je de fout gevonden wilt hebben in plaats van een vergelijking gemaakt, omdat het tweede model direct kan ingaan op het specifieke argument. Zie modellen wisselen tijdens een gesprek.

Vuistregel: naast elkaar om te beslissen welk model, opeenvolgend om een antwoord te verbeteren.

Checklist
  • Schrijf en verfijn de prompt in een normale chat voordat je gaat vergelijken
  • Bepaal wat beter betekent voor deze taak voordat je een van beide antwoorden leest
  • Schrijf één zin die een goed antwoord beschrijft, lees daarna pas, om de polijstbias te vermijden
  • Behandel bij feitelijke vragen onenigheid als de bevinding en ga het verifiëren
  • Vergelijk op je eigen echte werk, niet op puzzels
  • Log een week lang de winnaar en de grootte van het verschil, stel dan standaardinstellingen in op basis van het patroon
  • Stop met vergelijken op de taken waar het verschil steevast nihil is

Veelgestelde vragen

Hoeveel modellen kan ik tegelijk vergelijken?

Naast elkaar vergelijken is een Powerhouse-functie en draait twee modellen tegelijk, wat bewust is: twee kolommen is de indeling die je echt zorgvuldig kunt lezen. Drie kolommen leidt al snel tot vluchtig lezen, en vluchtig lezen ondermijnt het doel, omdat de waarde van de oefening juist zit in het opmerken waar de antwoorden werkelijk verschillen.

Gebruikt naast elkaar vergelijken meer van mijn maandelijkse berichten?

Ja, het kost dubbel: twee modellen produceren elk een antwoord, en elk antwoord wordt gefactureerd tegen zijn eigen credit-tarief, dus een model van 10 credits vergelijken met een van 20 credits kost 30 credits in plaats van 10 of 20. Een verkeerd antwoord of een onbruikbare conceptversie opvangen voordat die de deur uitgaat, is dat meestal waard. De efficiënte aanpak is vergelijken bij beslissingen en opleveringen, en een enkel model gebruiken voor routinematige opzoekingen en snelle herschrijvingen.

Wat als beide antwoorden even goed zijn?

Dat is een echt en nuttig resultaat: het vertelt je dat deze taak niet afhangt van modelkeuze, dus stop met er aandacht aan te besteden en gebruik welk model dan ook je standaard is. De meeste workloads splitsen zich op deze manier, met een meerderheid van taken waarbij de modellen uitwisselbaar zijn en een minderheid waarbij het verschil groot is. Uitzoeken welk van beide het geval is, is het doel van een week lang vergelijkingen uitvoeren.

Hoe voorkom ik dat ik gewoon het antwoord kies dat beter klinkt?

Bepaal je criterium voordat je gaat lezen. Langere, zelfverzekerdere en gepolijstere antwoorden worden systematisch geprefereerd, zelfs als ze slechter zijn, en die bias is grotendeels onbewust. Eén zin schrijven over wat een goed antwoord zou moeten bevatten, voordat je kijkt, is genoeg om het grootste deel ervan tegen te gaan. Beoordeel bij feitelijk werk of de bronnen kloppen en de bewering ondersteunen, in plaats van hoe het antwoord leest.

Welke twee modellen moet ik vergelijken?

Vergelijk de twee waartussen je voor die specifieke taak daadwerkelijk aan het beslissen bent, wat voor de meeste mensen Claude tegenover GPT is voor schrijven en redeneren, of een model met een grote context tegenover je standaard wanneer documenten erbij betrokken zijn. Een model dat je nooit zou gebruiken vergelijken met je favoriet, vertelt je niets waar je naar zult handelen.