Cum să compari modele AI unul lângă altul în Whizi

Răspuns rapid

Pentru a compara modele AI unul lângă altul în Whizi, apasă Compare în antetul conversației, alege un model pentru fiecare coloană, și trimite un singur prompt către ambele. Fiecare coloană își păstrează propriul context, astfel încât niciun răspuns nu este influențat de celălalt. Comparația unul lângă altul este o funcție Powerhouse, iar fiecare răspuns este taxat la rata de credite a modelului propriu.

Răspunsul scurt

Apasă Compare în antetul conversației, alege un model pentru fiecare coloană, și trimite un singur prompt către ambele. Fiecare coloană își păstrează propria conversație ascunsă, astfel încât niciun model nu vede răspunsul celuilalt și niciun răspuns nu este influențat de celălalt, ceea ce este chiar motivul pentru care comparația are vreo valoare. Coloanele se generează una după alta, întâi stânga apoi dreapta, pentru că o singură generare rulează per cont la un moment dat.

Comparația unul lângă altul este o funcție Powerhouse și rulează două modele odată. Fiecare răspuns este taxat la rata de credite a propriului model, deci compararea unui model de 10 credite cu unul de 20 de credite costă 30 de credite.

Folosește această funcție ca să decizi ce model ar trebui să fie implicit pentru un anumit tip de muncă. Dacă vrei ca un singur răspuns să fie îmbunătățit, nu două răspunsuri comparate, fă în schimb cealaltă acțiune: schimbă modelul în același fir de discuție și cere-i celui de-al doilea să critice primul răspuns.

De ce benchmarkurile nu răspund la întrebarea ta

Benchmarkurile publicate măsoară performanța pe sarcini standardizate. Întrebarea ta este mai îngustă și mai utilă: care model se descurcă mai bine la lucrul pe care tu personal îl faci de douăzeci de ori pe săptămână. Sunt întrebări diferite, iar a doua nu are un răspuns publicat pentru că nimeni nu are volumul tău de muncă.

Rularea unui prompt pe două modele durează aproximativ treizeci de secunde și răspunde direct la întrebare. Partea importantă nu este că obții două răspunsuri, ci că afli cât de mare este diferența dintre ele. Uneori răspunsurile sunt aproape identice, ceea ce îți spune să nu mai te gândești la alegerea modelului pentru sarcina respectivă. Alteori unul dintre ele este inutilizabil, lucru bine de știut înainte să construiești un flux de lucru pe baza lui.

Celălalt lucru pe care comparația îl prinde este eroarea prezentată cu încredere. Când două modele oferă răspunsuri substanțial diferite la o întrebare factuală, cel puțin unul greșește, și nu ai fi știut asta citind doar unul dintre ele. Acest semnal nu este disponibil într-un flux de lucru cu un singur model, indiferent de preț.

Decide ce înseamnă mai bun înainte să citești

Capcana în comparația unul lângă altul este preferința pentru orice răspuns e mai lung, mai încrezător sau mai lustruit. Acestea nu sunt semne de calitate. Alege-ți întâi criteriul, apoi citește.

SarcinăCe înseamnă mai bunCe să ignori
ScriereAre nevoie de mai puțină editare pentru a fi trimisLungime, vocabular, entuziasm
Cercetare factualăSurse care se verifică și susțin afirmațiaFluența și încrederea
ExtragereSchemă corectă, fără câmpuri inventate, etichete consistenteCalitatea prozei din jurul tabelului
RaționamentPașii se susțin și cazul special este tratatDacă concluzia se potrivește cu părerea ta inițială
CodTratează calea de eșec, este ușor de revizuitIngeniozitate, concizie
RezumarePăstrează ce contează și elimină ce nu conteazăExhaustivitate

Un truc practic: înainte să citești oricare dintre răspunsuri, scrie o propoziție care descrie ce ar conține un răspuns bun. Apoi citește. Durează zece secunde și previne părtinirea față de lustruire, care este puternică și în mare parte inconștientă.

Pentru întrebările factuale, verifică dezacordul, nu câștigătorul. Acolo unde două modele sunt de acord asupra unui număr specific și a unei surse, încrederea este rezonabilă. Acolo unde diverg, acela este lucrul de verificat, și este cel mai valoros rezultat al întregului exercițiu.

Prompturi care expun diferențe reale

Unele sarcini separă modelele clar, altele nu. Dacă vrei să înveți ceva dintr-o comparație, folosește prompturi care pun presiune pe o capacitate specifică.

  • Ton în situații dificile. Scrie o notă pentru un client explicând că am ratat termenul limită, asumându-ne responsabilitatea fără a ne scuza excesiv și fără scuze. Sub 120 de cuvinte. Diferențele de registru apar imediat aici.
  • Extragere strictă. Extrage fiecare dată, sumă și parte din acest text într-un array JSON cu exact aceste chei. Dacă un câmp lipsește, folosește null. Nu deduce. Testează disciplina formatului și tendința de a inventa.
  • Raționament cu o capcană. Oferă o problemă cu un răspuns greșit plauzibil, cum ar fi o întrebare de rată sau proporție unde ruta intuitivă e incorectă. Modelele diferă în privința luării scurtăturii.
  • Memorare pe context lung. Încarcă un document lung și întreabă despre ceva de la mijloc. Dezvăluie contextul real utilizabil, nu cel promovat.
  • Recunoașterea necunoașterii. Ce s-a anunțat despre [ceva cu adevărat obscur sau foarte recent]? Cel mai bun răspuns este un clar "nu știu" sau o preluare cu sursă. Fabricarea aici este descalificantă.
  • Respectarea unei constrângeri negative. Explică X fără să folosești nicio analogie sau metaforă. Respectarea instrucțiunilor negative variază mai mult decât te-ai aștepta.

Rulează comparațiile pe munca ta reală, nu pe puzzle-uri. Un model mai bun la raportul tău trimestrial este mai util decât unul mai bun la o ghicitoare logică.

Transformarea unei săptămâni de comparații într-o hartă de rutare

O singură comparație este interesantă. O săptămână de comparații poate fi pusă în practică. Rutina:

  1. Timp de cinci zile, ori de câte ori o sarcină contează, rulează-o pe două modele în loc de unul.
  2. Notează tipul sarcinii, câștigătorul, și cât de mare a fost diferența. Trei cuvinte sunt suficiente.
  3. La sfârșitul săptămânii, uită-te unde un model a câștigat repetat și unde răspunsurile au fost interschimbabile.
  4. Setează-ți valorile implicite pe baza asta, și oprește comparațiile la sarcinile unde diferența a fost constant nulă.

Ce descoperă de obicei oamenii este că o comparație contează pentru o minoritate din munca lor și e o pierdere de timp pentru restul. Căutările factuale rapide, rescrierile simple și formatarea de rutină rareori separă modelele. Scrierea care va fi citită de un client, cercetarea care va fundamenta o decizie și raționamentul despre ceva nefamiliar le separă mult.

Acel rezultat este recompensa: nu mai compari acolo unde nu contează și păstrezi comparația pentru sarcinile unde schimbă rezultatul.

Unul lângă altul versus secvențial

Două tehnici diferite, care merită diferențiate.

Unul lângă altul rulează același prompt pe două modele care nu își pot vedea reciproc răspunsul. Fiecare coloană își păstrează propria conversație ascunsă, numită cu un prefix [Compare] și ținută în afara barei laterale, astfel încât întrebările de urmărire rămân un test corect: ambele modele păstrează context independent pe mai multe replici. Acesta este instrumentul potrivit pentru a alege un model implicit și pentru a prinde dezacorduri factuale.

Secvențial înseamnă să obții un răspuns, apoi să schimbi modelul în același fir de discuție și să-i ceri noului model să-l critice. Folosește această metodă când vrei ca defectul să fie găsit, nu o comparație făcută, pentru că al doilea model se poate implica direct cu argumentul specific. Vezi schimbarea modelelor în mijlocul conversației.

Regulă aproximativă: unul lângă altul pentru a decide ce model, secvențial pentru a îmbunătăți un răspuns.

Listă de verificare
  • Scrie și rafinează promptul într-o conversație normală înainte de a compara
  • Decide ce înseamnă mai bun pentru această sarcină înainte să citești vreun răspuns
  • Scrie o propoziție care descrie un răspuns bun, apoi citește, ca să eviți părtinirea față de lustruire
  • La întrebările factuale, tratează dezacordul ca fiind descoperirea și mergi să îl verifici
  • Compară pe munca ta reală, nu pe puzzle-uri
  • Notează câștigătorul și mărimea diferenței timp de o săptămână, apoi setează valorile implicite pe baza tiparului
  • Oprește comparațiile la sarcinile unde diferența este constant nulă

Întrebări frecvente

Câte modele pot compara odată?

Comparația unul lângă altul este o funcție Powerhouse și rulează două modele odată, ceea ce este intenționat: două coloane reprezintă structura pe care chiar poți să o citești cu atenție. Trei coloane tind să devină o citire în fugă, iar citirea în fugă anulează scopul, pentru că valoarea exercițiului stă în observarea locurilor unde răspunsurile chiar diferă.

Comparația unul lângă altul folosește mai multe din mesajele mele lunare?

Da, costă dublu: două modele produc fiecare un răspuns, iar fiecare răspuns este taxat la rata proprie de credite, deci compararea unui model de 10 credite cu unul de 20 de credite cheltuiește 30 de credite, nu 10 sau 20. Prinderea unui răspuns greșit sau a unei ciorne inutilizabile înainte să fie livrată merită de obicei acest cost. Abordarea eficientă este să compari la decizii și livrabile, și să folosești un singur model pentru căutări de rutină și rescrieri rapide.

Ce se întâmplă dacă ambele răspunsuri sunt la fel de bune?

Acesta este un rezultat real și util: îți spune că sarcina asta nu depinde de alegerea modelului, deci nu mai cheltui atenție pe ea și folosește orice model îți este implicit. Majoritatea volumelor de muncă se împart astfel, cu o majoritate de sarcini unde modelele sunt interschimbabile și o minoritate unde diferența este mare. Aflarea care este care este scopul rulării comparațiilor timp de o săptămână.

Cum evit să aleg pur și simplu răspunsul care sună mai bine?

Decide-ți criteriul înainte să citești. Răspunsurile mai lungi, mai încrezătoare și mai lustruite sunt preferate sistematic chiar și atunci când sunt mai slabe, iar această părtinire este în mare parte inconștientă. Scrierea unei propoziții despre ce ar conține un răspuns bun, înainte să te uiți, este suficientă pentru a contracara cea mai mare parte din ea. Pentru munca factuală, judecă în funcție de dacă sursele se verifică și susțin afirmația, nu în funcție de cum sună răspunsul.

Ce două modele ar trebui să compar?

Compară cele două între care chiar te decizi pentru sarcina respectivă, ceea ce pentru majoritatea oamenilor înseamnă Claude versus GPT pentru scriere și raționament, sau un model cu context mare versus modelul tău implicit atunci când sunt implicate documente. Compararea unui model pe care nu l-ai folosi niciodată cu preferatul tău nu îți spune nimic pe baza căruia să acționezi.