Jak porovnat AI modely vedle sebe ve Whizi

Krátká odpověď

Chcete-li porovnat AI modely vedle sebe ve Whizi, stiskněte Compare v záhlaví chatu, vyberte model pro každý sloupec a odešlete jeden prompt oběma. Každý sloupec si udržuje vlastní kontext, takže jedna odpověď neovlivňuje druhou. Srovnání vedle sebe je funkce Powerhouse a každá odpověď se účtuje podle kreditové sazby svého modelu.

Stručná odpověď

Stiskněte Compare v záhlaví chatu, vyberte model pro každý sloupec a odešlete jeden prompt oběma. Každý sloupec má vlastní skrytou konverzaci, takže žádný model nevidí výstup toho druhého a žádná odpověď není ovlivněna druhou, což je celý důvod, proč má srovnání smysl. Sloupce se generují postupně, nejprve levý, pak pravý, protože na jeden účet běží najednou jedno generování.

Srovnání vedle sebe je funkce Powerhouse a běží na dva modely najednou. Každá odpověď se účtuje podle kreditové sazby svého modelu, takže srovnání modelu za 10 kreditů s modelem za 20 kreditů stojí 30 kreditů.

Použijte ho k rozhodnutí, který model by měl být váš výchozí pro daný typ práce. Pokud chcete jednu vylepšenou odpověď, ne dvě porovnané, udělejte místo toho něco jiného: přepněte model ve stejném vlákně a požádejte druhý o kritiku prvního.

Proč benchmarky neodpoví na vaši otázku

Publikované benchmarky měří výkon na standardizovaných úlohách. Vaše otázka je užší a praktičtější: který model je lepší v tom, co osobně děláte dvacetkrát týdně. To jsou jiné otázky a ta druhá nemá publikovanou odpověď, protože nikdo jiný nemá vaši pracovní zátěž.

Spustit jeden prompt na dva modely trvá zhruba třicet sekund a odpoví na to přímo. Důležité není, že dostanete dvě odpovědi, ale že zjistíte, jak velký je rozdíl mezi nimi. Někdy jsou výstupy téměř identické, což vám říká, ať u tohoto úkolu přestanete přemýšlet o volbě modelu. Někdy je jeden nepoužitelný, což se vyplatí zjistit dřív, než na něm postavíte celý postup.

Druhá věc, kterou srovnání odhalí, je jistě znějící chyba. Když dva modely dají na faktickou otázku podstatně odlišné odpovědi, alespoň jedna je špatná, a to byste se nedozvěděli, kdybyste četli jen jednu z nich. Tento signál není dostupný v žádném jednomodelovém postupu, ať zaplatíte cokoli.

Rozhodněte, co znamená lepší, ještě než začnete číst

Nástraha při srovnání vedle sebe je preferovat tu odpověď, která je delší, jistější nebo uhlazenější. To není kvalita. Nejprve zvolte kritérium, pak čtěte.

ÚlohaCo znamená lepšíCo ignorovat
PsaníVyžaduje méně úprav, aby bylo odeslatelnéDélka, slovní zásoba, nadšení
Faktický průzkumZdroje, které se dají ověřit a podporují tvrzeníPlynulost a jistota
ExtrakceSprávné schéma, žádná vymyšlená pole, konzistentní popiskyKvalita textu okolo tabulky
UvažováníKroky dávají smysl a hraniční případ je řešenZda závěr sedí s vaším očekáváním
KódŘeší chybové stavy, je čitelný pro reviewVychytralost, stručnost
ShrnutíZachovává podstatné a vynechává nepodstatnéVyčerpávající pokrytí

Praktický trik: než přečtete kteroukoli odpověď, napište si jednu větu popisující, co by dobrá odpověď měla obsahovat. Pak čtěte. Zabere to deset sekund a zabrání to zkreslení leskem, které je silné a většinou nevědomé.

U faktických otázek sledujte spíš neshodu než vítěze. Pokud se dva modely shodnou na konkrétním čísle a zdroji, důvěra je oprávněná. Pokud se rozejdou, právě to je věc, kterou si ověřit, a je to jediný nejcennější výstup celého cvičení.

Prompty, které odhalí skutečné rozdíly

Některé úlohy modely výrazně odliší a jiné ne. Pokud se ze srovnání chcete něco naučit, použijte prompty, které tlačí na konkrétní schopnost.

  • Tón v obtížné situaci. Write a note to a client explaining that we missed the deadline, taking responsibility without over-apologising and without excuses. Under 120 words. Rozdíly v registru se tu projeví okamžitě.
  • Striktní extrakce. Extract every date, amount, and party from this text into a JSON array with exactly these keys. If a field is absent, use null. Do not infer. Testuje disciplínu formátu a sklon si věci vymýšlet.
  • Uvažování s nástrahou. Dejte úlohu s věrohodnou, ale nesprávnou odpovědí, například otázku na sazbu nebo poměr, kde intuitivní postup je chybný. Modely se liší v tom, zda si zvolí zkratku.
  • Vybavování z dlouhého kontextu. Nahrajte dlouhý dokument a zeptejte se na něco uprostřed. Odhalí skutečně použitelný kontext, ne jen ten deklarovaný.
  • Přiznání neznalosti. What was announced about [something genuinely obscure or very recent]? Nejlepší odpověď je jasné „nevím“ nebo doložené vyhledání. Vymýšlení je tady vyřazující.
  • Dodržení negativního omezení. Explain X without using any analogy or metaphor. Dodržování negativních instrukcí se liší víc, než byste čekali.

Spouštějte srovnání na vlastní skutečné práci, ne na hádankách. Model, který je lepší na vaší čtvrtletní zprávě, je užitečnější než ten, který je lepší na logické hádance.

Jak proměnit týden srovnávání ve směrovací mapu

Jedno srovnání je zajímavé. Týden srovnávání je akční. Postup:

  1. Pět dní, kdykoli na úloze skutečně záleží, ji spusťte na dva modely místo jednoho.
  2. Zapište si typ úlohy, vítěze a jak velký byl rozdíl. Tři slova stačí.
  3. Na konci týdne se podívejte, kde jeden model opakovaně vyhrával a kde byly výstupy zaměnitelné.
  4. Podle toho nastavte výchozí modely a přestaňte srovnávat u úloh, kde byl rozdíl trvale nulový.

Lidé obvykle zjistí, že srovnání má smysl u menšiny jejich práce a je zbytečné u zbytku. Rychlé faktické dotazy, jednoduché přepisy a rutinní formátování modely málokdy odliší. Psaní, které si přečte klient, průzkum, který ovlivní rozhodnutí, a uvažování o něčem neznámém je odliší výrazně.

Tento výsledek je odměna: přestanete srovnávat tam, kde to nic nemění, a udržíte to u úloh, kde to výsledek ovlivňuje.

Vedle sebe versus postupně

Dvě odlišné techniky, stojí za to je rozlišovat.

Vedle sebe spustí stejný prompt na dva modely, které nevidí výstup toho druhého. Každý sloupec má vlastní skrytou konverzaci, pojmenovanou s předponou [Compare] a ukrytou z postranního panelu, takže navazující otázky zůstávají férovým testem: oba modely udržují nezávislý víceturnový kontext. Toto je správný nástroj pro volbu výchozího modelu a pro odhalení faktické neshody.

Postupně znamená získat odpověď, pak ve stejném vlákně přepnout model a požádat nový o její kritiku. Použijte to, když chcete najít chybu, ne provést srovnání, protože druhý model se může přímo zapojit do konkrétního argumentu. Viz přepínání modelů uprostřed konverzace.

Zjednodušené pravidlo: vedle sebe pro rozhodnutí, který model, postupně pro vylepšení odpovědi.

Kontrolní seznam
  • Napište a vylaďte prompt v běžném chatu ještě před srovnáváním
  • Rozhodněte, co pro tuto úlohu znamená lepší, ještě než přečtete kteroukoli odpověď
  • Napište jednu větu popisující dobrou odpověď, pak čtěte, abyste se vyhnuli zkreslení leskem
  • U faktických otázek berte neshodu jako zjištění a jděte ji ověřit
  • Srovnávejte na vlastní skutečné práci, ne na hádankách
  • Zapisujte si vítěze a velikost rozdílu po týden, pak podle vzorce nastavte výchozí modely
  • Přestaňte srovnávat u úloh, kde je rozdíl trvale nulový

Časté dotazy

Kolik modelů mohu porovnat najednou?

Srovnání vedle sebe je funkce Powerhouse a běží na dva modely najednou, což je záměr: dva sloupce jsou uspořádání, které lze skutečně pozorně přečíst. Tři sloupce se obvykle mění v prolétávání pohledem a to popírá smysl celého cvičení, protože hodnota tohoto postupu je v tom všimnout si, kde se odpovědi skutečně liší.

Spotřebuje srovnání vedle sebe víc mých měsíčních zpráv?

Ano, stojí to dvakrát tolik: dva modely, každý vytvoří odpověď, a každá odpověď se účtuje podle vlastní kreditové sazby, takže srovnání modelu za 10 kreditů s modelem za 20 kreditů utratí 30 kreditů, ne 10 nebo 20. Odhalit špatnou odpověď nebo nepoužitelný návrh dřív, než se odešle, to obvykle stojí za to. Efektivní přístup je srovnávat u rozhodnutí a výstupů a u rutinních vyhledávání a rychlých přepisů použít jeden model.

Co když jsou obě odpovědi stejně dobré?

To je skutečný a užitečný výsledek: říká vám, že tento úkol nezávisí na volbě modelu, takže na něj přestaňte plýtvat pozorností a použijte ten, který máte jako výchozí. Většina pracovní zátěže se rozděluje takto, s většinou úloh, kde jsou modely zaměnitelné, a menšinou, kde je rozdíl velký. Zjistit, co je co, je smyslem spouštění srovnání po dobu týdne.

Jak se vyhnout tomu, že vyberu jen tu odpověď, která zní lépe?

Rozhodněte své kritérium ještě před čtením. Delší, jistější a uhlazenější výstupy jsou systematicky preferovány, i když jsou horší, a toto zkreslení je do velké míry nevědomé. Napsat jednu větu o tom, co by dobrá odpověď měla obsahovat, ještě než se na ni podíváte, stačí, abyste tomu z velké části zabránili. U faktické práce posuzujte podle toho, zda se zdroje dají ověřit a podporují tvrzení, ne podle toho, jak odpověď zní.

Které dva modely bych měl porovnat?

Porovnejte ty dva, mezi kterými se pro daný úkol skutečně rozhodujete, což je pro většinu lidí Claude proti GPT pro psaní a uvažování, nebo model s velkým kontextem proti vašemu výchozímu, když jsou zapojené dokumenty. Srovnání modelu, který byste nikdy nepoužili, s vaším oblíbeným vám neřekne nic, na základě čeho byste jednali.