Proč vám benchmarky z uvedení na trh neodpoví na otázku
Každé nové vydání přichází s grafem, který ho ukazuje napřed v sadě standardizovaných testů. Tato čísla jsou reálná a zároveň jsou skoro k ničemu pro rozhodnutí, co použít v pondělí, a to ze tří důvodů.
Rozdíly jsou malé a úkoly nejsou vaše. Rozdíl dvou bodů v benchmarku na uvažování vám nic neřekne o tom, zda jeden model napíše lepší e-mail klientovi nebo spolehlivěji udrží schéma napříč dvěma sty řádky.
Benchmarky měří úkoly, které se snadno hodnotí. Věci se správnou odpovědí. Většina profesní práce žádnou nemá: tón, strukturu, úsudek o tom, co vynechat. Právě v tom se modely liší nejvíc a právě tam se nic neměří.
Srovnání při uvedení na trh dělá výrobce. Ne nutně nečestně, ale nikdo nezveřejní hodnocení, ve kterém jejich model skončil druhý.
Otázka, na kterou se vyplatí odpovědět, je užší: u konkrétních úkolů, které děláte dvacetkrát týdně, který z těch dvou je lepší? Na to žádná zveřejněná odpověď neexistuje a zjistíte ji za zhruba hodinu.
Co se mezi vydáními skutečně obvykle mění
V posledních vydáních nejnovějších modelů jsou zlepšení, na kterých záleží v denním používání, soustavně ve stejných oblastech, a jen málokdy jsou to ty, které vyzdvihuje oznámení.
| Co se zlepšilo | Jak to poznáte | Zda to ukazuje benchmark |
|---|---|---|
| Dodržování instrukcí | Přestane ignorovat vaše třetí omezení | Zřídka |
| Negativní instrukce | "Nepoužívej analogie" se skutečně dodrží | Ne |
| Zapamatování dlouhého kontextu | Najde věc na straně 140, ne jen na straně 3 | Částečně |
| Disciplína formátování | Tabulka má sloupce, které jste chtěli, pokaždé | Ne |
| Kalibrovaná nejistota | Řekne, že to nevím, místo vymýšlení | Ne |
| Kontrola tónu | Méně přepisů, než je něco odeslatelné | Ne |
| Hloubka uvažování | Odhalí okrajový případ, který jste přehlédli | Ano, tohle měří |
Pět z těch sedmi je v grafu benchmarku nevidět a jsou důvodem, proč se s novým modelem pracuje lépe nebo hůř. Dodržování instrukcí je konkrétně rozdíl mezi prvním návrhem, který upravíte, a prvním návrhem, který zahodíte.
Hodinové hodnocení
Dělejte tohle místo čtení pokrytí uvedení na trh. Spusťte oba modely vedle sebe na vlastním materiálu.
- Vyberte pět reálných úkolů z posledních dvou týdnů. Skutečné, s vloženým reálným kontextem, ne testovací prompty. Zařaďte alespoň jeden psací úkol, jeden úkol se strukturovaným výstupem a jeden, kde jste potřebovali uvažovat o něčem neznámém.
- Předem si napište, co má dobrá odpověď obsahovat, pro každý úkol jednou větou, dřív než cokoli spustíte. Tento krok vás chrání před tím, abyste dali přednost výstupu, který je jen delší a jistější, což je silné a z velké části nevědomé zkreslení.
- Spusťte každý úkol proti oběma modelům paralelně, aby jedna odpověď nebyla ukotvená druhou.
- Hodnoťte podle množství úprav, tedy kolik práce leží mezi výstupem a tím, co byste odeslali. Ne podle toho, jak to zní.
- Zaznamenejte velikost rozdílu, ne jen vítěze. Zaměnitelné výsledky vám říkají, ať u tohoto úkolu přestanete přemýšlet o volbě modelu, což je skutečně užitečné.
- Zápis si uchovejte. Za tři měsíce, když vyjde další vydání, spustíte stejných pět úkolů znovu a dostanete reálnou odpověď za dvacet minut.
Tento poslední bod se kumuluje. Uložená sada hodnocení je jediná věc, díky které je posouzení každého dalšího vydání levné.
Šest promptů, které rozliší nejnovější modely
Obecné otázky vyprodukují podobné odpovědi u jakéhokoli schopného modelu. Chcete-li vidět rozdíl, vyviňte tlak na konkrétní schopnost.
- Tón v obtížné situaci.
Napiš zprávu klientovi, že jsme nestihli termín. Přijmi odpovědnost bez přehnaného omlouvání a bez výmluv. Do 120 slov.Rozdíly v registru se projeví okamžitě. - Negativní omezení.
Vysvětli [pojem] bez použití jakékoli analogie nebo metafory.Dodržování negativních instrukcí kolísá mnohem víc, než byste čekali. - Striktní extrakce.
Extrahuj každé datum, částku a stranu do JSON pole s přesně těmito klíči. Pokud pole chybí, použij null. Nedomýšlej si.Testuje disciplínu formátu a tendenci vyplňovat mezery. - Zapamatování dlouhého kontextu. Nahrajte dlouhý dokument a zeptejte se na něco uprostřed. Odhalí využitelný kontext, což není totéž jako inzerovaný kontext.
- Přiznání neznalosti. Zeptejte se na něco skutečně obskurního nebo velmi aktuálního. Nejlepší odpověď je jasné "nevím" nebo dohledání se zdrojem. Vymýšlení je zde diskvalifikující bez ohledu na jakýkoli benchmark.
- Dodržení více omezení najednou. Dejte šest omezení najednou a spočítejte, kolik z nich přežije. Tento jediný test predikuje běžnou spokojenost lépe než cokoli jiného v tomto seznamu.
Odpověď je obvykle "obojí, na jiné věci"
Lidé přistupují k vydání s touhou po verdiktu, a upřímné zjištění po hodnocení je téměř vždy vyrovnané. Jeden model vede v psaní a tónu. Druhý vede v přísné struktuře a rychlosti. V obecném uvažování jsou natolik blízko, že to nic nerozhoduje.
Není to úlitba, je to skutečný výsledek a má praktický důsledek. Pokud můžete použít jen jeden model, vybíráte si, v jaké kategorii úkolů budete horší. Pokud můžete použít oba, otázka vydání se přestává jmenovat "mám přejít" a stává se "které úkoly se posunou", což je mnohem menší a méně rizikové rozhodnutí.
Také to mění, co pro vás vydání znamená. Když nové modely přistanou v prostoru, kde už jich je několik, znovu spustíte svých pět úkolů, upravíte směrování a jedete dál. Žádná migrace, žádné zrušené předplatné a žádný měsíc používání něčeho horšího, protože jste se zavázali dřív, než jste to otestovali.
Co dělat v den vydání
Nepřepínejte hned výchozí nastavení. Dojmy z prvního týdne ovládá novost a to, jaké ukázky se šíří jako první.
Znovu spusťte svou sadu hodnocení. Dvacet minut, pokud jste ji uchovali z minula.
Zkontrolujte nezajímavé věci. Kontextové okno, zda se vaše stávající prompty chovají stejně a zda se nezměnilo něco, na co jste spoléhali. Model, který je obecně lepší, může být horší na vaší konkrétní šabloně, a to je dobré vědět, než na něj přesunete produkční práci.
Aktualizujte směrování po úkolech, ne najednou. Přesuňte kategorie, ve kterých nový model jasně vyhrál, a zbytek nechte.
Na omezení počkejte čtrnáct dní. Chybové módy nového modelu se projeví přibližně po dvou týdnech širokého používání a málokdy jsou v oznámení.
Obecný rámec najdete v jak vybrat AI model a mechaniku spuštění dvou modelů na jeden prompt v porovnání modelů vedle sebe.
- Vytvořte si sadu pěti reálných úkolů z vlastní práce a uchovejte si ji
- Předem si napište, co má dobrá odpověď obsahovat, dřív než přečtete kterýkoli výstup
- Spusťte oba modely paralelně, aby jeden neukotvil druhý
- Hodnoťte podle množství úprav, ne podle toho, jak výstup zní
- Zaznamenejte velikost rozdílu, protože zaměnitelné výsledky jsou užitečná informace
- Testujte konkrétně negativní omezení a dodržení více omezení najednou
- Před přesunem produkční práce na nový model počkejte čtrnáct dní
- Aktualizujte směrování po úkolech, ne najednou celé
Časté dotazy
Mám přejít na nejnovější model?
Ne v den vydání a ne najednou celé. Znovu spusťte malou sadu vlastních reálných úkolů proti oběma, hodnoťte podle toho, kolik úprav vyžaduje každý výstup, a přesuňte jen ty kategorie, ve kterých nový model jasně vyhrává. Novější model je spolehlivě lepší v některých věcech a příležitostně horší v jiných, zejména u stávajících promptů vyladěných na předchozí verzi.
Proč se benchmarky neshodují s mou zkušeností?
Protože měří to, co se dá automaticky ohodnotit, tedy úkoly se správnou odpovědí. Většina profesní práce jednu jedinou správnou odpověď nemá, a vlastnosti, které rozhodují o denní spokojenosti, tedy dodržování instrukcí, kontrola tónu, disciplína formátování a schopnost říct "nevím", zůstávají z velké části neměřené. Model může vést v každém zveřejněném grafu a přesto se s ním hůř pracuje.
Jak často bych měl znovu hodnotit?
Kdykoli model, který používáte, dostane významné vydání, což je nyní zhruba každých pár měsíců, a navíc jednou za čtvrtletí bez ohledu na to. Uchování fixní sady pěti reálných úkolů z toho udělá dvacetiminutovou práci místo odpoledne a je to jediný způsob, jak si všimnout, že směrování nastavené před šesti měsíci je teď špatně.
Můžu jen použít model, který vede celkově?
Můžete, a budete tím akceptovat horší výsledky u předvídatelné části své práce. Trvalé zjištění při hodnocení na vlastních úkolech je, že jeden model vede v psaní a tónu, zatímco druhý vede v přísné struktuře a rychlosti, s obecným uvažováním natolik blízkým, že nic nerozhoduje. Pokud máte k dispozici oba, volba se stane úkolovou, ne předplatitelskou.
Hraje roli, přes jaký produkt se k modelu dostávám?
Model je model, takže kvalita výstupu je zhruba stejná bez ohledu na to, kde se k němu dostanete. Liší se to, zda můžete porovnávat, zda se kontext přenese při přepnutí a zda vás nové vydání stojí migraci, nebo je jen další volbou ve výběru. Prostor s několika modely změní každé vydání z rozhodnutí na úpravu.