Proč AI lže a dává špatné odpovědi, a jak to odhalit dřív, než vás to stojí peníze

Krátká odpověď

AI lže a dává špatné odpovědi, protože vytváří text, který odpovídá vzoru správné odpovědi, a nic v tomto procesu neověřuje, zda je odpověď pravdivá. Chyby se kupí kolem konkrétních faktů, citací, všeho po datu ukončení trénování, aritmetiky a sugestivních otázek. Nejrychlejší kontrola je položit stejnou otázku druhému modelu od jiné společnosti.

Nic v procesu neověřuje, že je odpověď pravdivá

Když se zeptáte AI chatbota na něco, nic nikde nevyhledává. Vytváří text, znak po znaku, který odpovídá vzoru, jakým bývá zapsaná správná odpověď na danou otázku. To je celý úkol. Odpovídat vzoru a být pravdivý jsou dva různé cíle, a nic v tomto procesu nemíří na ten druhý.

Většinu času si toho nevšimnete, protože se oba cíle překrývají. Text, ze kterého se tyto systémy učily, psali převážně lidé, kteří měli většinou pravdu, takže text vypadající jako odpověď je obvykle i text pravdivý. Překryv se ztenčuje na okrajích: u faktů, které jsou vzácné, nedávné, velmi konkrétní, nebo prostě chybí v tom, co model četl. Na těchto okrajích je stále snadné vytvořit tvar správné odpovědi. Vytvořit její obsah už ne. Dostanete větu postavenou jako fakt, s číslem na správném místě a věrohodně znějícím jménem, popisující něco, co se nikdy nestalo.

To také vysvětluje, proč selhává očividná další otázka. "Jsi si jistý?" působí jako kontrola. Není. Souhlas odpovídá vzoru užitečné odpovědi, takže tlak obvykle vede k souhlasu, a model se často omluví a nahradí správnou odpověď horší. Vyzkoušejte to za dvě minuty: zeptejte se na něco, co už znáte, přijměte správnou odpověď, pak řekněte "to mi nesedí" a sledujte, co se stane. Vrátí se stejné soukolí generující souhlasný text. Základní verzi toho, jak je to celé postavené, bez matematiky, popisuje co je to vlastně AI.

Pět míst, kde chybuje nejčastěji

Chyby nejsou rozprostřené rovnoměrně na všechno, na co se můžete zeptat. Kupí se. Naučit se pět shluků vám dá malý vnitřní alarm, který se spustí ve správnou chvíli, což má větší cenu než obecný pocit opatrnosti, který zvoní neustále a pak přestane zvonit úplně.

Kde to uklouzneJak to vypadáPříklad na jeden řádek
Konkrétní fakta a číslaPřesné číslo, za kterým nic nestojíŘekne vám, že místní obchod otevřel v roce 1987, přitom otevřel v roce 1994
Citace, cituje, odkazyVěrohodně znějící názvy, věrohodně vypadající URL, žádná se nenačteStudie od dvou skutečných výzkumníků, ve skutečném časopise, která nikdy nebyla napsána
Cokoliv po datu ukončení trénováníSebejisté odpovědi o světě, který se před měsíci zastavilCituje loňskou cenu předplatného u plánu, který se změnil v březnu
Aritmetika a počítáníSprávný postup, špatný součetSečte jedenáct položek na faktuře a spletě se o 40 dolarů
Otázky, které v sobě nesou vlastní odpověďSouhlas přestrojený za analýzu"Proč je X lepší volba?" vrátí argumenty pro X a nikdy je nezpochybní

Řádek s citacemi má na sobě slavnou cenovku. V červnu 2023 federální soudce udělil pokutu $5,000 dvěma newyorským právníkům a jejich firmě za podání s odvoláním na šest soudních případů, které si ChatGPT vymyslel, včetně jmen, citací a citovaných pasáží (Mata v. Avianca). Poslední řádek si ale způsobíte sami, a v praxi je nejčastější. Otázka "proč je X lepší než Y" téměř zaručeně přinese argumenty pro X, a otázka obsahující "jistě" nebo "není pravda, že" obvykle dostane odpověď ano. Zkuste místo toho: "Porovnej X a Y pro tuto situaci a pak mi dej nejsilnější argument proti tomu, který sis vybral." Formulovat otázky tak, aby v sobě nepašovaly odpověď, je polovina toho, čemu se říká prompting, a zbytek popisuje jak mluvit s AI. Ještě jedna zvláštnost, kterou je dobré znát včas. Ve velmi dlouhé konverzaci, nebo po vložení velmi dlouhého dokumentu, mohou detaily ze začátku modelu vypadnout z dohledu, a on díru raději zaplní, než aby přiznal, že ztratil nit. Je to limit kapacity, ne problém s pravdou, a co je to kontextové okno vysvětluje, kde ten strop leží.

Sebejistý tón není blaf

Většina lidí sem přichází s rozumným předpokladem: ta věc ví, jak moc si je jistá, a pochybnost skrývá, aby vypadala kompetentně. Ten předpoklad je špatný, a záleží na tom, protože vás pošle hledat signál jistoty, který tam nikdy nebyl.

Žádný ukazatel jistoty před vámi tajen není. Systém nesedí na soukromém čísle, které ukazuje 62 procent, a nevolí si vyznít jako 100. Špatnou odpověď generuje stejným procesem, stejně plynule, jako správnou. Právě proto je tón zde jako signál k ničemu, jinak než u lidí. I fráze jako "nejsem si úplně jistý, ale" je stejně tak generovaný text. Objeví se, protože taková formulace odpovídá vzoru otázek tohoto typu. Žádný vnitřní alarm se nespustil. Požádejte model, ať ohodnotí vlastní jistotu na deset bodů, a dostanete číslo, často vysoké, přímo vedle citace, kterou si vymyslel. Hodnocení vzniklo stejným procesem jako ta citace.

Takže pokyny typu "odpověz jen pokud si jsi jistý" nebo "nic si nevymýšlej" pomáhají méně, než lidé doufají. Přidat k důležité otázce "pokud nevíš, řekni, že nevíš" se přesto vyplatí, protože novější modely odmítají odpovědět častěji než dřív, ale berte to jako pobídku, ne záruku. Spolehlivější verze té myšlenky míří ven: ať odpověď ukáže něco, co si můžete sami otevřít. Když aplikace prohledá web a připojí odkazy, můžete si stránku sami přečíst a přestat věřit jejímu slovu. Když odpovídá jen z paměti, jeho slovo je vše, co máte.

Čtyři kontroly, seřazené od nejlevnější

Neověříte všechno, a snaha o to skončí tím, že neověříte nic. Chcete kontrolu, která stojí méně než samotná chyba. Tyto čtyři jdou od téměř zdarma po mírně otravné, a u většiny otázek stačí ta první, po které sáhnete.

  1. Požádejte o zdroje, pak je otevřete. Ne "cituj své zdroje" jako rituál. Klikněte na ně. Mrtvý odkaz, nebo živá stránka, která tvrzení neobsahuje, vyřeší otázku za deset vteřin.
  2. Zeptejte se znovu v nové konverzaci. Stejná otázka, nová konverzace, žádná předchozí výměna. Pokud se čísla, jména nebo data vrátí jinak, model spíš zaplňoval mezery než si něco pamatoval. Nic to nestojí a odhalí to překvapivě velký podíl vymyšlených detailů.
  3. Zeptejte se jiného modelu. Nejcennější kontrola pro faktické otázky. Vložte stejnou otázku druhému poskytovateli a porovnejte konkrétní detaily, ne tón.
  4. Vyhledejte to běžným způsobem. U všeho, co pošlete, podepíšete, zveřejníte nebo za to zaplatíte, věnujte devadesát vteřin vyhledávači. AI je vynikající první krok. První krok není ověření.

Bod tři si své místo zaslouží. Dva modely od různých firem, trénované na jiných datech jinými metodami, se můžou u stejné otázky mýlit oba. Jen velmi zřídka si ale vymyslí stejný chybný detail, protože smyšlený konkrétní údaj vychází z konkrétních mezer jednoho konkrétního systému. Když vám Claude a ChatGPT nezávisle na sobě dají stejné číslo, to číslo je pravděpodobně skutečné. Když se neshodnou, našli jste přesně tu větu, kterou stojí za to ověřit, a to je lepší než neurčitý pocit, že s odpovědí něco nesedí. Pro občasnou kontrolu stačí bezplatné verze dvou poskytovatelů a nic to nestojí. Přestává to být zadarmo, jakmile se křížové ověřování stane zvykem, protože placený přístup vychází zhruba na 20 dolarů měsíčně za poskytovatele, a přesně tuhle mezeru zaplňuje předplatné s více modely, jako je Whizi. Používání více modelů společně provede celým postupem.

Kde na tom záleží, a kde vůbec ne

Návyk ověřovat úplně všechno se zhroutí do týdne. Většina toho, na co se ptáte, je nízkoriziková a sama se kontroluje. Požádejte o kratší verzi vlastního e-mailu a hned uvidíte, jestli je kratší a jestli pořád říká, co jste chtěli. Stejné to je s brainstormingem, pojmenováváním věcí, osnovami, koncepty, překladem zprávy, kterou si přečtete před odesláním, nebo přeměnou zmatených poznámek na seznam. Kontrolu děláte vy sami a chyba se objeví přímo před vámi hned.

Dvě otázky roztřídí jakýkoli úkol do správné přihrádky a zabere to asi tři vteřiny.

  1. Pokud je to špatně, kdo na to přijde a kdy? Vy, za deset vteřin při čtení, nebo klient, za tři měsíce?
  2. Dá se to vrátit zpět? Smazat špatný odstavec je zadarmo. Přepodat daňové přiznání, stáhnout nabídku nebo vrátit platbu ne.

Pokud vás u jedné z otázek zarazí odpověď, ověřte každé konkrétní tvrzení dřív, než začnete jednat. Jasní kandidáti do té přihrádky: názvy a dávkování léků, právní a podací lhůty, daňové údaje, smluvní podmínky, cokoliv týkající se něčího zdraví nebo imigračního statusu, a kód, který hýbe penězi nebo pracuje s osobními údaji. Špatné synonymum v e-mailu vás na den udělá trochu divným. Špatné dávkování nebo zmeškaná lhůta není něco, co AI vyřeší za vás dodatečně. Zda je AI bezpečné používat rozebírá tuhle stránku podrobněji, včetně toho, co byste tam nikdy neměli vkládat. Začněte jedním návykem: jakmile odpověď obsahuje číslo, jméno, datum nebo odkaz, považujte právě tuto část za neověřenou a zkontrolujte ji. Zbytek bývá v pořádku.

Kontrolní seznam
  • Považujte každé číslo, jméno, datum a odkaz v odpovědi za neověřené, dokud to sami nezkontrolujete.
  • Přestaňte používat "jsi si jistý?" jako test, protože tlak vyvolá souhlas, ne opravu.
  • Požádejte o zdroje, otevřete je a ověřte, že stránka skutečně říká to, co odpověď tvrdila.
  • Zeptejte se na důležitou otázku znovu v nové konverzaci a sledujte, jestli zůstanou detaily stejné.
  • Faktické otázky ověřte u druhého modelu od jiné společnosti, než se na ně spolehnete.
  • Přeformulujte sugestivní otázky, aby modelu neprozrazovaly, kterou odpověď chcete.
  • Zeptejte se, kdo na chybu přijde a jestli se dá vrátit zpět, a podle toho pak ověřujte.

Časté dotazy

Co je halucinace AI?

Halucinace je sebejistá, dobře zformulovaná odpověď, která prostě není pravdivá: vymyšlená statistika, neexistující citace, funkce, kterou produkt nikdy neměl. Ten název je nešťastný, protože si nic nic nepředstavuje. Systém vytvořil text, který odpovídá vzoru správné odpovědi, a v tomto konkrétním případě se vzor a pravda nepotkaly. Co je halucinace AI vysvětluje, proč je model vytváří a co odhalí druhý model.

Proč si AI něco vymýšlí, místo aby řekla, že to neví?

Říct "nevím" je jen jedna z mnoha odpovědí, které se k otázce hodí, a plynulá odpověď se hodí obvykle lépe. Model nemá žádný samostatný krok, který by fakt ověřil dřív, než ho vytvoří, takže nic nespustí odmítnutí. Novější modely odmítají odpovědět častěji než starší, a přímá žádost o "netuším", pokud opravdu netuší, trochu pomůže.

Lze věřit odpovědím AI?

Věřte úsudku, struktuře a psaní, v tom jsou tyto nástroje opravdu silné. Nevěřte bez ověření konkrétním údajům: číslům, jménům, datům, citátům, citacím a čemukoliv nedávnému. Tohle rozdělení je praktická verze důvěry v tomto kontextu a umožňuje vám používat AI denně, aniž byste se spálili.

Opraví otázka "jsi si jistý?" špatnou odpověď?

Zřídka, a může to zhoršit situaci. Modely mají tendenci ustupovat tlaku, takže často opustí správnou odpověď a nahradí ji slabší. Mnohem lepší test je nová konverzace se stejnou otázkou, protože druhá odpověď vzniká bez tlaku vaší pochybnosti.

Jak rychle zkontroluji odpověď od AI?

Otevřete jakékoli uvedené zdroje a ověřte, že říkají to, co bylo tvrzeno. Pokud žádné zdroje nejsou, položte stejnou otázku v nové konverzaci a sledujte, jestli se detaily shodují. U čehokoliv faktického, na čem plánujete jednat, se zeptejte druhého modelu od jiného poskytovatele, protože dva systémy si jen zřídka vymyslí stejný detail.