Varför AI ger fel svar, och hur du upptäcker dem innan de kostar dig

Snabbt svar

AI ger fel svar för att den producerar text som passar mönstret för ett korrekt svar, och inget i den processen kontrollerar om svaret faktiskt stämmer. Fel klumpar ihop sig kring specifika fakta, källhänvisningar, allt efter träningsdatumet, aritmetik och ledande frågor. Den snabbaste kontrollen är att fråga en andra modell från ett annat företag.

Inget i processen kontrollerar att svaret stämmer

När du ställer en fråga till en AI-chattbot letar den inte upp något. Den producerar text, några tecken i taget, som passar mönstret för hur ett korrekt svar på den frågan brukar formuleras. Det är hela uppgiften. Att passa mönstret och att stämma är två olika mål, och inget i processen siktar på det andra.

Oftast märker du inget, eftersom de två målen överlappar. Texten dessa system lärde sig av skrevs mestadels av människor som mestadels hade rätt, så svarsformad text är oftast korrekt text också. Överlappningen tunnas ut vid kanterna: fakta som är sällsynta, färska, väldigt specifika eller helt enkelt saknas i det modellen läste. Vid de kanterna är det fortfarande lätt att producera formen av ett rätt svar. Att producera innehållet i ett är det inte. Det du får är en mening byggd som ett faktum, med en siffra på rätt plats och ett trovärdigt klingande namn kopplat till, som beskriver något som aldrig hänt.

Det här förklarar också varför den uppenbara följdfrågan misslyckas. Att fråga "är du säker?" känns som en granskning. Det är det inte. Medhåll passar mönstret för ett hjälpsamt svar, så press tenderar att framkalla medhåll, och en modell ber ofta om ursäkt och ersätter ett korrekt svar med ett sämre. Testa det på två minuter: fråga något du redan vet, acceptera det rätta svaret, säg sedan "det låter inte rätt" och se vad som händer. Det som kommer tillbaka är samma maskineri som genererar tillmötesgående text. För grundversionen av hur allt detta byggs täcker vad AI faktiskt är det utan matematik.

De fem ställen där det oftast går fel

Fel är inte jämnt spridda över allt du kan fråga om. De klumpar ihop sig. Att lära sig de fem klustren ger dig ett litet internt alarm som går igång vid rätt tillfälle, vilket är värt mer än en allmän känsla av försiktighet som ständigt tjuter och sedan slutar tjuta helt.

Var det slinker inHur det ser utEtt exempel i korthet
Specifika fakta och siffrorEn exakt siffra utan något bakom sigSäger att en lokal butik öppnade 1987 när den öppnade 1994
Källhänvisningar, citat, länkarVerklighetstrogna titlar, äkta-lika URL:er, ingen av dem laddarEn studie av två riktiga forskare, i en riktig tidskrift, som aldrig skrevs
Allt efter träningsdatumetSjälvsäkra svar om en värld som slutade för månader sedanAnger förra årets abonnemangspris för ett paket som ändrades i mars
Aritmetik och räkningRätt metod, fel totalsummaSummerar elva fakturarader och hamnar 40 dollar fel
Frågor som bär sitt eget svarMedhåll utklätt till analys"Varför är X det bättre valet?" ger fallet för X och ifrågasätter det aldrig

Källhänvisningsraden bär en berömd prislapp. I juni 2023 bötfällde en federal domare två advokater i New York och deras firma med $5,000 för att ha lämnat in en inlaga byggd på sex rättsfall som ChatGPT hittat på, komplett med namn, källhänvisningar och citerade avsnitt (Mata v. Avianca). Den sista raden är dock den du orsakar själv, och den är vanligast i verklig användning. Att fråga "varför är X bättre än Y" garanterar nästan alltid ett fall för X, och en fråga som innehåller "visst" eller "är det inte sant att" får oftast ett ja. Fråga istället: "Jämför X och Y för den här situationen, ge mig sedan det starkaste argumentet mot vilken du än valde." Att formulera frågor så de inte smugglar in svaret är hälften av det man kallar prompting, och hur du pratar med AI täcker resten. En sak till värd att veta tidigt. I en väldigt lång konversation, eller efter att du klistrat in ett väldigt långt dokument, kan detaljer från början slinka ur modellens synfält, och den fyller igen hålet istället för att säga att den tappat tråden. Det är en kapacitetsbegränsning snarare än ett sanningsproblem, och vad ett kontextfönster är förklarar var taket ligger.

Den självsäkra tonen är inte ett bluff

De flesta kommer hit med ett rimligt antagande: att den vet hur säker den är och döljer tvivlet för att verka kompetent. Det antagandet är fel, och det spelar roll, eftersom det får dig att leta efter en säkerhetssignal som aldrig funnits.

Det finns ingen säkerhetsmätare som hålls dold för dig. Systemet sitter inte på ett privat tal som visar 62 procent och väljer att låta som 100. Det genererar ett felaktigt svar genom samma process, med samma flyt, som ett rätt. Det är precis varför tonläge är värdelöst som signal här, på ett sätt det inte är hos människor. En reservation som "jag är inte helt säker, men" är också genererad text. Den dyker upp för att den formuleringen passar frågor av den formen. Ingen intern varningssignal utlöstes. Be en modell rangordna sin egen säkerhet på en tiogradig skala och du får en siffra, ofta en hög, sittande precis intill en källhänvisning den hittade på. Bedömningen producerades av samma process som källhänvisningen.

Så instruktioner som "svara bara om du är säker" eller "hitta inte på något" hjälper mindre än folk hoppas. Att lägga till "säg att du inte vet om du inte vet" i en viktig fråga är fortfarande värt att göra, eftersom nyare modeller avstår oftare än förr, men se det som en knuff, inte en garanti. Den pålitliga versionen av den idén pekar utåt: se till att svaret visar dig något du kan öppna. När en app söker på webben och bifogar länkar kan du läsa sidan själv och sluta ta dess ord för något. När den svarar rakt ur minnet är dess ord allt du har.

Fyra kontroller, i ordning efter hur lite de kostar

Du kommer inte att verifiera allt, och att försöka slutar med att du inte verifierar något. Det du vill ha är en kontroll som kostar mindre än misstaget skulle göra. Dessa fyra går från nästan gratis till milt irriterande, och för de flesta frågor räcker den första du tar till.

  1. Be om källor, öppna dem sedan. Inte "ange dina källor" som en ritual. Klicka på dem. En död länk, eller en levande sida som inte innehåller påståendet, avgör saken på ungefär tio sekunder.
  2. Fråga igen i en ny chatt. Samma fråga, ny konversation, utan den tidigare fram och tillbaka. Om siffrorna, namnen eller datumen kommer tillbaka annorlunda fyllde modellen igen hål istället för att minnas något. Det här kostar inget och fångar en förvånande andel påhittade detaljer.
  3. Fråga en annan modell. Den enskilt mest värdefulla kontrollen för faktafrågor. Klistra in samma fråga till en annan leverantör och jämför detaljerna, inte tonen.
  4. Sök efter det på vanligt sätt. För allt du kommer skicka, signera, publicera eller spendera pengar på, lägg nittio sekunder i en sökmotor. AI är en utmärkt första genomgång. En första genomgång är inte verifiering.

Punkt tre förtjänar sin plats. Två modeller byggda av olika företag, tränade på olika data med olika metoder, kan båda ha fel om samma fråga. De hittar väldigt sällan på samma felaktiga detalj, eftersom en påhittad specifik detalj kommer ur luckorna i just det systemet. När Claude och ChatGPT oberoende av varandra ger dig samma siffra är den siffran troligen äkta. När de är oense har du hittat exakt den mening som är värd att kontrollera, vilket slår en vag känsla av att något i svaret är fel. För enstaka kontroller räcker de gratis nivåerna hos två leverantörer och kostar inget. Det slutar vara gratis när korskontroll blir en vana, eftersom betald tillgång kostar runt 20 dollar i månaden per leverantör, och det är gapet en flermodellsprenumeration som Whizi täcker. Att använda flera modeller tillsammans går igenom arbetsflödet.

Var det spelar roll, och var det verkligen inte gör det

En verifieringsvana som gäller allt kollapsar inom en vecka. Det mesta du frågar om är lågrisk och självkontrollerande. Be om en kortare version av ditt eget mejl och du kan se om det blev kortare och om det fortfarande säger det du menade. Detsamma gäller idégenerering, namngivning, disposition, utkast, att översätta ett meddelande du läser innan du skickar det, eller att göra om röriga anteckningar till en lista. Du är kontrollen, och misstaget syns direkt framför dig.

Två frågor sorterar vilken uppgift som helst i rätt fack, och de tar ungefär tre sekunder att ställa till dig själv.

  1. Om det här är fel, vem märker det, och när? Du, tio sekunder från nu medan du läser det, eller en klient, tre månader från nu?
  2. Kan jag ångra det? Att radera ett dåligt stycke är gratis. Att göra om en deklaration, ta tillbaka en offert eller reversera en betalning är det inte.

Om något av svaren får dig att tveka, verifiera varje specifikt påstående innan du agerar. De tydliga medlemmarna i det facket: läkemedelsnamn och doseringar, juridiska deadlines och inlämningsdatum, skattesiffror, avtalsvillkor, allt som rör någons hälsa eller uppehållsstatus, och kod som flyttar pengar eller hanterar personuppgifter. Ett felaktigt synonymval i ett mejl gör dig lite lustig i en dag. En felaktig dosering eller en missad deadline är inget AI:n hanterar efteråt. Om AI är säkert att använda täcker den sidan mer på djupet, inklusive vad du aldrig bör klistra in. Börja med en vana: i samma stund ett svar innehåller en siffra, ett namn, ett datum eller en länk, behandla den delen som obekräftad och kontrollera den. Resten är oftast bra.

Checklista
  • Behandla varje siffra, namn, datum och länk i ett svar som obekräftat tills du kontrollerat det.
  • Släpp "är du säker?" som test, eftersom press ger medhåll snarare än rättelse.
  • Be om källor, öppna dem, och bekräfta att sidan faktiskt säger det svaret påstod.
  • Ställ en viktig fråga igen i en ny chatt och se om detaljerna förblir desamma.
  • Ställ faktafrågor till en andra modell från ett annat företag innan du litar på dem.
  • Skriv om ledande frågor så de inte avslöjar vilket svar du vill ha.
  • Fråga vem som märker om det här är fel och om du kan ångra det, verifiera sedan därefter.

Vanliga frågor

Vad är en AI-hallucination?

En hallucination är ett självsäkert, välformulerat svar som helt enkelt inte stämmer: en påhittad statistik, en källhänvisning som inte finns, en funktion en produkt aldrig haft. Namnet är olyckligt, eftersom inget föreställs. Systemet producerade text som passar mönstret för ett korrekt svar, och i det fallet stämde inte mönstret med sanningen. Vad är en AI-hallucination går igenom varför modellen producerar dem och vad en andra modell fångar.

Varför hittar AI på saker istället för att säga att den inte vet?

Att säga "jag vet inte" är bara ett av många svar som passar en fråga, och ett flytande svar passar oftast bättre. Modellen har inget separat steg som kontrollerar ett faktum innan det produceras, så det finns inget som utlöser en vägran. Nyare modeller avstår oftare än äldre, och att direkt be om "ingen aning" när den inte har någon hjälper faktiskt lite.

Kan man lita på AI-svar?

Lita på resonemanget, strukturen och skrivandet, det är där dessa verktyg genuint är starka. Lita inte på detaljerna utan att kontrollera: siffror, namn, datum, citat, källhänvisningar och allt nytt. Den uppdelningen är den praktiska versionen av tillit här, och den gör att du kan använda AI dagligen utan att bränna dig.

Åtgärdar det ett felaktigt svar att fråga "är du säker?"

Sällan, och det kan göra saken värre. Modeller tenderar att tillmötesgå motstånd, så de överger ofta ett korrekt svar och ersätter det med ett svagare. En ny chatt med samma fråga är ett mycket bättre test, eftersom det andra svaret genereras utan pressen från ditt tvivel.

Hur kontrollerar jag ett AI-svar snabbt?

Öppna eventuella källor det gav dig och bekräfta att de säger det som påstods. Om det inte finns några källor, ställ samma fråga i en ny chatt och se om detaljerna håller. För allt faktabaserat du planerar att agera på, ställ det till en andra modell från en annan leverantör, eftersom två system sällan hittar på samma detalj.