Det korta svaret
Dra PDF:en till meddelanderutan eller klicka på gemikonen för att bifoga den, och ställ sedan din fråga med vanliga ord. Alla modeller på ditt paket kan läsa den, och du kan byta modell mot samma fil utan att ladda upp den igen.
Gör en sak innan du litar på ett svar: be modellen citera det avsnitt den använde. Verktyg som söker i en fil istället för att läsa den i sin helhet hittar avsnitt utifrån betydelse, och vad är embeddings inom AI förklarar hur. Ett självsäkert svar hämtat från träningsdata istället för från din fil är det fel som kostar folk pengar, och en lokaliseringsfråga avslöjar det på cirka tio sekunder. Resten av den här sidan handlar om hur du gör det på bästa sätt.
Bekräfta först att den läser ditt dokument
Det farligaste felet vid dokumentchatt är inte ett felaktigt svar, det är ett självsäkert svar hämtat från träningsdata istället för från din fil. Det händer oftast med dokument som liknar något vanligt: ett standardhyresavtal, en välkänd förordning, en flitigt diskuterad artikel. Modellen känner genren så väl att den kan producera ett rimligt svar utan att konsultera din specifika text, och ingenting i svaret signalerar att det skedde.
En vana löser detta. Innan du ställer din riktiga fråga, ställ en lokaliseringsfråga.
Citera avsnittet i det bifogade dokumentet som handlar om [ämne], och ange sidan eller avsnittet det finns i. Om det inte finns i dokumentet, säg det.
Om den returnerar ett verkligt citat läser den din fil. Om den producerar en generisk omskrivning eller inte kan hitta något du vet finns där har extraktionen misslyckats och varje efterföljande svar är tvivelaktigt. Det tar tio sekunder och det är skillnaden mellan ett verktyg och en risk.
Ta med vanan in i de riktiga frågorna också: Citera den exakta text som stöder ditt svar bör finnas i varje prompt vars svar kommer att användas som underlag.
Välja modell för dokumentet
| Dokument | Modell | Varför |
|---|---|---|
| Rapporter på 100+ sidor, arkivhandlingar, hela avtalspaket | Gemini | Ett kontextfönster på 1 000 000 token, så dokumentet finns verkligen med istället för att styckas upp |
| Avtal, policyer, allt där formuleringar spelar roll | Claude | Bäst på nyanser och på att säga vad ett dokument inte säger |
| Fakturor, formulär, korta strukturerade filer | GPT | Snabb, och mest pålitlig vid strikt extraktion till tabeller eller JSON |
| Artiklar med figurer, skannade sidor, diagram | Valfri multimodal modell | Läser sidan som en bild där textextraktion inte räcker till |
Poängen med kontextfönstret är värd att förklara. När ett dokument överstiger vad en modell kan hålla måste det behandlas i delar, och frågor som kräver hela dokumentet samtidigt (motsäger något här paragraf 14, är det här begreppet definierat någonstans, vilket av dessa tre avsnitt är inkonsekvent) blir opålitliga. Det är den specifika anledningen att välja modellen med stort kontextfönster för långa filer istället för en allmän preferens.
Du kan byta modell utan att ladda upp igen, så läs med en och extrahera med en annan mot samma fil. Se byta modell mitt i en konversation.
Prompter per dokumenttyp
Avtal och kontrakt
Extrahera från det bifogade avtalet till en tabell: löptid och förlängning, uppsägningstid, betalningsvillkor, ansvarsbegränsning, skadeersättningar, tillämplig lag, överlåtelse och alla klausuler som gäller efter avtalets upphörande. Ange för varje punkt klausulnumret och citera den avgörande satsen. Lista sedan separat de skyldigheter som ligger på oss snarare än på dem.
Följ upp med frågan som faktiskt spelar roll: Vad i det här avtalet är ovanligt jämfört med standardvillkor för den här typen av kontrakt, och vad saknas märkbart? Det som saknas är oftast där risken finns, och det är något en sökning på nyckelord aldrig kan hitta.
Forskningsartiklar
Från den bifogade artikeln, returnera: forskningsfrågan, studiens utformning, urval och population, det primära utfallet, huvudresultatet med dess effektstorlek, de angivna begränsningarna och finansieringskällan. Berätta sedan vilka tre påståenden i artikeln som skulle behöva verifieras oberoende innan jag citerar dem.
Långa rapporter och arkivhandlingar
Sammanfatta den bifogade rapporten i 10 punkter, ordnade efter betydelse snarare än dokumentordning. Lista sedan: de tre siffrorna en beslutsfattare skulle bry sig om med sidhänvisningar, allt rapporten framställer som fakta utan källa, och alla platser där sammanfattningen eller den inledande delen inte stämmer med detaljerna längre fram i dokumentet.
Den sista kontrollen hittar överraskande ofta verkliga problem. Sammanfattningar skrivs tidigt och redigeras mindre än de avsnitt de sammanfattar.
Jämföra två dokument
Jämför contract-a.pdf och contract-b.pdf klausul för klausul. Returnera en tabell över varje väsentlig skillnad: ämne, vad A säger, vad B säger och vilket som gynnar oss. Bortse från skillnader i formatering och numrering. Lista separat allt som finns i det ena men saknas i det andra.
Göra det till något du kan använda
Skriv om resultaten för en ledningsgrupp på 150 ord. Börja med beslutet som krävs. Ingen jargong som inte förklaras. Flagga allt jag bör verifiera innan detta skickas vidare.
Felsökning
"Jag kan inte se ett dokument." Bekräfta att filen har laddats upp helt, och referera sedan till den uttryckligen med namn i ditt meddelande. I väldigt långa trådar går det snabbare att bifoga filen på nytt eller starta en ny chatt med bara filen än att argumentera om det.
Skannad PDF, oläsbar eller saknad text. Dokumentet är en bild, så vanlig textextraktion har lite att läsa. Whizi upptäcker en bildtung PDF utifrån hur lite text sidorna ger och skickar den en gång genom en serverbaserad synanalys som returnerar en transkription per sida. Noggrannheten sjunker vid låg upplösning, ovanliga typsnitt, handskrift och täta tabeller. Eftersom en felläst siffra är osynlig i ett flytande svar bör du kontrollera varje siffra från ett skannat dokument mot originalsidan.
Tabeller blir fel. PDF-tabeller är notoriskt dåligt strukturerade under ytan. Be att tabellen återges ordagrant först, kontrollera den mot sidan och be först därefter om analys. Vid tungt tabellarbete är en multimodal modell som läser sidan som en bild ofta mer pålitlig än textextraktion.
Den missade något du vet finns där. Ställ lokaliseringsfrågan. Om modellen inte kan citera ett avsnitt du kan se är problemet extraktionen snarare än resonemanget. Prova en annan modell, eller ladda upp bara de relevanta sidorna.
Filen är för stor. Använd modellen med stort kontextfönster, eller dela upp efter syfte snarare än sidantal. Att ladda upp de tre avsnitt du faktiskt behöver slår att ladda upp 400 sidor och hoppas på det bästa.
Svaren blir vagare ju längre konversationen pågår. Långa trådar samlar kontext som konkurrerar med dokumentet. Starta en ny chatt med filen och en kort beskrivning av vad du behöver.
Verifiera innan du litar på det
Tre kontroller, i ordning efter vikt.
Kräv citat för allt som har betydelse. Ett citerat avsnitt går att kontrollera på några sekunder, en omskrivning gör inte det. Den här enda vanan eliminerar det mesta av risken i dokumentarbete.
Korskontrollera med en andra modell. Ställ samma fråga till en annan modell mot samma fil. Enighet är meningsfullt bevis, oenighet visar exakt var du ska titta. Whizis sida vid sida-jämförelse finns för detta.
Fråga vad den är osäker på. Vilket av dina svar ovan är du minst säker på, och vad i dokumentet är otydligt? Modeller är inte perfekta på självbedömning, men de otydligheter de lyfter fram är oftast äkta otydligheter i källan, vilket är nyttig information om dokumentet i sig.
Och den stående regeln för allt som har konsekvenser, det vill säga juridiskt, finansiellt, medicinskt eller regelmaterial: modellen hittar avsnittet, du gör bedömningen. Det är en läsassistent, inte en rådgivare, och ansvaret för ett beslut som fattas utifrån dess svar är helt och hållet ditt.
- Ställ en lokaliseringsfråga först för att bekräfta att modellen läser din fil
- Kräv ett exakt citat för varje svar som har betydelse
- Använd modellen med stort kontextfönster för långa dokument så att inget styckas bort
- Fråga efter vad som märkbart saknas, inte bara vad dokumentet säger
- Verifiera siffror från skannade dokument mot originalsidan
- Återge tabeller ordagrant och kontrollera dem innan du analyserar dem
- Korskontrollera allt viktigt mot en andra modell
Vanliga frågor
Vad är den maximala PDF-storleken?
På webbplatsen kan varje uppladdad fil vara upp till 100 MB, och ett meddelande kan innehålla upp till 6 filer, iOS-appen begränsar en fil till 10 MB. Inom det spannet är den verkliga begränsningen modellens kontextfönster snarare än filtaket. Gemini i Whizi har ett kontextfönster på 1 000 000 token, vilket är varför den rekommenderas för långa rapporter, arkivhandlingar och avtalspaket med flera dokument. Utöver det, ladda upp de avsnitt du faktiskt behöver istället för hela dokumentet, eftersom riktad kontext oftast ger ett skarpare svar också.
Sparar Whizi mina PDF-filer?
Uppladdade filer lagras under ditt konto, är inställda på att gå ut efter upp till 30 dagar och kan raderas tidigare när du vill. Whizi använder inte dina prompter, filer, konversationer, rösttranskriptioner eller genererat innehåll för att träna Whizi-ägda AI-modeller, och säljer inte det innehållet som träningsdata. Att radera en fil tar inte bort det som redan diskuterats om den i konversationen, så om dokumentet är känsligt nog för att motivera radering, radera chatten också.
Kan jag chatta med flera PDF-filer samtidigt?
Ja, och jämförelse mellan dokument är där det är mest värdefullt. Ladda upp flera filer till samma tråd och referera till dem med namn i dina prompter, annars väljer modellen själv vilken den svarar utifrån utan att säga det. Klausul för klausul-jämförelse av avtal, att sammanställa resultat från flera rapporter och att hitta motsägelser mellan dokument kräver alla att allt finns tillgängligt samtidigt, vilket är en till anledning att använda modellen med stort kontextfönster.
Fungerar det med skannade PDF-filer?
Ja. Whizi upptäcker en skannad eller bildtung PDF utifrån hur lite text sidorna ger och transkriberar den sida för sida genom en serverbaserad synanalys. Noggrannheten är bra på rena skanningar och sjunker vid låg upplösning, ovanliga typsnitt, handskrift och täta tabeller. Eftersom ett feltolkat tecken ger en felaktig siffra i ett annars flytande svar bör du kontrollera varje siffra från ett skannat dokument mot originalsidan.
Hur vet jag att svaret faktiskt kom från mitt dokument?
Kräv ett citat. Be modellen citera det exakta avsnittet som stöder svaret tillsammans med sidan eller avsnittet, och att tydligt säga om informationen inte finns i dokumentet. Svar hämtade från träningsdata istället för från din fil är det farligaste felet vid dokumentchatt, just eftersom de är rimliga för vanliga dokumenttyper, och att kräva ett verifierbart citat är det enda pålitliga sättet att se skillnaden.