Ondersteunde bestandstypen, en wat er echt met elk gebeurt
Voeg het bestand toe door het in het invoerveld te slepen of op de paperclip te klikken, en stel dan je vraag. Wat het model ontvangt verschilt per bestandstype, en weten wat welk is verklaart de meeste verrassende resultaten.
| Type | Extensies | Waar het model mee werkt |
|---|---|---|
| Tekst-PDF's | De geëxtraheerde tekst, in leesvolgorde, inclusief tabellen als tekst | |
| Gescande PDF's | Een transcript per pagina van een serverzijdige visuele verwerking | |
| Worddocumenten | .docx | De documenttekst, geëxtraheerd in je browser |
| Spreadsheets | .xlsx, .csv | Celwaarden als tekst, geen actieve formules |
| Afbeeldingen | .png, .jpg, .jpeg | De afbeelding zelf, gelezen door een multimodaal model |
| Code en platte tekst | .py, .js, .ts, .go, .md, .txt en vergelijkbaar | De bestandsinhoud woordelijk |
Twee gevolgen zijn het onthouden waard. Ten eerste komt een spreadsheet aan als waarden in plaats van als werkend werkblad, dus het model kan lezen wat je formule heeft opgeleverd, maar kan de formule niet opnieuw uitvoeren. Ten tweede is een gescande PDF door een visuele transcriptie gegaan in plaats van gewone tekstextractie, en een ongebruikelijk lettertype, een handgeschreven aantekening, of een scan met lage resolutie kan nog steeds een verkeerd gelezen teken in een getal opleveren. Controleer cijfers uit gescande documenten aan de hand van het origineel. Eén opmerking over afbeeldingen: het invoerveld weigert GIF-bestanden en vraagt in plaats daarvan om een PNG of JPEG.
Bereid het bestand voor voordat je iets vraagt
Vijf minuten hier bespaart later een verwarrend gesprek.
- Noem het bestand naar wat het is. Het model ziet de bestandsnaam, en
2025-q3-vendor-contract-acme.pdfgeeft meer bruikbare context dandocument(3).pdf. Dit wordt nog belangrijker zodra er meerdere bestanden in het gesprek staan. - Stuur de brondata, niet de presentatieversie. Vooral bij spreadsheets veroorzaakt de versie met samengevoegde cellen, subtotalen tussen de data, en notities in de marge veel meer fouten dan een groot, eenvoudig bestand.
- Splits enorme documenten op doel, niet op grootte. Als je alleen de methodologie en resultaten nodig hebt, is het uploaden daarvan beter dan 400 pagina's uploaden en hopen dat de aandacht op de juiste plek terechtkomt.
- Verwijder persoonlijke gegevens die je niet nodig hebt. Namen, e-mailadressen en identificatoren zijn zelden nodig voor de analyse, en ze verwijderen is sneller dan uitzoeken of je toestemming had om ze te uploaden.
- Controleer of een PDF echt tekst bevat. Probeer tekst te selecteren in je PDF-lezer. Kan dat niet, dan is het een scan, zal Whizi hem transcriberen met een visuele verwerking, en verdienen cijfers een controle aan de hand van het origineel.
Het model kiezen voor het bestand
Deze keuze is belangrijker dan de prompt bij documentwerk.
- Gemini voor alles wat lang is. Gemini-modellen in Whizi hebben een contextvenster van 1.000.000 tokens, waardoor een rapport van 200 pagina's, een volledige set contracten, of een dozijn papers in één keer aanwezig kan zijn in plaats van in stukken verwerkt te worden. Vragen over meerdere documenten werken alleen goed als alles echt in de context zit.
- Claude voor nuance. Juridische taal, beleidsdocumenten, alles waarbij de betekenis afhangt van nuancering en voorbehouden. Het is ook het beste in het vertellen wat een document niet zegt, wat vaak de eigenlijke vraag is.
- GPT voor extractie. Facturen, formulieren, gestructureerde data, alles waarbij je een strikte tabel of JSON terug wilt met consistente veldnamen over honderd rijen.
- Elk multimodaal model voor afbeeldingen, grafieken, screenshots en diagrammen. Vraag het eerst te beschrijven wat het ziet voordat je het laat interpreteren, dat vangt verkeerde interpretaties vroeg op.
Je kunt halverwege een gesprek van model wisselen zonder opnieuw te uploaden, dat is het hele punt van het werken in één werkruimte. Lees met Gemini, extraheer met GPT, en laat Claude de samenvatting schrijven, allemaal met hetzelfde bijgevoegde bestand. Zie tussen modellen wisselen tijdens een gesprek.
Werken met meerdere documenten tegelijk
Vragen over één document zijn nuttig. Vragen over meerdere documenten zijn waar dit ophoudt een gemak te zijn en een mogelijkheid wordt die je eerder niet had.
Prompt: vergelijken
Vergelijk contract-a.pdf en contract-b.pdf. Geef een tabel van elke clausule die verschilt: clausule, wat A zegt, wat B zegt, en welke gunstiger is voor ons en waarom. Negeer verschillen in opmaak en nummering. Vermeld clausules die in de ene wel en in de andere niet voorkomen apart.
Prompt: consolideren
Bouw over alle bijgevoegde bestanden één tabel die [vraag] beantwoordt. Eén rij per document, met de documentnaam in de eerste kolom. Als een document het niet behandelt, schrijf dan NIET BEHANDELD. Voeg geen documenten samen die verschillende definities gebruiken zonder dit te vermelden.
Prompt: vind de tegenstrijdigheid
Waar spreken deze documenten elkaar tegen? Citeer beide passages naast elkaar en noem het bestand waar elke vandaan komt. Onderscheid echte tegenstrijdigheden van verschillen in reikwijdte of datum.
Verwijs in je prompt altijd naar bestanden bij naam zodra er meer dan één zijn. "Wat is de opzegtermijn in de leveranciersovereenkomst?" is ondubbelzinnig; "wat is de opzegtermijn?" laat het model kiezen, en het zal je niet vertellen welke het koos.
Wanneer het antwoord verkeerd lijkt
Een korte diagnostische reeks die de meeste problemen oplost.
Het model zegt dat het het bestand niet kan zien. Bevestig dat de bijlage daadwerkelijk is geüpload, en verwijs er dan expliciet naar: "In het bijgevoegde report.pdf". Vooral bij afbeeldingen zorgt "kijk naar de bijgevoegde afbeelding" ervoor dat het multimodale pad wordt gebruikt in plaats van dat het model alleen antwoordt op basis van de tekst van je vraag.
Het antwoord gaat over het verkeerde document. Noem het bestand in elke vraag zodra er meerdere in het gesprek staan.
De cijfers zijn subtiel verkeerd bij een gescand document. Dit ligt aan de transcriptie van de scan, niet aan het redeneren. Vraag het model de omringende regel woordelijk te citeren zodat je kunt zien wat het gelezen heeft, en controleer dan het origineel.
Het heeft iets gemist waarvan je weet dat het erin staat. Stel eerst een lokaliserende vraag: Citeer de passage die [onderwerp] bespreekt en geef de pagina of sectie. Als het dat niet kan vinden, ligt het probleem bij de extractie, niet bij het redeneren. Probeer een ander model of upload de relevante pagina's apart.
Het vat samen in plaats van te antwoorden. Vraag om het bewijs in plaats van de conclusie: Citeer de exacte tekst die je antwoord onderbouwt. Dit vangt ook het geval op waarbij het antwoord is afgeleid van algemene kennis in plaats van uit je document, wat de belangrijkste fout is om te betrappen.
Die laatste controle verdient nadruk. Een model dat een vraag krijgt over een bekend contracttype, een gangbare regelgeving, of een beroemd paper kan plausibel antwoorden vanuit trainingsdata zonder je bestand ooit te raadplegen. Door een citaat te eisen wordt het antwoord verankerd aan het document dat daadwerkelijk voor je ligt.
Privacy en waar je aan moet denken voor het uploaden
Geüploade bijlagen zijn ingesteld om na maximaal 30 dagen te verlopen, en je kunt een bestand of een heel gesprek zelf eerder verwijderen. Whizi gebruikt je prompts, bestanden, gesprekken, spraaktranscripten of gegenereerde inhoud niet om Whizi-eigen AI-modellen te trainen, en verkoopt die inhoud niet als trainingsdata. De provider die het door jou gekozen model draait, ontvangt wat nodig is om te antwoorden en kan tijdelijke caches bijhouden onder zijn eigen beleid.
Het oordeel dat bij jou blijft, is of het document er een is dat je mag verwerken met een externe dienst. De categorieën die het overwegen waard zijn: persoonsgegevens van andere mensen, alles wat onder een specifieke geheimhoudingsclausule valt, materiële niet-openbare informatie, en gereguleerde gegevens zoals medische of financiële dossiers die aan specifieke regels onderworpen zijn.
De praktische middenweg voor de meeste mensen is redigeren in plaats van afzien. Namen vervangen door rollen, cijfers geïndexeerd in plaats van absoluut, en identificatoren verwijderd behouden alles wat de analyse nodig heeft, terwijl het meeste wordt weggehaald wat een document gevoelig maakt.
- Noem bestanden beschrijvend, want het model ziet de bestandsnaam
- Controleer of een PDF tekst of een scan is voordat je geëxtraheerde cijfers vertrouwt
- Upload de brondata-spreadsheet, niet de opgemaakte presentatieversie
- Kies Gemini voor lange bestanden, Claude voor nuance, GPT voor extractie
- Verwijs naar bestanden bij naam zodra er meer dan één is bijgevoegd
- Vraag om een onderbouwend citaat zodat antwoorden verankerd blijven aan het document
- Verwijder persoonlijke gegevens die je niet nodig hebt voor de analyse
Veelgestelde vragen
Zijn mijn uploads privé?
Uploads worden opgeslagen onder je account, zijn ingesteld om na maximaal 30 dagen te verlopen, en kunnen eerder worden verwijderd wanneer je wilt. Whizi gebruikt je prompts, bestanden, gesprekken, spraaktranscripten of gegenereerde inhoud niet om Whizi-eigen AI-modellen te trainen, en verkoopt die inhoud niet als trainingsdata. Wat jouw keuze blijft, is of een bepaald document er een is dat je mag versturen naar een externe dienst, wat meestal wordt bepaald door je eigen contracten of interne beleid, niet door het onze.
Wat is de maximale bestandsgrootte?
Elk bestand is beperkt tot 10 MB, en één bericht kan tot 6 bestanden bevatten. Binnen die grenzen is de bindende beperking het contextvenster van het model: kies voor lange contracten, rapporten en sets met meerdere documenten een model met een groot contextvenster zoals Gemini, of upload alleen de relevante secties in plaats van het hele bestand, aangezien gerichte context toch meestal een beter antwoord oplevert.
Kan ik een bestand verwijderen na het chatten?
Ja, bestanden kunnen op elk moment worden verwijderd, en uploads die je met rust laat, zijn ingesteld om na maximaal 30 dagen vanzelf te verlopen. Let op: het verwijderen van een bestand wist niet met terugwerkende kracht wat al besproken is in het gesprek, dus als de inhoud gevoelig genoeg is om het bestand te verwijderen, verwijder dan ook het gesprek.
Werkt het met gescande PDF's?
Ja. Whizi herkent een beeldrijke of gescande PDF aan hoe weinig tekst de pagina's opleveren, en stuurt hem één keer door een serverzijdige visuele verwerking die een transcript per pagina teruggeeft. De nauwkeurigheid is hoog bij schone scans en daalt bij lage resolutie, ongebruikelijke lettertypen, handschrift en complexe tabellayouts. Omdat een verkeerd gelezen teken in een getal onzichtbaar is in een vloeiend antwoord, controleer elk cijfer uit een gescand document aan de hand van het origineel.
Kan ik meerdere documenten naar hetzelfde gesprek uploaden?
Ja, en daar zit de meeste waarde. Twee contracten clausule voor clausule vergelijken, bevindingen consolideren over een set rapporten, of tegenstrijdigheden tussen documenten vinden zijn allemaal zaken die vereisen dat alles tegelijk in de context staat. Verwijs in je prompts naar bestanden bij naam zodra er meer dan één zijn, anders kiest het model voor jou zonder te zeggen welke het koos.