Unterstützte Dateitypen, und was mit jedem wirklich passiert
Häng die Datei an, indem du sie in das Eingabefeld ziehst oder auf die Büroklammer klickst, und stell dann deine Frage. Was das Modell erhält, unterscheidet sich je nach Dateityp, und zu wissen, welcher welcher ist, erklärt die meisten überraschenden Ergebnisse.
| Typ | Endungen | Womit das Modell arbeitet |
|---|---|---|
| Text-PDFs | Der extrahierte Text, in Lesereihenfolge, Tabellen eingeschlossen als Text | |
| Gescannte PDFs | Ein seitenweises Transkript aus einem serverseitigen Vision-Durchlauf | |
| Word-Dokumente | .docx | Der Dokumenttext, extrahiert in deinem Browser |
| Tabellen | .xlsx, .csv | Zellwerte als Text, keine lebenden Formeln |
| Bilder | .png, .jpg, .jpeg | Das Bild selbst, gelesen von einem multimodalen Modell |
| Code und einfacher Text | .py, .js, .ts, .go, .md, .txt und ähnliche | Der Dateiinhalt wortwörtlich |
Zwei Konsequenzen lohnt es sich zu verinnerlichen. Erstens: Eine Tabelle kommt als Werte an, nicht als funktionierende Arbeitsmappe, das Modell kann also lesen, was deine Formel ergeben hat, aber die Formel nicht neu ausführen. Zweitens: Ein gescanntes PDF hat eine Vision-Transkription durchlaufen statt einer reinen Textextraktion, und eine ungewöhnliche Schrift, eine handschriftliche Notiz oder ein niedrig aufgelöster Scan können immer noch ein falsch gelesenes Zeichen in einer Zahl erzeugen. Prüf Zahlen aus gescannten Dokumenten gegen das Original. Ein Hinweis zu Bildern: Das Eingabefeld lehnt GIF-Dateien ab und verlangt stattdessen ein PNG oder JPEG.
Bereite die Datei vor, bevor du etwas fragst
Fünf Minuten hier ersparen dir später ein verwirrendes Gespräch.
- Benenne die Datei so, wie sie ist. Das Modell sieht den Dateinamen, und
2025-q3-liefervertrag-acme.pdfgibt ihm nützlichen Kontext, dendokument(3).pdfnicht liefert. Das zählt umso mehr, sobald mehrere Dateien im Thread liegen. - Schick die Quelldatei, nicht die Präsentationsversion. Besonders bei Tabellen verursacht die Version mit verbundenen Zellen, Zwischensummen mitten in den Daten und Notizen am Rand deutlich mehr Fehler als eine große schlichte Datei.
- Teile riesige Dokumente nach Zweck, nicht nach Größe. Wenn du nur den Methoden- und Ergebnisteil brauchst, ist es besser, genau die hochzuladen, statt 400 Seiten hochzuladen und zu hoffen, dass die Aufmerksamkeit an der richtigen Stelle landet.
- Entferne persönliche Daten, die du nicht brauchst. Namen, E-Mail-Adressen und Kennungen sind für die Analyse selten nötig, und sie zu entfernen geht schneller, als zu entscheiden, ob du sie überhaupt hochladen durftest.
- Prüfe, ob ein PDF wirklich Text ist. Versuch, im PDF-Reader Text zu markieren. Geht das nicht, ist es ein Scan, Whizi transkribiert ihn mit einem Vision-Durchlauf, und Zahlen verdienen einen Abgleich mit dem Original.
Das richtige Modell für die Datei wählen
Diese Wahl zählt bei Dokumentarbeit mehr als der Prompt.
- Gemini für alles Lange. Gemini-Modelle in Whizi bieten ein Kontextfenster von 1.000.000 Token, ein 200-seitiger Bericht, ein kompletter Vertragssatz oder ein Dutzend Papers können also auf einmal vorliegen, statt stückweise verarbeitet zu werden. Fragen über mehrere Dokumente hinweg funktionieren nur richtig, wenn wirklich alles im Kontext ist.
- Claude für Nuancen. Rechtssprache, Richtliniendokumente, alles, bei dem die Bedeutung von Einschränkungen und Vorbehalten abhängt. Es ist auch am besten darin, dir zu sagen, was ein Dokument nicht sagt, was oft die eigentliche Frage ist.
- GPT für Extraktion. Rechnungen, Formulare, strukturierte Daten, alles, wo du eine strikte Tabelle oder JSON zurückhaben willst und konsistente Feldnamen über hundert Zeilen hinweg.
- Jedes multimodale Modell für Bilder, Diagramme, Screenshots und Skizzen. Bitte es zunächst zu beschreiben, was es sieht, bevor du es interpretieren lässt, das fängt Fehllesungen früh ab.
Du kannst mitten im Thread das Modell wechseln, ohne neu hochzuladen, genau das ist der Sinn, das in einem Workspace zu tun. Mit Gemini lesen, mit GPT extrahieren und Claude die Zusammenfassung schreiben lassen, alles anhand derselben angehängten Datei. Siehe Modelle mitten im Gespräch wechseln.
Mit mehreren Dokumenten gleichzeitig arbeiten
Fragen zu einem einzelnen Dokument sind nützlich. Fragen zu mehreren Dokumenten sind der Punkt, an dem das aufhört, bloß praktisch zu sein, und zu einer Fähigkeit wird, die du vorher nicht hattest.
Prompt: vergleichen
Vergleiche vertrag-a.pdf und vertrag-b.pdf. Gib eine Tabelle jeder abweichenden Klausel zurück: Klausel, was A sagt, was B sagt, und was für uns günstiger ist und warum. Ignoriere Unterschiede in Formatierung und Nummerierung. Liste Klauseln, die nur in einem der Dokumente vorkommen, separat auf.
Prompt: konsolidieren
Erstelle über alle angehängten Dateien hinweg eine Tabelle, die [Frage] beantwortet. Eine Zeile pro Dokument, mit dem Dokumentnamen in der ersten Spalte. Wo ein Dokument es nicht behandelt, schreib NICHT BEHANDELT. Führe keine Dokumente mit unterschiedlichen Definitionen zusammen, ohne das zu kennzeichnen.
Prompt: den Widerspruch finden
Wo widersprechen sich diese Dokumente? Zitiere beide Passagen nebeneinander und nenn die Datei, aus der jede stammt. Unterscheide echte Widersprüche von Unterschieden in Umfang oder Datum.
Nenn Dateien im Prompt immer namentlich, sobald es mehr als eine gibt. "Welche Kündigungsfrist gilt im Liefervertrag?" ist eindeutig, "welche Kündigungsfrist gilt?" zwingt das Modell zu wählen, und es sagt dir nicht, welche es gewählt hat.
Wenn die Antwort falsch aussieht
Eine kurze Diagnosefolge, die die meisten Probleme löst.
Das Modell sagt, es kann die Datei nicht sehen. Prüf, ob der Anhang wirklich hochgeladen wurde, und verweis dann ausdrücklich darauf: "Im angehängten bericht.pdf". Besonders bei Bildern stellt "schau dir das angehängte Bild an" sicher, dass der multimodale Pfad genutzt wird, statt dass das Modell allein aus dem Text deiner Frage antwortet.
Die Antwort bezieht sich auf das falsche Dokument. Nenn die Datei bei jeder Frage, sobald der Thread mehrere enthält.
Die Zahlen sind bei einem gescannten Dokument leicht falsch. Das ist die Transkription des Scans, nicht das Schlussfolgern. Bitte das Modell, die umliegende Zeile wörtlich zu zitieren, damit du siehst, was es gelesen hat, und prüf dann das Original.
Es hat etwas übersehen, von dem du weißt, dass es drinsteht. Stell zuerst eine Lokalisierungsfrage: Zitiere die Passage, die [Thema] behandelt, und gib Seite oder Abschnitt an. Findet es sie nicht, liegt das Problem an der Extraktion, nicht am Schlussfolgern. Versuch ein anderes Modell oder lade die relevanten Seiten separat hoch.
Es fasst zusammen, statt zu antworten. Bitte um den Beleg statt um die Schlussfolgerung: Zitiere den genauen Text, der deine Antwort stützt. Das fängt auch den Fall ab, in dem die Antwort aus allgemeinem Wissen erschlossen wurde statt aus deinem Dokument, das ist der wichtigste Fehler, den man erkennen muss.
Diese letzte Prüfung verdient Nachdruck. Ein Modell, das nach einem bekannten Vertragstyp, einer gängigen Vorschrift oder einem berühmten Paper gefragt wird, kann plausibel aus Trainingsdaten antworten, ohne deine Datei überhaupt heranzuziehen. Ein verlangtes Zitat zwingt die Antwort, an das Dokument gebunden zu bleiben, das tatsächlich vorliegt.
Datenschutz und was du vor dem Hochladen bedenken solltest
Hochgeladene Anhänge sind so eingestellt, dass sie nach bis zu 30 Tagen ablaufen, und du kannst eine Datei oder ein ganzes Gespräch selbst früher löschen. Whizi nutzt deine Prompts, Dateien, Gespräche, Sprachtranskripte oder erzeugten Inhalte nicht, um Whizi-eigene KI-Modelle zu trainieren, und verkauft diese Inhalte nicht als Trainingsdaten. Der Anbieter, der das von dir gewählte Modell betreibt, erhält, was er zur Beantwortung braucht, und kann nach seiner eigenen Richtlinie vorübergehende Caches vorhalten.
Die Entscheidung, die bei dir bleibt, ist, ob du das Dokument überhaupt mit einem Drittanbieterdienst verarbeiten darfst. Die Kategorien, bei denen ein Innehalten lohnt: personenbezogene Daten anderer Menschen, alles, was einer bestimmten Vertraulichkeitsklausel unterliegt, wesentliche nicht öffentliche Informationen und regulierte Daten wie Gesundheits- oder Finanzunterlagen mit besonderen Umgangsregeln.
Der praktische Mittelweg für die meisten Menschen ist Schwärzen statt Verzichten. Namen durch Rollen ersetzt, Zahlen indexiert statt absolut, und entfernte Kennungen bewahren alles, was die Analyse braucht, während das meiste entfällt, was ein Dokument sensibel macht.
- Benenn Dateien beschreibend, denn das Modell sieht den Dateinamen
- Prüf, ob ein PDF Text oder ein Scan ist, bevor du extrahierten Zahlen vertraust
- Lad die Quelltabelle hoch, nicht die formatierte Präsentationsversion
- Wähl Gemini für lange Dateien, Claude für Nuancen, GPT für Extraktion
- Nenn Dateien namentlich, sobald mehr als eine angehängt ist
- Bitte um ein stützendes Zitat, damit Antworten am Dokument verankert bleiben
- Entfern persönliche Daten, die du für die Analyse nicht brauchst
Häufige Fragen
Sind meine Uploads privat?
Uploads werden unter deinem Konto gespeichert, sind so eingestellt, dass sie nach bis zu 30 Tagen ablaufen, und können jederzeit früher gelöscht werden. Whizi nutzt deine Prompts, Dateien, Gespräche, Sprachtranskripte oder erzeugten Inhalte nicht, um Whizi-eigene KI-Modelle zu trainieren, und verkauft diese Inhalte nicht als Trainingsdaten. Was bei dir bleibt, ist, ob du ein bestimmtes Dokument an einen Drittanbieterdienst schicken darfst, was meist von deinen eigenen Verträgen oder internen Richtlinien geregelt wird, nicht von unseren.
Wie groß darf eine Datei maximal sein?
Jede Datei ist auf 10 MB begrenzt, und eine Nachricht kann bis zu 6 Dateien tragen. Innerhalb dieser Grenzen ist das Kontextfenster des Modells die bindende Beschränkung: Für lange Verträge, Berichte und Sätze mehrerer Dokumente wähl ein Modell mit großem Kontext wie Gemini, oder lad die relevanten Abschnitte statt der ganzen Datei hoch, da gezielter Kontext ohnehin meist eine bessere Antwort liefert.
Kann ich eine Datei nach dem Chatten löschen?
Ja, Dateien können jederzeit entfernt werden, und Uploads, die du unangetastet lässt, sind so eingestellt, dass sie nach bis zu 30 Tagen von selbst ablaufen. Beachte, dass das Entfernen einer Datei nicht rückwirkend löscht, was im Gespräch bereits besprochen wurde. Ist der Inhalt sensibel genug, um die Datei zu löschen, lösch also auch das Gespräch.
Funktioniert es mit gescannten PDFs?
Ja. Whizi erkennt ein bild- oder scanlastiges PDF daran, wie wenig Text seine Seiten liefern, und schickt es einmal durch einen serverseitigen Vision-Durchlauf, der ein seitenweises Transkript zurückgibt. Die Genauigkeit ist bei sauberen Scans hoch und sinkt bei niedriger Auflösung, ungewöhnlichen Schriften, Handschrift und komplexen Tabellenlayouts. Da ein falsch gelesenes Zeichen in einer Zahl in einer flüssigen Antwort unsichtbar ist, prüf jede Zahl aus einem gescannten Dokument gegen das Original.
Kann ich mehrere Dokumente demselben Gespräch hinzufügen?
Ja, und genau dort liegt der größte Nutzen. Zwei Verträge klauselweise vergleichen, Erkenntnisse über einen Satz von Berichten hinweg konsolidieren oder Widersprüche zwischen Dokumenten finden, all das erfordert, dass alles gleichzeitig im Kontext steht. Nenn Dateien in deinen Prompts namentlich, sobald es mehr als eine gibt, sonst wählt das Modell für dich, ohne zu sagen, welche es gewählt hat.