La réponse courte
Faites glisser le PDF dans la zone de message ou cliquez sur l'icône trombone pour le joindre, puis posez votre question en langage courant. N'importe quel modèle de votre offre peut le lire, et vous pouvez changer de modèle sur le même fichier sans le réimporter.
Faites une chose avant de vous fier à une réponse : demandez au modèle de citer le passage qu'il a utilisé. Une réponse assurée tirée des données d'entraînement plutôt que de votre fichier est l'échec qui coûte de l'argent aux gens, et une question de localisation le détecte en dix secondes environ. Le reste de cette page explique comment bien faire cela.
D'abord, confirmez qu'il lit bien votre document
L'échec le plus dangereux dans le chat avec un document n'est pas une mauvaise réponse, c'est une réponse assurée tirée des données d'entraînement plutôt que de votre fichier. Cela arrive surtout avec des documents qui ressemblent à quelque chose de courant : un bail commercial standard, une réglementation bien connue, un article largement discuté. Le modèle connaît assez bien le genre pour produire une réponse plausible sans consulter votre texte précis, et rien dans la sortie ne signale qu'il l'a fait.
Une habitude élimine ce problème. Avant de poser votre vraie question, posez une question de localisation.
Citez le passage du document joint qui traite de [sujet], et indiquez la page ou la section où il apparaît. S'il n'est pas dans le document, dites-le.
S'il renvoie une vraie citation, c'est qu'il lit votre fichier. S'il produit une paraphrase générique ou ne trouve pas quelque chose que vous savez présent, l'extraction a échoué et toute réponse ultérieure est suspecte. Cela prend dix secondes et fait la différence entre un outil et un risque.
Gardez cette habitude aussi pour les vraies questions : Citez le texte exact qui appuie votre réponse devrait figurer dans tout prompt dont la réponse sera utilisée pour décider.
Choisir un modèle pour le document
| Document | Modèle | Pourquoi |
|---|---|---|
| Rapports de 100 pages ou plus, dossiers, ensembles de contrats complets | Gemini | Une fenêtre de contexte de 1 000 000 tokens, donc le document est réellement présent plutôt que découpé |
| Contrats, politiques, tout ce dont la nuance compte | Claude | Le meilleur pour la nuance et pour dire ce qu'un document ne dit pas |
| Factures, formulaires, fichiers courts et structurés | GPT | Rapide, et le plus fiable pour l'extraction stricte en tableaux ou en JSON |
| Articles avec figures, pages scannées, diagrammes | Tout modèle multimodal | Lit la page comme une image là où l'extraction de texte échoue |
Le point sur la fenêtre de contexte mérite d'être précisé. Quand un document dépasse ce qu'un modèle peut contenir, il doit être traité par morceaux, et les questions qui nécessitent tout le document à la fois (est-ce que quelque chose ici contredit la clause 14, ce terme est-il défini quelque part, laquelle de ces trois sections est incohérente) deviennent peu fiables. C'est la raison précise de privilégier le modèle à grand contexte sur les longs fichiers plutôt qu'une préférence générale.
Vous pouvez changer de modèle sans réimporter, donc lisez avec l'un et extrayez avec l'autre sur le même fichier. Voir changer de modèle en cours de conversation.
Prompts selon le type de document
Contrats et accords
À partir de l'accord joint, extrayez dans un tableau : durée et renouvellement, préavis de résiliation, conditions de paiement, plafond de responsabilité, indemnités, droit applicable, cession, et toute clause qui survit à la résiliation. Pour chacune, indiquez le numéro de clause et citez la phrase opérative. Puis listez séparément les obligations qui nous incombent plutôt qu'à eux.
Poursuivez avec la question qui compte vraiment : Qu'est-ce que cet accord contient d'inhabituel par rapport aux conditions standard pour ce type de contrat, et qu'est-ce qui manque de façon flagrante ? L'absence est souvent là où se trouve le risque, et c'est ce qu'une recherche par mot-clé ne peut jamais trouver.
Articles de recherche
Pour l'article joint, retournez : la question de recherche, le plan d'étude, l'échantillon et la population, le résultat principal, le résultat phare avec sa taille d'effet, les limites indiquées, et la source de financement. Puis dites-moi les trois affirmations de cet article qui nécessiteraient une vérification indépendante avant que je les cite.
Longs rapports et dossiers
Résumez le rapport joint en 10 points classés par importance plutôt que par ordre du document. Puis listez : les trois chiffres qui intéresseraient un décideur avec leurs références de page, tout ce que le rapport présente comme un fait sans source, et tout endroit où le résumé ou la section exécutive contredit le détail plus loin dans le document.
Cette dernière vérification trouve de vrais problèmes étonnamment souvent. Les résumés exécutifs sont rédigés tôt et moins révisés que les sections qu'ils résument.
Comparer deux documents
Comparez contract-a.pdf et contract-b.pdf clause par clause. Retournez un tableau de chaque différence substantielle : sujet, ce que dit A, ce que dit B, et lequel nous favorise. Ignorez les différences de mise en forme et de numérotation. Listez séparément tout ce qui est présent dans l'un et absent de l'autre.
En faire quelque chose d'utilisable
Réécrivez les conclusions pour un public exécutif en 150 mots. Commencez par la décision requise. Aucun jargon non défini. Signalez tout ce que je devrais vérifier avant de diffuser ceci.
Dépannage
« Je ne vois pas de document. » Confirmez que le fichier a fini d'être importé, puis référencez-le explicitement par son nom dans votre message. Sur de très longs fils, réimporter le fichier ou démarrer une nouvelle conversation avec juste ce fichier est plus rapide que d'en discuter.
PDF scanné, texte brouillé ou manquant. Le document est une image, donc l'extraction de texte brut a peu de choses à lire. Whizi détecte un PDF riche en images d'après la faible quantité de texte que ses pages produisent et le fait passer une fois par une analyse visuelle côté serveur qui renvoie une transcription page par page. La précision baisse avec une faible résolution, des polices inhabituelles, l'écriture manuscrite et les tableaux denses. Comme un chiffre mal lu est invisible dans une réponse fluide, vérifiez chaque chiffre d'un document scanné par rapport à la page d'origine.
Les tableaux ressortent mal. Les tableaux PDF sont notoirement mal structurés en dessous. Demandez d'abord que le tableau soit reproduit tel quel, vérifiez-le par rapport à la page, et ensuite seulement demandez une analyse. Pour un travail intensif sur les tableaux, un modèle multimodal lisant la page comme une image est souvent plus fiable que l'extraction de texte.
Il a manqué quelque chose que vous savez être présent. Posez la question de localisation. Si le modèle ne peut pas citer un passage que vous voyez, le problème vient de l'extraction plutôt que du raisonnement. Essayez un autre modèle, ou importez seulement les pages concernées.
Le fichier est trop volumineux. Utilisez le modèle à grand contexte, ou divisez par objectif plutôt que par nombre de pages. Importer les trois sections dont vous avez réellement besoin vaut mieux qu'importer 400 pages en espérant.
Les réponses deviennent plus vagues à mesure que la conversation avance. Les longs fils accumulent un contexte qui entre en concurrence avec le document. Démarrez une nouvelle conversation avec le fichier et un énoncé concis de ce dont vous avez besoin.
Vérifiez avant de vous y fier
Trois vérifications, par ordre d'importance.
Exigez des citations pour tout ce qui a des conséquences. Un passage cité est vérifiable en quelques secondes ; une paraphrase ne l'est pas. Cette seule pratique élimine la plupart des risques dans le travail documentaire.
Recoupez avec un second modèle. Posez la même question à un modèle différent sur le même fichier. L'accord est une preuve significative ; le désaccord vous indique précisément où regarder. La comparaison côte à côte de Whizi existe pour cela.
Demandez de quoi il est incertain. Parmi vos réponses ci-dessus, de laquelle êtes-vous le moins sûr, et qu'est-ce qui est ambigu dans le document ? Les modèles sont imparfaits en auto-évaluation, mais les ambiguïtés qu'ils font ressortir sont généralement de vraies ambiguïtés de la source, ce qui constitue une information utile sur le document lui-même.
Et la règle permanente pour tout ce qui a des conséquences, c'est-à-dire le contenu juridique, financier, médical ou de conformité : le modèle trouve le passage, vous portez le jugement. C'est un assistant de lecture, pas un conseiller, et la responsabilité d'une décision prise sur la base de sa sortie est entièrement la vôtre.
- Posez d'abord une question de localisation pour confirmer que le modèle lit votre fichier
- Exigez une citation exacte pour chaque réponse ayant des conséquences
- Utilisez le modèle à grand contexte pour les longs documents afin que rien ne soit découpé
- Demandez ce qui manque de façon flagrante, en plus de ce que dit le document
- Vérifiez les chiffres des documents scannés par rapport à la page d'origine
- Reproduisez les tableaux tels quels et vérifiez-les avant de les analyser
- Recoupez tout ce qui est important avec un second modèle
Questions fréquentes
Quelle est la taille maximale d'un PDF ?
Chaque fichier importé est limité à 10 Mo, et un message peut contenir jusqu'à 6 fichiers. Dans cette limite, la vraie contrainte est la fenêtre de contexte du modèle plutôt que le plafond de fichier. Gemini dans Whizi offre une fenêtre de contexte de 1 000 000 tokens, ce qui explique qu'il soit recommandé pour les longs rapports, les dossiers et les ensembles multi-contrats. Au-delà, importez les sections dont vous avez réellement besoin plutôt que le document entier, car un contexte ciblé produit généralement aussi une réponse plus précise.
Whizi conserve-t-il mes PDF ?
Les fichiers importés sont stockés sous votre compte, configurés pour expirer au bout de 30 jours maximum, et peuvent être supprimés plus tôt à tout moment. Whizi n'utilise pas vos prompts, fichiers, conversations, transcriptions vocales ou contenus générés pour entraîner des modèles d'IA propriétaires de Whizi, et ne vend pas ce contenu comme données d'entraînement. Supprimer un fichier ne retire pas ce qui en a déjà été discuté dans la conversation, donc si le document est assez sensible pour justifier une suppression, supprimez aussi la conversation.
Puis-je discuter avec plusieurs PDF à la fois ?
Oui, et la comparaison entre documents est là où c'est le plus utile. Importez plusieurs fichiers dans le même fil et référencez-les par leur nom dans vos prompts, sinon le modèle choisit celui auquel il répond sans vous le dire. La comparaison de contrats clause par clause, la consolidation de résultats entre plusieurs rapports et la recherche de contradictions entre documents nécessitent tous d'avoir tout présent en même temps, ce qui est une autre raison d'utiliser le modèle à grand contexte.
Ça fonctionne avec les PDF scannés ?
Oui. Whizi détecte un PDF scanné ou riche en images d'après la faible quantité de texte que ses pages produisent et le transcrit page par page via une analyse visuelle côté serveur. La précision est bonne sur des scans propres et se dégrade avec une faible résolution, des polices inhabituelles, l'écriture manuscrite et les tableaux denses. Comme un caractère mal lu produit un chiffre erroné dans une réponse par ailleurs fluide, vérifiez tout chiffre tiré d'un document scanné par rapport à la page d'origine.
Comment savoir si la réponse vient vraiment de mon document ?
Exigez une citation. Demandez au modèle de citer le passage exact qui appuie sa réponse, avec la page ou la section, et de dire clairement si l'information n'est pas dans le document. Les réponses tirées des données d'entraînement plutôt que de votre fichier sont l'échec le plus dangereux dans le chat avec un document, précisément parce qu'elles sont plausibles pour les types de documents courants, et exiger une citation vérifiable est le seul moyen fiable de faire la différence.