Коротка відповідь
Перетягніть PDF у поле повідомлення або натисніть іконку скріпки, щоб прикріпити його, а потім поставте своє питання звичайною мовою. Будь-яка модель у вашому плані може його прочитати, і ви можете перемикати моделі щодо того самого файлу без повторного завантаження.
Зробіть одну річ перед тим, як покладатися на відповідь: попросіть модель процитувати уривок, на який вона спиралася. Впевнена відповідь, узята з навчальних даних, а не з вашого файлу, це помилка, яка коштує людям грошей, і уточнювальне питання виявляє її приблизно за десять секунд. Решта цієї сторінки про те, як робити це правильно.
Спершу переконайтеся, що модель читає ваш документ
Найнебезпечніша помилка в чаті з документами не хибна відповідь, а впевнена відповідь, узята з навчальних даних, а не з вашого файлу. Найчастіше це трапляється з документами, схожими на щось поширене: стандартний комерційний договір оренди, добре відому норму, широко обговорювану статтю. Модель настільки добре знає жанр, що може дати правдоподібну відповідь, не звертаючись до вашого конкретного тексту, і ніщо у відповіді не вказує на це.
Одна звичка усуває цю проблему. Перш ніж ставити справжнє запитання, поставте уточнювальне.
Процитуй уривок у прикріпленому документі, де йдеться про [тема], і вкажи сторінку або розділ, де він міститься. Якщо цього немає в документі, скажи про це.
Якщо модель повертає справжню цитату, вона читає ваш файл. Якщо вона видає загальний перефраз або не може знайти щось, що ви знаєте, там є, вилучення тексту не вдалося, і кожна наступна відповідь під сумнівом. Це займає десять секунд і є різницею між інструментом і проблемою.
Перенесіть цю звичку і в справжні запитання: Процитуй точний текст, який підтверджує твою відповідь має з'являтися в будь-якому промпті, на відповідь якого ви покладатиметеся.
Вибір моделі для документа
| Документ | Модель | Чому |
|---|---|---|
| Звіти на 100+ сторінок, подання, повні пакети контрактів | Gemini | Вікно контексту на 1 000 000 токенів, тож документ справді присутній повністю, а не фрагментами |
| Контракти, політики, усе, де важливі формулювання | Claude | Найкраще розуміє нюанси і вказує, чого документ не каже |
| Рахунки, форми, короткі структуровані файли | GPT | Швидка і найнадійніша для строгого вилучення в таблиці або JSON |
| Статті з рисунками, скановані сторінки, діаграми | Будь-яка мультимодальна модель | Читає сторінку як зображення там, де вилучення тексту не спрацьовує |
Варто пояснити суть вікна контексту. Коли документ перевищує те, що модель може утримати, його доводиться обробляти частинами, і запитання, які потребують усього документа одразу (чи суперечить щось тут пункту 14, чи визначено цей термін десь, який з цих трьох розділів непослідовний) стають ненадійними. Саме тому для довгих файлів варто обирати модель з великим контекстом, а не покладатися на загальну перевагу.
Ви можете перемикати моделі без повторного завантаження, тож читайте однією, а вилучайте дані іншою в межах того самого файлу. Див. перемикання моделей посеред розмови.
Промпти за типом документа
Контракти й угоди
З прикріпленої угоди вилучи в таблицю: строк і продовження, термін повідомлення про розірвання, умови оплати, ліміт відповідальності, гарантії відшкодування, застосовне право, передачу прав та будь-який пункт, що зберігає чинність після розірвання. Для кожного вкажи номер пункту і зацитуй ключове речення. Потім окремо перелічи зобов'язання, що покладаються на нас, а не на них.
Продовжіть питанням, яке справді має значення: Що в цій угоді незвичне порівняно зі стандартними умовами для такого типу контракту, і що помітно відсутнє? Ризик зазвичай ховається саме у відсутності, і це те, чого пошук за ключовими словами ніколи не знайде.
Наукові статті
Для прикріпленої статті поверни: дослідницьке питання, дизайн дослідження, вибірку і популяцію, основний результат, головний висновок з розміром ефекту, зазначені обмеження і джерело фінансування. Потім скажи мені три твердження в цій статті, які потребували б незалежної перевірки перед тим, як я їх цитуватиму.
Довгі звіти та подання
Підсумуй прикріплений звіт у 10 пунктах, впорядкованих за важливістю, а не за порядком у документі. Потім перелічи: три числа, які цікавили б особу, що приймає рішення, із посиланнями на сторінки, усе, що звіт подає як факт без джерела, і будь-яке місце, де короткий виклад чи вступний розділ суперечить деталям далі в документі.
Ця остання перевірка напрочуд часто виявляє реальні проблеми. Виконавчі резюме пишуться рано і редагуються менше, ніж розділи, які вони підсумовують.
Порівняння двох документів
Порівняй contract-a.pdf і contract-b.pdf пункт за пунктом. Поверни таблицю всіх суттєвих відмінностей: тема, що каже A, що каже B, і кому це вигідніше. Ігноруй відмінності форматування та нумерації. Окремо перелічи все, що є в одному, але відсутнє в іншому.
Перетворення на щось придатне до використання
Перепиши висновки для аудиторії керівників у 150 словах. Почни з рішення, яке потрібно ухвалити. Без жаргону без пояснень. Познач усе, що варто перевірити перед поширенням цього.
Усунення проблем
«Я не бачу документа». Переконайтеся, що файл завершив завантаження, а потім явно згадайте його за назвою у своєму повідомленні. У дуже довгих гілках швидше повторно прикріпити файл або почати новий чат лише з ним, ніж з'ясовувати причину.
Сканований PDF, спотворений або відсутній текст. Документ є зображенням, тож звичайне вилучення тексту майже нічого не дає прочитати. Whizi виявляє PDF, насичений зображеннями, за тим, як мало тексту дають його сторінки, і одноразово пропускає його через серверний прохід розпізнавання зображень, який повертає посторінковий транскрипт. Точність падає при низькій роздільній здатності, незвичних шрифтах, рукописному тексті та щільних таблицях. Оскільки неправильно розпізнану цифру не видно в плавній відповіді, перевіряйте кожне число зі сканованого документа за оригінальною сторінкою.
Таблиці виходять неправильно. Таблиці в PDF мають на диво погано структуровану основу. Спершу попросіть відтворити таблицю дослівно, звірте її зі сторінкою і лише тоді просіть аналіз. Для складної роботи з таблицями мультимодальна модель, що читає сторінку як зображення, часто надійніша за вилучення тексту.
Модель пропустила щось, що ви точно бачите в документі. Поставте уточнювальне запитання. Якщо модель не може процитувати уривок, який ви бачите, проблема у вилученні, а не в міркуванні. Спробуйте іншу модель або завантажте лише потрібні сторінки.
Файл завеликий. Використайте модель з великим контекстом або розділіть за призначенням, а не за кількістю сторінок. Завантаження трьох потрібних вам розділів краще, ніж завантаження 400 сторінок і сподівання на краще.
Відповіді стають розпливчастішими у міру розмови. Довгі гілки накопичують контекст, який конкурує з документом. Почніть новий чат з файлом і стислим формулюванням того, що вам потрібно.
Перевіряйте перед тим, як покладатися на відповідь
Три перевірки за порядком важливості.
Вимагайте цитат для всього суттєвого. Процитований уривок можна перевірити за секунди, перефраз ні. Одна ця практика усуває більшу частину ризику в роботі з документами.
Перехресна перевірка іншою моделлю. Поставте те саме питання іншій моделі щодо того самого файлу. Збіг це вагомий доказ, розбіжність показує, куди дивитися. Саме для цього існує порівняння моделей поруч від Whizi.
Запитайте, у чому модель невпевнена. У якій зі своїх відповідей вище ти найменш впевнена, і що в документі неоднозначне? Моделі недосконалі в самооцінці, але неоднозначності, які вони виявляють, зазвичай є справжніми неоднозначностями в джерелі, а це корисна інформація про сам документ.
І незмінне правило для всього, що має наслідки, тобто юридичних, фінансових, медичних матеріалів чи питань відповідності нормам: модель знаходить уривок, а рішення ухвалюєте ви. Це помічник із читання, а не радник, і відповідальність за рішення, ухвалене на основі її результату, повністю на вас.
- Спершу поставте уточнювальне запитання, щоб переконатися, що модель читає ваш файл
- Вимагайте точну цитату для кожної суттєвої відповіді
- Використовуйте модель з великим контекстом для довгих документів, щоб нічого не фрагментувалося
- Питайте, що помітно відсутнє, а не лише те, що каже документ
- Перевіряйте цифри зі сканованих документів за оригінальною сторінкою
- Відтворюйте таблиці дослівно і перевіряйте їх перед аналізом
- Перехресно перевіряйте все важливе іншою моделлю
Поширені запитання
Який максимальний розмір PDF?
Кожен завантажений файл обмежено 10 МБ, і одне повідомлення може містити до 6 файлів. У цих межах справжнім обмеженням є вікно контексту моделі, а не ліміт файлу. Gemini у Whizi має вікно контексту на 1 000 000 токенів, тому саме її рекомендують для довгих звітів, подань і пакетів із кількох контрактів. Понад це завантажуйте потрібні вам розділи, а не весь документ, оскільки цілеспрямований контекст зазвичай дає й точнішу відповідь.
Чи зберігає Whizi мої PDF?
Завантажені файли зберігаються під вашим обліковим записом, налаштовані на видалення через до 30 днів і можуть бути видалені раніше в будь-який момент. Whizi не використовує ваші промпти, файли, розмови, голосові транскрипти чи згенерований контент для навчання власних AI-моделей і не продає цей контент як навчальні дані. Видалення файлу не прибирає те, що вже обговорювалося про нього в розмові, тож якщо документ достатньо чутливий, щоб виправдати видалення, видаліть і чат.
Чи можна спілкуватися з кількома PDF одночасно?
Так, і саме порівняння документів тут найцінніше. Завантажте кілька файлів в один потік і згадуйте їх за назвою у своїх промптах, інакше модель сама обере, з якого відповідати, не повідомивши вас про це. Порівняння контрактів пункт за пунктом, зведення висновків із кількох звітів і пошук суперечностей між документами вимагають, щоб усе було присутнє одночасно, що є ще однією причиною використовувати модель з великим контекстом.
Чи працює це зі сканованими PDF?
Так. Whizi виявляє сканований або насичений зображеннями PDF за тим, як мало тексту дають його сторінки, і транскрибує його посторінково через серверний прохід розпізнавання зображень. Точність висока на чистих сканах і знижується при низькій роздільній здатності, незвичних шрифтах, рукописному тексті та щільних таблицях. Оскільки неправильно розпізнаний символ дає хибне число в іншому плавному тексті відповіді, перевіряйте будь-яку цифру зі сканованого документа за оригінальною сторінкою.
Як зрозуміти, що відповідь справді походить з мого документа?
Вимагайте цитату. Попросіть модель процитувати точний уривок, що підтверджує її відповідь, разом зі сторінкою чи розділом, і прямо сказати, якщо цієї інформації немає в документі. Відповіді, узяті з навчальних даних, а не з вашого файлу, це найнебезпечніша помилка в чаті з документами саме тому, що вони правдоподібні для поширених типів документів, і вимога перевіряної цитати це єдиний надійний спосіб відрізнити одне від іншого.