Підтримувані типи файлів і що насправді відбувається з кожним із них
Прикріпіть файл, перетягнувши його у поле введення або натиснувши на скріпку, а тоді поставте запитання. Те, що отримує модель, залежить від типу файлу, і розуміння цієї різниці пояснює більшість несподіваних результатів.
| Тип | Розширення | З чим працює модель |
|---|---|---|
| Текстові PDF | Видобутий текст у порядку читання, включно з таблицями як текстом | |
| Скановані PDF | Розшифровка кожної сторінки після серверної обробки зором | |
| Документи Word | .docx | Текст документа, видобутий у вашому браузері |
| Таблиці | .xlsx, .csv | Значення комірок як текст, без активних формул |
| Зображення | .png, .jpg, .jpeg | Саме зображення, яке читає мультимодальна модель |
| Код і звичайний текст | .py, .js, .ts, .go, .md, .txt та подібні | Вміст файлу дослівно |
Варто засвоїти два наслідки. По-перше, таблиця надходить як значення, а не як робоча книга, тож модель бачить результат вашої формули, але не може виконати її повторно. По-друге, сканований PDF пройшов через розпізнавання зором, а не звичайне видобування тексту, тому незвичний шрифт, рукописна помітка чи низька роздільна здатність можуть призвести до помилкового розпізнавання символу в числі. Перевіряйте цифри зі сканованих документів за оригіналом. Ще одна деталь щодо зображень: поле введення не приймає файли GIF і просить натомість PNG або JPEG.
Підготуйте файл перед тим, як щось запитати
П'ять хвилин зараз рятують вас від заплутаної розмови пізніше.
- Назвіть файл відповідно до його змісту. Модель бачить назву файлу, і
2025-q3-vendor-contract-acme.pdfдає їй корисний контекст, якого не даєdocument(3).pdf. Це особливо важливо, коли у розмові вже кілька файлів. - Надсилайте вихідний файл, а не презентаційну версію. Для таблиць це особливо критично: версія з об'єднаними комірками, проміжними підсумками всередині даних і нотатками на полях спричиняє набагато більше помилок, ніж великий, але простий файл.
- Розділяйте величезні документи за призначенням, а не за розміром. Якщо вам потрібні лише розділи методології та результатів, краще завантажити саме їх, ніж 400 сторінок у надії, що увага моделі потрапить у потрібне місце.
- Видаляйте персональні дані, які вам не потрібні. Імена, електронні адреси й ідентифікатори рідко потрібні для аналізу, і прибрати їх швидше, ніж з'ясовувати, чи мали ви право їх завантажувати.
- Перевірте, чи PDF справді текстовий. Спробуйте виділити текст у своєму переглядачі PDF. Якщо не вдається, це скан, Whizi розшифрує його через обробку зором, і цифри варто перевірити за оригіналом.
Вибір моделі під файл
Цей вибір важливіший за сам запит, коли йдеться про роботу з документами.
- Gemini для всього довгого. Моделі Gemini у Whizi мають контекстне вікно на 1 000 000 токенів, тож звіт на 200 сторінок, повний пакет контрактів чи десяток статей можуть бути присутні одночасно, а не оброблятися частинами. Питання, що охоплюють кілька документів, працюють коректно лише тоді, коли все справді є в контексті.
- Claude для нюансів. Юридична мова, політики та документи, де сенс залежить від застережень і уточнень. Він також найкраще пояснює, чого документ не каже, а це часто і є справжнє питання.
- GPT для видобування даних. Рахунки, форми, структуровані дані, все, де потрібна чітка таблиця чи JSON у відповідь і незмінні назви полів у сотнях рядків.
- Будь яка мультимодальна модель для зображень, графіків, знімків екрана та діаграм. Спершу попросіть описати, що вона бачить, перш ніж просити інтерпретацію, це допомагає виявити помилки прочитання на ранньому етапі.
Ви можете перемикати моделі посеред розмови без повторного завантаження, і саме в цьому сенс роботи в одному робочому просторі. Читайте разом із Gemini, видобувайте дані з GPT, а підсумок хай напише Claude, і все це з тим самим прикріпленим файлом. Див. перемикання моделей посеред розмови.
Робота з кількома документами одночасно
Питання про один документ корисні. Питання про кілька документів це вже не просто зручність, а можливість, якої у вас раніше не було.
Запит: порівняти
Порівняй contract-a.pdf і contract-b.pdf. Поверни таблицю з усіма пунктами, що відрізняються: пункт, що каже A, що каже B, і що вигідніше для нас та чому. Ігноруй відмінності у форматуванні й нумерації. Перелічи пункти, наявні в одному документі й відсутні в іншому, окремо.
Запит: об'єднати
У всіх прикріплених файлах побудуй одну таблицю з відповіддю на [питання]. Один рядок на документ, назва документа у першій колонці. Якщо документ це не розглядає, напиши НЕ РОЗГЛЯДАЄТЬСЯ. Не об'єднуй документи з різними визначеннями без попередження про це.
Запит: знайти суперечність
Де ці документи суперечать один одному? Наведи обидва фрагменти поряд і вкажи, з якого файлу кожен узятий. Відрізняй справжні суперечності від відмінностей у охопленні чи даті.
Завжди посилайтеся на файли за назвою у своєму запиті, щойно їх стає більше одного. "В угоді з постачальником, який строк повідомлення?" однозначне; "який строк повідомлення?" змушує модель обирати самій, і вона не скаже, який файл вибрала.
Коли відповідь виглядає неправильною
Короткий діагностичний ланцюжок, що вирішує більшість проблем.
Модель каже, що не бачить файл. Переконайтеся, що вкладення справді завантажилося, а тоді пошліться на нього прямо: "У прикріпленому report.pdf". Для зображень особливо корисно сказати "подивись на прикріплене зображення", щоб задіяти мультимодальний шлях, а не відповідь лише з тексту вашого запитання.
Відповідь стосується не того документа. Називайте файл у кожному запитанні, щойно в розмові з'являється кілька файлів.
Числа в сканованому документі трохи неправильні. Це наслідок розшифровки скану, а не міркування. Попросіть модель дослівно процитувати рядок навколо, щоб побачити, що саме вона прочитала, а тоді звірте з оригіналом.
Модель пропустила щось, що точно є в документі. Спершу поставте пошукове питання: Процитуй уривок, де йдеться про [тема], і вкажи його сторінку чи розділ. Якщо вона не може знайти, проблема у видобуванні, а не у міркуванні. Спробуйте іншу модель або завантажте відповідні сторінки окремо.
Модель підсумовує замість того, щоб відповідати. Просіть докази, а не висновок: Процитуй точний текст, що підтверджує твою відповідь. Це також викриває випадок, коли відповідь виведена із загальних знань, а не з вашого документа, а це найважливіша помилка, яку варто ловити.
Ця остання перевірка заслуговує на окрему увагу. Модель, яку запитали про добре відомий тип контракту, поширену норму права чи відому статтю, може відповісти правдоподібно з навчальних даних, зовсім не звертаючись до вашого файлу. Вимога навести цитату прив'язує відповідь саме до документа, що перед нею.
Приватність і що варто продумати перед завантаженням
Завантажені вкладення налаштовані на видалення щонайпізніше через 30 днів, і ви можете видалити файл чи всю розмову раніше самостійно. Whizi не використовує ваші запити, файли, розмови, голосові транскрипти чи згенерований контент для навчання власних моделей ШІ Whizi і не продає цей контент як навчальні дані. Провайдер, що обробляє обрану вами модель, отримує те, що потрібно для відповіді, і може тимчасово кешувати дані за власною політикою.
Рішення, яке залишається за вами, це чи маєте ви право взагалі обробляти цей документ через стороній сервіс. Категорії, над якими варто замислитися: персональні дані інших людей, все, що охоплює окрема угода про конфіденційність, суттєва непублічна інформація, а також регульовані дані, як-от медичні чи фінансові записи з окремими правилами поводження.
Практичний середній шлях для більшості це редагувати документ, а не відмовлятися від нього повністю. Заміна імен на посади, індексація показників замість абсолютних значень і видалення ідентифікаторів збережуть усе потрібне для аналізу, прибравши більшість того, що робить документ чутливим.
- Називайте файли змістовно, адже модель бачить назву файлу
- Перевіряйте, чи PDF текстовий, чи це скан, перш ніж довіряти видобутим числам
- Завантажуйте вихідну таблицю, а не відформатовану презентаційну версію
- Обирайте Gemini для довгих файлів, Claude для нюансів, GPT для видобування даних
- Посилайтеся на файли за назвою, щойно прикріплено більше одного
- Просіть цитату на підтвердження, щоб відповідь лишалась прив'язаною до документа
- Видаляйте персональні дані, не потрібні для аналізу
Поширені запитання
Чи приватні мої завантаження?
Завантаження зберігаються під вашим обліковим записом, налаштовані на видалення щонайпізніше через 30 днів, і ви можете видалити їх раніше в будь який момент. Whizi не використовує ваші запити, файли, розмови, голосові транскрипти чи згенерований контент для навчання власних моделей ШІ Whizi і не продає цей контент як навчальні дані. За вами залишається рішення, чи маєте ви право надсилати конкретний документ стороньому сервісу, що зазвичай регулюється вашими власними угодами чи внутрішньою політикою, а не нашою.
Який максимальний розмір файлу?
Кожен файл обмежений 10 МБ, і одне повідомлення може містити до 6 файлів. У межах цих обмежень визначальним чинником є контекстне вікно моделі: для довгих контрактів, звітів і наборів документів обирайте модель з великим контекстом, як Gemini, або завантажуйте лише потрібні розділи замість усього файлу, адже цільовий контекст зазвичай дає кращу відповідь.
Чи можна видалити файл після розмови?
Так, файли можна видалити в будь який момент, а завантаження, які ви не чіпаєте, налаштовані на видалення самі щонайпізніше через 30 днів. Зверніть увагу, що видалення файлу не стирає заднім числом те, що вже обговорювалося в розмові, тож якщо контент достатньо чутливий, щоб видаляти файл, видаліть і всю розмову.
Чи працює це зі сканованими PDF?
Так. Whizi визначає насичений зображеннями чи сканований PDF за тим, як мало тексту дають його сторінки, і надсилає його один раз через серверну обробку зором, яка повертає розшифровку кожної сторінки. Точність висока на чистих сканах і падає при низькій роздільній здатності, незвичних шрифтах, рукописному тексті та складних таблицях. Оскільки помилково розпізнаний символ у числі непомітний у зв'язній відповіді, перевіряйте будь яку цифру зі сканованого документа за оригіналом.
Чи можна завантажити кілька документів в одну розмову?
Так, і саме тут закладена основна цінність. Порівняння двох контрактів пункт за пунктом, зведення висновків із набору звітів або пошук суперечностей між документами, все це вимагає, щоб усе було в контексті одночасно. Посилайтеся на файли за назвою у своїх запитах, щойно їх більше одного, інакше модель обере сама, не сказавши, який файл вибрала.