Jak przesyłać dokumenty do AI w Whizi

Krótka odpowiedź

Dołącz plik w oknie rozmowy, przeciągając go lub klikając ikonę spinacza, a następnie zadaj pytanie. Whizi akceptuje pliki PDF, dokumenty Word, arkusze kalkulacyjne, obrazy oraz pliki kodu lub zwykłego tekstu. To, co otrzymuje model, różni się w zależności od typu pliku: wyodrębniony tekst dla dokumentów, wartości komórek dla arkuszy oraz sam obraz dla zdjęć.

Obsługiwane typy plików i co się z nimi naprawdę dzieje

Dołącz plik, przeciągając go do okna rozmowy lub klikając ikonę spinacza, a następnie zadaj pytanie. To, co otrzymuje model, różni się w zależności od typu pliku, a znajomość tych różnic tłumaczy większość zaskakujących wyników.

TypRozszerzeniaZ czym pracuje model
Tekstowe PDF.pdfWyodrębniony tekst, w kolejności czytania, wraz z tabelami zapisanymi jako tekst
Zeskanowane PDF.pdfTranskrypcja strona po stronie z serwerowego przebiegu wizyjnego
Dokumenty Word.docxTekst dokumentu, wyodrębniony w przeglądarce
Arkusze kalkulacyjne.xlsx, .csvWartości komórek jako tekst, nie działające formuły
Obrazy.png, .jpg, .jpegSam obraz, odczytywany przez model multimodalny
Kod i zwykły tekst.py, .js, .ts, .go, .md, .txt i podobneZawartość pliku dosłownie

Warto zapamiętać dwie konsekwencje. Po pierwsze, arkusz kalkulacyjny trafia do modelu jako wartości, a nie jako działający skoroszyt, więc model widzi wynik formuły, ale nie może jej ponownie wykonać. Po drugie, zeskanowany PDF przeszedł przez transkrypcję wizyjną, a nie zwykłe wyodrębnianie tekstu, więc nietypowa czcionka, odręczna adnotacja lub niska rozdzielczość skanu mogą wciąż powodować błędny odczyt znaku w liczbie. Sprawdzaj liczby z zeskanowanych dokumentów względem oryginału. Jedna uwaga dotycząca obrazów: okno rozmowy odrzuca pliki GIF i prosi o PNG lub JPEG.

Przygotuj plik, zanim o cokolwiek zapytasz

Pięć minut tutaj oszczędza chaotyczną rozmowę później.

  • Nadaj plikowi nazwę zgodną z jego treścią. Model widzi nazwę pliku, a 2025-q3-vendor-contract-acme.pdf daje mu przydatny kontekst, którego nie daje document(3).pdf. Ma to ogromne znaczenie zwłaszcza gdy w wątku jest już kilka plików.
  • Wyślij źródło, a nie wersję prezentacyjną. Zwłaszcza w przypadku arkuszy kalkulacyjnych, wersja ze scalonymi komórkami, sumami pośrednimi w danych i notatkami na marginesie powoduje znacznie więcej błędów niż duży, zwykły plik.
  • Dziel ogromne dokumenty według treści, nie rozmiaru. Jeśli potrzebujesz tylko sekcji metodologii i wyników, przesłanie ich jest lepsze niż wgranie 400 stron w nadziei, że uwaga trafi we właściwe miejsce.
  • Usuń zbędne dane osobowe. Imiona, nazwiska, e-maile i identyfikatory rzadko są potrzebne do analizy, a ich usunięcie jest szybsze niż zastanawianie się, czy w ogóle wolno było je przesłać.
  • Sprawdź, czy PDF faktycznie jest tekstem. Spróbuj zaznaczyć tekst w czytniku PDF. Jeśli się nie da, to skan, Whizi przetranskrybuje go za pomocą przebiegu wizyjnego, a liczby zasługują na porównanie z oryginałem.

Wybór modelu do konkretnego pliku

Ten wybór ma większe znaczenie niż prompt przy pracy z dokumentami.

  • Gemini do wszystkiego, co długie. Modele Gemini w Whizi mają okno kontekstu na 1 000 000 tokenów, co oznacza, że 200 stronicowy raport, pełny komplet umów albo kilkanaście artykułów może być obecne naraz, zamiast być przetwarzane w częściach. Pytania dotyczące wielu dokumentów działają poprawnie tylko wtedy, gdy wszystko rzeczywiście znajduje się w kontekście.
  • Claude do niuansów. Język prawny, dokumenty dotyczące polityk, wszystko, gdzie znaczenie zależy od zastrzeżeń i ostrożnych sformułowań. Jest też najlepszy w mówieniu, czego dokument nie mówi, co często jest właściwym pytaniem.
  • GPT do ekstrakcji. Faktury, formularze, dane strukturalne, wszystko, gdzie chcesz otrzymać ścisłą tabelę lub JSON i spójne nazwy pól w setce wierszy.
  • Dowolny model multimodalny do obrazów, wykresów, zrzutów ekranu i diagramów. Poproś go, aby najpierw opisał, co widzi, zanim poprosisz o interpretację, co pozwala wcześnie wychwycić błędne odczyty.

Możesz zmieniać modele w trakcie wątku bez ponownego przesyłania pliku, o to właśnie chodzi w pracy w jednym miejscu. Czytaj z Gemini, wyciągaj dane z GPT, a podsumowanie zleć Claude, wszystko na tym samym załączonym pliku. Zobacz zmianę modeli w trakcie rozmowy.

Praca z kilkoma dokumentami naraz

Pytania dotyczące jednego dokumentu są przydatne. Pytania dotyczące wielu dokumentów to miejsce, w którym przestaje to być wygodą, a zaczyna być możliwością, której wcześniej nie miałeś.

Prompt: porównaj

Porównaj contract-a.pdf i contract-b.pdf. Zwróć tabelę każdej klauzuli, która się różni: klauzula, co mówi A, co mówi B oraz która wersja jest dla nas korzystniejsza i dlaczego. Zignoruj różnice w formatowaniu i numeracji. Wypisz osobno klauzule obecne w jednym dokumencie, a nieobecne w drugim.

Prompt: skonsoliduj

Na podstawie wszystkich załączonych plików zbuduj jedną tabelę odpowiadającą na [pytanie]. Jeden wiersz na dokument, z nazwą dokumentu w pierwszej kolumnie. Tam, gdzie dokument tego nie porusza, wpisz BRAK DANYCH. Nie łącz dokumentów stosujących różne definicje bez oznaczenia tego.

Prompt: znajdź sprzeczność

Gdzie te dokumenty sobie zaprzeczają? Zacytuj oba fragmenty obok siebie i podaj plik, z którego pochodzi każdy z nich. Odróżnij prawdziwe sprzeczności od różnic wynikających z zakresu lub daty.

Zawsze odwołuj się do plików po nazwie w prompcie, gdy jest ich więcej niż jeden. "W umowie z dostawcą, jaki jest okres wypowiedzenia?" jest jednoznaczne; "jaki jest okres wypowiedzenia?" zmusza model do wyboru, a on nie powie ci, który wybrał.

Gdy odpowiedź wygląda źle

Krótka sekwencja diagnostyczna, która rozwiązuje większość problemów.

Model twierdzi, że nie widzi pliku. Sprawdź, czy załącznik faktycznie się wgrał, a następnie odwołaj się do niego wprost: "W załączonym report.pdf". Zwłaszcza w przypadku obrazów, powiedzenie "spójrz na załączony obraz" zapewnia użycie ścieżki multimodalnej zamiast odpowiedzi opartej wyłącznie na tekście twojego pytania.

Odpowiedź dotyczy niewłaściwego dokumentu. Podawaj nazwę pliku przy każdym pytaniu, gdy w wątku jest ich kilka.

Liczby są subtelnie błędne w zeskanowanym dokumencie. To wina transkrypcji skanu, nie rozumowania. Poproś model, aby zacytował otaczającą linię dosłownie, żebyś zobaczył, co odczytał, a następnie sprawdź oryginał.

Ominął coś, o czym wiesz, że tam jest. Zadaj najpierw pytanie lokalizujące: Zacytuj fragment omawiający [temat] i podaj jego stronę lub sekcję. Jeśli go nie znajdzie, problemem jest ekstrakcja, nie rozumowanie. Spróbuj innego modelu albo prześlij osobno odpowiednie strony.

Podsumowuje zamiast odpowiadać. Poproś o dowód zamiast wniosku: Zacytuj dokładny tekst, który potwierdza twoją odpowiedź. To wychwytuje też przypadek, gdy odpowiedź wywnioskowano z ogólnej wiedzy, a nie z twojego dokumentu, co jest najważniejszym błędem do wychwycenia.

Ta ostatnia kontrola zasługuje na podkreślenie. Model zapytany o dobrze znany typ umowy, powszechne przepisy albo słynny artykuł naukowy może odpowiedzieć wiarygodnie na podstawie danych treningowych, w ogóle nie zaglądając do twojego pliku. Wymóg cytatu zmusza odpowiedź do oparcia się na dokumencie faktycznie przed nim.

Prywatność i o czym pomyśleć przed przesłaniem

Przesłane załączniki są skonfigurowane tak, by wygasać po maksymalnie 30 dniach, a ty sam możesz usunąć plik lub całą rozmowę wcześniej. Whizi nie wykorzystuje twoich promptów, plików, rozmów, transkrypcji głosowych ani wygenerowanych treści do trenowania modeli AI należących do Whizi i nie sprzedaje tych treści jako danych treningowych. Dostawca obsługujący wybrany przez ciebie model otrzymuje to, co potrzebne do udzielenia odpowiedzi, i może przechowywać tymczasowe kopie zgodnie z własną polityką.

To, co zawsze pozostaje twoją oceną, to czy dany dokument w ogóle wolno ci przetwarzać za pomocą usługi zewnętrznego dostawcy. Kategorie warte zastanowienia: dane osobowe innych osób, wszystko objęte konkretną klauzulą poufności, istotne informacje niepubliczne oraz dane regulowane, takie jak dokumentacja medyczna lub finansowa podlegająca szczególnym zasadom postępowania.

Praktycznym rozwiązaniem pośrednim dla większości osób jest zredagowanie danych zamiast rezygnacji z przesłania. Zastąpienie imion i nazwisk rolami, indeksowanie liczb zamiast podawania wartości bezwzględnych oraz usunięcie identyfikatorów zachowa wszystko, czego potrzebuje analiza, usuwając większość tego, co czyni dokument wrażliwym.

Lista kontrolna
  • Nadawaj plikom opisowe nazwy, bo model widzi nazwę pliku
  • Sprawdź, czy PDF jest tekstem czy skanem, zanim zaufasz wyodrębnionym liczbom
  • Prześlij źródłowy arkusz kalkulacyjny, a nie sformatowaną wersję prezentacyjną
  • Wybierz Gemini do długich plików, Claude do niuansów, GPT do ekstrakcji
  • Odwołuj się do plików po nazwie, gdy dołączony jest więcej niż jeden
  • Poproś o cytat na poparcie, aby odpowiedzi pozostały oparte na dokumencie
  • Usuń zbędne dane osobowe niepotrzebne do analizy

Najczęstsze pytania

Czy moje przesłane pliki są prywatne?

Przesłane pliki są przechowywane na twoim koncie, skonfigurowane tak, by wygasać po maksymalnie 30 dniach, i można je usunąć wcześniej w dowolnym momencie. Whizi nie wykorzystuje twoich promptów, plików, rozmów, transkrypcji głosowych ani wygenerowanych treści do trenowania modeli AI należących do Whizi i nie sprzedaje tych treści jako danych treningowych. To, co pozostaje twoją decyzją, to czy dany dokument w ogóle wolno ci wysłać do usługi zewnętrznego dostawcy, co zwykle regulują twoje własne umowy lub wewnętrzne zasady, a nie nasze.

Jaki jest maksymalny rozmiar pliku?

Każdy plik jest ograniczony do 10 MB, a jedna wiadomość może zawierać do 6 plików. W ramach tych limitów wiążącym ograniczeniem jest okno kontekstu modelu: przy długich umowach, raportach i zestawach wielu dokumentów wybierz model z dużym kontekstem, taki jak Gemini, albo prześlij odpowiednie fragmenty zamiast całego pliku, ponieważ celowany kontekst zwykle i tak daje lepszą odpowiedź.

Czy mogę usunąć plik po rozmowie?

Tak, pliki można usunąć w dowolnym momencie, a pozostawione bez zmian przesłane pliki są skonfigurowane tak, by wygasać samodzielnie po maksymalnie 30 dniach. Zwróć uwagę, że usunięcie pliku nie wymazuje wstecznie tego, co zostało już omówione w rozmowie, więc jeśli treść jest na tyle wrażliwa, by usunąć plik, usuń też całą rozmowę.

Czy to działa z zeskanowanymi plikami PDF?

Tak. Whizi wykrywa zeskanowany lub obrazowy PDF na podstawie tego, jak mało tekstu dają jego strony, i wysyła go raz przez serwerowy przebieg wizyjny, który zwraca transkrypcję strona po stronie. Dokładność jest wysoka przy czystych skanach i spada przy niskiej rozdzielczości, nietypowych czcionkach, piśmie odręcznym i złożonych układach tabel. Ponieważ błędnie odczytany znak w liczbie jest niewidoczny w płynnej odpowiedzi, sprawdzaj każdą liczbę z zeskanowanego dokumentu względem oryginału.

Czy mogę przesłać kilka dokumentów do tej samej rozmowy?

Tak, i właśnie tam kryje się najwięcej wartości. Porównywanie dwóch umów klauzula po klauzuli, konsolidowanie wniosków z zestawu raportów czy szukanie sprzeczności między dokumentami to wszystko rzeczy wymagające, by wszystko było naraz w kontekście. Odwołuj się do plików po nazwie w swoich promptach, gdy jest ich więcej niż jeden, w przeciwnym razie model wybierze za ciebie, nie mówiąc który.