Профілюйте дані, перш ніж про щось питати
Найпоширеніша причина, чому аналіз таблиць виходить хибним, взагалі не пов'язана зі ШІ. Просто у файлі є 14 рядків із пробілом наприкінці назви регіону, два формати дат, рядок підсумку, який хтось лишив посередині, і 300 порожніх клітинок у колонці, яку ви зараз хочете усереднити. Поставте питання одразу, і отримаєте впевнену відповідь, обчислену на сміттєвих даних.
Тому перший запит однаковий для будь-якого файлу.
Запит: профіль
Профілюй цей файл, перш ніж ми щось аналізуватимемо. Поверни: кількість рядків, назви колонок із визначеним типом, кількість і відсоток пропущених значень у кожній колонці, кількість точних дублікатів рядків, унікальні значення для кожної колонки з менш ніж 25 унікальними значеннями, мінімум і максимум кожної числової колонки та колонки з датами, а також будь-яку колонку, де значення виглядають непослідовними (змішані формати, зайві пробіли, змішані одиниці, змішані формати дат). Ще не аналізуй і не інтерпретуй. Просто скажи, що є у файлі і що в ньому виглядає підозріло.
Один цей запит виловлює більшість того, що інакше зіпсувало б аналіз. Саме список унікальних значень покаже, що "UK", "U.K." і "United Kingdom" у ваших даних це три окремі регіони.
Запит: виправ знайдене
Стандартизуй знайдені проблеми: прибери зайві пробіли, приведи [колонка] до єдиного формату та об'єднай ці варіанти: [перелічіть їх]. Покажи мапінг, який застосуєш, у вигляді таблиці перед тим, як його застосувати. Не видаляй жодного рядка, не сказавши, який саме і чому.
Ставте питання, які дають перевірювані відповіді
Розмиті питання дають розмиті відповіді. Робочі запити називають колонку, операцію та формат виводу і вимагають показати хід обчислення.
Запит: агрегація з показаним ходом обчислення
Згрупуй за [колонка] та порахуй [метрика]. Поверни таблицю Markdown із групою, кількістю рядків у ній і метрикою. Під таблицею вкажи точно, як ти обчислив метрику, які рядки виключив і чому, а також як опрацював порожні значення. Відсортуй за спаданням за [колонка].
Запит: когортне питання
Для кожної [вимір когорти, наприклад, місяць реєстрації] порахуй [метрика] за [інтервал]. Показуй розмір когорти поруч із кожним числом. Познач будь-яку когорту з менш ніж [n] рядків як занадто малу для інтерпретації замість того, щоб наводити для неї відсоток.
Ця остання вказівка запобігає найбільш оманливому результату в аналізі таблиць: коли когорту з чотирьох користувачів подають як "75% утримання" поруч у таблиці з когортою з дев'яти тисяч.
Запит: пошук аномалій
Що виглядає підозріло в цих даних? Шукай: значення поза правдоподібним діапазоном, різкі розриви в часовому ряду, колонки, де розподіл змінюється посередині, рядки, які є точними або майже точними дублікатами, значення, що виглядають надто круглими, і все, що вказує на зміну способу збору даних. Для кожного випадку наведи конкретні рядки.
Це найцінніший запит на цій сторінці, і в звичайному робочому процесі з таблицями йому немає аналога. Він регулярно знаходить день, коли зламався трекінг, постачальника, який почав звітувати в іншій валюті, і дублювальний імпорт, що роздув показники за квартал.
Запит: специфікація графіка
Порекомендуй правильний тип графіка для цього питання і форми даних та поясни, чому очевидна альтернатива тут гірша. Потім дай специфікацію: тип графіка, x, y, серії, агрегацію, порядок сортування та обробку осей. Не використовуй подвійну вісь. Не обрізай вісь стовпчикової діаграми.
Де арифметика насправді дає збій
Це заслуговує на пряму відповідь, бо твердження "ШІ поганий у математиці" водночас правдиве і безкорисно розмите.
Мовна модель, яка міркує над числами в тексті, завершує шаблон, а не рахує. Вона надійна в описі структури, категоризації рядків і визначенні, яке обчислення потрібне. Але значно менш надійна у виконанні довгого ланцюга арифметичних дій через сотні рядків, і збій стається мовчки: результат виглядає як акуратно відформатована таблиця неправильних чисел без жодного сигналу тривоги.
Практичні правила:
- Вимагайте метод, а не лише результат. "Вкажи точно, як ти це обчислив і що виключив" робить помилку видимою, якщо вона є.
- Звірте одну групу вручну. Виберіть найменшу групу в таблиці результатів і перевірте її в реальній таблиці. Якщо збігається, метод, ймовірно, правильний; якщо ні, довіряти таблиці не можна нічому.
- Перевіряйте будь-що важливе другою моделлю. Дві незалежні моделі, що дійшли до одного числа, це значно краще свідчення, ніж одна модель, яка повторює саму себе. Саме для цього існує режим порівняння Whizi поруч.
- Стежте за подвійним підрахунком. Рядки підсумків, лишені у файлі, та зв'язки один до багатьох, це два звичні винуватці, і модель не знатиме, що вони неправильні.
- Для всього, що має бути точним, просіть формулу або код.
Дай мені формулу Excelабодай мені код pandasпереносить арифметику в детерміновану машину, а модель лишається для того, у чому вона хороша: знати, яке обчислення виконати.
Останнє це справжня відповідь для фінансової чи звітної роботи. Використовуйте модель, щоб спроєктувати аналіз, а таблицю чи скрипт, щоб його виконати.
Яка модель читає який файл і наскільки великий файл це вже забагато?
CSV і Excel завантажуються напряму, і три моделі акуратно ділять роботу між собою.
| Модель | Контекстне вікно | Кредитів за повідомлення | Використовуйте для |
|---|---|---|---|
| GPT-5.6 Terra | 1 млн токенів | 4 | Суворих форматів: чисті таблиці, JSON, точні мапінги колонок |
| Claude Sonnet 5 | 1 млн токенів | 10 | Перевірки багатоетапної агрегації |
| Gemini 3.5 Flash | 1 млн токенів, приблизно 1 900 сторінок рукопису | 8 | Найбільших файлів або таблиці разом із PDF в одному потоці |
Цифри контексту і кредитів взято з індексу вартості моделей Whizi, тарифи отримано 2026-08-20.
Кілька практичних порад:
- Дайте моделі чистий прямокутник. Один рядок заголовка, без об'єднаних клітинок, без порожніх рядків-роздільників, без приміток у колонці K. Багаторівневі відформатовані звіти плутають вилучення даних більше, ніж будь-яке обмеження на розмір файлу.
- Надсилайте необроблений аркуш, а не презентаційний. Версія з форматуванням і підсумками це та, яка спричиняє подвійний підрахунок.
- Дуже широкі файли виграють від списку колонок спочатку. Запитайте, що означає кожна колонка, перш ніж аналізувати, якщо назви незрозумілі, і скажіть моделі, де вона помилилася.
- Для дуже великих файлів використовуйте Gemini 3.5 Flash, яка читає той самий контекст у 1 млн токенів, що й Claude Sonnet 5 та GPT-5.6 Terra, за найнижчою ціною за відповідь серед трьох. Понад цей обсяг вибирайте вибірку свідомо:
проаналізуй випадкову вибірку з 5000 рядків і скажи, якої похибки вибірки очікувати для кожного показникакраще, ніж мовчки обрізати файл. - Спершу приберіть особисті дані. Імена, електронні адреси й ідентифікатори майже ніколи не потрібні для аналізу, і прибрати їх швидше, ніж з'ясовувати, чи мали ви право їх завантажувати.
Механіка завантаження файлів описана в розділі завантаження документів.
Повна послідовність із восьми кроків на реальному файлі
Весь робочий процес на реальному файлі, по порядку:
- Завантажте файл. Виконайте запит-профіль. Уважно прочитайте унікальні значення і кількість пропусків.
- Виправте знайдене, переглянувши таблицю мапінгу перед тим, як її застосувати.
- Попросіть короткий опис того, про що ці дані, і три питання, які, на думку моделі, варто поставити. Цей крок швидкий і часто переосмислює аналіз.
- Поставте своє реальне питання, вимагаючи в відповіді метод і винятки.
- Завжди виконуйте запит на пошук аномалій. Саме тут ховаються несподіванки.
- Вручну звірте найменшу групу.
- Перевірте головне число другою моделлю.
- Попросіть специфікацію графіка або формулу, якщо число має бути точним і відтворюваним.
Кроки 1, 5 і 6 це ті, які найчастіше пропускають, і саме вони відрізняють аналіз, який можна захистити, від гарно оформленого здогаду.
- Профілюйте файл, перш ніж поставити хоч одне аналітичне питання
- Читайте список унікальних значень, щоб виловити варіанти написання і змішані формати
- Вимагайте метод і винятки поруч із кожним числом
- Позначайте малі групи як занадто малі замість того, щоб наводити для них відсоток
- Завжди виконуйте запит "що виглядає підозріло в цих даних"
- Вручну звіряйте найменшу групу, перш ніж довіряти таблиці
- Перевіряйте важливі показники другою моделлю
- Просіть формулу або код, коли число має бути абсолютно точним
Поширені запитання
Наскільки великою може бути моя таблиця?
Це залежить від плану і моделі, і практичне обмеження це радше контекстне вікно моделі, ніж ліміт розміру файлу. Claude Sonnet 5, GPT-5.6 Terra і Gemini 3.5 Flash читають у Whizi контекст у 1 млн токенів, приблизно 1 900 сторінок рукопису даних. Понад цей обсяг вибирайте вибірку свідомо і просіть модель вказати похибку вибірки, замість того щоб дозволити файлу мовчки обрізатися, а саме це і призводить до впевнених відповідей про частину ваших даних.
Чи може ШІ виявити помилки в моїй таблиці?
Так, і це один із найкорисніших доступних запитів. Питання про те, що виглядає підозріло в даних, надійно виявляє дублювальні імпорти, день, коли зламався трекінг, змішані одиниці чи валюти, рядки підсумків, лишені всередині даних, і розподіли, що змінюються посередині файлу. Попросіть навести конкретні рядки, щоб перевірити кожне спостереження, а не приймати список на віру.
Чи можна довіряти числам, які видає модель?
Довіряйте структурі, перевіряйте арифметику. Мовні моделі сильні у визначенні того, яке обчислення потрібне, і в описі того, що є в наборі даних, і слабші в довгих ланцюгах арифметики через багато рядків, де вони мовчки дають збій із акуратно оформленою неправильною відповіддю. Вручну звірте найменшу групу, перевірте головні показники другою моделлю, а для всього, що має бути точним, попросіть формулу Excel або код Python і виконайте його самостійно.
Яка модель найкраща для роботи з таблицями?
GPT для структурованих міркувань, суворих форматів виводу і чистих таблиць чи JSON. Claude як перевірка багатоетапної агрегації, бо вона зазвичай помиляється інакше, а не так само. Gemini, коли файл дуже великий або коли потрібно аналізувати таблицю разом із PDF чи звітом в одній розмові.
Чи працює це з формулами Excel і кількома аркушами?
Модель читає значення, а не виконує вашу книгу, тож результати формул проходять, а сама логіка формул, яка діє наживо, ні. Для книг із кількома аркушами вкажіть, який аркуш маєте на увазі, і опишіть, як аркуші пов'язані між собою, або експортуйте потрібний аркуш як CSV. Файли, зроблені для презентації, з об'єднаними клітинками і підсумками всередині даних, спричиняють значно більше проблем, ніж великі файли.