Как анализировать таблицы с помощью ИИ в Whizi

Краткий ответ

Чтобы проанализировать таблицу с помощью ИИ, загрузите CSV или Excel файл и сначала попросите его профилировать: количество строк, пропущенные значения, дубликаты и уникальные значения по каждому столбцу. Затем задайте свой реальный вопрос и требуйте указывать метод расчёта рядом с каждой цифрой. Выполните анализ в GPT, затем проверьте вручную одну группу и сверьте результат с Claude.

Профилируйте данные, прежде чем что-либо спрашивать

Самая частая причина, по которой анализ таблиц идёт не так, вообще не связана с ИИ. Дело в том, что в файле 14 строк с пробелом в конце названия региона, два формата дат, строка с промежуточным итогом, которую кто-то оставил посередине, и 300 пустых ячеек в столбце, который вы собираетесь усреднить. Задайте вопрос первым делом, и вы получите уверенный ответ, посчитанный по мусору.

Поэтому первый промпт одинаковый для любого файла.

Промпт: профиль данных

Профилируй этот файл, прежде чем мы что-либо анализируем. Верни: количество строк, названия столбцов с определённым типом, количество и процент пропущенных значений по каждому столбцу, число точных дубликатов строк, уникальные значения для каждого столбца с менее чем 25 уникальными значениями, минимум и максимум для каждого числового столбца и столбца с датами, а также любой столбец, где значения выглядят непоследовательно (смешанные форматы, пробелы в начале или конце, смешанные единицы измерения, смешанные форматы дат). Пока не анализируй и не интерпретируй. Просто скажи, что в файле и что в нём выглядит неправильно.

Один этот промпт отлавливает большую часть того, что иначе испортило бы анализ. Список уникальных значений особенно полезен: именно здесь вы обнаружите, что "UK", "U.K." и "United Kingdom" в ваших данных это три разных региона.

Промпт: исправить найденное

Стандартизируй проблемы, которые ты нашёл: убери лишние пробелы, приведи [столбец] к единому формату и объедини такие варианты: [перечислить]. Покажи мне таблицу соответствий, которую ты применил, прежде чем применять её. Не удаляй ни одной строки, не сказав мне, какие и почему.

Задавайте вопросы, которые дают проверяемые ответы

Расплывчатые вопросы дают расплывчатые ответы. Работающие промпты называют столбец, операцию и формат вывода, а также требуют показать ход расчёта.

Промпт: агрегация с показом расчёта

Сгруппируй по [столбец] и вычисли [метрика]. Верни таблицу в формате Markdown с группой, количеством строк в ней и метрикой. Под таблицей укажи, как именно ты вычислил метрику, какие строки исключил и почему, и как обработал пустые значения. Отсортируй по убыванию по [столбец].

Промпт: когортный вопрос

Для каждой [когортная размерность, например месяц регистрации] вычисли [метрика] на [интервал]. Показывай размер когорты рядом с каждым показателем. Помечай любую когорту меньше [n] строк как слишком маленькую для интерпретации, вместо того чтобы указывать для неё процент.

Эта последняя инструкция предотвращает самый вводящий в заблуждение результат в анализе таблиц: когорту из четырёх пользователей, представленную как "удержание 75%" в таблице рядом с когортой из девяти тысяч.

Промпт: поиск аномалий

Что подозрительного в этих данных? Ищи: значения вне правдоподобного диапазона, резкие разрывы во временном ряду, столбцы, где распределение меняется на середине, строки, которые являются точными или почти точными дубликатами, значения, которые выглядят слишком округлыми, и всё, что указывает на изменение способа сбора данных. По каждому пункту процитируй конкретные строки.

Это самый ценный промпт на этой странице, и у него нет аналога в обычной работе с таблицами. Он регулярно находит день, когда сломалась аналитика, поставщика, который начал отчитываться в другой валюте, и дублирующий импорт, раздувший показатели за квартал.

Промпт: спецификация графика

Порекомендуй подходящий график для этого вопроса и формы данных и объясни, почему очевидная альтернатива здесь хуже. Затем дай мне спецификацию: тип графика, x, y, серии, агрегация, порядок сортировки и обработка осей. Не используй двойную ось. Не обрезай ось столбчатой диаграммы.

Где на самом деле ошибается арифметика

Этот вопрос заслуживает прямого ответа, потому что фраза "ИИ плохо считает" одновременно верна и бесполезно расплывчата.

Языковая модель, рассуждающая о числах в тексте, занимается достраиванием паттернов, а не вычислением. Она надёжна в описании структуры, категоризации строк и определении, какой расчёт вам нужен. Она гораздо менее надёжна в выполнении длинной цепочки арифметики по сотням строк, и ошибается она молча: результат выглядит как аккуратно оформленная таблица неверных чисел без какого-либо сигнала тревоги.

Практические правила:

  • Требуйте метод, а не только результат. Фраза "укажи точно, как ты это посчитал и что исключил" делает ошибку видимой, если она есть.
  • Проверьте одну группу вручную. Возьмите самую маленькую группу в итоговой таблице и проверьте её в реальной таблице. Если совпадает, метод, вероятно, верен; если нет, доверять таблице нельзя.
  • Перепроверяйте всё значимое с помощью второй модели. Совпадение двух независимых моделей на одном числе куда более весомое доказательство, чем повтор одной и той же моделью. Режим сравнения бок о бок в Whizi существует именно для этого.
  • Следите за двойным счётом. Строки с промежуточными итогами, оставленные в файле, и соединения один ко многим, это два обычных виновника, и модель не узнает, что они неправильные.
  • Для всего, что должно быть точным, просите формулу или код. Дай мне формулу Excel или дай мне код на pandas переносит арифметику в детерминированный движок, а модель остаётся для того, в чём она хороша, то есть для определения нужного расчёта.

Последний пункт и есть настоящий ответ для финансовой или отчётной работы. Используйте модель, чтобы спроектировать анализ, и таблицу или скрипт, чтобы его выполнить.

Какая модель читает какой файл и насколько большой файл это слишком много?

CSV и Excel загружаются напрямую, и три модели чётко разделяют работу между собой.

МодельКонтекстное окноКредитов за сообщениеИспользовать для
GPT-5.6 Terra1M токенов4Строгие форматы: чистые таблицы, JSON, точные сопоставления столбцов
Claude Sonnet 51M токенов10Проверочный проход по многошаговой агрегации
Gemini 3.5 Flash1M токенов, около 1900 страниц рукописи8Самые крупные файлы или таблица вместе с PDF в одном чате

Цифры по контексту и кредитам взяты из индекса стоимости моделей Whizi, прайс актуален на 2026-08-20.

Несколько практических советов:

  • Дайте модели чистый прямоугольник. Одна строка заголовка, без объединённых ячеек, без пустых строк-разделителей, без заметок в столбце K. Многострочные заголовки в оформленных отчётах путают извлечение данных сильнее, чем любой лимит размера файла.
  • Отправляйте исходный лист, а не презентационный. Именно версия с оформлением и промежуточными итогами приводит к двойному счёту.
  • Для очень широких файлов сначала полезен список столбцов. Если названия непонятны, спросите, что означает каждый столбец, прежде чем анализировать, и скажите модели, где она ошиблась.
  • Для очень больших файлов используйте Gemini 3.5 Flash, которая читает тот же контекст в 1M токенов, что и Claude Sonnet 5 и GPT-5.6 Terra, при самой низкой цене за ответ среди трёх. Если файл ещё больше, сэмплируйте осознанно: проанализируй случайную выборку из 5000 строк и скажи, какую ошибку выборки мне ожидать по каждому показателю лучше, чем молчаливое усечение файла.
  • Сначала уберите персональные данные. Имена, email и идентификаторы почти никогда не нужны для анализа, а удалить их быстрее, чем спорить, разрешено ли было их загружать.

Технические детали загрузки описаны в загрузке документов.

Полная последовательность из восьми шагов на реальном файле

Весь рабочий процесс на реальном файле, по порядку:

  1. Загрузите файл. Запустите промпт профилирования. Внимательно изучите уникальные значения и количество пропусков.
  2. Исправьте найденное, проверив таблицу соответствий перед её применением.
  3. Попросите краткое описание того, о чём эти данные, и три вопроса, которые, по мнению модели, стоит задать. Этот шаг быстрый и часто переосмысляет весь анализ.
  4. Задайте свой настоящий вопрос, потребовав указать метод и исключения в ответе.
  5. Всегда запускайте промпт поиска аномалий. Именно здесь скрываются сюрпризы.
  6. Проверьте самую маленькую группу вручную.
  7. Перепроверьте итоговое число с помощью второй модели.
  8. Попросите спецификацию графика или формулу, если число должно быть точным и воспроизводимым.

Шаги 1, 5 и 6 люди чаще всего пропускают, и именно они отделяют анализ, который вы сможете обосновать, от красиво оформленной догадки.

Чек-лист
  • Профилируйте файл, прежде чем задавать хоть один аналитический вопрос
  • Изучите список уникальных значений, чтобы отловить варианты написания и смешанные форматы
  • Требуйте указывать метод и исключения рядом с каждой цифрой
  • Помечайте маленькие группы как слишком маленькие вместо указания для них процента
  • Всегда запускайте промпт "что подозрительного в этих данных"
  • Проверяйте самую маленькую группу вручную, прежде чем доверять таблице
  • Перепроверяйте значимые показатели с помощью второй модели
  • Просите формулу или код, когда число должно быть абсолютно точным

Частые вопросы

Насколько большой может быть моя таблица?

Это зависит от тарифа и модели, а практический предел это контекстное окно модели, а не ограничение по размеру файла. Claude Sonnet 5, GPT-5.6 Terra и Gemini 3.5 Flash все читают контекст в 1M токенов в Whizi, это примерно 1900 страниц рукописи данных. Сверх этого сэмплируйте осознанно и просите модель указать ошибку выборки, вместо того чтобы дать файлу молчаливо усечься, ведь именно это приводит к уверенным ответам по части ваших данных.

Может ли ИИ найти ошибки в моей таблице?

Да, и это один из самых полезных промптов из доступных. Вопрос о том, что подозрительного в данных, надёжно выявляет дублирующие импорты, день, когда сломалась аналитика, смешанные единицы измерения или валюты, промежуточные итоги, оставленные внутри данных, и распределения, меняющиеся на середине файла. Просите модель цитировать конкретные строки, чтобы вы могли проверить каждую находку, а не принимать список на веру.

Можно ли доверять цифрам, которые она даёт?

Доверяйте структуре, проверяйте арифметику. Языковые модели сильны в определении нужного расчёта и описании того, что находится в наборе данных, и слабее в длинных цепочках арифметики по многим строкам, где они молча ошибаются, выдавая аккуратно оформленный неверный ответ. Проверяйте самую маленькую группу вручную, перепроверяйте итоговые показатели с помощью второй модели, а для всего, что должно быть точным, просите формулу Excel или код на Python и запускайте его сами.

Какая модель лучше всего подходит для работы с таблицами?

GPT для структурированных рассуждений, строгих форматов вывода и чистых таблиц или JSON. Claude как проверочный проход на многошаговой агрегации, потому что он обычно ошибается иначе, а не так же. Gemini, когда файл очень большой или когда нужно проанализировать таблицу вместе с PDF или отчётом в одном чате.

Работает ли это с формулами Excel и несколькими листами?

Модель читает значения, а не выполняет вашу книгу, поэтому результаты формул передаются, а сама логика формул нет. Для книг с несколькими листами укажите, какой лист вы имеете в виду, и опишите, как листы связаны между собой, либо экспортируйте нужный лист в CSV. Файлы, сделанные для презентации, с объединёнными ячейками и промежуточными итогами внутри данных, создают куда больше проблем, чем просто большие файлы.