Профилируйте данные, прежде чем что-либо спрашивать
Самая частая причина, по которой анализ таблиц идёт не так, вообще не связана с ИИ. Дело в том, что в файле 14 строк с пробелом в конце названия региона, два формата дат, строка с промежуточным итогом, которую кто-то оставил посередине, и 300 пустых ячеек в столбце, который вы собираетесь усреднить. Задайте вопрос первым делом, и вы получите уверенный ответ, посчитанный по мусору.
Поэтому первый промпт одинаковый для любого файла.
Промпт: профиль данных
Профилируй этот файл, прежде чем мы что-либо анализируем. Верни: количество строк, названия столбцов с определённым типом, количество и процент пропущенных значений по каждому столбцу, число точных дубликатов строк, уникальные значения для каждого столбца с менее чем 25 уникальными значениями, минимум и максимум для каждого числового столбца и столбца с датами, а также любой столбец, где значения выглядят непоследовательно (смешанные форматы, пробелы в начале или конце, смешанные единицы измерения, смешанные форматы дат). Пока не анализируй и не интерпретируй. Просто скажи, что в файле и что в нём выглядит неправильно.
Один этот промпт отлавливает большую часть того, что иначе испортило бы анализ. Список уникальных значений особенно полезен: именно здесь вы обнаружите, что "UK", "U.K." и "United Kingdom" в ваших данных это три разных региона.
Промпт: исправить найденное
Стандартизируй проблемы, которые ты нашёл: убери лишние пробелы, приведи [столбец] к единому формату и объедини такие варианты: [перечислить]. Покажи мне таблицу соответствий, которую ты применил, прежде чем применять её. Не удаляй ни одной строки, не сказав мне, какие и почему.
Задавайте вопросы, которые дают проверяемые ответы
Расплывчатые вопросы дают расплывчатые ответы. Работающие промпты называют столбец, операцию и формат вывода, а также требуют показать ход расчёта.
Промпт: агрегация с показом расчёта
Сгруппируй по [столбец] и вычисли [метрика]. Верни таблицу в формате Markdown с группой, количеством строк в ней и метрикой. Под таблицей укажи, как именно ты вычислил метрику, какие строки исключил и почему, и как обработал пустые значения. Отсортируй по убыванию по [столбец].
Промпт: когортный вопрос
Для каждой [когортная размерность, например месяц регистрации] вычисли [метрика] на [интервал]. Показывай размер когорты рядом с каждым показателем. Помечай любую когорту меньше [n] строк как слишком маленькую для интерпретации, вместо того чтобы указывать для неё процент.
Эта последняя инструкция предотвращает самый вводящий в заблуждение результат в анализе таблиц: когорту из четырёх пользователей, представленную как "удержание 75%" в таблице рядом с когортой из девяти тысяч.
Промпт: поиск аномалий
Что подозрительного в этих данных? Ищи: значения вне правдоподобного диапазона, резкие разрывы во временном ряду, столбцы, где распределение меняется на середине, строки, которые являются точными или почти точными дубликатами, значения, которые выглядят слишком округлыми, и всё, что указывает на изменение способа сбора данных. По каждому пункту процитируй конкретные строки.
Это самый ценный промпт на этой странице, и у него нет аналога в обычной работе с таблицами. Он регулярно находит день, когда сломалась аналитика, поставщика, который начал отчитываться в другой валюте, и дублирующий импорт, раздувший показатели за квартал.
Промпт: спецификация графика
Порекомендуй подходящий график для этого вопроса и формы данных и объясни, почему очевидная альтернатива здесь хуже. Затем дай мне спецификацию: тип графика, x, y, серии, агрегация, порядок сортировки и обработка осей. Не используй двойную ось. Не обрезай ось столбчатой диаграммы.
Где на самом деле ошибается арифметика
Этот вопрос заслуживает прямого ответа, потому что фраза "ИИ плохо считает" одновременно верна и бесполезно расплывчата.
Языковая модель, рассуждающая о числах в тексте, занимается достраиванием паттернов, а не вычислением. Она надёжна в описании структуры, категоризации строк и определении, какой расчёт вам нужен. Она гораздо менее надёжна в выполнении длинной цепочки арифметики по сотням строк, и ошибается она молча: результат выглядит как аккуратно оформленная таблица неверных чисел без какого-либо сигнала тревоги.
Практические правила:
- Требуйте метод, а не только результат. Фраза "укажи точно, как ты это посчитал и что исключил" делает ошибку видимой, если она есть.
- Проверьте одну группу вручную. Возьмите самую маленькую группу в итоговой таблице и проверьте её в реальной таблице. Если совпадает, метод, вероятно, верен; если нет, доверять таблице нельзя.
- Перепроверяйте всё значимое с помощью второй модели. Совпадение двух независимых моделей на одном числе куда более весомое доказательство, чем повтор одной и той же моделью. Режим сравнения бок о бок в Whizi существует именно для этого.
- Следите за двойным счётом. Строки с промежуточными итогами, оставленные в файле, и соединения один ко многим, это два обычных виновника, и модель не узнает, что они неправильные.
- Для всего, что должно быть точным, просите формулу или код.
Дай мне формулу Excelилидай мне код на pandasпереносит арифметику в детерминированный движок, а модель остаётся для того, в чём она хороша, то есть для определения нужного расчёта.
Последний пункт и есть настоящий ответ для финансовой или отчётной работы. Используйте модель, чтобы спроектировать анализ, и таблицу или скрипт, чтобы его выполнить.
Какая модель читает какой файл и насколько большой файл это слишком много?
CSV и Excel загружаются напрямую, и три модели чётко разделяют работу между собой.
| Модель | Контекстное окно | Кредитов за сообщение | Использовать для |
|---|---|---|---|
| GPT-5.6 Terra | 1M токенов | 4 | Строгие форматы: чистые таблицы, JSON, точные сопоставления столбцов |
| Claude Sonnet 5 | 1M токенов | 10 | Проверочный проход по многошаговой агрегации |
| Gemini 3.5 Flash | 1M токенов, около 1900 страниц рукописи | 8 | Самые крупные файлы или таблица вместе с PDF в одном чате |
Цифры по контексту и кредитам взяты из индекса стоимости моделей Whizi, прайс актуален на 2026-08-20.
Несколько практических советов:
- Дайте модели чистый прямоугольник. Одна строка заголовка, без объединённых ячеек, без пустых строк-разделителей, без заметок в столбце K. Многострочные заголовки в оформленных отчётах путают извлечение данных сильнее, чем любой лимит размера файла.
- Отправляйте исходный лист, а не презентационный. Именно версия с оформлением и промежуточными итогами приводит к двойному счёту.
- Для очень широких файлов сначала полезен список столбцов. Если названия непонятны, спросите, что означает каждый столбец, прежде чем анализировать, и скажите модели, где она ошиблась.
- Для очень больших файлов используйте Gemini 3.5 Flash, которая читает тот же контекст в 1M токенов, что и Claude Sonnet 5 и GPT-5.6 Terra, при самой низкой цене за ответ среди трёх. Если файл ещё больше, сэмплируйте осознанно:
проанализируй случайную выборку из 5000 строк и скажи, какую ошибку выборки мне ожидать по каждому показателюлучше, чем молчаливое усечение файла. - Сначала уберите персональные данные. Имена, email и идентификаторы почти никогда не нужны для анализа, а удалить их быстрее, чем спорить, разрешено ли было их загружать.
Технические детали загрузки описаны в загрузке документов.
Полная последовательность из восьми шагов на реальном файле
Весь рабочий процесс на реальном файле, по порядку:
- Загрузите файл. Запустите промпт профилирования. Внимательно изучите уникальные значения и количество пропусков.
- Исправьте найденное, проверив таблицу соответствий перед её применением.
- Попросите краткое описание того, о чём эти данные, и три вопроса, которые, по мнению модели, стоит задать. Этот шаг быстрый и часто переосмысляет весь анализ.
- Задайте свой настоящий вопрос, потребовав указать метод и исключения в ответе.
- Всегда запускайте промпт поиска аномалий. Именно здесь скрываются сюрпризы.
- Проверьте самую маленькую группу вручную.
- Перепроверьте итоговое число с помощью второй модели.
- Попросите спецификацию графика или формулу, если число должно быть точным и воспроизводимым.
Шаги 1, 5 и 6 люди чаще всего пропускают, и именно они отделяют анализ, который вы сможете обосновать, от красиво оформленной догадки.
- Профилируйте файл, прежде чем задавать хоть один аналитический вопрос
- Изучите список уникальных значений, чтобы отловить варианты написания и смешанные форматы
- Требуйте указывать метод и исключения рядом с каждой цифрой
- Помечайте маленькие группы как слишком маленькие вместо указания для них процента
- Всегда запускайте промпт "что подозрительного в этих данных"
- Проверяйте самую маленькую группу вручную, прежде чем доверять таблице
- Перепроверяйте значимые показатели с помощью второй модели
- Просите формулу или код, когда число должно быть абсолютно точным
Частые вопросы
Насколько большой может быть моя таблица?
Это зависит от тарифа и модели, а практический предел это контекстное окно модели, а не ограничение по размеру файла. Claude Sonnet 5, GPT-5.6 Terra и Gemini 3.5 Flash все читают контекст в 1M токенов в Whizi, это примерно 1900 страниц рукописи данных. Сверх этого сэмплируйте осознанно и просите модель указать ошибку выборки, вместо того чтобы дать файлу молчаливо усечься, ведь именно это приводит к уверенным ответам по части ваших данных.
Может ли ИИ найти ошибки в моей таблице?
Да, и это один из самых полезных промптов из доступных. Вопрос о том, что подозрительного в данных, надёжно выявляет дублирующие импорты, день, когда сломалась аналитика, смешанные единицы измерения или валюты, промежуточные итоги, оставленные внутри данных, и распределения, меняющиеся на середине файла. Просите модель цитировать конкретные строки, чтобы вы могли проверить каждую находку, а не принимать список на веру.
Можно ли доверять цифрам, которые она даёт?
Доверяйте структуре, проверяйте арифметику. Языковые модели сильны в определении нужного расчёта и описании того, что находится в наборе данных, и слабее в длинных цепочках арифметики по многим строкам, где они молча ошибаются, выдавая аккуратно оформленный неверный ответ. Проверяйте самую маленькую группу вручную, перепроверяйте итоговые показатели с помощью второй модели, а для всего, что должно быть точным, просите формулу Excel или код на Python и запускайте его сами.
Какая модель лучше всего подходит для работы с таблицами?
GPT для структурированных рассуждений, строгих форматов вывода и чистых таблиц или JSON. Claude как проверочный проход на многошаговой агрегации, потому что он обычно ошибается иначе, а не так же. Gemini, когда файл очень большой или когда нужно проанализировать таблицу вместе с PDF или отчётом в одном чате.
Работает ли это с формулами Excel и несколькими листами?
Модель читает значения, а не выполняет вашу книгу, поэтому результаты формул передаются, а сама логика формул нет. Для книг с несколькими листами укажите, какой лист вы имеете в виду, и опишите, как листы связаны между собой, либо экспортируйте нужный лист в CSV. Файлы, сделанные для презентации, с объединёнными ячейками и промежуточными итогами внутри данных, создают куда больше проблем, чем просто большие файлы.