Cách phân tích bảng tính bằng AI trong Whizi

Trả lời nhanh

Để phân tích một bảng tính bằng AI, hãy tải tệp CSV hoặc Excel lên và khảo sát dữ liệu trước khi hỏi bất cứ điều gì: số dòng, giá trị thiếu, dòng trùng lặp và số giá trị khác biệt trong từng cột. Sau đó đặt câu hỏi thật của bạn và yêu cầu nêu rõ phương pháp tính bên cạnh mọi con số. Chạy phân tích trong GPT, rồi kiểm chứng bằng cách rà soát thủ công một nhóm và đối chiếu với Claude.

Khảo sát dữ liệu trước khi hỏi bất cứ điều gì

Cách phổ biến nhất khiến việc phân tích bảng tính đi sai hướng không liên quan gì đến AI. Đó là khi tệp chứa 14 dòng có khoảng trắng thừa trong tên khu vực, hai định dạng ngày khác nhau, một dòng tổng phụ ai đó để sót ở giữa, và 300 ô trống trong đúng cột bạn sắp tính trung bình. Nếu bạn hỏi câu hỏi trước, bạn sẽ nhận được một câu trả lời rất tự tin được tính trên dữ liệu rác.

Vì vậy prompt đầu tiên luôn giống nhau trên mọi tệp.

Prompt: khảo sát dữ liệu

Hãy khảo sát tệp này trước khi chúng ta phân tích bất cứ điều gì. Trả về: số dòng, tên cột kèm kiểu dữ liệu suy ra, số lượng và tỷ lệ phần trăm giá trị thiếu theo từng cột, số dòng trùng lặp hoàn toàn, các giá trị khác biệt của mọi cột có ít hơn 25 giá trị khác biệt, giá trị nhỏ nhất và lớn nhất của mọi cột số và cột ngày, cùng bất kỳ cột nào có giá trị trông không nhất quán (định dạng lẫn lộn, khoảng trắng thừa, đơn vị lẫn lộn, định dạng ngày lẫn lộn). Chưa phân tích hay diễn giải vội. Chỉ cho tôi biết tệp này chứa gì và có gì trông không ổn.

Chỉ riêng prompt này đã bắt được phần lớn những gì đáng lẽ sẽ phá hỏng phân tích. Danh sách giá trị khác biệt đặc biệt là nơi bạn phát hiện ra "UK", "U.K." và "United Kingdom" là ba khu vực riêng biệt trong dữ liệu của bạn.

Prompt: sửa những gì đã phát hiện

Hãy chuẩn hóa các vấn đề bạn vừa phát hiện: cắt bỏ khoảng trắng thừa, thống nhất [cột] về một định dạng duy nhất, và gộp các biến thể sau: [liệt kê]. Hiển thị bảng ánh xạ bạn đã áp dụng trước khi thực hiện. Không được xóa bất kỳ dòng nào mà không cho tôi biết dòng nào và vì sao.

Đặt câu hỏi cho ra câu trả lời có thể kiểm chứng

Câu hỏi mơ hồ sẽ nhận câu trả lời mơ hồ. Các prompt hiệu quả nêu rõ tên cột, phép tính, định dạng đầu ra, và yêu cầu trình bày cả cách làm.

Prompt: tổng hợp kèm cách tính

Nhóm theo [cột] và tính [chỉ số]. Trả về một bảng Markdown gồm nhóm, số dòng trong nhóm đó, và chỉ số. Bên dưới bảng, nêu chính xác cách bạn tính chỉ số này, những dòng nào bạn đã loại và vì sao, cùng cách bạn xử lý ô trống. Sắp xếp giảm dần theo [cột].

Prompt: câu hỏi theo nhóm cohort

Với mỗi [chiều cohort, ví dụ tháng đăng ký], hãy tính [chỉ số] theo [khoảng thời gian]. Hiển thị quy mô cohort cạnh mỗi con số. Đánh dấu bất kỳ cohort nào có ít hơn [n] dòng là quá nhỏ để diễn giải thay vì báo cáo một tỷ lệ phần trăm cho nó.

Chỉ dẫn cuối cùng đó ngăn chặn kiểu kết quả gây hiểu lầm nhất trong phân tích bảng tính: một cohort chỉ có bốn người dùng được báo cáo là "giữ chân 75%" và nằm trong cùng bảng với một cohort chín nghìn người.

Prompt: truy tìm bất thường

Điều gì trong dữ liệu này trông đáng ngờ? Hãy tìm: giá trị nằm ngoài phạm vi hợp lý, sự gián đoạn đột ngột trong chuỗi thời gian, các cột mà phân phối thay đổi giữa chừng, các dòng trùng lặp hoàn toàn hoặc gần giống nhau, các giá trị trông quá tròn, và bất cứ điều gì cho thấy cách thu thập dữ liệu đã thay đổi. Với mỗi phát hiện, hãy trích dẫn các dòng cụ thể.

Đây là prompt có giá trị cao nhất trên trang này và không có điều tương đương trong quy trình bảng tính thông thường. Nó thường xuyên tìm ra ngày mà việc theo dõi bị hỏng, nhà cung cấp bắt đầu báo cáo bằng loại tiền tệ khác, và lần nhập dữ liệu trùng lặp đã thổi phồng một quý.

Prompt: đặc tả biểu đồ

Đề xuất loại biểu đồ phù hợp cho câu hỏi này và hình dạng dữ liệu này, và giải thích vì sao phương án hiển nhiên khác lại kém hơn ở đây. Sau đó cho tôi đặc tả: loại biểu đồ, trục x, trục y, chuỗi dữ liệu, phép tổng hợp, thứ tự sắp xếp, và cách xử lý trục. Không dùng trục kép. Không cắt ngắn trục của biểu đồ cột.

Chỗ nào phép tính thực sự đi sai

Vấn đề này xứng đáng có một câu trả lời rõ ràng, vì "AI kém về toán" vừa đúng vừa mơ hồ đến mức vô ích.

Một mô hình ngôn ngữ suy luận trên các con số dưới dạng văn bản đang thực hiện việc hoàn thiện mẫu hình, chứ không phải tính toán. Nó đáng tin cậy khi mô tả cấu trúc, phân loại các dòng, và xác định phép tính bạn cần. Nó kém tin cậy hơn nhiều khi thực hiện một chuỗi phép tính dài qua hàng trăm dòng, và nó thất bại một cách im lặng: kết quả là một bảng được trình bày đẹp mắt chứa những con số sai mà không có tín hiệu cảnh báo nào.

Các quy tắc thực tế:

  • Yêu cầu nêu phương pháp, không chỉ kết quả. "Nêu chính xác cách bạn tính ra con số này và những gì đã loại" giúp lộ ra lỗi nếu có.
  • Rà soát thủ công một nhóm. Chọn nhóm nhỏ nhất trong bảng kết quả và kiểm chứng nó trong bảng tính thực tế. Nếu khớp, phương pháp có khả năng đúng; nếu không, không con số nào trong bảng có thể tin được.
  • Đối chiếu mọi thứ quan trọng với một mô hình thứ hai. Hai mô hình độc lập cùng ra một con số là bằng chứng đáng tin hơn nhiều so với một mô hình lặp lại chính nó. Chế độ xem song song của Whizi tồn tại chính vì mục đích này.
  • Cảnh giác với việc đếm trùng. Các dòng tổng phụ còn sót lại trong tệp và các phép nối một-nhiều là hai thủ phạm thường gặp nhất, và mô hình sẽ không biết chúng sai.
  • Với những gì bắt buộc phải chính xác, hãy yêu cầu công thức hoặc mã. Cho tôi công thức Excel hoặc cho tôi mã pandas đưa phép tính vào một cỗ máy xác định, và bạn giữ lại mô hình cho phần nó giỏi, đó là biết cần chạy phép tính nào.

Điều cuối cùng đó chính là câu trả lời thực sự cho công việc tài chính hoặc báo cáo. Dùng mô hình để thiết kế phân tích, dùng bảng tính hoặc một đoạn script của bạn để thực thi nó.

Mô hình nào đọc tệp nào, và tệp bao lớn là quá lớn?

Cả CSV và Excel đều tải lên trực tiếp, và ba mô hình chia công việc rất rõ ràng.

Mô hìnhCửa sổ ngữ cảnhTín dụng mỗi tin nhắnDùng cho
GPT-5.6 Terra1M token4Định dạng chặt chẽ: bảng gọn gàng, JSON, ánh xạ cột chính xác
Claude Sonnet 51M token10Bước đối chiếu cho phép tổng hợp nhiều bước
Gemini 3.5 Flash1M token, khoảng 1.900 trang bản thảo8Các tệp lớn nhất, hoặc một bảng tính cộng một PDF trong cùng một luồng

Số liệu ngữ cảnh và tín dụng lấy từ chỉ số chi phí mô hình của Whizi, giá niêm yết cập nhật ngày 2026-08-20.

Một vài lưu ý thực tế:

  • Đưa một khối hình chữ nhật sạch. Một dòng tiêu đề, không ô nào bị gộp, không dòng trống chen giữa, không ghi chú trong cột K. Các báo cáo có định dạng nhiều tiêu đề gây rối cho việc trích xuất hơn bất kỳ giới hạn dung lượng tệp nào.
  • Gửi bảng thô, không phải bảng trình chiếu. Phiên bản có định dạng và các dòng tổng phụ chính là phiên bản gây ra đếm trùng.
  • Tệp rất rộng nên có danh sách cột trước. Hãy hỏi mỗi cột nghĩa là gì trước khi phân tích nếu tên cột khó hiểu, và cho mô hình biết nó đã hiểu sai chỗ nào.
  • Với tệp rất lớn, dùng Gemini 3.5 Flash, mô hình đọc cùng cửa sổ ngữ cảnh 1M token như Claude Sonnet 5 và GPT-5.6 Terra với chi phí mỗi câu trả lời thấp nhất trong ba mô hình. Vượt quá mức đó, hãy lấy mẫu một cách có chủ đích: phân tích một mẫu ngẫu nhiên 5000 dòng và cho tôi biết sai số lấy mẫu tôi nên kỳ vọng trên mỗi con số là tốt hơn việc để tệp bị cắt bớt âm thầm.
  • Loại bỏ dữ liệu cá nhân trước. Tên, email và định danh gần như không bao giờ cần cho việc phân tích, và việc gỡ bỏ chúng nhanh hơn nhiều so với việc tranh cãi xem bạn có được phép tải chúng lên hay không.

Cách thức tải tệp lên được trình bày trong tải tài liệu lên.

Toàn bộ trình tự tám bước trên một tệp thực tế

Toàn bộ quy trình trên một tệp thực tế, theo thứ tự:

  1. Tải tệp lên. Chạy prompt khảo sát dữ liệu. Đọc kỹ danh sách giá trị khác biệt và số lượng giá trị thiếu.
  2. Sửa những gì đã phát hiện, xem lại bảng ánh xạ trước khi áp dụng.
  3. Yêu cầu tóm tắt dữ liệu này nói về gì và ba câu hỏi mà mô hình nghĩ bạn nên đặt ra. Bước này nhanh và thường giúp định hình lại phân tích.
  4. Đặt câu hỏi thật của bạn, yêu cầu nêu phương pháp và các phần loại trừ trong câu trả lời.
  5. Luôn chạy prompt truy tìm bất thường. Đây là nơi những bất ngờ xuất hiện.
  6. Rà soát thủ công nhóm nhỏ nhất.
  7. Đối chiếu con số chính với một mô hình thứ hai.
  8. Yêu cầu đặc tả biểu đồ, hoặc công thức nếu con số cần chính xác và có thể tái tạo.

Bước 1, 5 và 6 là những bước mọi người hay bỏ qua, và chính chúng là ranh giới giữa một phân tích bạn có thể bảo vệ được và một phỏng đoán được trình bày đẹp mắt.

Danh sách kiểm tra
  • Khảo sát tệp trước khi đặt bất kỳ câu hỏi phân tích nào
  • Đọc danh sách giá trị khác biệt để phát hiện cách viết biến thể và định dạng lẫn lộn
  • Yêu cầu nêu phương pháp và các phần loại trừ bên cạnh mỗi con số
  • Đánh dấu các nhóm nhỏ là quá nhỏ thay vì báo cáo tỷ lệ phần trăm cho chúng
  • Luôn chạy prompt "điều gì trong dữ liệu này trông đáng ngờ"
  • Rà soát thủ công nhóm nhỏ nhất trước khi tin bảng kết quả
  • Đối chiếu các con số quan trọng với một mô hình thứ hai
  • Yêu cầu công thức hoặc mã khi con số cần phải chính xác tuyệt đối

Câu hỏi thường gặp

Bảng tính của tôi có thể lớn đến mức nào?

Điều này phụ thuộc vào gói và mô hình, và giới hạn thực tế là cửa sổ ngữ cảnh của mô hình chứ không phải mức trần dung lượng tệp. Claude Sonnet 5, GPT-5.6 Terra và Gemini 3.5 Flash đều đọc cửa sổ ngữ cảnh 1M token trong Whizi, khoảng 1.900 trang bản thảo dữ liệu. Vượt quá mức đó, hãy lấy mẫu một cách có chủ đích và yêu cầu mô hình nêu rõ sai số lấy mẫu thay vì để tệp bị cắt bớt âm thầm, đó là kiểu lỗi tạo ra những câu trả lời tự tin về chỉ một phần dữ liệu của bạn.

AI có thể phát hiện lỗi trong bảng tính của tôi không?

Có, và đây là một trong những prompt có giá trị cao nhất hiện có. Việc hỏi điều gì trong dữ liệu trông đáng ngờ thường phát hiện ra các lần nhập dữ liệu trùng lặp, ngày mà việc theo dõi bị hỏng, đơn vị hoặc loại tiền tệ lẫn lộn, các dòng tổng phụ còn sót trong dữ liệu, và các phân phối thay đổi giữa chừng tệp. Hãy yêu cầu trích dẫn các dòng cụ thể để bạn có thể kiểm chứng từng phát hiện thay vì tin theo danh sách đó.

Tôi có thể tin những con số nó đưa ra không?

Hãy tin cấu trúc, kiểm chứng phép tính. Các mô hình ngôn ngữ mạnh trong việc xác định cần phép tính nào và mô tả những gì có trong tập dữ liệu, và yếu hơn trong các chuỗi phép tính dài qua nhiều dòng, nơi chúng thất bại một cách im lặng với một câu trả lời sai được trình bày đẹp mắt. Hãy rà soát thủ công nhóm nhỏ nhất, đối chiếu các con số chính với một mô hình thứ hai, và với những gì bắt buộc phải chính xác, hãy yêu cầu công thức Excel hoặc mã Python và tự mình chạy nó.

Mô hình nào tốt nhất cho công việc bảng tính?

GPT cho việc suy luận có cấu trúc, định dạng đầu ra chặt chẽ, và bảng hoặc JSON gọn gàng. Claude làm bước đối chiếu cho phép tổng hợp nhiều bước, vì nó có xu hướng mắc lỗi khác thay vì lặp lại cùng một lỗi. Gemini khi tệp rất lớn hoặc khi bạn muốn phân tích một bảng tính cùng với một PDF hoặc báo cáo trong cùng một cuộc trò chuyện.

Nó có hoạt động với công thức Excel và nhiều trang tính không?

Nó đọc các giá trị chứ không thực thi tệp làm việc của bạn, vì vậy kết quả công thức sẽ được đưa vào nhưng logic công thức sống không đi kèm. Với tệp làm việc nhiều trang tính, hãy nói rõ bạn muốn trang nào và mô tả các trang liên hệ với nhau ra sao, hoặc xuất trang bạn quan tâm dưới dạng CSV. Các tệp được làm để trình chiếu, với ô gộp và tổng phụ nằm trong dữ liệu, gây ra nhiều vấn đề hơn hẳn so với tệp lớn.