Whizi-তে AI দিয়ে স্প্রেডশিট বিশ্লেষণ করার উপায়

দ্রুত উত্তর

AI দিয়ে একটি স্প্রেডশিট বিশ্লেষণ করতে, CSV বা Excel ফাইলটি আপলোড করুন এবং কিছু জিজ্ঞাসা করার আগে সেটি প্রোফাইল করুন: সারির সংখ্যা, অনুপস্থিত মান, ডুপ্লিকেট, আর প্রতিটি কলামের ভিন্ন ভিন্ন মান। তারপর আপনার আসল প্রশ্নটি জিজ্ঞাসা করুন আর প্রতিটি সংখ্যার সাথে পদ্ধতিটিও দাবি করুন। GPT-তে বিশ্লেষণটি চালান, তারপর একটি গ্রুপ হাতে যাচাই করে আর Claude দিয়ে ক্রস-চেক করে যাচাই করুন।

কিছু জিজ্ঞাসা করার আগে ডেটা প্রোফাইল করুন

স্প্রেডশিট বিশ্লেষণ ভুল হওয়ার সবচেয়ে সাধারণ কারণের সাথে AI-এর কোনো সম্পর্ক নেই। আসল ব্যাপার হলো ফাইলে অঞ্চলের নামে পিছনে স্পেসসহ 14টি সারি আছে, দুটি তারিখ ফরম্যাট আছে, মাঝখানে কেউ একটি সাবটোটাল সারি রেখে দিয়েছে, আর যে কলামের গড় বের করতে যাচ্ছেন তাতে 300টি ফাঁকা ঘর আছে। আগে প্রশ্ন জিজ্ঞাসা করলে আপনি জঞ্জালের উপর হিসাব করা একটি আত্মবিশ্বাসী উত্তর পাবেন।

তাই প্রতিটি ফাইলে প্রথম প্রম্পটটি একই থাকে।

প্রম্পট: প্রোফাইল

আমরা কিছু বিশ্লেষণ করার আগে এই ফাইলটি প্রোফাইল করুন। ফেরত দিন: সারির সংখ্যা, অনুমিত টাইপসহ কলামের নাম, প্রতিটি কলামে অনুপস্থিত মানের সংখ্যা আর শতাংশ, হুবহু ডুপ্লিকেট সারির সংখ্যা, 25টির কম ভিন্ন মানযুক্ত প্রতিটি কলামের ভিন্ন মানগুলো, প্রতিটি সংখ্যাসূচক আর তারিখ কলামের সর্বনিম্ন আর সর্বোচ্চ মান, আর যেকোনো কলাম যেখানে মানগুলো অসামঞ্জস্যপূর্ণ মনে হয় (মিশ্র ফরম্যাট, পিছনে ফাঁকা স্থান, মিশ্র একক, মিশ্র তারিখ ফরম্যাট)। এখনো বিশ্লেষণ বা ব্যাখ্যা করবেন না। শুধু বলুন ফাইলে কী আছে আর এতে কী ভুল মনে হচ্ছে।

একক প্রম্পটটি সেই বেশিরভাগ সমস্যাই ধরে ফেলে যা অন্যথায় বিশ্লেষণটি নষ্ট করে দিত। বিশেষ করে ভিন্ন-মানের তালিকাতেই আপনি আবিষ্কার করবেন যে "UK", "U.K.", আর "United Kingdom" আপনার ডেটায় তিনটি আলাদা অঞ্চল।

প্রম্পট: যা পাওয়া গেছে তা ঠিক করুন

আপনি যে সমস্যাগুলো চিহ্নিত করেছেন তা প্রমিতকরণ করুন: ফাঁকা স্থান ছেঁটে ফেলুন, [column]-কে একটি একক ফরম্যাটে একত্র করুন, আর এই ভ্যারিয়েন্টগুলো একত্রিত করুন: [তালিকা করুন]। প্রয়োগ করার আগে আপনি যে ম্যাপিং প্রয়োগ করেছেন তা একটি টেবিল হিসেবে দেখান। কোনো সারি না জানিয়ে বাদ দেবেন না, কোনটি আর কেন তা বলুন।

যেসব প্রশ্ন যাচাইযোগ্য উত্তর দেয় সেগুলো জিজ্ঞাসা করুন

অস্পষ্ট প্রশ্নে অস্পষ্ট উত্তর পাওয়া যায়। যেসব প্রম্পট কাজ করে সেগুলো কলাম, অপারেশন, আর আউটপুট ফরম্যাটের নাম বলে দেয়, আর কাজের পদ্ধতিও চায়।

প্রম্পট: কাজের পদ্ধতিসহ অ্যাগ্রিগেশন

[column] অনুযায়ী গ্রুপ করুন আর [metric] গণনা করুন। গ্রুপ, তাতে থাকা সারির সংখ্যা, আর মেট্রিকসহ একটি Markdown টেবিল ফেরত দিন। টেবিলের নিচে, আপনি কীভাবে মেট্রিকটি গণনা করেছেন, কোন সারিগুলো বাদ দিয়েছেন আর কেন, আর ফাঁকা ঘরগুলো কীভাবে সামলেছেন তা সঠিকভাবে বলুন। [column] অনুযায়ী নিম্নক্রমে সাজান।

প্রম্পট: কোহোর্ট প্রশ্ন

প্রতিটি [cohort dimension, যেমন সাইনআপ মাস]-এর জন্য, [interval]-এ [metric] গণনা করুন। প্রতিটি সংখ্যার পাশে কোহোর্টের আকার দেখান। [n]-এর কম সারিযুক্ত যেকোনো কোহোর্টকে শতাংশ না দিয়ে ব্যাখ্যা করার জন্য খুব ছোট বলে চিহ্নিত করুন।

সেই শেষ নির্দেশটি স্প্রেডশিট বিশ্লেষণের সবচেয়ে বিভ্রান্তিকর আউটপুটটি ঠেকায়: চারজন ব্যবহারকারীর একটি কোহোর্টকে "75% ধরে রাখা" হিসেবে দেখানো, যা নয় হাজার ব্যবহারকারীর একটি কোহোর্টের পাশে একটি টেবিলে বসে থাকে।

প্রম্পট: অ্যানোমালি খোঁজা

এই ডেটায় সন্দেহজনক কী আছে? খুঁজুন: প্রশংসনীয় সীমার বাইরের মান, একটি টাইম সিরিজে হঠাৎ বিচ্ছিন্নতা, যেসব কলামে ডিস্ট্রিবিউশন মাঝপথে বদলে যায়, হুবহু বা প্রায়-হুবহু ডুপ্লিকেট সারি, খুব বেশি গোলগাল দেখানো মান, আর ডেটা সংগ্রহের পদ্ধতিতে পরিবর্তন আছে বলে যা কিছু ইঙ্গিত দেয়। প্রতিটির জন্য, নির্দিষ্ট সারিগুলো উদ্ধৃত করুন।

এটি এই পাতার সবচেয়ে মূল্যবান প্রম্পট আর একটি সাধারণ স্প্রেডশিট ওয়ার্কফ্লোতে এর কোনো সমতুল্য নেই। এটি নিয়মিতভাবে খুঁজে বের করে সেই দিনটি যেদিন ট্র্যাকিং ভেঙে গিয়েছিল, যে ভেন্ডর ভিন্ন মুদ্রায় রিপোর্ট করা শুরু করেছিল, আর সেই ডুপ্লিকেট ইমপোর্ট যা একটি কোয়ার্টারকে ফুলিয়ে দিয়েছিল।

প্রম্পট: চার্ট স্পেসিফিকেশন

এই প্রশ্ন আর এই ডেটার আকৃতির জন্য সঠিক চার্টটি সুপারিশ করুন, আর ব্যাখ্যা করুন কেন স্পষ্ট বিকল্পটি এখানে খারাপ। তারপর আমাকে স্পেসিফিকেশনটি দিন: চার্টের ধরন, x, y, সিরিজ, অ্যাগ্রিগেশন, সাজানোর ক্রম, আর অক্ষের ব্যবস্থা। ডুয়াল অক্ষ ব্যবহার করবেন না। বার চার্টের অক্ষ কাটবেন না।

গাণিতিক হিসাব আসলে কোথায় ভুল হয়

এর একটি সোজা উত্তর প্রাপ্য, কারণ "AI অঙ্কে খারাপ" কথাটি সত্য আর একই সাথে অহেতুক অস্পষ্ট।

টেক্সটে সংখ্যা নিয়ে যুক্তি করা একটি ভাষা মডেল আসলে প্যাটার্ন সম্পূর্ণ করছে, গণনা করছে না। এটি গঠন বর্ণনা করতে, সারি শ্রেণীবদ্ধ করতে, আর কোন গণনাটি দরকার তা চিহ্নিত করতে নির্ভরযোগ্য। কিন্তু শত শত সারি জুড়ে দীর্ঘ ধারাবাহিক গাণিতিক হিসাব করার ক্ষেত্রে এটি অনেক কম নির্ভরযোগ্য, আর এটি নীরবে ব্যর্থ হয়: আউটপুটটি হয় ভুল সংখ্যার একটি সুন্দরভাবে ফরম্যাট করা টেবিল, কোনো বিপদ সংকেত ছাড়াই।

ব্যবহারিক নিয়মগুলো:

  • শুধু ফলাফল নয়, পদ্ধতিও চান। "আপনি ঠিক কীভাবে এটি গণনা করেছেন আর কী বাদ দিয়েছেন তা বলুন" থাকলে ভুল থাকলে সেটা দৃশ্যমান হয়ে ওঠে।
  • হাতে একটি গ্রুপ স্পট চেক করুন। আউটপুট টেবিলের সবচেয়ে ছোট গ্রুপটি বেছে নিন আর আসল স্প্রেডশিটে সেটি যাচাই করুন। মিলে গেলে, পদ্ধতিটি সম্ভবত ঠিক আছে; না মিললে, টেবিলের কোনো কিছুই বিশ্বাস করা যাবে না।
  • যেকোনো গুরুত্বপূর্ণ জিনিস দ্বিতীয় একটি মডেল দিয়ে ক্রস-চেক করুন। দুটি স্বতন্ত্র মডেল একই সংখ্যায় পৌঁছানো, একটি মডেলের নিজেকে পুনরাবৃত্তি করার চেয়ে অর্থবহভাবে ভালো প্রমাণ। Whizi-এর সাইড-বাই-সাইড ভিউ ঠিক এই কারণেই আছে।
  • দ্বিগুণ গণনার দিকে খেয়াল রাখুন। ফাইলে রয়ে যাওয়া সাবটোটাল সারি আর ওয়ান-টু-মেনি জয়েন হলো দুটি সাধারণ অপরাধী, আর মডেল জানবে না যে সেগুলো ভুল।
  • যা কিছুর সঠিক হওয়া আবশ্যক, তার জন্য ফর্মুলা বা কোড চান। Excel ফর্মুলাটি আমাকে দিন অথবা pandas কোডটি আমাকে দিন গণনাটিকে একটি নির্ধারক ইঞ্জিনে রাখে, আর আপনি মডেলটিকে সেই অংশের জন্য রাখেন যেটাতে এটি ভালো, অর্থাৎ কোন গণনাটি চালাতে হবে তা জানা।

সেই শেষটিই আর্থিক বা রিপোর্টিং কাজের আসল উত্তর। বিশ্লেষণটি ডিজাইন করতে মডেলটি ব্যবহার করুন, সেটি চালাতে আপনার স্প্রেডশিট বা একটি স্ক্রিপ্ট ব্যবহার করুন।

কোন মডেল কোন ফাইল পড়ে, আর কতটা বড় বেশি বড়?

CSV আর Excel উভয়ই সরাসরি আপলোড হয়, আর তিনটি মডেল কাজটি পরিষ্কারভাবে ভাগ করে নেয়।

মডেলকনটেক্সট উইন্ডোপ্রতি মেসেজে ক্রেডিটএর জন্য ব্যবহার করুন
GPT-5.6 Terra1M টোকেন4কঠোর ফরম্যাট: পরিষ্কার টেবিল, JSON, সঠিক কলাম ম্যাপিং
Claude Sonnet 51M টোকেন10মাল্টি-স্টেপ অ্যাগ্রিগেশনে ক্রস-চেক পাস
Gemini 3.5 Flash1M টোকেন, প্রায় 1,900 পাণ্ডুলিপি পৃষ্ঠা8সবচেয়ে বড় ফাইল, বা একটি থ্রেডে একটি স্প্রেডশিট আর একটি PDF

কনটেক্সট আর ক্রেডিট সংখ্যা এসেছে Whizi-এর মডেল কস্ট ইনডেক্স থেকে, তালিকা মূল্য সংগ্রহ করা হয়েছে 2026-08-20 তারিখে।

কিছু ব্যবহারিক নোট:

  • এটিকে একটি পরিষ্কার আয়তক্ষেত্র দিন। একটি হেডার সারি, কোনো মার্জ করা সেল নেই, কোনো ফাঁকা স্পেসার সারি নেই, K কলামে কোনো নোট নেই। মাল্টি-হেডার ফরম্যাট করা রিপোর্ট যেকোনো ফাইল আকারের সীমার চেয়ে বেশি এক্সট্র্যাকশনকে বিভ্রান্ত করে।
  • প্রেজেন্টেশন শিট নয়, কাঁচা শিট পাঠান। ফরম্যাটিং আর সাবটোটালসহ ভার্সনটিই দ্বিগুণ গণনা তৈরি করে।
  • খুব প্রশস্ত ফাইলে আগে একটি কলাম তালিকা কাজে দেয়। নাম দুর্বোধ্য হলে বিশ্লেষণের আগে প্রতিটি কলামের মানে কী জিজ্ঞাসা করুন, আর মডেলটি কী ভুল করেছে তা বলুন।
  • খুব বড় ফাইলের জন্য, Gemini 3.5 Flash ব্যবহার করুন, যা Claude Sonnet 5 আর GPT-5.6 Terra-র মতোই একই 1M টোকেন কনটেক্সট পড়ে, তিনটির মধ্যে সবচেয়ে কম প্রতি-উত্তর খরচে। এর বাইরে, ইচ্ছাকৃতভাবে নমুনা নিন: একটি এলোমেলো 5000 সারির নমুনা বিশ্লেষণ করুন আর প্রতিটি সংখ্যায় আমার কী নমুনা ত্রুটি আশা করা উচিত তা বলুন নীরবে ছেঁটে ফেলার চেয়ে ভালো।
  • প্রথমে ব্যক্তিগত ডেটা সরিয়ে ফেলুন। নাম, ইমেইল, আর আইডেন্টিফায়ার প্রায় কখনোই বিশ্লেষণের জন্য দরকার হয় না, আর সেগুলো সরিয়ে ফেলা এই তর্ক করার চেয়ে দ্রুত যে আপনাকে সেগুলো আপলোড করার অনুমতি ছিল কিনা।

আপলোডের কলাকৌশল কভার করা আছে ডকুমেন্ট আপলোড করা-এ।

একটি আসল ফাইলে পুরো আট-ধাপের ক্রম

একটি আসল ফাইলে পুরো ওয়ার্কফ্লো, ক্রমানুসারে:

  1. আপলোড করুন। প্রোফাইল প্রম্পটটি চালান। ভিন্ন মান আর অনুপস্থিত সংখ্যা মনোযোগ দিয়ে পড়ুন।
  2. যা পাওয়া গেছে তা ঠিক করুন, প্রয়োগ করার আগে ম্যাপিং টেবিলটি পর্যালোচনা করুন।
  3. ডেটাটি কী সম্পর্কে আর সেটা মনে করে আপনার কোন তিনটি প্রশ্ন জিজ্ঞাসা করা উচিত তার একটি সারসংক্ষেপ চান। এই ধাপটি দ্রুত আর প্রায়ই বিশ্লেষণটিকে নতুনভাবে সাজিয়ে দেয়।
  4. আপনার আসল প্রশ্নটি জিজ্ঞাসা করুন, উত্তরে পদ্ধতি আর বাদ দেওয়া বিষয়সহ চান।
  5. অ্যানোমালি প্রম্পটটি সবসময় চালান। এখানেই চমকগুলো থাকে।
  6. হাতে সবচেয়ে ছোট গ্রুপটি স্পট চেক করুন।
  7. দ্বিতীয় একটি মডেল দিয়ে হেডলাইন সংখ্যাটি ক্রস-চেক করুন।
  8. চার্ট স্পেসিফিকেশন চান, অথবা সংখ্যাটি সঠিক আর পুনরুৎপাদনযোগ্য হতে হলে ফর্মুলাটি চান।

ধাপ 1, 5, আর 6 মানুষ প্রায়ই বাদ দেয়, আর সেগুলোই একটি রক্ষণযোগ্য বিশ্লেষণকে একটি সুন্দরভাবে ফরম্যাট করা অনুমান থেকে আলাদা করে।

চেকলিস্ট
  • একটি বিশ্লেষণাত্মক প্রশ্ন জিজ্ঞাসা করার আগে ফাইলটি প্রোফাইল করুন
  • ভিন্ন বানান আর মিশ্র ফরম্যাট ধরতে ভিন্ন-মানের তালিকাটি পড়ুন
  • প্রতিটি সংখ্যার সাথে পদ্ধতি আর বাদ দেওয়া বিষয় দাবি করুন
  • শতাংশ রিপোর্ট করার বদলে ছোট গ্রুপগুলোকে খুব ছোট বলে চিহ্নিত করুন
  • সবসময় "এই ডেটায় কী সন্দেহজনক" প্রম্পটটি চালান
  • টেবিলটি বিশ্বাস করার আগে হাতে সবচেয়ে ছোট গ্রুপটি স্পট চেক করুন
  • গুরুত্বপূর্ণ সংখ্যাগুলো দ্বিতীয় একটি মডেল দিয়ে ক্রস-চেক করুন
  • সংখ্যাটি সঠিক হওয়া আবশ্যক হলে ফর্মুলা বা কোড চান

প্রায়ই জিজ্ঞাসিত প্রশ্ন

আমার স্প্রেডশিট কত বড় হতে পারে?

এটি প্ল্যান আর মডেলের উপর নির্ভর করে, আর ব্যবহারিক সীমাটি ফাইল আকারের ক্যাপের চেয়ে মডেল কনটেক্সট উইন্ডো। Claude Sonnet 5, GPT-5.6 Terra, আর Gemini 3.5 Flash সবগুলোই Whizi-তে 1M টোকেন কনটেক্সট পড়ে, প্রায় 1,900 পাণ্ডুলিপি পৃষ্ঠা ডেটার সমান। এর বাইরে, ইচ্ছাকৃতভাবে নমুনা নিন আর মডেলটিকে নীরবে ফাইল ছেঁটে ফেলার বদলে নমুনা ত্রুটি বলতে বলুন, যা আপনার ডেটার একটি ভগ্নাংশ সম্পর্কে আত্মবিশ্বাসী উত্তর তৈরি করার ব্যর্থতার ধরন।

AI কি আমার স্প্রেডশিটের ভুলগুলো ধরতে পারে?

হ্যাঁ, আর এটি উপলব্ধ সবচেয়ে বেশি লিভারেজযুক্ত প্রম্পটগুলোর একটি। ডেটায় কী সন্দেহজনক তা জিজ্ঞাসা করলে নির্ভরযোগ্যভাবে ডুপ্লিকেট ইমপোর্ট, ট্র্যাকিং ভেঙে যাওয়ার দিন, মিশ্র একক বা মুদ্রা, ডেটার ভেতরে রয়ে যাওয়া সাবটোটাল সারি, আর ফাইলের মাঝপথে বদলে যাওয়া ডিস্ট্রিবিউশন সামনে আসে। এটিকে নির্দিষ্ট সারিগুলো উদ্ধৃত করতে বলুন যাতে আপনি প্রতিটি অনুসন্ধান যাচাই করতে পারেন, শুধু তালিকাটি বিশ্বাস না করে।

এটি যে সংখ্যা দেয় তা কি আমি বিশ্বাস করতে পারি?

গঠনে বিশ্বাস করুন, গণনা যাচাই করুন। ভাষা মডেলগুলো কোন গণনা দরকার তা চিহ্নিত করতে আর ডেটাসেটে কী আছে তা বর্ণনা করতে শক্তিশালী, আর অনেক সারি জুড়ে দীর্ঘ গাণিতিক চেইনে দুর্বল, যেখানে তারা একটি সুন্দরভাবে ফরম্যাট করা ভুল উত্তর দিয়ে নীরবে ব্যর্থ হয়। হাতে সবচেয়ে ছোট গ্রুপটি স্পট চেক করুন, দ্বিতীয় একটি মডেল দিয়ে হেডলাইন সংখ্যা ক্রস-চেক করুন, আর যা কিছু সঠিক হওয়া আবশ্যক তার জন্য Excel ফর্মুলা বা Python কোড চান আর নিজে চালান।

স্প্রেডশিট কাজের জন্য কোন মডেলটি সেরা?

গঠনমূলক যুক্তি, কঠোর আউটপুট ফরম্যাট, আর পরিষ্কার টেবিল বা JSON-এর জন্য GPT। মাল্টি-স্টেপ অ্যাগ্রিগেশনে ক্রস-চেক হিসেবে Claude, কারণ এটি একই ভুলের বদলে ভিন্ন ভুল করার প্রবণতা রাখে। যখন ফাইলটি খুব বড় হয় বা আপনি একই কথোপকথনে একটি স্প্রেডশিট আর একটি PDF বা রিপোর্ট একসাথে বিশ্লেষণ করতে চান তখন Gemini।

এটি কি Excel ফর্মুলা আর একাধিক শিটের সাথে কাজ করে?

এটি আপনার ওয়ার্কবুক এক্সিকিউট না করে মানগুলো পড়ে, তাই ফর্মুলার ফলাফল আসে কিন্তু লাইভ ফর্মুলা লজিক আসে না। মাল্টি-শিট ওয়ার্কবুকের জন্য, কোন শিটটি বোঝাতে চাচ্ছেন তা বলুন আর শিটগুলো কীভাবে সম্পর্কিত তা বর্ণনা করুন, অথবা আপনি যে শিটটি নিয়ে চিন্তিত সেটি CSV হিসেবে এক্সপোর্ট করুন। মার্জ করা সেল আর ডেটার ভেতরে সাবটোটালসহ প্রেজেন্টেশনের জন্য তৈরি ফাইলগুলো বড় ফাইলের চেয়ে অনেক বেশি সমস্যা করে।