Whizi-তে পাশাপাশি এআই মডেল কীভাবে তুলনা করবেন

দ্রুত উত্তর

Whizi-তে পাশাপাশি এআই মডেল তুলনা করতে চ্যাট হেডারে Compare চাপুন, প্রতিটা কলামের জন্য একটা মডেল বেছে নিন, আর দুটোতেই একটা প্রম্পট পাঠান। প্রতিটা কলাম নিজের কনটেক্সট ধরে রাখে, তাই একটা উত্তর অন্যটার দ্বারা প্রভাবিত হয় না। পাশাপাশি তুলনা একটা Powerhouse ফিচার, আর প্রতিটা উত্তরের জন্য তার নিজের মডেলের ক্রেডিট রেট অনুযায়ী চার্জ করা হয়।

সংক্ষিপ্ত উত্তর

চ্যাট হেডারে Compare চাপুন, প্রতিটা কলামের জন্য একটা মডেল বেছে নিন, আর দুটোতেই একটা প্রম্পট পাঠান। প্রতিটা কলাম নিজের একটা লুকানো কথোপকথন ধরে রাখে, তাই কোনো মডেল অন্যটার আউটপুট দেখে না আর কোনো উত্তর অন্যটার দ্বারা প্রভাবিত হয় না, যেটাই এই তুলনাকে মূল্যবান করে তোলে। কলামগুলো একটার পর একটা স্ট্রিম হয়, আগে বাঁয়েরটা তারপর ডানেরটা, কারণ প্রতি অ্যাকাউন্টে একবারে একটা জেনারেশন চলে।

পাশাপাশি তুলনা একটা Powerhouse ফিচার আর একবারে দুটো মডেল চালায়। প্রতিটা উত্তর তার নিজের মডেলের ক্রেডিট রেট অনুযায়ী বিল হয়, তাই একটা 10 ক্রেডিটের মডেলকে একটা 20 ক্রেডিটের মডেলের সাথে তুলনা করলে খরচ হয় 30 ক্রেডিট।

এটা ব্যবহার করুন এটা ঠিক করতে যে একটা নির্দিষ্ট ধরনের কাজের জন্য কোন মডেলটা আপনার ডিফল্ট হওয়া উচিত। আপনি যদি দুটো উত্তর তুলনা করার বদলে একটা উত্তর উন্নত করাতে চান, তাহলে অন্য কাজটা করুন: একই থ্রেডের ভেতরে মডেল বদলান আর দ্বিতীয়টাকে প্রথমটার সমালোচনা করতে বলুন।

কেন বেঞ্চমার্ক আপনার প্রশ্নের উত্তর দেয় না

প্রকাশিত বেঞ্চমার্কগুলো স্ট্যান্ডার্ডাইজড কাজে পারফরম্যান্স মাপে। আপনার প্রশ্ন আরও নির্দিষ্ট আর বেশি কাজের: আপনি ব্যক্তিগতভাবে সপ্তাহে কুড়িবার যে কাজটা করেন, তাতে কোন মডেলটা ভালো। এগুলো আলাদা প্রশ্ন, আর দ্বিতীয়টার কোনো প্রকাশিত উত্তর নেই কারণ আপনার কাজের চাপ কারো কাছেই নেই।

দুটো মডেলে একটা প্রম্পট চালাতে প্রায় ত্রিশ সেকেন্ড লাগে আর এটা সরাসরি উত্তর দেয়। গুরুত্বপূর্ণ ব্যাপারটা এটা না যে আপনি দুটো উত্তর পাচ্ছেন; বরং এটা যে আপনি জানতে পারছেন পার্থক্যটা কতটা বড়। কখনো কখনো আউটপুটগুলো প্রায় একইরকম হয়, যা আপনাকে জানায় যে সেই কাজের জন্য মডেল বাছাই নিয়ে ভাবা বন্ধ করুন। কখনো কখনো একটা একেবারে অকেজো হয়, যেটা জানা দরকার একটা ওয়ার্কফ্লো তৈরি করার আগেই।

তুলনা যে আরেকটা জিনিস ধরে ফেলে তা হলো আত্মবিশ্বাসী ভুল। যখন দুটো মডেল একটা তথ্যভিত্তিক প্রশ্নে বাস্তবিকভাবে ভিন্ন উত্তর দেয়, তখন অন্তত একটা ভুল, আর শুধু একটা পড়ে আপনি এটা জানতে পারতেন না। এই সংকেতটা কোনো দামেই একক-মডেল ওয়ার্কফ্লোতে পাওয়া যায় না।

পড়ার আগেই ঠিক করুন 'ভালো' মানে কী

পাশাপাশি তুলনার ফাঁদটা হলো যে আউটপুট বেশি লম্বা, বেশি আত্মবিশ্বাসী, বা বেশি ঝকঝকে সেটাকে পছন্দ করা। এগুলো মান নয়। প্রথমে আপনার মানদণ্ড ঠিক করুন, তারপর পড়ুন।

কাজ'ভালো' মানে কীকী উপেক্ষা করবেন
লেখাপাঠানোর আগে কম সম্পাদনা লাগেদৈর্ঘ্য, শব্দভাণ্ডার, উদ্দীপনা
তথ্যভিত্তিক গবেষণাউৎস যা দাবিটা নিশ্চিত করে আর সমর্থন করেসাবলীলতা আর আত্মবিশ্বাস
এক্সট্র্যাকশনসঠিক স্কিমা, কোনো বানানো ফিল্ড নেই, সামঞ্জস্যপূর্ণ লেবেলটেবিলের চারপাশের গদ্যের মান
যুক্তিধাপগুলো ঠিক আছে আর প্রান্তিক ঘটনাটা মোকাবিলা করা হয়েছেউপসংহারটা আপনার পূর্বধারণার সাথে মেলে কিনা
কোডব্যর্থতার পথ সামলায়, রিভিউযোগ্যচতুরতা, সংক্ষিপ্ততা
সারসংক্ষেপযা গুরুত্বপূর্ণ তা রাখে আর যা নয় তা বাদ দেয়সম্পূর্ণতা

একটা ব্যবহারিক কৌশল: কোনো আউটপুট পড়ার আগেই, একটা ভালো উত্তরে কী থাকা উচিত তা বর্ণনা করে এক লাইন লিখুন। তারপর পড়ুন। এটাতে দশ সেকেন্ড লাগে আর এটা 'ঝকঝকে' পক্ষপাত ঠেকায়, যা শক্তিশালী আর বেশিরভাগ ক্ষেত্রেই অচেতন।

তথ্যভিত্তিক প্রশ্নের ক্ষেত্রে, বিজয়ীর বদলে অমিলটা দেখুন। যেখানে দুটো মডেল একটা নির্দিষ্ট সংখ্যা আর একটা উৎসে একমত হয়, সেখানে আত্মবিশ্বাস যুক্তিসঙ্গত। যেখানে তারা ভিন্নমত হয়, সেটাই যাচাই করার জিনিস, আর এটাই পুরো অনুশীলনের সবচেয়ে মূল্যবান ফলাফল।

প্রম্পট যা আসল পার্থক্য প্রকাশ করে

কিছু কাজ মডেলগুলোকে স্পষ্টভাবে আলাদা করে আর কিছু করে না। তুলনা থেকে কিছু শিখতে চাইলে, এমন প্রম্পট ব্যবহার করুন যা একটা নির্দিষ্ট সক্ষমতার ওপর চাপ দেয়।

  • কঠিন পরিস্থিতিতে সুর। একজন ক্লায়েন্টকে একটা নোট লিখুন যেখানে বোঝানো হচ্ছে যে আমরা ডেডলাইন মিস করেছি, অতিরিক্ত ক্ষমা না চেয়ে আর অজুহাত ছাড়াই দায়িত্ব নিয়ে। 120 শব্দের মধ্যে। রেজিস্টারের পার্থক্য এখানে তাৎক্ষণিকভাবে ধরা পড়ে।
  • কঠোর এক্সট্র্যাকশন। এই টেক্সট থেকে প্রতিটা তারিখ, পরিমাণ, আর পক্ষ ঠিক এই কী-গুলো দিয়ে একটা JSON অ্যারেতে বের করুন। কোনো ফিল্ড না থাকলে null ব্যবহার করুন। অনুমান করবেন না। ফরম্যাট শৃঙ্খলা আর বানিয়ে বলার প্রবণতা পরীক্ষা করে।
  • ফাঁদসহ যুক্তি। এমন একটা সমস্যা দিন যাতে একটা যুক্তিসঙ্গত ভুল উত্তর আছে, যেমন একটা হার বা অনুপাতের প্রশ্ন যেখানে স্বজ্ঞাত পথটা ভুল। শর্টকাট নেয় কিনা তাতে মডেলগুলো আলাদা হয়।
  • দীর্ঘ-কনটেক্সট মনে রাখা। একটা লম্বা ডকুমেন্ট আপলোড করুন আর মাঝখানের কিছু নিয়ে প্রশ্ন করুন। এটা আসল ব্যবহারযোগ্য কনটেক্সট প্রকাশ করে, বিজ্ঞাপিত কনটেক্সট না।
  • অজ্ঞতা স্বীকার। [সত্যিকারের অস্পষ্ট বা খুব সাম্প্রতিক কিছু] সম্পর্কে কী ঘোষণা করা হয়েছিল? সেরা উত্তর হলো একটা স্পষ্ট "আমি জানি না" বা একটা সোর্সড রিট্রিভাল। এখানে বানানো তথ্য অযোগ্য করে দেয়।
  • নেতিবাচক শর্ত মেনে চলা। কোনো উপমা বা রূপক ব্যবহার ছাড়া X ব্যাখ্যা করুন। নেতিবাচক নির্দেশনা মানার ক্ষেত্রে যতটা আশা করবেন তার চেয়ে বেশি তারতম্য দেখা যায়।

ধাঁধার বদলে আপনার নিজের আসল কাজে তুলনা চালান। যে মডেলটা আপনার ত্রৈমাসিক রিপোর্টে ভালো, সেটা যুক্তির ধাঁধায় ভালো হওয়া মডেলের চেয়ে বেশি কাজের।

এক সপ্তাহের তুলনাকে একটা রাউটিং ম্যাপে রূপান্তর করা

একটা একক তুলনা আকর্ষণীয়। এক সপ্তাহের তুলনা কার্যকর। রুটিনটা হলো:

  1. পাঁচ দিন ধরে, যখনই একটা কাজ গুরুত্বপূর্ণ হয়, একটার বদলে দুটো মডেলে সেটা চালান।
  2. কাজের ধরন, বিজয়ী, আর পার্থক্যটা কতটা বড় ছিল তা নোট করুন। তিনটা শব্দই যথেষ্ট।
  3. সপ্তাহের শেষে দেখুন কোথায় একটা মডেল বারবার জিতেছে আর কোথায় আউটপুটগুলো অদল-বদলযোগ্য ছিল।
  4. এর থেকে আপনার ডিফল্ট ঠিক করুন, আর যেসব কাজে পার্থক্যটা ধারাবাহিকভাবে শূন্য ছিল সেগুলোতে তুলনা করা বন্ধ করুন।

মানুষ সাধারণত যা দেখেন তা হলো তুলনা তাদের কাজের একটা ছোট অংশে গুরুত্বপূর্ণ আর বাকিটাতে সময়ের অপচয়। দ্রুত তথ্যভিত্তিক খোঁজ, সাধারণ পুনর্লিখন, আর রুটিন ফরম্যাটিং খুব কমই মডেলগুলোকে আলাদা করে। যে লেখাটা একজন গ্রাহক পড়বে, যে গবেষণা একটা সিদ্ধান্তকে প্রভাবিত করবে, আর অপরিচিত কিছু নিয়ে যুক্তি, এগুলো তাদের অনেকটাই আলাদা করে।

এই ফলাফলটাই লাভ: যেখানে কোনো পার্থক্য হয় না সেখানে তুলনা করা বন্ধ করুন, আর যেসব কাজে ফলাফল পাল্টায় সেগুলোর জন্য রেখে দিন।

পাশাপাশি বনাম ধারাবাহিক

দুটো ভিন্ন কৌশল, আলাদা করে বোঝার মতো।

পাশাপাশি একই প্রম্পট দুটো মডেলে চালায় যারা একে অপরের আউটপুট দেখতে পায় না। প্রতিটা কলাম নিজের একটা লুকানো কথোপকথন ধরে রাখে, যেটার নাম একটা [Compare] প্রিফিক্স দিয়ে দেওয়া আর সাইডবারের বাইরে রাখা হয়, তাই ফলো-আপ প্রশ্নগুলো একটা ন্যায্য পরীক্ষা থাকে: দুটো মডেলই স্বতন্ত্র মাল্টি-টার্ন কনটেক্সট ধরে রাখে। এটাই একটা ডিফল্ট মডেল বাছাই করার আর তথ্যভিত্তিক মতবিরোধ ধরার সঠিক টুল।

ধারাবাহিক মানে একটা উত্তর পাওয়া, তারপর একই থ্রেডে মডেল বদলে নতুনটাকে সেটার সমালোচনা করতে বলা। এটা তখন ব্যবহার করুন যখন আপনি একটা তুলনার বদলে ত্রুটিটা খুঁজে পেতে চান, কারণ দ্বিতীয় মডেলটা নির্দিষ্ট যুক্তিটার সাথে সরাসরি জড়িত হতে পারে। দেখুন কথোপকথনের মাঝে মডেল বদলানো

মোটামুটি নিয়ম: কোন মডেলটা বেছে নেবেন তা ঠিক করতে পাশাপাশি, একটা উত্তর উন্নত করতে ধারাবাহিক।

চেকলিস্ট
  • তুলনা করার আগে একটা সাধারণ চ্যাটে প্রম্পটটা লিখুন আর ঠিক করুন
  • দুটো আউটপুট পড়ার আগেই এই কাজের জন্য 'ভালো' মানে কী তা ঠিক করুন
  • একটা ভালো উত্তরের বর্ণনা দিয়ে এক লাইন লিখুন, তারপর পড়ুন, যাতে ঝকঝকে পক্ষপাত এড়ানো যায়
  • তথ্যভিত্তিক প্রশ্নে, অমিলটাকেই ফলাফল হিসেবে ধরুন আর সেটা যাচাই করুন
  • ধাঁধার বদলে আপনার নিজের আসল কাজে তুলনা করুন
  • এক সপ্তাহ ধরে বিজয়ী আর পার্থক্যের আকার লগ করুন, তারপর সেই প্যাটার্ন থেকে ডিফল্ট ঠিক করুন
  • যেসব কাজে পার্থক্যটা ধারাবাহিকভাবে শূন্য থাকে সেগুলোতে তুলনা করা বন্ধ করুন

প্রায়ই জিজ্ঞাসিত প্রশ্ন

আমি একসাথে কতগুলো মডেল তুলনা করতে পারি?

পাশাপাশি তুলনা একটা Powerhouse ফিচার, আর এটা একবারে দুটো মডেল চালায়, যেটা ইচ্ছাকৃত: দুটো কলামই সেই লেআউট যা আপনি আসলে মনোযোগ দিয়ে পড়তে পারেন। তিনটা কলাম প্রায়ই স্রেফ চোখ বুলিয়ে যাওয়ায় পরিণত হয়, আর তাতে পুরো উদ্দেশ্যটাই ব্যর্থ হয়, কারণ এই অনুশীলনের মূল্যটা আছে সেখানে যেখানে উত্তরগুলো সত্যিকারভাবে আলাদা তা লক্ষ্য করায়।

পাশাপাশি তুলনা কি আমার মাসিক মেসেজের বেশি ব্যবহার করে?

হ্যাঁ, এটার খরচ দ্বিগুণ: দুটো মডেল প্রত্যেকে একটা করে উত্তর তৈরি করে, আর প্রতিটা উত্তর তার নিজের ক্রেডিট রেট অনুযায়ী বিল হয়, তাই একটা 10 ক্রেডিটের মডেলকে একটা 20 ক্রেডিটের মডেলের সাথে তুলনা করলে 10 বা 20 এর বদলে 30 ক্রেডিট খরচ হয়। একটা ভুল উত্তর বা অকেজো ড্রাফট পাঠানোর আগেই ধরে ফেলা সাধারণত সেই খরচের যোগ্য। কার্যকর পদ্ধতি হলো সিদ্ধান্ত আর ডেলিভারেবলে তুলনা করা, আর রুটিন খোঁজ আর দ্রুত পুনর্লিখনের জন্য একটামাত্র মডেল ব্যবহার করা।

দুটো উত্তরই যদি সমান ভালো হয়?

এটা একটা বাস্তব আর কাজের ফলাফল: এটা বলে দেয় যে এই কাজটা মডেল বাছাইয়ের ওপর নির্ভর করে না, তাই এতে মনোযোগ দেওয়া বন্ধ করুন আর আপনার যেটা ডিফল্ট সেটাই ব্যবহার করুন। বেশিরভাগ কাজের চাপ এভাবেই ভাগ হয়, বেশিরভাগ কাজে মডেলগুলো অদল-বদলযোগ্য আর অল্প কিছু কাজে পার্থক্যটা বড়। কোনটা কী তা খুঁজে বের করাই এক সপ্তাহ ধরে তুলনা চালানোর মূল উদ্দেশ্য।

যেটা শোনাতে ভালো লাগে সেই উত্তরটাই বেছে নেওয়া কীভাবে এড়াবো?

পড়ার আগেই আপনার মানদণ্ড ঠিক করুন। লম্বা, বেশি আত্মবিশ্বাসী, আর বেশি ঝকঝকে আউটপুট নিয়মিতভাবে পছন্দ করা হয় এমনকি সেগুলো খারাপ হলেও, আর এই পক্ষপাতটা মূলত অচেতন। দেখার আগেই একটা ভালো উত্তরে কী থাকা উচিত তা নিয়ে এক লাইন লেখাই এর বেশিরভাগটা প্রতিরোধ করার জন্য যথেষ্ট। তথ্যভিত্তিক কাজের জন্য, উত্তরটা কেমন পড়তে লাগে তার বদলে উৎসগুলো দাবিটা নিশ্চিত করে আর সমর্থন করে কিনা তার ওপর বিচার করুন।

আমার কোন দুটো মডেল তুলনা করা উচিত?

যে নির্দিষ্ট কাজের জন্য আপনি আসলেই দুটোর মধ্যে সিদ্ধান্ত নিচ্ছেন সেই দুটো তুলনা করুন, যা বেশিরভাগ মানুষের জন্য লেখা আর যুক্তির ক্ষেত্রে Claude বনাম GPT, বা ডকুমেন্ট জড়িত থাকলে একটা বড়-কনটেক্সট মডেল বনাম আপনার ডিফল্ট। আপনি কখনো ব্যবহার করবেন না এমন একটা মডেলকে আপনার প্রিয়টার সাথে তুলনা করলে এমন কিছু জানা যায় না যাতে আপনি কাজ করবেন।