লঞ্চ বেঞ্চমার্ক কেন আপনার প্রশ্নের উত্তর দেবে না
প্রতিটা ফ্রন্টিয়ার রিলিজ আসে একটা স্ট্যান্ডার্ডাইজড মূল্যায়নের সেটে এগিয়ে থাকার চার্ট নিয়ে। সেই সংখ্যাগুলো সত্যি, কিন্তু সোমবার আপনি কী ব্যবহার করবেন তা ঠিক করার জন্য প্রায় অকেজো, তিনটা কারণে।
মার্জিন ছোট আর কাজগুলো আপনার নয়। একটা রিজনিং বেঞ্চমার্কে দুই পয়েন্টের পার্থক্য বলে না একটা মডেল ভালো ক্লায়েন্ট ইমেইল লেখে কিনা, বা দুইশো সারি জুড়ে স্কিমা বেশি নির্ভরযোগ্যভাবে ধরে রাখে কিনা।
বেঞ্চমার্ক সেই কাজগুলো মাপে যেগুলো স্কোর করা সহজ। যেগুলোর একটা সঠিক উত্তর আছে। বেশিরভাগ পেশাদার কাজের তা নেই: সুর, গঠন, কী বাদ দেওয়া উচিত সেই বিচার। ঠিক এখানেই মডেলগুলো সবচেয়ে বেশি আলাদা হয়, আর এখানেই কিছুই মাপা হয় না।
লঞ্চ তুলনাগুলো তৈরি করে ভেন্ডর নিজেই। অসৎভাবে নয় ঠিক, কিন্তু কেউ সেই মূল্যায়ন প্রকাশ করে না যেখানে তাদের মডেল দ্বিতীয় হয়েছে।
যে প্রশ্নটার উত্তর দেওয়া দরকার সেটা আরও নির্দিষ্ট: আপনি সপ্তাহে যে নির্দিষ্ট কাজগুলো বিশবার করেন, তাতে এই দুটোর মধ্যে কোনটা ভালো? এর কোনো প্রকাশিত উত্তর নেই, আর এটা বের করতে প্রায় এক ঘণ্টা লাগে।
রিলিজগুলোর মধ্যে আসলে কী বদলায়
সাম্প্রতিক ফ্রন্টিয়ার রিলিজগুলো জুড়ে, দৈনন্দিন ব্যবহারে গুরুত্বপূর্ণ উন্নতিগুলো ধারাবাহিকভাবে একই জায়গায় হয়, আর সেগুলো খুব কমই ঘোষণায় তুলে ধরা হয়।
| কী উন্নত হয়েছে | আপনি কীভাবে টের পান | বেঞ্চমার্কে এটা দেখায় কিনা |
|---|---|---|
| নির্দেশনা মেনে চলা | এটা আপনার তৃতীয় শর্ত উপেক্ষা করা বন্ধ করে | কদাচিৎ |
| নেতিবাচক নির্দেশনা | "উপমা ব্যবহার করবেন না" আসলেই মানা হয় | না |
| দীর্ঘ-প্রসঙ্গ স্মরণ | এটা 140 নম্বর পাতার জিনিসটা খুঁজে পায়, শুধু 3 নম্বর পাতা নয় | আংশিকভাবে |
| ফরম্যাটিং শৃঙ্খলা | টেবিলে আপনি যে কলাম চেয়েছেন সেগুলোই থাকে, প্রতিবার | না |
| ক্যালিব্রেটেড অনিশ্চয়তা | এটা বানানোর বদলে বলে যে জানে না | না |
| সুর নিয়ন্ত্রণ | পাঠানোর মতো কিছু হওয়ার আগে কম রিরাইট লাগে | না |
| রিজনিং গভীরতা | আপনি যেই এজ কেসটা মিস করেছেন সেটা এটা ধরে ফেলে | হ্যাঁ, এটাই তারা মাপে |
ওই সাতটার মধ্যে পাঁচটা বেঞ্চমার্ক চার্টে অদৃশ্য, আর এটাই কারণ যে একটা নতুন মডেল কাজ করতে ভালো বা খারাপ লাগে। নির্দেশনা মেনে চলা বিশেষভাবে সেই পার্থক্য যা আপনি সম্পাদনা করবেন এমন একটা প্রথম খসড়া, আর যেটা ফেলে দেবেন এমন একটা প্রথম খসড়ার মধ্যে থাকে।
এক ঘণ্টার মূল্যায়ন
লঞ্চ কভারেজ পড়ার বদলে এটা করুন। নিজের উপাদানে দুটো মডেল পাশাপাশি চালান।
- পাঁচটা আসল কাজ জোগাড় করুন গত দুই সপ্তাহ থেকে। আসল কাজ, আপনার আসল প্রসঙ্গ পেস্ট করা, খেলনা প্রম্পট নয়। অন্তত একটা লেখার কাজ, একটা স্ট্রাকচার্ড আউটপুট কাজ, আর একটা যেখানে অপরিচিত কিছু নিয়ে রিজনিং দরকার ছিল, রাখুন।
- লিখে রাখুন একটা ভালো উত্তরে কী থাকে, প্রতিটার জন্য, এক বাক্যে, কিছু চালানোর আগেই। এই ধাপটাই আপনাকে যেটা লম্বা আর বেশি আত্মবিশ্বাসী মনে হয় সেটাকে পছন্দ করা থেকে আটকায়, যা একটা শক্তিশালী আর মূলত অচেতন পক্ষপাত।
- প্রতিটা কাজ দুই মডেলের বিরুদ্ধে চালান সমান্তরালে যাতে কোনো একটা উত্তর অন্যটার দ্বারা প্রভাবিত না হয়।
- সম্পাদনার পরিমাণ দিয়ে স্কোর করুন, মানে আউটপুট আর আপনি যা পাঠাবেন তার মধ্যে কতটা কাজ লাগে। এটা কেমন পড়তে লাগে তা দিয়ে নয়।
- ব্যবধানের আকার লক্ষ্য করুন, শুধু বিজয়ী নয়। বদলযোগ্য ফলাফল আপনাকে বলে ওই কাজের জন্য মডেল নির্বাচন নিয়ে ভাবা বন্ধ করতে, যা আসলেই উপকারী।
- লগটা রেখে দিন। তিন মাস পর, যখন পরের রিলিজ আসবে, আপনি একই পাঁচটা কাজ আবার চালাবেন আর বিশ মিনিটে একটা আসল উত্তর পাবেন।
শেষ পয়েন্টটাই যৌগিক প্রভাবওয়ালা। একটা সংরক্ষিত মূল্যায়ন সেট-ই একমাত্র জিনিস যা পরবর্তী প্রতিটা রিলিজ মূল্যায়ন করাকে সস্তা করে তোলে।
ছয়টা প্রম্পট যা ফ্রন্টিয়ার মডেলগুলোকে আলাদা করে
সাধারণ প্রশ্নগুলো যেকোনো সক্ষম মডেল থেকে একই রকম উত্তর তৈরি করে। পার্থক্য দেখতে চাইলে, একটা নির্দিষ্ট সক্ষমতার ওপর চাপ দিন।
- কঠিন পরিস্থিতিতে সুর।
একজন ক্লায়েন্টকে বলার জন্য একটা নোট লিখুন যে আমরা সময়সীমা মিস করেছি। অতিরিক্ত ক্ষমা না চেয়ে আর অজুহাত ছাড়া দায়িত্ব নিন। 120 শব্দের কম।রেজিস্টারের পার্থক্য তাৎক্ষণিকভাবে ধরা পড়ে। - নেতিবাচক শর্ত।
[concept] কোনো উপমা বা রূপক ব্যবহার না করে ব্যাখ্যা করুন।নেতিবাচক নির্দেশনা মেনে চলা যতটা আশা করবেন তার চেয়ে অনেক বেশি ভিন্ন হয়। - কঠোর এক্সট্র্যাকশন।
প্রতিটা তারিখ, পরিমাণ, আর পক্ষকে ঠিক এই কী-গুলো দিয়ে একটা JSON অ্যারেতে বের করুন। কোনো ফিল্ড না থাকলে null ব্যবহার করুন। অনুমান করবেন না।ফরম্যাট শৃঙ্খলা আর ফাঁক পূরণের প্রবণতা পরীক্ষা করে। - দীর্ঘ-প্রসঙ্গ স্মরণ। একটা লম্বা নথি আপলোড করুন আর মাঝখানের কিছু নিয়ে জিজ্ঞাসা করুন। এটা ব্যবহারযোগ্য প্রসঙ্গ প্রকাশ করে, যা বিজ্ঞাপিত প্রসঙ্গের মতো একই জিনিস নয়।
- অজ্ঞতা স্বীকার করা। সত্যিই দুর্বোধ্য বা খুব সাম্প্রতিক কিছু নিয়ে জিজ্ঞাসা করুন। সেরা উত্তর হলো একটা পরিষ্কার "আমি জানি না" বা একটা সূত্রযুক্ত রিট্রিভাল। এখানে বানানো তথ্য যেকোনো বেঞ্চমার্ক নির্বিশেষে অযোগ্য করে দেয়।
- বহু-শর্ত মেনে চলা। একসাথে ছয়টা শর্ত দিন আর গুনুন কতগুলো টিকে থাকে। এই একটা পরীক্ষাই তালিকার অন্য যেকোনো কিছুর চেয়ে ভালো দৈনন্দিন সন্তুষ্টি ভবিষ্যদ্বাণী করে।
উত্তর সাধারণত হয় "দুটোই, ভিন্ন ভিন্ন কাজের জন্য"
মানুষ একটা রায় চেয়ে একটা রিলিজের কাছে আসে, আর মূল্যায়ন চালানোর পর সৎ ফলাফল প্রায় সবসময় বিভক্ত। একটা মডেল লেখা আর সুরে জেতে। অন্যটা কঠোর গঠন আর গতিতে জেতে। সাধারণ রিজনিংয়ে তারা এত কাছাকাছি যে সেটা কিছু ঠিক করে না।
এটা কোনো ফাঁকি নয়, এটাই আসল ফলাফল, আর এর একটা ব্যবহারিক প্রভাব আছে। আপনি যদি শুধু একটা মডেল ব্যবহার করতে পারেন, তাহলে আপনি বেছে নিচ্ছেন কোন ধরনের কাজে খারাপ হবেন। আপনি যদি দুটোই ব্যবহার করতে পারেন, তাহলে রিলিজ প্রশ্নটা "আমার কি বদলানো উচিত" থাকা বন্ধ করে হয়ে যায় "কোন কাজগুলো সরে যায়", যা অনেক ছোট আর কম ঝুঁকিপূর্ণ একটা সিদ্ধান্ত।
এটা আপনার কাছে একটা রিলিজের অর্থও বদলে দেয়। নতুন মডেলগুলো যখন এমন একটা ওয়ার্কস্পেসে আসে যেখানে ইতিমধ্যে বেশ কয়েকটা আছে, তখন আপনি নিজের পাঁচটা কাজ আবার চালান, রাউটিং সামঞ্জস্য করেন, আর চালিয়ে যান। কোনো মাইগ্রেশন নেই, কোনো বাতিল সাবস্ক্রিপশন নেই, আর পরীক্ষা না করে প্রতিশ্রুতিবদ্ধ হওয়ার কারণে খারাপ কিছু ব্যবহার করে এক মাস কাটানোও নেই।
রিলিজের দিনে কী করবেন
সাথে সাথে আপনার ডিফল্ট বদলাবেন না। লঞ্চ-সপ্তাহের ধারণা নতুনত্ব আর যেসব উদাহরণ প্রথমে ছড়িয়ে পড়ে তা দ্বারা প্রভাবিত হয়।
আপনার মূল্যায়ন সেট আবার চালান। গত বার একটা রেখে দিলে বিশ মিনিট লাগবে।
সাধারণ জিনিসগুলো পরীক্ষা করুন। কনটেক্সট উইন্ডো, আপনার বিদ্যমান প্রম্পটগুলো এখনও একই রকম আচরণ করে কিনা, আর আপনি যার ওপর নির্ভর করতেন তার কিছু বদলেছে কিনা। একটা মডেল সাধারণভাবে ভালো হয়েও আপনার নির্দিষ্ট টেমপ্লেটে খারাপ হতে পারে, আর প্রোডাকশন কাজ সেটার ওপর সরানোর আগে এটা জানা মূল্যবান।
কাজ অনুযায়ী রাউটিং আপডেট করুন, পুরোপুরি নয়। যে ক্যাটেগরিগুলোতে নতুন মডেল স্পষ্টভাবে জিতেছে সেগুলো সরান আর বাকিগুলো রেখে দিন।
সীমাবদ্ধতার জন্য দুই সপ্তাহ অপেক্ষা করুন। একটা নতুন মডেলের ব্যর্থতার ধরনগুলো ব্যাপক ব্যবহারের প্রায় দুই সপ্তাহের মধ্যে প্রকাশ পায়, আর সেগুলো কদাচিৎ ঘোষণায় থাকে।
সাধারণ ফ্রেমওয়ার্কের জন্য দেখুন একটা AI মডেল কীভাবে বেছে নেবেন, আর একটা প্রম্পটে দুটো মডেল চালানোর কৌশলের জন্য দেখুন পাশাপাশি মডেল তুলনা।
- নিজের কাজ থেকে পাঁচটা আসল কাজের একটা সেট তৈরি করুন আর রেখে দিন
- যেকোনো আউটপুট পড়ার আগে লিখে রাখুন একটা ভালো উত্তরে কী থাকে
- দুটো মডেল সমান্তরালে চালান যাতে কোনোটা অন্যটার দ্বারা প্রভাবিত না হয়
- আউটপুট কেমন পড়তে লাগে তা নয়, সম্পাদনার পরিমাণ দিয়ে স্কোর করুন
- ব্যবধানের আকার রেকর্ড করুন, কারণ বদলযোগ্য ফলাফল উপকারী তথ্য
- নেতিবাচক শর্ত আর বহু-শর্ত মেনে চলা নির্দিষ্টভাবে পরীক্ষা করুন
- একটা নতুন মডেলে প্রোডাকশন কাজ সরানোর আগে দুই সপ্তাহ অপেক্ষা করুন
- পুরোপুরি বদলানোর বদলে কাজ অনুযায়ী রাউটিং আপডেট করুন
প্রায়ই জিজ্ঞাসিত প্রশ্ন
আমার কি সবচেয়ে নতুন মডেলে বদলানো উচিত?
লঞ্চের দিনে নয়, আর পুরোপুরিও নয়। দুটোর বিরুদ্ধে নিজের আসল কাজের একটা ছোট সেট আবার চালান, প্রতিটা আউটপুটে কতটা সম্পাদনা লাগে তা দিয়ে স্কোর করুন, আর শুধু সেই ক্যাটেগরিগুলো সরান যেখানে নতুন মডেল স্পষ্টভাবে জেতে। নতুন মডেল নির্ভরযোগ্যভাবে কিছু জিনিসে ভালো আর মাঝে মাঝে অন্যগুলোতে খারাপ, বিশেষ করে আগের সংস্করণের বিরুদ্ধে টিউন করা বিদ্যমান প্রম্পটের জন্য।
বেঞ্চমার্ক কেন আমার অভিজ্ঞতার সাথে মেলে না?
কারণ সেগুলো যা স্বয়ংক্রিয়ভাবে স্কোর করা যায় তা মাপে, মানে যেসব কাজের একটা সঠিক উত্তর আছে। বেশিরভাগ পেশাদার কাজের একটামাত্র সঠিক উত্তর নেই, আর যে গুণগুলো দৈনন্দিন সন্তুষ্টি ঠিক করে, মানে নির্দেশনা মেনে চলা, সুর নিয়ন্ত্রণ, ফরম্যাটিং শৃঙ্খলা, আর কখন "আমি জানি না" বলতে হয় তা জানা, সেগুলো মূলত অপরিমাপিত থেকে যায়। একটা মডেল প্রতিটা প্রকাশিত চার্টে এগিয়ে থেকেও কাজ করতে বেশি বিরক্তিকর হতে পারে।
কতবার আবার মূল্যায়ন করা উচিত?
যখনই আপনার ব্যবহৃত কোনো মডেল একটা উল্লেখযোগ্য রিলিজ পায়, যা বর্তমানে প্রতি কয়েক মাসে হয়, তার সাথে নির্বিশেষে প্রতি প্রান্তিকে একবার। পাঁচটা আসল কাজের একটা নির্দিষ্ট সেট রাখা এটাকে একটা বিকেলের বদলে বিশ মিনিটের কাজ বানায়, আর এটাই একমাত্র উপায় লক্ষ্য করার যে ছয় মাস আগে সেট করা রাউটিং এখন ভুল।
আমি কি শুধু যে মডেল সামগ্রিকভাবে জেতে সেটাই ব্যবহার করতে পারি?
পারেন, আর আপনি নিজের কাজের একটা অনুমানযোগ্য অংশে খারাপ ফলাফল মেনে নেবেন। মানুষ নিজের কাজে মূল্যায়ন করলে ধারাবাহিক ফলাফল হলো একটা মডেল লেখা আর সুরে জেতে আর অন্যটা কঠোর গঠন আর গতিতে জেতে, সাধারণ রিজনিং এত কাছাকাছি থাকে যে সেটা কিছু ঠিক করে না। দুটোই যদি আপনার কাছে উপলব্ধ থাকে, তাহলে পছন্দটা প্রতি সাবস্ক্রিপশনের বদলে প্রতি কাজে হয়ে যায়।
আমি কোন প্রোডাক্টের মাধ্যমে মডেলে পৌঁছাই তাতে কি কিছু আসে যায়?
মডেল হলো মডেল, তাই আউটপুটের মান আপনি যেখান থেকেই পৌঁছান না কেন মোটামুটি একই। যা আলাদা হয় তা হলো আপনি তুলনা করতে পারেন কিনা, বদলানোর সময় প্রসঙ্গ বহন হয় কিনা, আর একটা নতুন রিলিজ আপনার একটা মাইগ্রেশনের খরচ করায় নাকি শুধু পিকারে আরেকটা অপশন হয়ে থাকে। বেশ কয়েকটা মডেলওয়ালা একটা ওয়ার্কস্পেস প্রতিটা রিলিজকে একটা সিদ্ধান্ত থেকে একটা সামঞ্জস্যে পরিণত করে।