প্রক্রিয়ায় কিছুই উত্তরটা সত্য কিনা তা চেক করে না
আপনি যখন একটা AI চ্যাটবটকে একটা প্রশ্ন জিজ্ঞাসা করেন, এটা কিছুই খুঁজে দেখছে না। এটা টেক্সট তৈরি করছে, একবারে কয়েকটা অক্ষর, যা সেই প্রশ্নের একটা সঠিক উত্তর সাধারণত যেভাবে লেখা হয় তার প্যাটার্নের সঙ্গে মানানসই। এটাই পুরো কাজ। প্যাটার্নের সঙ্গে মানানসই হওয়া আর সত্য হওয়া দুটো ভিন্ন লক্ষ্য, আর প্রক্রিয়ায় কিছুই দ্বিতীয়টার দিকে লক্ষ্য করছে না।
বেশিরভাগ সময় আপনি এটা কখনো লক্ষ্য করেন না, কারণ দুই লক্ষ্য একে অপরের সঙ্গে ওভারল্যাপ করে। এই সিস্টেমগুলো যে টেক্সট থেকে শিখেছে তা বেশিরভাগ এমন মানুষ লিখেছে যারা বেশিরভাগ ঠিক ছিল, তাই উত্তর-আকৃতির টেক্সট সাধারণত সঠিক টেক্সটও। ওভারল্যাপটা কিনারায় পাতলা হয়ে যায়: যে তথ্য বিরল, সাম্প্রতিক, খুব নির্দিষ্ট, বা মডেল যা পড়েছে তা থেকে কেবল অনুপস্থিত। সেই কিনারাগুলোতে, একটা সঠিক উত্তরের আকার তৈরি করা এখনও সহজ। একটার কনটেন্ট তৈরি করা নয়। আপনি যা পান তা হলো একটা তথ্যের মতো তৈরি করা একটা বাক্য, সঠিক জায়গায় একটা সংখ্যাসহ আর একটা বিশ্বাসযোগ্য-দেখতে নাম যুক্ত, এমন কিছু বর্ণনা করছে যা কখনো ঘটেনি।
এটা এটাও ব্যাখ্যা করে কেন সুস্পষ্ট ফলো-আপ ব্যর্থ হয়। "তুমি কি নিশ্চিত?" জিজ্ঞাসা করা একটা অডিটের মতো মনে হয়। এটা একটা নয়। সম্মতি একটা সহায়ক উত্তরের প্যাটার্নের সঙ্গে মানানসই, তাই চাপ সম্মতি তৈরি করতে থাকে, আর একটা মডেল প্রায়ই ক্ষমা চাইবে আর একটা সঠিক উত্তরকে একটা খারাপ উত্তর দিয়ে বদলাবে। দুই মিনিটে এটা টেস্ট করুন: এমন কিছু জিজ্ঞাসা করুন যা আপনি ইতিমধ্যে জানেন, সঠিক উত্তরটা মেনে নিন, তারপর বলুন "এটা ঠিক শোনাচ্ছে না" আর দেখুন। যা ফিরে আসে তা সেই একই যন্ত্রপাতি যা সম্মতিমূলক টেক্সট তৈরি করছে। এসবের যেকোনোটা কীভাবে তৈরি হয়েছে তার ভিত্তি-স্তরের ভার্সনের জন্য, AI আসলে কী গণিত ছাড়াই এটা কভার করে।
পাঁচটা জায়গা যেখানে এটা সবচেয়ে বেশি ভুল করে
আপনি যা জিজ্ঞাসা করতে পারেন তার সবকিছুজুড়ে ভুল সমানভাবে ছড়ানো নেই। এগুলো জমা হয়। পাঁচটা গুচ্ছ শেখা আপনাকে একটা ছোট অভ্যন্তরীণ অ্যালার্ম দেয় যা ঠিক মুহূর্তে বেজে ওঠে, যা একটা সাধারণ সতর্কতার বোধের চেয়ে বেশি মূল্যবান যা ক্রমাগত বাজে আর তারপর একেবারেই বাজা বন্ধ করে দেয়।
| এটা কোথায় পিছলে যায় | এটা দেখতে কেমন | একটা এক-লাইনের উদাহরণ |
|---|---|---|
| নির্দিষ্ট তথ্য আর সংখ্যা | পেছনে কিছু ছাড়া একটা নির্ভুল সংখ্যা | আপনাকে বলে একটা স্থানীয় দোকান 1987-এ খুলেছিল যখন এটা 1994-এ খুলেছিল |
| উদ্ধৃতি, কোট, লিংক | আসল-শোনানো শিরোনাম, আসল-দেখতে URL, একটাও লোড হয় না | দুইজন আসল গবেষকের একটা গবেষণা, একটা আসল জার্নালে, যা কখনো লেখা হয়নি |
| এর প্রশিক্ষণ কাটঅফের পরের যেকোনো কিছু | একটা পৃথিবী সম্পর্কে আত্মবিশ্বাসী উত্তর যা মাস আগে থেমেছে | একটা প্ল্যানের জন্য গত বছরের সাবস্ক্রিপশনের দাম উদ্ধৃত করে যা মার্চে বদলেছে |
| পাটিগণিত আর গণনা | সঠিক পদ্ধতি, ভুল মোট | এগারোটা ইনভয়েস লাইন যোগ করে আর 40 ডলার অফ হয় |
| প্রশ্ন যা তাদের নিজের উত্তর বহন করে | বিশ্লেষণ হিসেবে সাজানো সম্মতি | "X কেন ভালো পছন্দ?" X-এর পক্ষে যুক্তি ফেরত দেয় আর কখনো এটা প্রশ্ন করে না |
উদ্ধৃতির সারিটা একটা বিখ্যাত মূল্য বহন করে। 2023 সালের জুনে একজন ফেডারেল বিচারক দুইজন নিউ ইয়র্ক আইনজীবী আর তাদের ফার্মকে $5,000 জরিমানা করেছিলেন ChatGPT-র বানানো ছয়টা আদালতের মামলার ওপর তৈরি একটা ব্রিফ ফাইল করার জন্য, নাম, উদ্ধৃতি, আর উদ্ধৃত অংশসহ (Mata v. Avianca)। শেষ সারিটা অবশ্য, যেটা আপনি নিজে ঘটান, আর এটা আসল ব্যবহারে সবচেয়ে সাধারণ। "X কেন Y-এর চেয়ে ভালো" জিজ্ঞাসা করা প্রায় নিশ্চিতভাবে X-এর পক্ষে একটা কেস দেয়, আর "নিশ্চয়ই" বা "এটা কি সত্য নয় যে" থাকা একটা প্রশ্ন সাধারণত একটা হ্যাঁ পায়। এর বদলে এটা জিজ্ঞাসা করুন: "এই পরিস্থিতির জন্য X আর Y তুলনা করো, তারপর তুমি যেটা বেছে নিয়েছ তার বিপক্ষে সবচেয়ে শক্তিশালী যুক্তি আমাকে দাও।" প্রশ্নগুলো এমনভাবে সাজানো যাতে তারা উত্তরটা চোরাপথে না আনে তা মানুষ যাকে প্রম্পটিং বলে তার অর্ধেক, আর AI-এর সঙ্গে কীভাবে কথা বলবেন বাকিটা কভার করে। আগে জানার মতো আরেকটা অদ্ভুততা। একটা খুব লম্বা কথোপকথনে, বা আপনি একটা খুব লম্বা ডকুমেন্ট পেস্ট করার পর, শুরুর বিবরণ মডেলের দৃষ্টি থেকে পিছলে যেতে পারে, আর এটা আপনাকে সুতোটা হারিয়ে ফেলেছে তা বলার বদলে ফাঁকটা ভরাট করবে। এটা একটা সত্যের সমস্যার বদলে একটা ধারণক্ষমতার সীমা, আর একটা কনটেক্সট উইন্ডো কী ব্যাখ্যা করে সিলিংটা কোথায় বসে।
আত্মবিশ্বাসী সুরটা একটা ব্লাফ নয়
বেশিরভাগ মানুষ এখানে একটা যুক্তিসঙ্গত ধারণা নিয়ে আসে: জিনিসটা জানে এটা কতটা নিশ্চিত আর দক্ষ দেখাতে সন্দেহটা লুকায়। সেই ধারণাটা ভুল, আর এটা গুরুত্বপূর্ণ, কারণ এটা আপনাকে এমন একটা আত্মবিশ্বাসের সংকেত খুঁজতে পাঠায় যা কখনো ছিলই না।
আপনার কাছ থেকে আটকে রাখা কোনো কনফিডেন্স মিটার নেই। সিস্টেমটা একটা প্রাইভেট সংখ্যায় বসে নেই যা 62 শতাংশ পড়ে আর 100-এর মতো শোনানো বেছে নেয়। এটা একটা সঠিক উত্তরের মতো একই প্রক্রিয়ায়, একই সাবলীলতায়, একটা ভুল উত্তর তৈরি করে। এই কারণেই এখানে সুর একটা সংকেত হিসেবে অসার, যেভাবে মানুষের ক্ষেত্রে নয়। "আমি পুরোপুরি নিশ্চিত নই, কিন্তু"-এর মতো একটা হেজও তৈরি করা টেক্সট। এটা দেখা যায় কারণ সেই ভাষাটা সেই আকৃতির প্রশ্নের সঙ্গে মানানসই। কোনো অভ্যন্তরীণ সতর্কতা ট্রিগার হয়নি। একটা মডেলকে দশে তার নিজের আত্মবিশ্বাস রেট করতে বলুন আর আপনি একটা সংখ্যা পাবেন, প্রায়ই একটা উঁচু সংখ্যা, এটা বানানো একটা উদ্ধৃতির ঠিক পাশে বসে। রেটিংটা উদ্ধৃতির মতো একই প্রক্রিয়ায় তৈরি হয়েছিল।
তাই "শুধু নিশ্চিত হলে উত্তর দাও" বা "কিছু বানিও না"-এর মতো নির্দেশনা মানুষ যতটা আশা করে তার চেয়ে কম সাহায্য করে। একটা গুরুত্বপূর্ণ প্রশ্নে "তুমি না জানলে বলো তুমি জানো না" যোগ করা এখনও করার মতো, কারণ নতুন মডেলগুলো আগের চেয়ে বেশি প্রস্তুত অস্বীকার করতে, কিন্তু এটাকে একটা গ্যারান্টি নয়, একটা ঠেলা হিসেবে দেখুন। সেই আইডিয়ার নির্ভরযোগ্য ভার্সনটা বাইরের দিকে নির্দেশ করে: উত্তরটা এমন কিছু দেখান যা আপনি খুলতে পারেন। একটা অ্যাপ যখন ওয়েব সার্চ করে আর লিংক যুক্ত করে, আপনি নিজে পেজটা পড়তে পারেন আর যেকোনো কিছুতে এর কথা নেওয়া বন্ধ করতে পারেন। এটা শুধু স্মৃতি থেকে উত্তর দিলে, এর কথাই আপনার কাছে যা আছে তার সব।
চারটা চেক, সেগুলোর খরচ যত কম তার ক্রমে
আপনি সবকিছু যাচাই করতে যাচ্ছেন না, আর চেষ্টা করলে আপনি কিছুই যাচাই না করে শেষ করবেন। আপনার যা দরকার তা হলো এমন একটা চেক যার খরচ ভুলটার চেয়ে কম। এই চারটা প্রায় বিনামূল্য থেকে সামান্য বিরক্তিকর পর্যন্ত চলে, আর বেশিরভাগ প্রশ্নের জন্য আপনি যে প্রথমটা ধরেন সেটাই যথেষ্ট।
- উৎস চান, তারপর সেগুলো খুলুন। একটা আচারের মতো "তোমার উৎস উদ্ধৃত করো" নয়। সেগুলো ক্লিক করুন। একটা মৃত লিংক, বা একটা লাইভ পেজ যাতে দাবিটা নেই, প্রায় দশ সেকেন্ডে প্রশ্নটা মিটিয়ে দেয়।
- একটা নতুন চ্যাটে আবার জিজ্ঞাসা করুন। একই প্রশ্ন, নতুন কথোপকথন, আগের কোনো আলাপ-আলোচনা ছাড়া। সংখ্যা, নাম, বা তারিখ যদি আলাদা হয়ে ফিরে আসে, মডেলটা কিছু মনে করার বদলে ফাঁক ভরাট করছিল। এর কোনো খরচ নেই আর বানানো নির্দিষ্ট বিবরণের একটা আশ্চর্যজনক অংশ ধরে ফেলে।
- একটা ভিন্ন মডেল জিজ্ঞাসা করুন। তথ্যভিত্তিক প্রশ্নের জন্য একক সর্বোচ্চ-মূল্যের চেক। একই প্রশ্ন দ্বিতীয় একটা প্রোভাইডারে পেস্ট করুন আর বিবরণ তুলনা করুন, সুর নয়।
- স্বাভাবিক উপায়ে এটা সার্চ করুন। আপনি যা পাঠাবেন, স্বাক্ষর করবেন, প্রকাশ করবেন, বা টাকা খরচ করবেন তার জন্য, একটা সার্চ ইঞ্জিনে নব্বই সেকেন্ড দিন। AI একটা চমৎকার প্রথম পাস। একটা প্রথম পাস যাচাই নয়।
তিন নম্বর পয়েন্টটা এর জায়গাটা অর্জন করে। ভিন্ন কোম্পানি তৈরি, ভিন্ন পদ্ধতিসহ ভিন্ন ডেটায় প্রশিক্ষিত দুটো মডেল, একই প্রশ্নে দুটোই ভুল হতে পারে। তারা খুব কমই একই ভুল বিবরণ বানায়, কারণ একটা বানানো নির্দিষ্ট জিনিস একটা নির্দিষ্ট সিস্টেমের নির্দিষ্ট ফাঁক থেকে বের হয়। Claude আর ChatGPT স্বাধীনভাবে আপনাকে একই সংখ্যা দিলে, সেই সংখ্যাটা সম্ভবত আসল। তারা দ্বিমত হলে, আপনি ঠিক সেই বাক্যটা খুঁজে পেয়েছেন যা চেক করার মতো, যা উত্তরে কিছু ভুল আছে এমন একটা অস্পষ্ট অনুভূতির চেয়ে ভালো। মাঝেমধ্যে চেকের জন্য, দুই প্রোভাইডারের ফ্রি টিয়ার যথেষ্ট আর কোনো খরচ নেই। ক্রস-চেকিং একবার অভ্যাস হয়ে গেলে এটা বিনামূল্য থাকা বন্ধ হয়, কারণ পেইড অ্যাক্সেসের দাম প্রতি প্রোভাইডারে মাসে প্রায় 20 ডলার, আর সেটাই সেই ফাঁক যা Whizi-র মতো একটা মাল্টি-মডেল সাবস্ক্রিপশন বন্ধ করে। একাধিক মডেল একসঙ্গে ব্যবহার করা ওয়ার্কফ্লোটা দিয়ে যায়।
যেখানে এটা গুরুত্বপূর্ণ, আর যেখানে আসলেই নয়
সবকিছুতে প্রযোজ্য একটা যাচাই অভ্যাস এক সপ্তাহের মধ্যে ভেঙে পড়ে। আপনি যা জিজ্ঞাসা করেন তার বেশিরভাগই কম ঝুঁকিপূর্ণ আর নিজে-চেক করা। আপনার নিজের ইমেইলের একটা ছোট ভার্সন চান আর আপনি দেখতে পারেন এটা ছোট কিনা আর এটা এখনও আপনি যা বোঝাতে চেয়েছিলেন তা বলে কিনা। ব্রেইনস্টর্মিং, জিনিসের নাম দেওয়া, রূপরেখা তৈরি, খসড়া তৈরি, আপনি পাঠানোর আগে পড়বেন এমন একটা বার্তা অনুবাদ করা, বা এলোমেলো নোটকে একটা তালিকায় বদলানোর ক্ষেত্রেও একই কথা। আপনিই চেক, আর ভুলটা সঙ্গে সঙ্গে আপনার সামনে দেখা যায়।
যেকোনো কাজকে সঠিক বাকেটে সাজাতে দুটো প্রশ্ন, আর এগুলো নিজেকে জিজ্ঞাসা করতে প্রায় তিন সেকেন্ড সময় লাগে।
- এটা ভুল হলে, কে জানতে পারবে, আর কখন? আপনি, এখন থেকে দশ সেকেন্ড পরে এটা পড়ার সময়, নাকি একজন ক্লায়েন্ট, তিন মাস পরে?
- আমি কি এটা পূর্বাবস্থায় ফেরাতে পারি? একটা খারাপ প্যারাগ্রাফ মুছে ফেলা বিনামূল্যে। একটা ট্যাক্স রিটার্ন আবার ফাইল করা, একটা কোটেশন আন-সেন্ড করা, বা একটা পেমেন্ট উল্টে দেওয়া নয়।
দুটো উত্তরের কোনোটা আপনাকে থামালে, আপনি কাজ করার আগে প্রতিটা নির্দিষ্ট দাবি যাচাই করুন। সেই বাকেটের স্পষ্ট সদস্য: ওষুধের নাম আর ডোজ, আইনি আর ফাইলিংয়ের সময়সীমা, ট্যাক্সের সংখ্যা, চুক্তির শর্ত, কারও স্বাস্থ্য বা অভিবাসন অবস্থা ছুঁয়ে যাওয়া যেকোনো কিছু, আর টাকা সরায় বা ব্যক্তিগত ডেটা সামলায় এমন কোড। একটা ইমেইলে একটা ভুল প্রতিশব্দ আপনাকে একদিনের জন্য সামান্য অদ্ভুত দেখায়। একটা ভুল ডোজ বা একটা মিস হওয়া সময়সীমা এমন কিছু নয় যা AI পরে সামলায়। AI ব্যবহার করা কি নিরাপদ সেই দিকটা আরও গভীরভাবে কভার করে, আপনার কখনো পেস্ট করা উচিত নয় এমন কিছুসহ। একটা অভ্যাস দিয়ে শুরু করুন: যে মুহূর্তে একটা উত্তরে একটা সংখ্যা, একটা নাম, একটা তারিখ, বা একটা লিংক থাকে, সেই অংশটাকে একা অযাচাইকৃত হিসেবে দেখুন আর এটা চেক করুন। বাকিটা সাধারণত ঠিক থাকে।
- একটা উত্তরে প্রতিটা সংখ্যা, নাম, তারিখ, আর লিংক অযাচাইকৃত হিসেবে দেখুন যতক্ষণ না আপনি এটা চেক করেন।
- "তুমি কি নিশ্চিত?" একটা টেস্ট হিসেবে বাদ দিন, কারণ চাপ সংশোধনের বদলে সম্মতি তৈরি করে।
- উৎস চান, সেগুলো খুলুন, আর নিশ্চিত করুন পেজটা আসলে যা উত্তরে দাবি করা হয়েছিল তা বলে।
- একটা গুরুত্বপূর্ণ প্রশ্ন একটা নতুন চ্যাটে আবার জিজ্ঞাসা করুন আর দেখুন বিবরণগুলো একই থাকে কিনা।
- নির্ভর করার আগে অন্য একটা কোম্পানির দ্বিতীয় একটা মডেলকে তথ্যভিত্তিক প্রশ্ন দিন।
- নেতৃত্বদানকারী প্রশ্ন এমনভাবে নতুন করে লিখুন যাতে তারা মডেলকে বলে না আপনি কোন উত্তরটা চান।
- এটা ভুল হলে কে জানতে পারবে আর আপনি এটা পূর্বাবস্থায় ফেরাতে পারেন কিনা জিজ্ঞাসা করুন, তারপর সেই অনুযায়ী যাচাই করুন।
প্রায়ই জিজ্ঞাসিত প্রশ্ন
AI হ্যালুসিনেশন কী?
একটা হ্যালুসিনেশন হলো একটা আত্মবিশ্বাসী, ভালোভাবে গঠিত উত্তর যা কেবল সত্য নয়: একটা বানানো পরিসংখ্যান, একটা উদ্ধৃতি যা বিদ্যমান নেই, একটা ফিচার যা একটা পণ্যের কখনো ছিল না। নামটা দুর্ভাগ্যজনক, কারণ কিছুই কল্পনা করা হচ্ছে না। সিস্টেমটা এমন টেক্সট তৈরি করেছে যা একটা সঠিক উত্তরের প্যাটার্নের সঙ্গে মানানসই, আর সেই ক্ষেত্রে প্যাটার্ন আর সত্য মিলে যায়নি।
AI কেন জানে না বলার বদলে কথা বানায়?
"আমি জানি না" বলা একটা প্রশ্নের সঙ্গে মানানসই অনেক উত্তরের একটা মাত্র, আর একটা সাবলীল উত্তর সাধারণত বেশি মানানসই হয়। মডেলটার কোনো আলাদা ধাপ নেই যা তৈরি করার আগে একটা তথ্য চেক করে, তাই একটা অস্বীকার ট্রিগার করার মতো কিছু নেই। নতুন মডেলগুলো পুরোনোগুলোর চেয়ে বেশি প্রত্যাখ্যান করে, আর যখন এর কোনো ধারণা নেই তখন সরাসরি একটা "কোনো ধারণা নেই" জিজ্ঞাসা করা কিছুটা সাহায্য করে।
AI-এর উত্তর কি বিশ্বাস করা যায়?
যুক্তি, কাঠামো, আর খসড়া তৈরিতে বিশ্বাস করুন, যেখানে এই টুলগুলো সত্যিকারভাবে শক্তিশালী। চেক না করে বিবরণে বিশ্বাস করবেন না: সংখ্যা, নাম, তারিখ, উদ্ধৃতি, আর সাম্প্রতিক যেকোনো কিছু। সেই বিভাজনটাই এখানে বিশ্বাসের ব্যবহারিক ভার্সন, আর এটা আপনাকে পুড়ে না গিয়ে প্রতিদিন AI ব্যবহার করতে দেয়।
"তুমি কি নিশ্চিত?" জিজ্ঞাসা করলে কি একটা ভুল উত্তর ঠিক হয়?
খুব কমই, আর এটা জিনিসগুলো আরও খারাপ করতে পারে। মডেলগুলো চাপের সঙ্গে মানিয়ে নিতে থাকে, তাই তারা প্রায়ই একটা সঠিক উত্তর ছেড়ে দেয় আর এটাকে একটা দুর্বল উত্তর দিয়ে বদলায়। একই প্রশ্নসহ একটা নতুন চ্যাট অনেক ভালো একটা টেস্ট, কারণ দ্বিতীয় উত্তরটা আপনার সন্দেহের চাপ ছাড়া তৈরি হয়।
আমি কীভাবে দ্রুত একটা AI উত্তর চেক করব?
এটা আপনাকে দেওয়া যেকোনো উৎস খুলুন আর নিশ্চিত করুন সেগুলো যা দাবি করা হয়েছিল তা বলে। কোনো উৎস না থাকলে, একটা নতুন চ্যাটে একই প্রশ্ন জিজ্ঞাসা করুন আর দেখুন বিবরণগুলো টিকে থাকে কিনা। আপনি যা কাজ করার পরিকল্পনা করছেন এমন যেকোনো তথ্যভিত্তিক জিনিসের জন্য, একটা ভিন্ন প্রোভাইডারের দ্বিতীয় একটা মডেলকে দিন, কারণ দুটো সিস্টেম খুব কমই একই বিবরণ বানায়।