AI-এর Confidence Score না থাকলে উত্তর কতটা বিশ্বাস করবেন

সর্বাধিক আলোচিত

ChatGPT, Gemini, Claude বা অন্য কোনো AI চ্যাটবট খুব পরিষ্কার ও আত্মবিশ্বাসী ভাষায় উত্তর দিতে পারে। সমস্যা হলো, সেই উত্তরের কোনো তারিখ, গবেষণার নাম, উদ্ধৃতি বা সিদ্ধান্ত ভুল হলেও লেখার ধরন দেখে তা বোঝার উপায় সব সময় থাকে না।

সাধারণ LLM আউটপুটে ব্যবহারকারীর সামনে মডেলের অভ্যন্তরীণ Confidence Score সাধারণত সরাসরি দেখানো হয় না। ফলে AI উত্তর বিশ্বাসযোগ্যতা বিচার করতে হলে ভাষার দৃঢ়তা বা উত্তরের দৈর্ঘ্যের বদলে অন্য কিছু দেখতে হবে। গবেষণায় দেখা গেছে, দীর্ঘ ও বিস্তারিত ব্যাখ্যা মানুষের আস্থা বাড়াতে পারে, যদিও অতিরিক্ত ব্যাখ্যা উত্তরটির নির্ভুলতা বাড়ায় না।

ব্যবহারিকভাবে তিনটি প্রশ্ন এখানে সবচেয়ে কাজে দেয়: তথ্যটির প্রমাণ কী, সেটি স্বাধীনভাবে যাচাই করা যায় কি না এবং ভুল হলে ক্ষতির মাত্রা কতটা।

Hallucination হলে ভুল তথ্যও বিশ্বাসযোগ্য শোনাতে পারে

AI কখনো এমন বক্তব্য তৈরি করে, যা পড়তে স্বাভাবিক ও বিশ্বাসযোগ্য হলেও বাস্তবে ভুল বা ভিত্তিহীন। এই সমস্যাকে সাধারণভাবে AI hallucination বলা হয়।

যুক্তরাষ্ট্রের National Institute of Standards and Technology বা NIST তাদের Generative AI Risk Management Profile-এ এ ধরনের সমস্যার জন্য confabulation শব্দটি ব্যবহার করেছে। সেখানে এমন পরিস্থিতির কথা বলা হয়েছে, যেখানে generative AI ভুল বা মিথ্যা তথ্য আত্মবিশ্বাসের সঙ্গে উপস্থাপন করে। কখনো ভুল যুক্তি বা কাল্পনিক citation দিয়েও উত্তরকে বিশ্বাসযোগ্য দেখাতে পারে।

ভুলটি নানা রকম হতে পারে। যেমন AI—

  • ভুল তারিখ বা ব্যক্তির নাম দিতে পারে;
  • বাস্তবে নেই এমন গবেষণা বা বইয়ের নাম তৈরি করতে পারে;
  • বানানো উদ্ধৃতি কোনো বাস্তব ব্যক্তির নামে বসাতে পারে;
  • অস্তিত্বহীন citation বা reference দিতে পারে;
  • প্রশ্নে পর্যাপ্ত তথ্য না থাকলেও প্রয়োজনের চেয়ে বেশি নিশ্চিত উত্তর দিতে পারে।

OpenAI-এর Help Center-এও বলা হয়েছে, ChatGPT ভুল সংজ্ঞা, তারিখ বা তথ্যের পাশাপাশি বানানো উদ্ধৃতি, গবেষণা, citation ও reference তৈরি করতে পারে। ভুল উত্তরও আত্মবিশ্বাসী শোনাতে পারে। Google-ও Gemini সম্পর্কে একই ধরনের সতর্কতা দিয়েছে। এ কারণে সাবলীল ভাষা, সুন্দর তালিকা বা বিস্তারিত ব্যাখ্যাকে তথ্যের সত্যতার প্রমাণ হিসেবে দেখা ঠিক নয়।

আরও পড়ুন: AI কীভাবে উত্তর তৈরি করে: সাধারণ ব্যবহারকারীর জন্য সহজ ব্যাখ্যা

আত্মবিশ্বাসী ভাষা আর সঠিক তথ্য এক বিষয় নয়

আত্মবিশ্বাসী ভাষা আর সঠিক তথ্য এক বিষয় নয়

বড় ভাষা মডেলের প্রশিক্ষণের একটি মৌলিক অংশ হলো আগের লেখার ভিত্তিতে পরবর্তী token বা শব্দ অনুমান করা। এই প্রক্রিয়ায় তথ্যগতভাবে সঠিক ও ভাষাগতভাবে স্বাভাবিক উত্তর একসঙ্গে আসতে পারে, কিন্তু একটি আরেকটির নিশ্চয়তা দেয় না। NIST-এর বিশ্লেষণেও statistical prediction থেকে ভুল বা পরস্পরবিরোধী তথ্য তৈরির ঝুঁকির কথা বলা হয়েছে।

OpenAI-এর ২০২৫ সালের hallucination-বিষয়ক গবেষণায় আরেকটি গুরুত্বপূর্ণ বিষয় এসেছে। তাদের বিশ্লেষণ অনুযায়ী, অনেক প্রচলিত মূল্যায়নব্যবস্থায় অনিশ্চিত হলে উত্তর না দেওয়ার চেয়ে অনুমান করে উত্তর দিলে বেশি নম্বর পাওয়ার সুযোগ থাকে। অর্থাৎ “জানি না” বলার বদলে অনুমান করার প্রবণতা কিছু মূল্যায়ন কাঠামো থেকে উৎসাহিত হতে পারে।

এ থেকে প্রতিটি আত্মবিশ্বাসী AI উত্তরকে সন্দেহ করার প্রয়োজন নেই। তবে আত্মবিশ্বাসের ভঙ্গিকে প্রমাণ হিসেবে ব্যবহার করা যাবে না।

AI বলল “আমি ৯০% নিশ্চিত”—এই সংখ্যার মানে কী?

Confidence Score না থাকলে কেউ AI-কে জিজ্ঞেস করতে পারেন:

“এই উত্তরের ব্যাপারে তুমি কত শতাংশ নিশ্চিত?”

এ ধরনের প্রশ্ন উত্তরটির দুর্বল জায়গা খুঁজতে কিছুটা সাহায্য করতে পারে। কিন্তু AI যদি বলে “আমি ৯০% নিশ্চিত”, তার অর্থ এই নয় যে একই ধরনের ১০০টি প্রশ্নের মধ্যে ঠিক ৯০টির উত্তর সঠিক হবে। এভাবে ব্যাখ্যা করতে হলে confidence-এর সঙ্গে বাস্তব সঠিকতার সম্পর্ক যথাযথভাবে calibrated হতে হবে।

EMNLP ২০২৪-এ প্রকাশিত একটি গবেষণায় post-alignment language model-এর প্রকাশ করা confidence এবং প্রকৃত সঠিকতার মধ্যে অমিল ও অতিরিক্ত আত্মবিশ্বাসের সমস্যা পাওয়া গেছে। তাই AI-এর নিজের বলা শতকরা confidence-কে সতর্কতার সংকেত হিসেবে দেখা যেতে পারে, প্রমাণ হিসেবে নয়।

সব Confidence Score একই জিনিস মাপে না

সব AI ব্যবস্থায় confidence-সংক্রান্ত কোনো তথ্যই থাকে না—এমন কথাও ঠিক নয়।

কিছু developer API বা বিশেষ ব্যবহারে confidence, probability কিংবা grounding-সংক্রান্ত metadata থাকতে পারে। উদাহরণ হিসেবে Gemini API-এর GroundingSupport-এ supporting reference-এর জন্য confidenceScores ক্ষেত্র রয়েছে।

এটি পুরো উত্তর সঠিক হওয়ার সার্বজনীন সম্ভাবনা নয়। সংশ্লিষ্ট reference কোনো দাবিকে কতটা সমর্থন করছে, সেই নির্দিষ্ট প্রেক্ষাপটের metadata। তাই কোনো Confidence Score দেখলে প্রথম প্রশ্ন হওয়া উচিত: স্কোরটি আসলে কী মাপছে?

কোন ধরনের AI উত্তর কতটা যাচাই করবেন?

প্রতিটি উত্তরের পেছনে সমান সময় ব্যয় করা বাস্তবসম্মত নয়। ভুল হওয়ার সম্ভাবনার পাশাপাশি ভুল হলে তার প্রভাবও বিবেচনা করা দরকার।

ব্যবহারের ধরন যাচাইয়ের প্রয়োজন
শিরোনামের ধারণা, বাক্য সংক্ষিপ্ত করা, খসড়া সাজানো সাধারণ সম্পাদনা ও পর্যালোচনা
ইতিহাস, তারিখ, সংখ্যা ও উদ্ধৃতি নির্ভরযোগ্য উৎসে মিলিয়ে দেখা
গবেষণা বা পরিসংখ্যান মূল গবেষণা বা প্রাথমিক উৎস পরীক্ষা
বর্তমান দাম, ফিচার ও নীতি সাম্প্রতিক অফিসিয়াল উৎস দেখা
প্রকাশযোগ্য নিবন্ধ গুরুত্বপূর্ণ তথ্যভিত্তিক দাবি আলাদাভাবে যাচাই
চিকিৎসা, আইন বা অর্থের মতো উচ্চ ঝুঁকির সিদ্ধান্ত সংশ্লিষ্ট পেশাজীবী ও কর্তৃত্বপূর্ণ উৎসকে অগ্রাধিকার

Google তাদের Gemini নির্দেশনায় চিকিৎসা, আইনি, আর্থিক বা অন্যান্য পেশাগত পরামর্শ হিসেবে Gemini-এর উত্তরের ওপর নির্ভর না করতে বলেছে। এখান থেকে একটি ব্যবহারিক নিয়ম পাওয়া যায়: ভুল হলে ক্ষতি যত বেশি, যাচাই তত কঠোর হওয়া উচিত।

AI-এর উত্তর যাচাই করবেন যেভাবে

পুরো উত্তরটি “সঠিক” না “ভুল”—এভাবে একবারে বিচার না করে আগে যাচাইযোগ্য দাবিগুলো আলাদা করুন।

বিশেষভাবে দেখুন—

  • তারিখ ও সাল;
  • সংখ্যা ও শতকরা হার;
  • সরাসরি উদ্ধৃতি;
  • গবেষণাপত্রের নাম;
  • ব্যক্তি বা প্রতিষ্ঠানের বক্তব্য;
  • আইন ও সরকারি নিয়ম;
  • সফটওয়্যারের ফিচার;
  • দাম ও সাবস্ক্রিপশন;
  • “প্রথম”, “একমাত্র” বা “সবচেয়ে বেশি” ধরনের দাবি।

এরপর গুরুত্বপূর্ণ দাবিগুলোর উৎস পরীক্ষা করুন।

শুধু উৎস চেয়েই থামবেন না

AI-কে শুধু “source দিন” বলার বদলে বলা যেতে পারে:

“প্রতিটি গুরুত্বপূর্ণ তথ্যভিত্তিক দাবির পাশে সংশ্লিষ্ট উৎস দিন এবং কোন উৎস কোন দাবিকে সমর্থন করছে তা আলাদা করে দেখান।”

এতে যাচাইয়ের কাজ সহজ হয়। কিন্তু AI একটি source দেখাতে পারছে বলেই source-টি সঠিক বা দাবিটি সত্য—এমন নয়। ChatGPT-এর নিজস্ব সহায়তা নথিতেও গুরুত্বপূর্ণ তথ্য, উদ্ধৃতি, উপাত্ত, কারিগরি তথ্য ও বাইরের reference সরাসরি যাচাই করার পরামর্শ দেওয়া হয়েছে।

লিংক খুলে তিনটি বিষয় দেখুন

উৎসটি আসল কি না।
গবেষণা, প্রতিবেদন, আদালতের সিদ্ধান্ত বা উদ্ধৃতির নাম বাস্তবে আছে কি না দেখুন।

উৎসটি সত্যিই দাবিটিকে সমর্থন করছে কি না।
একটি আসল ওয়েবপেজের লিংক পাওয়া গেলেও সেখানে AI-এর বলা তথ্য নাও থাকতে পারে। কোনো গবেষণার ফলও প্রসঙ্গ বাদ দিয়ে অতিরঞ্জিতভাবে উপস্থাপন করা হতে পারে।

তথ্যটি এখনও প্রযোজ্য কি না।
দাম, সফটওয়্যারের ফিচার, প্ল্যাটফর্ম নীতি, সরকারি নির্দেশনা বা সাম্প্রতিক ঘটনার ক্ষেত্রে প্রকাশ বা হালনাগাদের তারিখ দেখা জরুরি।

অন্য AI-কে একই প্রশ্ন করা কি যথেষ্ট?

অন্য AI-কে একই প্রশ্ন করা কি যথেষ্ট?

একটি উত্তরের পর একই প্রশ্ন অন্য চ্যাটবটকে করা কাজে লাগতে পারে। দুইটি উত্তর আলাদা হলে অন্তত বোঝা যায় যে বিষয়টি আরও পরীক্ষা করা দরকার। কিন্তু দুইটি AI একই উত্তর দিলেই সেটি প্রমাণিত হয়ে যায় না। দ্বিতীয় মডেলটিও ভুল করতে পারে।

গুরুত্বপূর্ণ দাবির ক্ষেত্রে AI-এর সঙ্গে আরেক AI-এর উত্তর মেলানোর চেয়ে প্রাথমিক বা কর্তৃত্বপূর্ণ উৎসে যাওয়া বেশি কার্যকর। গবেষণার দাবি হলে মূল গবেষণাপত্র, সরকারি নিয়ম হলে সংশ্লিষ্ট সরকারি দপ্তরের নথি এবং সফটওয়্যারের ফিচার হলে নির্মাতার বর্তমান documentation দেখুন।

AI-কে নিজের উত্তরের দুর্বল জায়গা দেখাতে বলতে পারেন

অতিরিক্ত একটি ধাপ হিসেবে AI-কে জিজ্ঞেস করা যায়:

“এই উত্তরের কোন দাবিগুলো নিয়ে সবচেয়ে বেশি অনিশ্চয়তা আছে এবং কোনগুলো স্বাধীনভাবে যাচাই করা উচিত?”

আরও নির্দিষ্টভাবে বলা যায়:

“যেসব তথ্যের নির্ভরযোগ্য উৎস পাওয়া যাচ্ছে না, সেগুলো আলাদা করে দেখাও।”

এতে দুর্বল দাবি সামনে আসতে পারে। তবে এটি স্বাধীন তথ্য যাচাই নয়। একই মডেল নিজের আগের ভুলকেও আবার সমর্থন করতে পারে। তাই এই পদ্ধতিকে নিজস্ব যাচাই, চূড়ান্ত fact-check হিসেবে নয়, ব্যবহার করা ভালো।

Citation থাকলেই কি উত্তর বিশ্বাসযোগ্য?

না। Citation থাকলে যাচাই সহজ হয়, কিন্তু citation নিজে সত্যতার সিলমোহর নয়। NIST সতর্ক করেছে যে generative AI কাল্পনিক citation বা যুক্তি তৈরি করতে পারে, যা ব্যবহারকারীর আস্থা অযথা বাড়াতে পারে। OpenAI-ও বানানো citation ও reference-কে hallucination-এর উদাহরণ হিসেবে উল্লেখ করেছে।

Citation দেখলে অন্তত চারটি বিষয় পরীক্ষা করুন:

১. উৎসটি বাস্তবে আছে কি না।
২. উদ্ধৃত পেজটিই তথ্যটির উৎস কি না।
৩. মূল লেখার অর্থ ঠিকভাবে তুলে ধরা হয়েছে কি না।
৪. পুরোনো তথ্যকে বর্তমান তথ্য হিসেবে ব্যবহার করা হচ্ছে কি না।

বিশেষ করে গবেষণা, আইন বা পরিসংখ্যানের ক্ষেত্রে source-এর শিরোনাম দেখা আর source-এর বক্তব্য যাচাই করা এক বিষয় নয়।

Search-যুক্ত AI কোথায় বাড়তি সুবিধা দেয়?

ওয়েব অনুসন্ধানের সুবিধাযুক্ত AI সাম্প্রতিক তথ্য খুঁজতে এবং মূল উৎসে পৌঁছাতে সুবিধা দিতে পারে।

০৯ আগস্ট ২০২৬ পর্যন্ত OpenAI-এর Help Center অনুযায়ী, ChatGPT Search ওয়েব থেকে সাম্প্রতিক তথ্য খুঁজে উত্তরের সঙ্গে প্রাসঙ্গিক web source-এর link বা inline citation দিতে পারে। এতে ব্যবহারকারী সরাসরি উৎস খুলে দাবিটি পরীক্ষা করতে পারেন।

তবে Search থাকলেই উত্তর স্বয়ংক্রিয়ভাবে সঠিক হয়ে যায় না। OpenAI-ও নির্ভুলতা গুরুত্বপূর্ণ হলে cited source সরাসরি পরীক্ষা করার পরামর্শ দেয়। তাই Search-এর আসল সুবিধা হলো যাচাইয়ের পথ ছোট করা, AI-কে যাচাই ছাড়াই বেশি বিশ্বাস করার সুযোগ তৈরি করা নয়।

যেসব উত্তরে বাড়তি সতর্কতা দরকার

AI কোনো অজানা বিষয়ে উৎস ছাড়াই খুব নির্দিষ্ট তারিখ, সংখ্যা বা ব্যক্তির নাম দিলে সেটি যাচাই করুন।

আরও সতর্ক হওয়া দরকার যখন—

  • গবেষণাপত্রের পূর্ণ নাম দেওয়া হয়েছে, কিন্তু মূল paper খুঁজে পাওয়া যাচ্ছে না;
  • সরাসরি উদ্ধৃতি দেওয়া হয়েছে, কিন্তু মূল বক্তব্যের উৎস নেই;
  • বর্তমান দাম বা নীতির কথা বলা হয়েছে, অথচ সময় উল্লেখ করা হয়নি;
  • অস্পষ্ট প্রশ্নের অত্যন্ত নির্দিষ্ট উত্তর দেওয়া হয়েছে;
  • একই কথোপকথনে আগের ও পরের তথ্য পরস্পরবিরোধী;
  • ভুল ধরিয়ে দেওয়ার পর কোনো নতুন প্রমাণ ছাড়াই উত্তর সম্পূর্ণ বদলে যায়।

এগুলোর কোনো একটি লক্ষণ থাকলেই উত্তর ভুল—এমন সিদ্ধান্ত নেওয়া যাবে না। বরং এগুলো আরও যাচাই করার সংকেত।

প্রকাশযোগ্য লেখায় নিয়ম আরও কঠোর হওয়া উচিত

নিজের বোঝার জন্য AI ব্যবহার করা এবং হাজারো পাঠকের সামনে তথ্য প্রকাশ করা একই ধরনের দায়িত্ব নয়। কন্টেন্ট ক্রিয়েটর, সম্পাদক বা গবেষকের ক্ষেত্রে AI থেকে পাওয়া সংখ্যা, গবেষণার ফল, উদ্ধৃতি, তারিখ, আইনি দাবি, পণ্যের ফিচার ও সরকারি নীতি মূল উৎস না দেখে সরাসরি প্রকাশ করা ঠিক নয়।

AI কোনো গবেষণার সারাংশ দিলে প্রয়োজনে মূল গবেষণাপত্রের পদ্ধতি, নমুনা ও সীমাবদ্ধতাও দেখা দরকার। কারণ গবেষণাটি সত্য হলেও তার ফলাফলকে মূল প্রসঙ্গের বাইরে নিয়ে অতিরঞ্জিত করা সম্ভব।

AI তথ্য খোঁজা, বিষয় বোঝা, খসড়া সাজানো বা যাচাই করার জায়গা চিহ্নিত করতে সহায়ক হতে পারে। কিন্তু প্রকাশযোগ্য দাবির ক্ষেত্রে প্রমাণের দায়িত্ব শেষ পর্যন্ত উৎসের ওপরই থাকে।

Confidence নয়, প্রমাণকে অগ্রাধিকার দিন

AI উত্তর বিশ্বাসযোগ্যতা বিচার করার জন্য একটি একক শতাংশের প্রয়োজন নেই। বেশির ভাগ ক্ষেত্রে তিনটি প্রশ্ন যথেষ্ট কার্যকর:

দাবিটি স্বাধীনভাবে যাচাই করা যায় কি?
নির্ভরযোগ্য উৎসে সেটি সমর্থিত কি?
ভুল হলে ক্ষতি কতটা হবে?

ভাষা ঠিক করা, ধারণা তৈরি বা খসড়া সাজানোর মতো কাজে যাচাই তুলনামূলক হালকা হতে পারে। কিন্তু সংখ্যা, উদ্ধৃতি, গবেষণা, বর্তমান তথ্য এবং প্রকাশযোগ্য দাবির ক্ষেত্রে উৎস দেখা জরুরি। ভবিষ্যতে কোনো AI interface Confidence Score দেখালেও একই নিয়ম প্রযোজ্য থাকবে। আগে জানতে হবে স্কোরটি কী মাপছে এবং বাস্তব সঠিকতার সঙ্গে তার সম্পর্ক কতটা নির্ভরযোগ্য।

শতকরা আত্মবিশ্বাসের চেয়ে যাচাইযোগ্য প্রমাণ বেশি মূল্যবান।

প্রায়শই জিজ্ঞাসিত প্রশ্ন

AI-কে “না জানলে জানি না বলবে” লিখলে কি hallucination বন্ধ হয়?

এ ধরনের নির্দেশ AI-কে অনুমান না করতে উৎসাহ দিতে পারে, কিন্তু hallucination বন্ধ হওয়ার নিশ্চয়তা দেয় না। গুরুত্বপূর্ণ তথ্যভিত্তিক দাবি তখনও স্বাধীনভাবে যাচাই করা দরকার।

AI-এর দেওয়া Wikipedia link কি যাচাইয়ের জন্য ব্যবহার করা যাবে?

কোনো বিষয় প্রাথমিকভাবে বোঝা বা সংশ্লিষ্ট reference খুঁজতে Wikipedia কাজে লাগতে পারে। তবে গবেষণা, সরকারি নীতি, আইন, চিকিৎসা বা গুরুত্বপূর্ণ প্রকাশযোগ্য দাবির ক্ষেত্রে সম্ভব হলে মূল নথি বা প্রাথমিক উৎসে যাওয়া উচিত।

Confidence Score থাকলে কি fact-checking আর প্রয়োজন হবে না?

প্রয়োজন থাকবে। একটি Confidence Score কতটা অর্থবহ, তা নির্ভর করে সেটি কী মাপছে এবং বাস্তব সঠিকতার সঙ্গে কতটা calibrated তার ওপর। কিছু confidence metadata পুরো উত্তরের factual accuracy-ও মাপে না।

সর্বশেষ