চ্যাটবটের উত্তর এত স্বাভাবিক হতে পারে যে মনে হয়, সেটি প্রশ্নটি মানুষের মতো বুঝেছে, তথ্য যাচাই করেছে এবং তারপর বাক্য লিখেছে। বাস্তবে উত্তর তৈরির প্রক্রিয়াটি সম্ভাবনা, গাণিতিক হিসাব এবং প্রশিক্ষণে শেখা ভাষার সম্পর্কের ওপর দাঁড়িয়ে।
AI কীভাবে উত্তর তৈরি করে, তার সহজ ব্যাখ্যা হলো: GPT-ধাঁচের একটি ভাষা মডেল আপনার প্রম্পটকে ছোট ছোট টোকেনে ভাগ করে, সেগুলোকে সংখ্যায় প্রকাশ করে এবং বর্তমান প্রসঙ্গে পরবর্তী কোন টোকেনটি মানানসই হতে পারে, তার সম্ভাবনা হিসাব করে। একটি টোকেন নির্বাচিত হলে সেটিকে আগের লেখার সঙ্গে যুক্ত করে আবার পরের টোকেনের হিসাব করা হয়। এই ধারাবাহিক প্রক্রিয়াতেই সম্পূর্ণ উত্তর গড়ে ওঠে।
কিছু চ্যাটবট ওয়েব সার্চ, ফাইল অনুসন্ধান, ক্যালকুলেটর, কোড চালানো বা অন্য টুল ব্যবহার করতে পারে। এসব টুল নতুন তথ্য সংগ্রহ করে মডেলকে দেয়। তবে তথ্য সংগ্রহ এবং সেই তথ্য দিয়ে ভাষা তৈরি করা দুটি আলাদা ধাপ।
এ কারণেই দুটি বিষয় শুরুতেই মনে রাখা দরকার। AI প্রতিটি প্রশ্নের উত্তর ইন্টারনেট থেকে তুলে আনে না। আবার সাবলীলভাবে লেখা কোনো বাক্য সত্য হওয়ার নিশ্চয়তাও দেয় না।
এক নজরে উত্তর তৈরির ৬টি ধাপ
একটি টেক্সটভিত্তিক AI চ্যাটবটে সাধারণত নিচের প্রক্রিয়া দেখা যায়:
১. ব্যবহারকারীর প্রশ্ন, নির্দেশ ও প্রাসঙ্গিক কথোপকথন গ্রহণ করা
২. লেখাকে টোকেন নামের ছোট এককে ভাগ করা
৩. টোকেনগুলোকে সংখ্যাগত উপস্থাপনায় রূপ দেওয়া
৪. ট্রান্সফরমার নেটওয়ার্ক দিয়ে টোকেনগুলোর পারস্পরিক সম্পর্ক হিসাব করা
৫. সম্ভাব্য পরবর্তী টোকেনগুলোর মধ্য থেকে একটি নির্বাচন করা
৬. তৈরি টোকেনের ধারাকে পাঠযোগ্য উত্তর হিসেবে দেখানো
পণ্য ও মডেলভেদে এর সঙ্গে নিরাপত্তা পরীক্ষা, সার্চ, মেমোরি, ফাইল বিশ্লেষণ বা অন্য টুল যুক্ত হতে পারে।
AI, মেশিন লার্নিং ও LLM-এর পার্থক্য
বিষয়টি বুঝতে তিনটি সম্পর্কিত শব্দ আলাদা করা প্রয়োজন।
কৃত্রিম বুদ্ধিমত্তা বা AI একটি বিস্তৃত ক্ষেত্র। লেখা তৈরি, ছবি শনাক্ত করা, অনুবাদ, দাবা খেলা বা আর্থিক জালিয়াতির সংকেত খোঁজা—সবই AI ব্যবস্থার উদাহরণ হতে পারে।
মেশিন লার্নিং হলো AI ব্যবস্থা তৈরির একটি পদ্ধতি। এখানে প্রতিটি নিয়ম আলাদাভাবে লিখে দেওয়ার বদলে অনেক উদাহরণ থেকে কাজের ধরন শেখানো হয়।
লার্জ ল্যাঙ্গুয়েজ মডেল বা LLM বিপুল পরিমাণ ভাষাগত উদাহরণ দিয়ে প্রশিক্ষিত এক ধরনের মেশিন লার্নিং মডেল। এটি লেখা বিশ্লেষণ ও তৈরি করতে পারে।
ChatGPT-এর মতো চ্যাটবট একটি LLM ব্যবহার করতে পারে। তবে সম্পূর্ণ চ্যাটবটটি শুধু ভাষা মডেল নয়। এর সঙ্গে চ্যাট ইন্টারফেস, নিরাপত্তাব্যবস্থা, সিস্টেম নির্দেশনা, সার্চ, মেমোরি, ফাইল বিশ্লেষণ এবং অন্য টুল থাকতে পারে।
সহজ তুলনায়, LLM হলো ভাষা তৈরির ইঞ্জিন। চ্যাটবট হলো সেই ইঞ্জিনকে ঘিরে তৈরি সম্পূর্ণ সেবা।
প্রম্পট কীভাবে টোকেন ও সংখ্যায় বদলে যায়
ভাষা মডেল একটি পূর্ণ অনুচ্ছেদকে মানুষের মতো সরাসরি পড়ে না। প্রম্পট প্রথমে টোকেন নামের ছোট অংশে ভেঙে যায়।
একটি টোকেন পূর্ণ শব্দ হতে পারে। আবার সেটি কোনো শব্দের অংশ, বিরামচিহ্ন, স্পেসসহ শব্দাংশ বা কখনো একটি অক্ষরও হতে পারে। কোন লেখা কীভাবে ভাগ হবে, তা ভাষা, মডেল এবং ব্যবহৃত টোকেনাইজারের ওপর নির্ভর করে।
ধরা যাক, প্রশ্নটি হলো:
বাংলাদেশের রাজধানী কী?
মানুষ এটিকে একটি পূর্ণ প্রশ্ন হিসেবে পড়ে। টোকেনাইজার বাক্যটিকে কয়েকটি অংশে ভাগ করে প্রতিটি অংশের জন্য একটি টোকেন আইডি তৈরি করে। একই অর্থের বাংলা ও ইংরেজি বাক্য সমানসংখ্যক টোকেনে ভাগ হবে, এমন নিশ্চয়তা নেই।
টোকেনের সংখ্যা কয়েকটি কারণে গুরুত্বপূর্ণ। মডেল একসঙ্গে কতটা লেখা বিবেচনা করতে পারবে, উত্তর কত দীর্ঘ হতে পারবে এবং API ব্যবহারের হিসাব কীভাবে হবে—এসব সাধারণত টোকেনের সঙ্গে সম্পর্কিত। সাধারণ চ্যাট অ্যাপে ব্যবহারকারী অবশ্য সব সময় এই হিসাব দেখতে পান না।
টোকেন আইডি থেকে এমবেডিং
একটি টোকেনের পরিচয়সংখ্যা নিজে তার অর্থ প্রকাশ করে না। মডেল সেই আইডিকে বহু সংখ্যার একটি শেখা উপস্থাপনায় রূপ দেয়। প্রাথমিক এই সংখ্যাগত উপস্থাপনাকে সাধারণভাবে টোকেন এমবেডিং বলা হয়।
এমবেডিংয়ের মাধ্যমে লেখা বা ধারণার মধ্যে সম্পর্ক হিসাব করা যায়। কিন্তু কাছাকাছি অর্থের সব শব্দ একটি স্থির মানচিত্রে সব সময় পাশাপাশি থাকে—এভাবে বোঝা ঠিক হবে না। মডেলের পরবর্তী স্তরগুলো আশপাশের টোকেন দেখে প্রসঙ্গনির্ভর উপস্থাপনা তৈরি করে।
উদাহরণ হিসেবে “ব্যাংক” শব্দটি ধরা যায়। এটি আর্থিক প্রতিষ্ঠান বোঝাচ্ছে, নাকি নদীর তীর—তা নির্ধারণ করতে বাক্যের অন্য শব্দ দেখতে হয়। প্রাথমিক টোকেন একই হলেও পরবর্তী স্তরে তার উপস্থাপনা প্রসঙ্গ অনুযায়ী বদলে যেতে পারে।
ট্রান্সফরমার প্রসঙ্গের সম্পর্ক ধরে কীভাবে
আধুনিক Lার্জ ল্যাঙ্গুয়েজ মডেলের বড় অংশ ট্রান্সফরমার স্থাপত্যের ওপর নির্মিত। ২০১৭ সালে প্রকাশিত Attention Is All You Need গবেষণাপত্রে এই স্থাপত্য প্রস্তাব করা হয়। গবেষণাটির মূল বিষয় ছিল যন্ত্র অনুবাদ। পরে ট্রান্সফরমার ভাষা, ছবি এবং মাল্টিমোডাল মডেলের গুরুত্বপূর্ণ ভিত্তিতে পরিণত হয়।
ট্রান্সফরমারের কেন্দ্রীয় কৌশলগুলোর একটি হলো সেলফ-অ্যাটেনশন। একটি টোকেনের উপস্থাপনা তৈরির সময় ইনপুটের অন্য টোকেনগুলো বর্তমান হিসাবের জন্য কতটা প্রাসঙ্গিক, এই ব্যবস্থায় তার গাণিতিক ওজন নির্ধারণ করা হয়।
একটি বাক্য দেখা যাক:
রিনা বইটি মিতাকে দিল, কারণ সে এটি পড়তে চেয়েছিল।
এখানে “সে” কাকে বোঝাচ্ছে, তা শুধু ওই শব্দটি দেখে নিশ্চিত হওয়া কঠিন। বাক্যের নাম, ক্রিয়া ও গঠন একসঙ্গে বিবেচনা করতে হয়। সেলফ-অ্যাটেনশন টোকেনগুলোর মধ্যে এমন সম্পর্ক হিসাব করতে সাহায্য করে।
নামের কারণে এটি মানুষের মনোযোগের মতো শোনাতে পারে। কিন্তু এখানে “অ্যাটেনশন” বলতে সচেতনভাবে কোনো বিষয়ে মন দেওয়া বোঝানো হচ্ছে না। এটি মূলত বিভিন্ন টোকেনের সম্পর্কের গাণিতিক ওজন।
মূল প্রক্রিয়া: পরবর্তী টোকেন অনুমান
GPT-ধাঁচের অটোরিগ্রেসিভ ভাষা মডেলের প্রি-ট্রেনিংয়ে প্রধান কাজ সাধারণত আগের টোকেনগুলো দেখে পরবর্তী টোকেনের সম্ভাবনা অনুমান করা।
যেমন:
বাংলাদেশের রাজধানী হলো ___
এখানে “ঢাকা” অন্য অনেক সম্ভাব্য টোকেনের তুলনায় এগিয়ে থাকতে পারে। বাস্তব প্রম্পটে অবশ্য হিসাবটি এত সরল নয়। ব্যবহারকারীর প্রশ্ন, আগের কথোপকথন, সিস্টেম নির্দেশনা, ভাষা, চাওয়া ফরম্যাট এবং ইতিমধ্যে তৈরি করা উত্তরের প্রতিটি অংশ পরবর্তী টোকেনের সম্ভাবনাকে প্রভাবিত করতে পারে।
আরেকটি উদাহরণ:
প্রায় এক বায়ুমণ্ডলীয় চাপে পানি ১০০ ডিগ্রি সেলসিয়াসের কাছাকাছি তাপমাত্রায়…
এখানে সম্ভাব্য পরবর্তী অংশ হতে পারে “ফোটে”। এক বায়ুমণ্ডলীয় চাপের শর্তটি গুরুত্বপূর্ণ, কারণ চাপ বদলালে পানির স্ফুটনাঙ্কও বদলায়।
একটি টোকেন নির্বাচিত হলে সেটি তৈরি হওয়া লেখার সঙ্গে যুক্ত হয়। এরপর নতুন সম্পূর্ণ ধারার ভিত্তিতে আবার পরবর্তী টোকেনের সম্ভাবনা হিসাব করা হয়।
এই প্রক্রিয়া কোনো সমাপ্তি টোকেন তৈরি হওয়া, নির্ধারিত থামার শর্ত পূরণ হওয়া, আউটপুটসীমা এসে যাওয়া, টুল ব্যবহারের নির্দেশ তৈরি হওয়া অথবা পণ্যনির্ধারিত অন্য কোনো শর্ত পর্যন্ত চলতে পারে।
পর্দায় উত্তরটি দ্রুত ভেসে উঠলেও ভেতরে আউটপুট সাধারণত টোকেন ধরে গড়ে ওঠে।
সব সময় কি সবচেয়ে সম্ভাব্য টোকেন বেছে নেওয়া হয়?
না। প্রতিবার শুধু সর্বোচ্চ সম্ভাবনার টোকেন নিলে উত্তর অতিরিক্ত অনুমানযোগ্য ও একঘেয়ে হতে পারে। তাই অনেক মডেল ও API-তে সম্ভাব্য বিকল্পগুলোর মধ্য থেকে নিয়ন্ত্রিতভাবে নমুনা নির্বাচন করা হয়।
Temperature বেশি হলে সাধারণত উত্তরের বৈচিত্র্য ও অনিশ্চয়তা বাড়তে পারে। Top-p বা nucleus sampling পদ্ধতিতে সম্ভাবনার একটি নির্দিষ্ট মোট সীমার মধ্যে থাকা টোকেনগুলো বিবেচিত হয়। OpenAI-এর API নির্দেশনায় সাধারণত temperature অথবা top-p-এর মধ্যে একটি পরিবর্তনের পরামর্শ দেওয়া হয়, একসঙ্গে দুটিই নয়।
এসব সেটিং মূলত API ব্যবহারকারী ও ডেভেলপারদের জন্য বেশি প্রাসঙ্গিক। সাধারণ চ্যাট অ্যাপে ব্যবহারকারী সব সময় এগুলো নিয়ন্ত্রণ করতে পারেন না। মডেল ও পণ্যভেদে উত্তর তৈরির অভ্যন্তরীণ ব্যবস্থাও আলাদা হতে পারে।
একই প্রশ্নে কিছুটা ভিন্ন উত্তর পাওয়ার পেছনে নমুনা নির্বাচন ছাড়াও আগের কথোপকথন, মডেলের সংস্করণ, সিস্টেম নির্দেশনা, সার্চের ফল এবং যুক্ত টুল কাজ করতে পারে।
ভাষা মডেল শেখে কীভাবে

বর্তমান বাণিজ্যিক মডেলগুলোর সম্পূর্ণ প্রশিক্ষণপদ্ধতি সাধারণত প্রকাশ করা হয় না। প্রকাশিত গবেষণা ও অফিসিয়াল ব্যাখ্যা থেকে অবশ্য তিনটি বিস্তৃত পর্যায় বোঝা যায়: প্রি-ট্রেনিং, পোস্ট-ট্রেনিং এবং মূল্যায়ন।
প্রি-ট্রেনিংয়ে ভাষার প্যাটার্ন শেখা
অটোরিগ্রেসিভ ভাষা মডেলকে বিপুল পরিমাণ টেক্সট দিয়ে পরবর্তী টোকেন অনুমানের অনুশীলন করানো হয়।
প্রতিবার ভুল পূর্বানুমানের জন্য একটি গাণিতিক ত্রুটির মান হিসাব করা হয়। এরপর প্রশিক্ষণ অ্যালগরিদম মডেলের প্যারামিটারগুলো সামান্য বদলায়, যাতে একই ধরনের পরবর্তী উদাহরণে প্রত্যাশিত টোকেনের সম্ভাবনা বাড়ে।
এই প্রক্রিয়া বহুবার চলার ফলে মডেল ব্যাকরণ, বাক্যের গঠন, শব্দের সম্পর্ক, কোডের বিন্যাস এবং প্রশিক্ষণ-উপাত্তে থাকা বিভিন্ন তথ্যগত প্যাটার্ন শিখতে পারে। শেখা সম্পর্কগুলো কোনো একক তালিকায় থাকে না; মডেলের বিপুলসংখ্যক প্যারামিটারের মধ্যে ছড়িয়ে থাকে।
এর অর্থ এই নয় যে মডেল সাধারণ ডেটাবেসের মতো প্রতিটি বাক্যের একটি আলাদা কপি রেখে প্রয়োজনমতো তুলে আনে। তবে “ভাষা মডেল কখনো কোনো লেখা মুখস্থ করে না”—এ দাবিও ঠিক নয়। গবেষকেরা নির্দিষ্ট প্রম্পট ও পুনরাবৃত্ত প্রশিক্ষণ-উপাত্তের ক্ষেত্রে কিছু মডেল থেকে হুবহু লেখা পুনরুদ্ধার করতে পেরেছেন।
পোস্ট-ট্রেনিংয়ে নির্দেশ অনুসরণ শেখানো
শুধু পরবর্তী টোকেন অনুমানে দক্ষ একটি বেস মডেল ব্যবহারকারীর নির্দেশ ঠিকভাবে অনুসরণ নাও করতে পারে। পোস্ট-ট্রেনিংয়ে মানুষের লেখা উদাহরণ, পছন্দ বা রেটিং, কৃত্রিম প্রশিক্ষণ-উপাত্ত, পুরস্কারভিত্তিক মডেল এবং অন্য কৌশল ব্যবহার করা হতে পারে।
২০২২ সালের InstructGPT গবেষণা এ ধরনের একটি প্রকাশিত উদাহরণ। সেখানে মানুষের লেখা নমুনা দিয়ে supervised fine-tuning করা হয়েছিল। পরে মানুষের পছন্দের র্যাঙ্কিং ব্যবহার করে reinforcement learning from human feedback বা RLHF প্রয়োগ করা হয়।
গবেষণায় ছোট InstructGPT মডেলের উত্তর বড় GPT-3 বেস মডেলের উত্তরের চেয়ে মানুষের কাছে বেশি গ্রহণযোগ্য হয়েছিল। অর্থাৎ শুধু মডেলের আকার বাড়ালেই নির্দেশ অনুসরণের মান ভালো হবে, এমন নয়।
InstructGPT-এর পদ্ধতিকে অবশ্য ২০২৬ সালের প্রতিটি মডেলের সম্পূর্ণ প্রশিক্ষণপ্রক্রিয়া হিসেবে দেখা যাবে না। প্রতিষ্ঠান ও মডেলভেদে পোস্ট-ট্রেনিংয়ের কৌশল বদলে যেতে পারে।
মূল্যায়ন সব পরিস্থিতি ধরতে পারে না
প্রশিক্ষণের পর বিভিন্ন ভাষা, বিষয়, নির্দেশ ও ঝুঁকিপূর্ণ পরিস্থিতিতে মডেল পরীক্ষা করা হয়। ফল অনুযায়ী মডেল, নিরাপত্তাব্যবস্থা বা পণ্যস্তরের নিয়ম পরিবর্তন হতে পারে।
তবু কোনো পরীক্ষাসেট বাস্তবে আসতে পারে এমন প্রতিটি প্রশ্ন ধরতে পারে না। একটি মডেল নির্দিষ্ট পরীক্ষায় ভালো করেও নতুন, বিরল বা অস্পষ্ট প্রশ্নে ভুল করতে পারে।
প্রশ্ন পাঠানোর পর কোন তথ্যগুলো বিবেচিত হয়
পণ্য ও সেটিংয়ের ওপর নির্ভর করে একটি চ্যাট সেশনে শুধু বর্তমান প্রশ্ন নয়, আরও কিছু তথ্য মডেলের প্রসঙ্গে থাকতে পারে। যেমন:
- কথোপকথনের আগের প্রাসঙ্গিক বার্তা
- সিস্টেম বা ডেভেলপার নির্দেশনা
- সংযুক্ত ফাইল থেকে উদ্ধার করা অংশ
- ওয়েব সার্চ বা অন্য টুলের ফল
- মেমোরি বা ব্যক্তিগতকরণের প্রাসঙ্গিক তথ্য
- উত্তরের ফরম্যাট ও নিরাপত্তাবিধি
তাই একই ছোট প্রশ্ন আলাদা চ্যাটে ভিন্ন উত্তর দিতে পারে। আগের আলোচনা, সংযুক্ত নথি বা আড়ালে থাকা পণ্যনির্দেশ উত্তরটির অর্থ ও কাঠামো বদলে দিতে পারে।
প্রতিটি মডেলের একটি নির্দিষ্ট context window বা প্রসঙ্গসীমা থাকে। এতে ইনপুট, কথোপকথনের ইতিহাস এবং তৈরি আউটপুটের টোকেন অন্তর্ভুক্ত হতে পারে। সীমা মডেলভেদে আলাদা।
কোনো অনুরোধ সেই সীমা ছাড়ালে কী হবে, তা পণ্য ও বাস্তবায়নের ওপর নির্ভর করে। অনুরোধ প্রত্যাখ্যাত হতে পারে, কিছু অংশ কেটে যেতে পারে অথবা আগের প্রসঙ্গ সংক্ষিপ্ত করে ব্যবহার করা হতে পারে। তাই অত্যন্ত দীর্ঘ কথোপকথনে প্রথম দিকের প্রতিটি তথ্য সমানভাবে বিবেচিত হচ্ছে ধরে নেওয়া ঠিক নয়।
ইন্টারনেট ও নথি থেকে তথ্য আসে কীভাবে
ChatGPT কি প্রতিবার ওয়েব সার্চ করে?

না। ভাষা মডেলের শেখা প্যাটার্ন থেকে উত্তর তৈরি এবং ওয়েব সার্চ দুটি আলাদা প্রক্রিয়া।
তবে ২৬ জুলাই ২০২৬ পর্যন্ত ChatGPT প্রয়োজন মনে করলে স্বয়ংক্রিয়ভাবে ওয়েব সার্চ করতে পারে। ব্যবহারকারীও সরাসরি Search টুল নির্বাচন করতে পারেন। Search চালু হলে ChatGPT প্রশ্নটিকে এক বা একাধিক লক্ষ্যভিত্তিক সার্চ কোয়েরিতে রূপ দিতে পারে। প্রথম ফল যথেষ্ট না হলে আরও নির্দিষ্ট অনুসন্ধানও চালানো হতে পারে। সার্চভিত্তিক উত্তরে প্রাসঙ্গিক ওয়েব উৎসের citation দেখা যেতে পারে।
সার্চের ফল মডেলকে নতুন প্রসঙ্গ দেয়। চূড়ান্ত বাক্যগুলো তখনও ভাষা মডেল তৈরি করে। ফলে সার্চ ব্যবহার করা হয়েছে মানেই উত্তরের প্রতিটি বক্তব্য স্বয়ংক্রিয়ভাবে সঠিক নয়। দুর্বল উৎস নির্বাচন, ভুল ব্যাখ্যা বা প্রয়োজনীয় শর্ত বাদ পড়ার ঝুঁকি থেকেই যায়।
RAG কীভাবে নিজস্ব নথি ব্যবহার করে
Retrieval-Augmented Generation বা RAG পদ্ধতিতে প্রথমে বাইরের কোনো সংগ্রহ থেকে প্রশ্নের সঙ্গে সম্পর্কিত নথি বা অনুচ্ছেদ খুঁজে আনা হয়। পরে ভাষা মডেল সেই অংশগুলোকে প্রসঙ্গ হিসেবে ব্যবহার করে উত্তর তৈরি করে।
২০২০ সালের মূল RAG গবেষণায় একটি প্রি-ট্রেইন্ড sequence-to-sequence মডেলের সঙ্গে Wikipedia-ভিত্তিক dense vector index যুক্ত করা হয়েছিল। এতে দেখানো হয়, ভাষা তৈরির প্রক্রিয়ার সঙ্গে বাইরের তথ্যভান্ডার যুক্ত করা সম্ভব।
বর্তমান RAG ব্যবস্থা প্রতিষ্ঠানের নিজস্ব নথি, পণ্যের ম্যানুয়াল, গবেষণাপত্র, ওয়েব কনটেন্ট বা অন্য তথ্যভান্ডারের ওপর কাজ করতে পারে।
এখানেও তথ্য উদ্ধারের ধাপটি নির্ভুল হওয়ার নিশ্চয়তা নেই। প্রয়োজনীয় অনুচ্ছেদ বাদ পড়তে পারে, কাছাকাছি কিন্তু ভুল নথি উঠে আসতে পারে অথবা মডেল সঠিক নথির বক্তব্যও ভুলভাবে ব্যাখ্যা করতে পারে।
AI আত্মবিশ্বাসের সঙ্গে ভুল উত্তর দেয় কেন
ভাষা মডেল প্রসঙ্গের সঙ্গে মানানসই লেখা তৈরি করে। কিন্তু একটি বাক্য ভাষাগতভাবে স্বাভাবিক হলেই সেটি সত্য হয়ে যায় না।
হ্যালুসিনেশন বলতে সাধারণত ভাষা মডেলের তৈরি এমন বিশ্বাসযোগ্য বক্তব্য বোঝানো হয়, যা মিথ্যা, উদ্ভাবিত অথবা যথেষ্টভাবে সমর্থিত নয়।
ভুলের পেছনে কয়েকটি কারণ থাকতে পারে:
- প্রয়োজনীয় তথ্য প্রশিক্ষণ-উপাত্ত বা বর্তমান প্রসঙ্গে নেই
- তথ্যটি বিরল, পুরোনো বা পরস্পরবিরোধী
- প্রশ্নে প্রয়োজনীয় শর্ত দেওয়া হয়নি
- নির্দেশটি একাধিকভাবে ব্যাখ্যা করা যায়
- মডেল নাম, তারিখ, সংখ্যা বা উদ্ধৃতি অনুমান করে ফেলেছে
- সার্চ বা নথি অনুসন্ধানে ভুল তথ্য উঠে এসেছে
- বহু ধাপের কাজের আগের একটি ভুল পরের ধাপে ছড়িয়ে গেছে
OpenAI-এর ২০২৫ সালের একটি গবেষণাপত্রে যুক্তি দেওয়া হয়েছে, প্রচলিত কিছু মূল্যায়নপদ্ধতি অনিশ্চয়তা স্বীকার করার চেয়ে অনুমান করে উত্তর দেওয়াকে বেশি পুরস্কৃত করে। এটি হ্যালুসিনেশনের একমাত্র কারণ নয়। তবে মডেল কেন “জানি না” না বলে সম্ভাব্য একটি উত্তর তৈরি করে, তার একটি ব্যাখ্যা দেয়।
এ কারণে আত্মবিশ্বাসী ভাষাকে নির্ভুলতার প্রমাণ হিসেবে দেখা উচিত নয়। স্বাস্থ্য, আইন, অর্থ, নিরাপত্তা, সাম্প্রতিক সংবাদ, সফটওয়্যার সেটিং, গবেষণা ও পরিসংখ্যানের মতো বিষয়ে মূল উৎস আলাদা করে পরীক্ষা করা দরকার।
AI কি মানুষের মতো বোঝে বা চিন্তা করে?
এ প্রশ্নের উত্তর নির্ভর করে “বোঝা” ও “চিন্তা” বলতে কী বোঝানো হচ্ছে তার ওপর।
ভাষা মডেল জটিল ভাষাগত সম্পর্ক ধরতে, নির্দেশ অনুসরণ করতে, উদাহরণ থেকে কাজের ধরন নিতে এবং কিছু বহু-ধাপের সমস্যা সমাধান করতে পারে। বাইরে থেকে এসব আচরণ বুদ্ধিদীপ্ত মনে হওয়া স্বাভাবিক।
কিন্তু এই আচরণ মানুষের মতো সচেতন অভিজ্ঞতা, অনুভূতি, উদ্দেশ্য বা আত্মজ্ঞান প্রমাণ করে না। ভাষা তৈরির পর্যবেক্ষণযোগ্য প্রক্রিয়াটি টোকেন, সংখ্যাগত উপস্থাপনা, প্রশিক্ষিত প্যারামিটার, নিউরাল নেটওয়ার্ক এবং সম্ভাবনাভিত্তিক উত্তর তৈরির মাধ্যমে ব্যাখ্যা করা যায়।
“AI শুধু সাধারণ অটো-কমপ্লিট”—এই দাবিটিও অসম্পূর্ণ। ফোনের অটো-কমপ্লিটের তুলনায় বড় ভাষা মডেল দীর্ঘ প্রসঙ্গ, বহু স্তরের নির্দেশ এবং জটিল ভাষাগত সম্পর্ক বিবেচনা করতে পারে।
অন্যদিকে, “AI মানুষের মতো সব বুঝে উত্তর দেয়”—এটিও প্রমাণের চেয়ে বড় দাবি। ব্যবহারিকভাবে সবচেয়ে নিরাপদ অবস্থান হলো, মডেলের সক্ষমতা কাজে লাগানো কিন্তু তার সাবলীল ভাষাকে মানুষের সচেতন বোঝাপড়ার সমতুল্য ধরে না নেওয়া।
প্রচলিত ভুল ধারণা ও বাস্তব ব্যাখ্যা
| ভুল ধারণা | বাস্তব ব্যাখ্যা |
| AI প্রতিটি প্রশ্নে Google Search করে | সার্চ ব্যবহার না হলে মডেল বর্তমান প্রসঙ্গ ও শেখা প্যাটার্ন থেকে উত্তর তৈরি করতে পারে |
| AI একটি ডেটাবেস থেকে পূর্ণ উত্তর তুলে আনে | সাধারণত টোকেন ধরে নতুন আউটপুট তৈরি করে; তবে প্রশিক্ষণ-উপাত্তের কিছু অংশ মুখস্থ ও পুনরুৎপাদিত হতে পারে |
| সাবলীল উত্তর মানেই সঠিক | ভাষার স্বাভাবিকতা ও তথ্যের সত্যতা আলাদা বিষয় |
| একই প্রশ্নে সব সময় একই উত্তর আসে | নমুনা নির্বাচন, প্রসঙ্গ, মডেল ও যুক্ত টুলের কারণে উত্তর বদলাতে পারে |
| বড় প্রম্পট সব সময় ভালো | অপ্রাসঙ্গিক তথ্য মূল কাজ ও নির্দেশকে অস্পষ্ট করতে পারে |
| সার্চ চালু থাকলে ভুল অসম্ভব | ভুল উৎস, ভুল তথ্য উদ্ধার বা ভুল ব্যাখ্যা তখনও হতে পারে |
AI থেকে ভালো উত্তর পাওয়ার বাস্তব উপায়
কাজটি নির্দিষ্ট করুন। “AI নিয়ে লিখুন” বলার বদলে পাঠক, বিষয়, দৈর্ঘ্য, ভাষা এবং প্রত্যাশিত আউটপুট জানান।
প্রয়োজনীয় প্রেক্ষাপট দিন। কোনো নথি, ইমেল বা ডেটা বিশ্লেষণ করতে হলে সংশ্লিষ্ট উপাদান দিন। অনুপস্থিত তথ্য অনুমান না করতে স্পষ্টভাবে বলুন।
তথ্য ও অনুমান আলাদা করতে বলুন। কোন দাবি উৎসে সমর্থিত, কোনটি অনুমান এবং কোথায় অনিশ্চয়তা আছে—এগুলো আলাদা করে চাওয়া যায়।
সাম্প্রতিক তথ্যের ক্ষেত্রে সময়সীমা উল্লেখ করুন। “সর্বশেষ তথ্য” না বলে নির্দিষ্ট তারিখ দিন। প্রাথমিক বা অফিসিয়াল উৎস অগ্রাধিকার দিতেও বলতে পারেন।
বড় কাজ ধাপে ভাগ করুন। প্রথমে কাঠামো, পরে খসড়া এবং শেষে দাবি যাচাই করলে ভুল ধরার সুযোগ বাড়ে।
সবচেয়ে গুরুত্বপূর্ণ নিয়মটি হলো, একই মডেলের কাছে দ্বিতীয়বার জিজ্ঞেস করাকে স্বাধীন যাচাই হিসেবে না ধরা। মডেল আগের ভুলই নতুন ভাষায় আবার বলতে পারে।
কোন AI উত্তর বিশ্বাস করবেন
AI কীভাবে উত্তর তৈরি করে, তা মনে রাখার সহজ কাঠামো হলো:
প্রসঙ্গ গ্রহণ → টোকেনে ভাগ → সংখ্যাগত উপস্থাপনা → সম্পর্ক বিশ্লেষণ → পরবর্তী টোকেনের সম্ভাবনা হিসাব → ধাপে ধাপে উত্তর তৈরি।
এই প্রক্রিয়া ভাষা মডেলকে ব্যাখ্যা, তুলনা, অনুবাদ, সারাংশ, কোড ও পরিকল্পনা তৈরিতে সক্ষম করে। প্রয়োজন হলে ওয়েব, ফাইল বা অন্য টুলের তথ্যও এর সঙ্গে যুক্ত হতে পারে। কিন্তু তৈরি উত্তরটি সম্ভাবনাভিত্তিক। সত্যতা যাচাই আলাদা কাজ।
কোনো গুরুত্বপূর্ণ উত্তর ব্যবহার করার আগে তিনটি প্রশ্ন করুন:
১. উত্তরটি কোন প্রসঙ্গ, নথি বা উৎসের ওপর দাঁড়িয়ে আছে?
২. নতুন তথ্যের জন্য ওয়েব সার্চ বা অন্য টুল ব্যবহার করা হয়েছিল কি?
৩. সিদ্ধান্ত বদলে দিতে পারে এমন দাবিগুলো মূল উৎসে মেলে কি?
AI-কে গবেষণা, খসড়া ও ব্যাখ্যার সহকারী হিসেবে ব্যবহার করা বাস্তবসম্মত। স্বাস্থ্য, আইন, অর্থ, নিরাপত্তা বা বড় সিদ্ধান্তের ক্ষেত্রে চূড়ান্ত কর্তৃপক্ষ হিসেবে ব্যবহার করা নয়।
শেষ কথা
AI কীভাবে উত্তর তৈরি করে, তা বুঝলে এর সক্ষমতা ও সীমাবদ্ধতা দুটিই স্পষ্ট হয়। ভাষা মডেল প্রসঙ্গ, টোকেন ও সম্ভাবনার ভিত্তিতে সাবলীল লেখা তৈরি করতে পারে, কিন্তু সেই সাবলীলতা সত্যতার নিশ্চয়তা নয়। সাধারণ ব্যাখ্যা, খসড়া, তুলনা বা ধারণা গুছিয়ে নিতে AI কার্যকর সহকারী হতে পারে। তবে স্বাস্থ্য, আইন, অর্থ, নিরাপত্তা, সাম্প্রতিক ঘটনা বা গুরুত্বপূর্ণ সিদ্ধান্তের ক্ষেত্রে মূল উৎস যাচাই করা জরুরি। সবচেয়ে বাস্তবসম্মত পদ্ধতি হলো AI-এর উত্তরকে শুরু হিসেবে নেওয়া, চূড়ান্ত প্রমাণ হিসেবে নয়।
প্রায়শই জিজ্ঞাসিত প্রশ্ন
AI কি আগের সব কথা মনে রাখে?
চলমান কথোপকথনের আগের প্রাসঙ্গিক বার্তা প্রসঙ্গ হিসেবে ব্যবহৃত হতে পারে। দীর্ঘমেয়াদি Memory আলাদা পণ্য-ফিচার। ২৬ জুলাই ২০২৬ পর্যন্ত ChatGPT-তে Memory চালু থাকলে অতীতের চ্যাট, ফাইল ও সংযুক্ত অ্যাপের প্রাসঙ্গিক তথ্য ব্যক্তিগতকরণের কাজে ব্যবহার করা হতে পারে। এর প্রাপ্যতা ও আচরণ পরিকল্পনা, অঞ্চল, সেটিং এবং পর্যায়ক্রমিকভাবে ফিচার চালুর অবস্থার ওপর নির্ভর করতে পারে।
বাংলা ভাষায় AI-এর উত্তর কখন দুর্বল হতে পারে?
কোনো ভাষা, বিষয় বা স্থানীয় প্রেক্ষাপটের পর্যাপ্ত উচ্চমানের প্রশিক্ষণ ও মূল্যায়ন-উপাত্ত না থাকলে মডেলের মান অসম হতে পারে। বহুভাষিক গবেষণায় ভাষাভেদে প্রশিক্ষণ-উপাত্তের পরিমাণ ও পারফরম্যান্সে পার্থক্য পাওয়া গেছে। বাংলা পরিভাষা, অঞ্চল এবং কাঙ্ক্ষিত বানানরীতি স্পষ্ট করে দিলে বিভ্রান্তি কিছুটা কমতে পারে।
AI কি নিজের ভুল নিজে ধরতে পারে?
পুনরায় পর্যালোচনা করতে বললে মডেল কখনো ভুল শনাক্ত করতে পারে। তবে একই মডেলের দ্বিতীয় উত্তর স্বাধীন প্রমাণ নয়। গুরুত্বপূর্ণ দাবির ক্ষেত্রে মূল নথি, অফিসিয়াল ডকুমেন্টেশন বা বিষয়বিশেষজ্ঞের যাচাই প্রয়োজন।

