ডেটা লিটারেসি কী: চার্ট দেখে ভুল সিদ্ধান্ত এড়ানোর উপায়

সর্বাধিক আলোচিত

একটি চার্টে দুটি দণ্ডের উচ্চতা দেখে মনে হলো পার্থক্য বিশাল। সংখ্যাগুলো দেখার পর বোঝা গেল, ব্যবধান আসলে খুবই ছোট। আবার কোনো গ্রাফে রেখা টানা ওপরের দিকে উঠছে দেখে মনে হতে পারে পরিস্থিতি দ্রুত খারাপ হচ্ছে বা ব্যবসা দুর্দান্ত গতিতে বাড়ছে। পরে দেখা গেল, সেটি আসলে শুরু থেকে এখন পর্যন্ত জমা হওয়া মোট সংখ্যা।

এই ধরনের ভুল খুব স্বাভাবিক। কারণ চার্ট এমনভাবে তথ্য সাজায়, যাতে কয়েক সেকেন্ডের মধ্যেই একটি ধারণা তৈরি হয়। কিন্তু সেই ধারণা ঠিক কি না, তা বুঝতে সংখ্যার পাশাপাশি দেখতে হয় স্কেল, সময়সীমা, তুলনার ভিত্তি এবং তথ্যের উৎস।

এটাই Data literacy বা উপাত্ত সাক্ষরতার ব্যবহারিক দিক। এর জন্য সবাইকে data analyst হতে হবে না। একটি chart কী বলছে, কী বলছে না এবং কোথায় একটু থেমে যাচাই করা দরকার—এই অভ্যাসটাই বেশি জরুরি।

একটি chart দেখেই কোন চারটি জিনিস আগে দেখবেন

সব চার্ট বিশ্লেষণ করতে বসে দশ মিনিট সময় দেওয়া সম্ভব নয়। খবর পড়ার সময়, মিটিংয়ে বা সোশ্যাল মিডিয়ায় আরও দ্রুত সিদ্ধান্ত নিতে হয়। সে ক্ষেত্রে চারটি বিষয় আগে দেখলে অনেক ভুল এড়ানো যায়:

Scale — অক্ষের পরিসর কত?
Y-axis কোথা থেকে শুরু হয়েছে, এক ঘর থেকে পরের ঘরের ব্যবধান কত এবং পাশাপাশি থাকা chart-গুলোর scale একই কি না দেখুন।

Baseline — তুলনা কোথা থেকে শুরু হয়েছে?
বিশেষ করে bar chart-এ নিচের অংশ কাটা আছে কি না খেয়াল করুন।

Source — সংখ্যাগুলো এসেছে কোথা থেকে?
শুধু কোনো প্রতিষ্ঠানের নাম লেখা আছে, নাকি মূল dataset, survey বা report-ও খুঁজে পাওয়া যায়?

Context — কোন তথ্যটি না জানলে অর্থ বদলে যেতে পারে?
সময়কাল, নমুনার আকার, জনসংখ্যা, denominator, পদ্ধতির পরিবর্তন বা অনিশ্চয়তা—এর যেকোনো একটি গুরুত্বপূর্ণ হতে পারে।

এই চারটি প্রশ্নকে কঠোর নিয়ম হিসেবে দেখার দরকার নেই। বরং এগুলো সন্দেহ হওয়ার জায়গা খুঁজে বের করার শর্টকাট।

Y-axis কাটা থাকলে পার্থক্য বড় দেখাতে পারে

Y-axis কাটা থাকলে পার্থক্য বড় দেখাতে পারে

ধরা যাক, দুটি মান ৯৬ ও ১০০।

Bar chart-এর Y-axis যদি ০ থেকে শুরু হয়, দুটি মানের মধ্যে পার্থক্য খুব বড় মনে হবে না। কিন্তু একই axis ৯৫ থেকে শুরু করলে একটি bar অন্যটির তুলনায় অনেক উঁচু দেখাবে। সংখ্যা বদলায়নি, বদলেছে শুধু দৃশ্যমান অনুপাত।

এই জায়গাটিই truncated Y-axis নিয়ে সবচেয়ে বড় আপত্তি।

Bar chart-এর ক্ষেত্রে বিষয়টি বেশি গুরুত্বপূর্ণ, কারণ আমরা bar-এর দৈর্ঘ্য দেখেই মানের পার্থক্য বুঝি। নিচের অংশ বাদ দিলে সেই দৈর্ঘ্যের তুলনা আর প্রকৃত অনুপাত দেখায় না। সরকারি data visualisation guidance-এ এ কারণেই bar ও column chart-এর সংখ্যাগত axis সাধারণত শূন্য থেকে শুরু করার পরামর্শ দেওয়া হয়।

তবে এখান থেকে আরেকটি ভুল নিয়ম তৈরি করা যাবে না—“যে chart শূন্য থেকে শুরু হয়নি, সেটিই misleading।”

Line chart-এর ক্ষেত্রে পরিস্থিতি আলাদা। একটি line chart যদি ৯২ থেকে ১০০-এর মধ্যে ছোট পরিবর্তন দেখায়, তাহলে axis ৯০ থেকে শুরু করলে trend পরিষ্কার হতে পারে। এখানে মূল প্রশ্ন হলো: সংকুচিত scale কি পরিবর্তন বুঝতে সাহায্য করছে, নাকি ছোট পরিবর্তনকে অস্বাভাবিক নাটকীয় করে তুলছে?

চার্ট দেখার সময় তাই আগে chart-এর ধরন বুঝুন, তারপর baseline বিচার করুন।

3D pie chart দেখতে ভালো, তুলনা করতে নয়

Pie chart নিয়ে সমস্যা সব সময় pie chart-এ নয়; অনেক সময় সমস্যা হয় সেটি সাজাতে গিয়ে। বিশেষ করে 3D effect দিলে সামনের অংশ চোখে বড় এবং পেছনের অংশ তুলনামূলক ছোট দেখাতে পারে। একই percentage থাকা সত্ত্বেও perspective বদলে একটি sector বেশি গুরুত্বপূর্ণ বলে মনে হতে পারে।

Pie chart তখনই তুলনামূলক পরিষ্কার, যখন category কম এবং তাদের মধ্যে যথেষ্ট পার্থক্য আছে। খুব কাছাকাছি কয়েকটি মান থাকলে angle দেখে ২৪%, ২৬% আর ২৮%-এর পার্থক্য বোঝার চেয়ে bar chart পড়া অনেক সহজ।

আরেকটি জায়গায় ভুল হয় মোট শতাংশ নিয়ে। সব pie chart-এ যোগফল ১০০% হবে—এমন নয়। যদি কোনো survey-তে একজন উত্তরদাতা একাধিক বিকল্প বেছে নিতে পারেন, তাহলে বিভিন্ন উত্তর যোগ করলে ১০০% ছাড়িয়ে যেতে পারে। তাই chart কী মাপছে, সেটি না দেখে শুধু percentage যোগ করা ঠিক নয়।

Cumulative graph-এর ঊর্ধ্বমুখী রেখা সহজেই ভুল ধারণা দিতে পারে

কোনো ওয়েবসাইট চালুর পর মোট কতজন account খুলেছেন, শুরু থেকে মোট কতটি order হয়েছে বা কোনো ঘটনার cumulative count কত—এসব দেখাতে ক্রমসঞ্চিত graph কাজে লাগে। কিন্তু এমন graph-এর একটি স্বাভাবিক বৈশিষ্ট্য আছে: নতুন সংখ্যা যোগ হতে থাকলে মোট সংখ্যাও বাড়তে থাকে।

ধরা যাক, প্রথম সপ্তাহে ১০০ জন নতুন ব্যবহারকারী এলেন। পরের সপ্তাহে ৮০, তারপর ৫০, তারপর ২০। নতুন ব্যবহারকারীর সংখ্যা স্পষ্টভাবে কমছে। কিন্তু মোট ব্যবহারকারীর cumulative রেখা তখনও ওপরের দিকে উঠবে।

শুধু সেই রেখাটি দেখলে “বৃদ্ধি অব্যাহত” মনে হতে পারে। অথচ আসল প্রশ্ন যদি হয় নতুন ব্যবহারকারী পাওয়ার গতি কেমন, তাহলে সপ্তাহভিত্তিক নতুন সংখ্যা দেখতে হবে। এখানে cumulative data, stock এবং flow-কে এক করে ফেলাও ঠিক নয়।

  • শুরু থেকে এখন পর্যন্ত জমা হওয়া মোট জানতে cumulative figure দরকার হতে পারে।
  • নির্দিষ্ট একটি সময়ে মোট অবস্থান বুঝতে stock data কাজে লাগে।
  • একটি নির্দিষ্ট সময়পর্বে কত নতুন ঘটনা ঘটেছে, সেটি flow data।

কোন chart দরকার, তা তাই সংখ্যার চেয়ে প্রশ্নের ওপর বেশি নির্ভর করে।

বড় percentage দেখলেই বড় ঘটনা ধরে নেবেন না

“বিক্রি ১০০% বেড়েছে”—এই বাক্যটি চোখে পড়ার মতো।

কিন্তু বিক্রি যদি ১টি থেকে ২টি হয়, সেটিও ১০০% বৃদ্ধি। আবার ১০ লাখ থেকে ১১ লাখ হলে বৃদ্ধি ১০%, যদিও absolute সংখ্যায় পরিবর্তন অনেক বড়। Percentage ভুল নয়। সমস্যা হয় যখন baseline বা মূল সংখ্যা বাদ দিয়ে শুধু percentage দেখানো হয়।

এ ধরনের chart বা headline দেখলে অন্তত তিনটি জিনিস খুঁজুন: কত থেকে কত হয়েছে, শতাংশটি কোন মোট সংখ্যার ওপর হিসাব করা হয়েছে এবং তুলনাটি কোন সময়ের সঙ্গে করা হচ্ছে।

জনসংখ্যার আকারও গুরুত্বপূর্ণ। দুটি শহরের মোট ঘটনার সংখ্যা তুলনা করে একটি শহরকে বেশি ঝুঁকিপূর্ণ বলা হতে পারে, অথচ দুই শহরের জনসংখ্যা একেবারেই আলাদা। সে ক্ষেত্রে মাথাপিছু হার বেশি অর্থপূর্ণ হতে পারে।

সময়সীমা দিয়ে একই trend-এর আলাদা ছবি তৈরি করা যায়

একটি line chart গত সাত দিনের তথ্য দেখাচ্ছে। সেখানে রেখা নিচের দিকে। একই ডেটার পাঁচ বছরের chart খুললে দেখা গেল সামগ্রিক trend ওপরের দিকে। দুটিই সত্য হতে পারে। তাই trend দেখার সময় শুরু এবং শেষের তারিখ প্রায়ই headline-এর মতোই গুরুত্বপূর্ণ।

বিশেষ করে সতর্ক হওয়া দরকার যদি chart কোনো অস্বাভাবিক peak বা trough থেকে শুরু হয়, খুব ছোট একটি সময়কালকে দীর্ঘমেয়াদি প্রবণতা হিসেবে দেখায় অথবা দুটি series-এর সময়সীমা এক না হয়।

ছোট সময়সীমার chart ব্যবহার করা ভুল নয়। কোনো সাম্প্রতিক পরিবর্তন বোঝাতে সেটিই প্রয়োজন হতে পারে। ভুল শুরু হয় তখন, যখন সেই ছোট সময়সীমা দেখে দীর্ঘমেয়াদি সিদ্ধান্ত টেনে নেওয়া হয়।

আরও পড়ুন: নিজের ডিজিটাল লার্নিং ড্যাশবোর্ড বানানোর পদ্ধতি

পাশাপাশি দুটি chart মানেই একই scale নয়

পাশাপাশি দুটি chart মানেই একই scale নয়

প্রেজেন্টেশনে পাশাপাশি থাকা দুটি graph অনেক সময় দেখতে এমনভাবে সাজানো হয়, যেন সরাসরি তুলনা করা যায়। কিন্তু প্রথমটির Y-axis যদি ০–১০০ এবং দ্বিতীয়টির ০–৫০০ হয়, তাহলে দুই chart-এ সমান উচ্চতার bar একেবারেই সমান মান বোঝায় না।

Small multiples বা পাশাপাশি comparison দেখার সময় তাই axis label পড়া জরুরি। Scale আলাদা হলে চোখের তুলনার বদলে সংখ্যাই ধরুন।

Dual-axis chart আরও বেশি সতর্কতার দাবি রাখে। এখানে একই graph-এর দুই পাশে দুটি আলাদা scale থাকে। একটি series-এর জন্য ০–১০ এবং অন্যটির জন্য ০–১০০০ ব্যবহার করেও দুই রেখাকে প্রায় একইভাবে ওঠানামা করতে দেখানো সম্ভব।

এটি যে সব সময় ভুলভাবে করা হয় তা নয়। কিন্তু দুই variable-এর সম্পর্ক বোঝানোর ক্ষেত্রে dual axis খুব সহজেই চোখকে বেশি কিছু “দেখাতে” পারে। তাই এমন chart দেখলে রেখার মিলের আগে দুই পাশের scale পড়ুন।

খুব ছোট ব্যবধান দেখলে অনিশ্চয়তাও দেখুন

জরিপ বা নমুনাভিত্তিক গবেষণার সংখ্যাগুলো অনেক সময় exact count নয়, estimate। ধরা যাক, একটি survey-তে একটি মতের সমর্থন ৪৮% এবং অন্যটির ৫০%। শুধু দুই শতাংশের পার্থক্য দেখে দ্বিতীয়টিকে নিশ্চিতভাবে এগিয়ে বলা যাবে কি না, তা নির্ভর করবে sample size, uncertainty এবং ব্যবহৃত পদ্ধতির ওপর।

Confidence interval থাকলে সেটিও দেখা দরকার। তবে একটি সাধারণ ভুল এড়িয়ে চলা জরুরি: দুই confidence interval overlap করেছে কি না, সেটিকে একা statistical significance test হিসেবে ব্যবহার করা ঠিক নয়।

সাধারণ পাঠকের জন্য মূল কথাটি আরও সহজ। পার্থক্য খুব ছোট হলে chart-এর bar বা line দেখে “A নিশ্চিতভাবে B-এর চেয়ে ভালো” বলা থেকে বিরত থাকুন। আগে দেখুন নমুনা কত বড়, margin of error বা uncertainty দেওয়া আছে কি না এবং methodology কী।

Data literacy শেখার সহজ উপায়: প্রতিদিনের chart-কে প্রশ্ন করুন

Data literacy শেখার জন্য প্রথমে Python, R বা জটিল statistical software খুলতে হবে—এমন ধারণা অপ্রয়োজনীয়। একটি সংবাদ প্রতিবেদনের chart দিয়েই শুরু করা যায়।

Headline পড়ার পর chart-এর দিকে তাকিয়ে চেষ্টা করুন headline বাদ দিয়ে শুধু data থেকে কী বোঝা যায়। এরপর source খুঁজুন। মূল report পাওয়া গেলে দেখুন chart-এ যে সময়কাল নেওয়া হয়েছে, report-এ আরও দীর্ঘ series আছে কি না।

আরেকটি ভালো অনুশীলন হলো একই data অন্য chart-এ কল্পনা করা। Pie chart-টি bar chart হলে কেমন দেখাত? Cumulative রেখার বদলে সপ্তাহভিত্তিক নতুন সংখ্যা দেখালে trend সম্পর্কে ধারণা বদলাত?

এই ধরনের ছোট অনুশীলনেই ধীরে ধীরে mean, median, distribution, sampling, correlation এবং uncertainty-এর মতো বিষয় পড়া সহজ হয়।

চাকরিতে Data literacy মানে coding জানাই নয়

Data literacy নিয়ে আলোচনা হলেই অনেকের মাথায় data analyst বা programmer-এর কাজ আসে। বাস্তবে এর ব্যবহার আরও বিস্তৃত।

একজন সাংবাদিকের সামনে survey result আসে। Marketing team campaign dashboard দেখে। Manager quarterly performance chart থেকে সিদ্ধান্ত নেন। Researcher বিভিন্ন dataset তুলনা করেন। শিক্ষার্থীরা assignment বা thesis-এর জন্য published research ব্যবহার করেন।

এদের সবার coding skill একই হওয়া দরকার নেই।

তবে কয়েকটি দক্ষতা প্রায় সবারই কাজে লাগে: metric কী মাপছে তা বোঝা, source যাচাই করা, comparison ন্যায্য কি না দেখা, correlation দেখে তাড়াহুড়া করে causation না ধরা এবং data যতটুকু সমর্থন করে তার চেয়ে বড় দাবি না করা।

এই শেষ অভ্যাসটি বিশেষভাবে গুরুত্বপূর্ণ। ভালো Data literacy অনেক সময় জটিল হিসাব করার চেয়ে কোথায় থামতে হবে তা জানার ক্ষমতা।

কোনো chart গুরুত্বপূর্ণ সিদ্ধান্তে প্রভাব ফেললে কী করবেন

প্রতিটি chart-এর পেছনের dataset খুলে বসা বাস্তবসম্মত নয়। কিন্তু কোনো chart যদি আপনার মতামত, রিপোর্ট, বিনিয়োগের প্রস্তাব, সংবাদ শিরোনাম বা কাজের সিদ্ধান্তে প্রভাব ফেলে, তখন কয়েক মিনিট বেশি সময় দেওয়া যৌক্তিক।

প্রথমে axis দেখুন। তারপর source। সময়সীমা মিলিয়ে নিন। Percentage থাকলে মূল সংখ্যা খুঁজুন। দুটি group তুলনা করলে denominator বা population একইভাবে বিবেচনা করা হয়েছে কি না দেখুন।

আর chart যদি খুব নাটকীয় মনে হয়, সেটিই বরং আরেকবার যাচাই করার ভালো কারণ। Data literacy-এর উদ্দেশ্য প্রতিটি graph-কে সন্দেহ করা নয়। উদ্দেশ্য হলো সুন্দর visual এবং নির্ভরযোগ্য প্রমাণ—দুটিকে এক জিনিস না ভাবা।

সাধারণ জিজ্ঞাসা

Data literacy কি statistics জানা একই বিষয়?

না। মৌলিক statistics Data literacy-এর একটি অংশ হতে পারে, কিন্তু ধারণাটি আরও বিস্তৃত। ডেটার উৎস, প্রেক্ষাপট, মান, visualisation, সীমাবদ্ধতা এবং সেই ডেটা থেকে করা দাবি বিচার করার সক্ষমতাও এর মধ্যে পড়ে।

Y-axis শূন্য থেকে শুরু না হলে chart কি সব সময় misleading?

না। Bar বা column chart-এ zero baseline বিশেষভাবে গুরুত্বপূর্ণ, কারণ দণ্ডের দৈর্ঘ্য দিয়ে মান বোঝানো হয়। Line chart বা scatter plot-এ প্রয়োজন হলে non-zero axis ব্যবহার করা যেতে পারে, যদি scale পরিষ্কার থাকে এবং তা interpretation বিকৃত না করে।

Pie chart ব্যবহার করা কি ভুল?

সব ক্ষেত্রে নয়। অল্প কয়েকটি category একটি অর্থপূর্ণ মোটের অংশ হলে pie chart কার্যকর হতে পারে। কাছাকাছি মানের অনেক category বা 3D effect থাকলে তুলনা কঠিন হয়; তখন bar chart সাধারণত পরিষ্কার বিকল্প।

Data literacy শেখার জন্য coding জানা দরকার?

শুরু করার জন্য নয়। Statistics Canada-এর competency framework-এ data interpretation, source evaluation, visualisation ও decision-making-এর পাশাপাশি data tools-ও একটি আলাদা competency হিসেবে আছে। অর্থাৎ Data literacy-এর পরিধি coding বা নির্দিষ্ট software skill-এর চেয়ে বড়।

সর্বশেষ