📚 আজকের ক্লাসের রোডম্যাপ

01

ডেটা কী?

⏱ ১৫ মিনিট

গল্প দিয়ে শুরু করি

🧑‍🏫 কল্পনা করো

তুমি প্রতিদিন স্কুলে যাও। যাওয়ার সময় তুমি কোন রাস্তা দিয়ে যাও, কতক্ষণ সময় লাগে, কী খাও, কার সাথে কথা বলো — এগুলো সবই একেকটা "ঘটনা"। এখন যদি কেউ এই সব ঘটনাগুলো টুকে রাখে — যেমন "সকাল ৭টায় বের হলো, ২০ মিনিট লাগলো, রুটি খেলো" — তাহলে এই টুকে রাখা জিনিসটাই হলো ডেটা

ডেটা (Data) মানে হলো কোনো ঘটনা, কাজ বা অবস্থার কাঁচা রেকর্ড বা তথ্য-কণা। এটা সংখ্যা হতে পারে, শব্দ হতে পারে, ছবি হতে পারে, এমনকি শব্দও (audio) হতে পারে।

ডেটা কেন গুরুত্বপূর্ণ?

ধরো, একটা দোকানদার প্রতিদিন কে কী কিনছে তা মনে না রাখলে সে জানতেই পারবে না কোন জিনিস বেশি বিক্রি হয়, কোনটা কম। ডেটা রাখলে দোকানদার বুঝতে পারে — কোন জিনিস আরও আনতে হবে, কোনটা বাদ দিতে হবে। এভাবেই ডেটা আমাদের সিদ্ধান্ত নিতে সাহায্য করে।

💡 বাস্তব উদাহরণ

Facebook-এ তুমি যখন কোনো পোস্টে লাইক দাও, সেই "লাইক দেওয়া" একটা ডেটা। YouTube-এ ভিডিও দেখার সময় "কতক্ষণ দেখলে" সেটাও ডেটা। এসব ছোট ছোট ডেটা জমা হয়েই কোম্পানিগুলো বোঝে তুমি কী পছন্দ করো।

ডেটা কোথা থেকে আসে?

📱 মোবাইল অ্যাপ

স্টেপ কাউন্ট, লোকেশন, অ্যাপ ব্যবহারের সময়

🛒 অনলাইন শপিং

কী কিনলে, কতবার সার্চ করলে, কার্টে কী রাখলে

🏦 ব্যাংক লেনদেন

টাকা জমা, উত্তোলন, ট্রান্সফারের রেকর্ড

🏥 হাসপাতাল রেকর্ড

রোগীর ইতিহাস, টেস্ট রিপোর্ট, ওষুধ

🎓 পরীক্ষার ফলাফল

নম্বর, উপস্থিতি, বিষয়ভিত্তিক পারফরম্যান্স

📺 YouTube

ভিউ, লাইক, ওয়াচ টাইম, কমেন্ট

ডেটার ধরন: Structured vs Semi-Structured vs Unstructured

সব ডেটা একইভাবে সাজানো থাকে না। এটাকে বোঝার জন্য একটা সহজ উদাহরণ ভাবি — তোমার আলমারি।

🗄️ আলমারির উদাহরণ

যদি তোমার জামাকাপড় খোপ অনুযায়ী সাজানো থাকে (শার্ট এক জায়গায়, প্যান্ট আরেক জায়গায়) — এটা Structured। যদি কিছুটা সাজানো, কিছুটা এলোমেলো থাকে — এটা Semi-Structured। আর যদি সব একসাথে স্তূপ করা থাকে — এটা Unstructured

ধরনব্যাখ্যাউদাহরণ
Structured Dataসারি-কলাম আকারে সুন্দরভাবে সাজানো, যেমন এক্সেল শিটব্যাংক অ্যাকাউন্টের টেবিল, রেজাল্ট শিট
Semi-Structured Dataকিছুটা নিয়ম মেনে চলে, কিন্তু ফিক্সড টেবিল নাইমেইল, JSON ফাইল, XML
Unstructured Dataকোনো নির্দিষ্ট কাঠামো নেইছবি, ভিডিও, অডিও, ফেসবুক পোস্টের লেখা
Try it · Data Type Mixer

Structured / Semi-Structured / Unstructured mix দেখো

নিচের স্লাইডার বদলালে dataset-এর mix chart real-time update হবে।

ভিজ্যুয়ালি বুঝি: রিয়েল লাইফ অ্যাক্টিভিটি থেকে বিজনেস ভ্যালু

তুমি একটা প্রোডাক্ট সার্চ করলে
সেই সার্চ রেকর্ড হলো (ডেটা তৈরি হলো)
কোম্পানি বুঝলো তুমি কী চাও
🎯 ক্লাসরুম অ্যাক্টিভিটি: সবাইকে বলো — "আজ সকাল থেকে এখন পর্যন্ত তুমি যেসব ডিজিটাল কাজ করেছ (মোবাইল, অ্যাপ, ইন্টারনেট) তার ৩টা লেখো।" এরপর জিজ্ঞেস করো এর মধ্যে কোনটা ডেটা তৈরি করেছে।
02

ইনফরমেশন কী?

⏱ ১০ মিনিট
🧑‍🏫 কল্পনা করো

ধরো তোমার কাছে একগাদা সংখ্যা আছে: ৪৫, ৬০, ৭২, ৮৮, ৯০ — এগুলো শুধু সংখ্যা, এখনো তেমন কিছু বোঝা যাচ্ছে না। কিন্তু যদি বলি এগুলো তোমার গত ৫ সপ্তাহের পরীক্ষার নম্বর, তাহলেই বুঝতে পারো — তোমার নম্বর ধীরে ধীরে বাড়ছে। এই "বোঝা যাওয়া" অংশটাই হলো ইনফরমেশন

অর্থাৎ, কাঁচা ডেটাকে অর্থবহভাবে সাজালে সেটা হয়ে যায় ইনফরমেশন। শুধু ডেটা থাকলেই চলে না, সেটা থেকে অর্থ বের করতে হয়।

Data → Information → Knowledge → Decision

Data
৪৫, ৬০, ৭২, ৮৮, ৯০
Information
নম্বর বাড়ছে
Knowledge
বেশি পড়াশোনা করলে নম্বর বাড়ে
Decision
প্রতিদিন ১ ঘণ্টা বেশি পড়বো
ধাপমানে কীউদাহরণ
Dataকাঁচা তথ্য-কণা, কোনো অর্থ এখনো স্পষ্ট নয়একটা দোকানের প্রতিদিনের বিক্রির সংখ্যা
Informationডেটা সাজিয়ে বের করা প্যাটার্ন বা অর্থশুক্রবারে বিক্রি সবচেয়ে বেশি হয়
Knowledgeকেন এমন হচ্ছে তার বোঝাপড়াশুক্রবার ছুটির দিন বলে মানুষ বেশি কেনে
Decisionবোঝাপড়া থেকে নেওয়া পদক্ষেপশুক্রবার আরও বেশি স্টক রাখা হবে
Try it · DIKW Decision Explorer

Data → Information → Knowledge → Decision pipeline নিজে চালাও

একটা কাঁচা ডেটার প্রেক্ষাপট বেছে নাও, সিস্টেম তোমাকে কার্যকর সিদ্ধান্ত সাজেস্ট করবে।

⚠️ কেন শুধু ডেটা যথেষ্ট না: লাখ লাখ সংখ্যা জমা থাকলেও, যদি সেখান থেকে প্যাটার্ন বের না করা হয়, তাহলে সেটা অকেজো পড়ে থাকা কাগজের স্তূপের মতোই। ডেটা সায়েন্সের কাজই হলো এই কাঁচা ডেটাকে প্রতিটা ধাপ পার করে সিদ্ধান্তে রূপান্তর করা।
03

ডেটা সায়েন্স কী?

⏱ ১৫ মিনিট

সংজ্ঞায় যাওয়ার আগে বোঝাপড়া

🧑‍🏫 কল্পনা করো

Netflix-এ তুমি একটা মুভি দেখলে, এরপর আরেকটা একই ধরনের মুভি সাজেস্ট হলো। এটা কীভাবে হলো? Netflix তোমার আগের দেখা, রেটিং, সময়, সার্চ — এই সব ডেটা বিশ্লেষণ করে বুঝেছে তুমি কী পছন্দ করো। এই পুরো প্রক্রিয়াটাই — ডেটা জমা করা, বিশ্লেষণ করা, প্যাটার্ন বের করা, এবং তার ভিত্তিতে ভবিষ্যদ্বাণী করা — এটাই ডেটা সায়েন্স

সংজ্ঞা: ডেটা সায়েন্স হলো এমন একটা ক্ষেত্র, যেখানে গণিত, পরিসংখ্যান (statistics), প্রোগ্রামিং এবং ডোমেইন জ্ঞান একসাথে ব্যবহার করে কাঁচা ডেটা থেকে অর্থপূর্ণ সিদ্ধান্ত ও ভবিষ্যদ্বাণী বের করা হয়।

কোম্পানিগুলো কেন বিলিয়ন ডলার খরচ করে?

কারণ সঠিক সিদ্ধান্ত মানে সরাসরি লাভ। ভুল সিদ্ধান্ত মানে বিশাল ক্ষতি। ডেটা সায়েন্স অনুমান-ভিত্তিক সিদ্ধান্তকে প্রমাণ-ভিত্তিক সিদ্ধান্তে রূপান্তর করে।

উদাহরণডেটা সায়েন্স কী করে
Netflixতোমার পছন্দ বুঝে মুভি সাজেস্ট করে
Amazon"এই প্রোডাক্ট কেনা মানুষরা এটাও কিনেছেন" দেখায়
Google Searchকোটি কোটি পেজ থেকে সবচেয়ে প্রাসঙ্গিক ফলাফল বাছাই করে
Uber / Pathaoরাস্তার চাহিদা বুঝে ভাড়া ঠিক করে (surge pricing)
Food Delivery Appকোন খাবার কখন বেশি অর্ডার হবে তা আগে থেকেই বুঝে নেয়
হাসপাতালরোগীর লক্ষণ বিশ্লেষণ করে রোগ নির্ণয়ে সাহায্য করে
ব্যাংকঅস্বাভাবিক লেনদেন দেখে জালিয়াতি (fraud) ধরে ফেলে

একটু ইতিহাস: ডেটা সায়েন্স কীভাবে এলো?

১৯৬০-৭০
পরিসংখ্যান (Statistics)
১৯৯০
কম্পিউটার সায়েন্স + ডেটাবেজ
২০০০-২০১০
Big Data ও ইন্টারনেটের বিস্ফোরণ
এখন
Machine Learning ও AI-চালিত ডেটা সায়েন্স

আগে পরিসংখ্যানবিদরা হাতে হিসাব করতেন। কম্পিউটার আসার পর প্রচুর ডেটা জমা করা সম্ভব হলো। ইন্টারনেট আসার পর ডেটার পরিমাণ কোটি কোটি গুণ বেড়ে গেলো (একে বলে Big Data)। আর এখন Machine Learning ও AI ব্যবহার করে এই বিশাল ডেটা থেকে স্বয়ংক্রিয়ভাবে প্যাটার্ন বের করা হচ্ছে।

04

ডেটা সায়েন্স লাইফসাইকেল

⏱ ২০ মিনিট

একটা ডেটা সায়েন্স প্রজেক্ট এলোমেলোভাবে হয় না — এটার একটা নির্দিষ্ট ধাপে ধাপে প্রক্রিয়া থাকে। নিচের ফ্লোচার্টে পুরো যাত্রাটা দেখানো হলো।

Business Problem
Data Collection
Data Cleaning
EDA
Feature Engineering
Model Building
Model Evaluation
Deployment
Monitoring & Improvement
Try it · Lifecycle Simulator

প্রজেক্ট goal অনুযায়ী lifecycle walkthrough

step button ক্লিক করলে প্রতিটি ধাপে লক্ষ্য, output এবং common mistake দেখাবে।

১. Business Problem — সমস্যা বোঝা

উদ্দেশ্য: কাজ শুরুর আগে বুঝতে হবে আসলে কী সমস্যার সমাধান করতে হবে।

উদাহরণ

একটা ই-কমার্স কোম্পানি চায় জানতে — কোন কাস্টমার আবার কেনাকাটা করবে না (churn), যাতে তাদের ধরে রাখা যায়।

বিজনেস গুরুত্ব: ভুল সমস্যা বেছে নিলে পুরো প্রজেক্টই মূল্যহীন হয়ে যায়। শুরুর ভুল: নতুনরা প্রায়ই সরাসরি ডেটাতে ঝাঁপিয়ে পড়ে, প্রশ্নটাই ঠিকমতো না বুঝে।

২. Data Collection — ডেটা সংগ্রহ

উদ্দেশ্য: সমস্যা সমাধানের জন্য প্রয়োজনীয় ডেটা জোগাড় করা — যেমন ডেটাবেজ, সার্ভে, ওয়েবসাইট লগ, সেন্সর ইত্যাদি থেকে।

উদাহরণ

কাস্টমারের কেনাকাটার ইতিহাস, লগইন সময়, কাস্টমার সার্ভিস কল রেকর্ড সংগ্রহ করা।

শুরুর ভুল: অপ্রাসঙ্গিক ডেটা জমা করা, বা প্রয়োজনীয় ডেটা বাদ পড়ে যাওয়া।

৩. Data Cleaning — ডেটা পরিষ্কার করা

উদ্দেশ্য: ডেটাতে থাকা ভুল, ফাঁকা ঘর, ডুপ্লিকেট এন্ট্রি ঠিক করা।

উদাহরণ

কারো বয়স লেখা আছে "-৫" অথবা কারো ফোন নম্বর ফাঁকা — এগুলো ঠিক বা বাদ দিতে হয়।

বিজনেস গুরুত্ব: নোংরা ডেটা দিয়ে বানানো মডেল সবসময় ভুল ফলাফল দেবে (Garbage In, Garbage Out)। শুরুর ভুল: এই ধাপ স্কিপ করে সরাসরি মডেল বানাতে চাওয়া।

৪. Exploratory Data Analysis (EDA) — ডেটা অন্বেষণ

উদ্দেশ্য: ডেটার ভেতরে লুকিয়ে থাকা প্যাটার্ন, ট্রেন্ড ও অস্বাভাবিকতা খুঁজে বের করা — গ্রাফ ও চার্টের মাধ্যমে।

উদাহরণ

দেখা গেলো, যেসব কাস্টমার মাসে ১ বারের কম লগইন করে, তারাই বেশি churn করে।

৫. Feature Engineering — উপযোগী উপাদান তৈরি

উদ্দেশ্য: কাঁচা ডেটা থেকে মডেলের জন্য কাজে লাগার মতো নতুন তথ্য তৈরি করা।

উদাহরণ

"শেষ লগইনের পর কত দিন হয়েছে" — এটা একটা নতুন উপযোগী ফিচার যেটা সরাসরি ডেটাতে ছিলো না, বানিয়ে নিতে হয়েছে।

৬. Model Building — মডেল তৈরি

উদ্দেশ্য: Machine Learning অ্যালগরিদম ব্যবহার করে এমন একটা সিস্টেম বানানো যেটা প্যাটার্ন শিখে ভবিষ্যদ্বাণী করতে পারে।

উদাহরণ

একটা মডেল শেখানো হলো, যেটা আগের কাস্টমারদের ডেটা দেখে বলতে পারবে নতুন কাস্টমার churn করবে কিনা।

৭. Model Evaluation — মডেল যাচাই

উদ্দেশ্য: মডেল কতটা নির্ভুল, তা পরীক্ষা করা — নতুন ডেটার ওপর প্রয়োগ করে দেখা।

উদাহরণ

মডেলটা ১০০ জন কাস্টমারের মধ্যে ৮৫ জনের churn সঠিকভাবে ধরতে পেরেছে।

শুরুর ভুল: একই ডেটাতে ট্রেইন ও টেস্ট করা, যা ভুল বিশ্বাস তৈরি করে।

৮. Deployment — বাস্তবে প্রয়োগ

উদ্দেশ্য: মডেলকে বাস্তব অ্যাপ বা সিস্টেমে যুক্ত করা, যাতে প্রতিদিন সত্যিকারের সিদ্ধান্তে ব্যবহার হয়।

উদাহরণ

churn-prediction মডেলটা কাস্টমার সার্ভিস টিমের ড্যাশবোর্ডে যুক্ত হলো, যাতে তারা ঝুঁকিতে থাকা কাস্টমারকে আগেভাগে অফার পাঠাতে পারে।

৯. Monitoring & Improvement — নজরদারি ও উন্নয়ন

উদ্দেশ্য: সময়ের সাথে সাথে মডেলের পারফরম্যান্স পর্যবেক্ষণ করা এবং প্রয়োজনে পুনরায় শেখানো (retrain)।

উদাহরণ

৬ মাস পরে কাস্টমারের আচরণ বদলে গেলে, মডেলও নতুন ডেটা দিয়ে আবার প্রশিক্ষণ দিতে হয়।

শুরুর ভুল: মনে করা যে মডেল একবার বানালেই কাজ শেষ — বাস্তবে এটা একটা চলমান প্রক্রিয়া।

05

ডেটা সায়েন্সের উপাদান

⏱ ১৫ মিনিট

ডেটা সায়েন্স একটা একক বিষয় না — এটা কয়েকটা বিষয়ের সমন্বয়। প্রতিটার নিজস্ব ভূমিকা আছে।

উপাদানকেন দরকার
গণিত (Mathematics)ডেটার মধ্যে সম্পর্ক ও প্যাটার্ন বোঝার ভিত্তি তৈরি করে
পরিসংখ্যান (Statistics)ডেটা থেকে বিশ্বাসযোগ্য উপসংহার টানার "ভাষা" — এজন্যই একে ডেটার ভাষা বলা হয়
প্রোগ্রামিং (বিশেষত Python)ডেটা প্রসেস করা, বিশ্লেষণ করা, মডেল বানানো সহজ ও দ্রুত করে — কারণ Python সহজবোধ্য এবং এতে প্রচুর রেডিমেড টুল আছে
Machine Learningডেটা থেকে নিজে নিজে প্যাটার্ন শিখে ভবিষ্যদ্বাণী করার ক্ষমতা দেয়
Data Visualizationসংখ্যার টেবিলের চেয়ে গ্রাফ অনেক দ্রুত গল্প বলে — মানুষ চোখে দেখে বুঝতে পারে সহজে
Domain Knowledgeব্যবসা বা ক্ষেত্র সম্পর্কে জ্ঞান ছাড়া সংখ্যার সঠিক অর্থ বোঝা যায় না
💡 কেন গ্রাফ গুরুত্বপূর্ণ

যদি বলি "বিক্রি জানুয়ারিতে কম, জুনে বেশি, ডিসেম্বরে সর্বোচ্চ" — এটা বুঝতে সময় লাগে। কিন্তু একটা লাইন গ্রাফ দেখলে চোখের পলকেই ট্রেন্ডটা বোঝা যায়।

06

ডেটা সায়েন্স প্রজেক্টের ধরন

⏱ ১৫ মিনিট
প্রজেক্ট ধরনএটা কী করেউদাহরণ কোম্পানি
Predictive Analyticsভবিষ্যতে কী হতে পারে তার আন্দাজ দেয়ওয়েদার অ্যাপ, বিক্রি পূর্বাভাস
Recommendation Systemsব্যবহারকারীর পছন্দ অনুযায়ী জিনিস সাজেস্ট করেNetflix, Amazon, Spotify
Fraud Detectionঅস্বাভাবিক লেনদেন বা কার্যকলাপ ধরে ফেলেব্যাংক, পেমেন্ট গেটওয়ে (bKash, Visa)
Customer Segmentationকাস্টমারদের ভিন্ন ভিন্ন গ্রুপে ভাগ করেমার্কেটিং টিম, ই-কমার্স
Forecastingসময়ের সাথে কী পরিবর্তন হবে তার হিসাব দেয়স্টক মার্কেট, বিদ্যুৎ চাহিদা
NLP (টেক্সট অ্যানালাইসিস)মানুষের লেখা বা কথা বুঝতে পারেChatGPT, গুগল ট্রান্সলেট
Computer Visionছবি বা ভিডিও দেখে বুঝতে পারেফেস আনলক, স্বচালিত গাড়ি
Generative AIনতুন কনটেন্ট তৈরি করে (লেখা, ছবি, কোড)ChatGPT, Midjourney
07

ডেটা সায়েন্স বনাম সম্পর্কিত ক্ষেত্রসমূহ

⏱ ১৫ মিনিট

Data Science vs Data Analytics

বিষয়Data ScienceData Analytics
কাজভবিষ্যদ্বাণী ও মডেল তৈরিঅতীত ডেটা থেকে ব্যাখ্যা বের করা
টুলসPython, ML লাইব্রেরিExcel, SQL, Power BI
ফলাফল"ভবিষ্যতে কী হবে""অতীতে কী হয়েছে"

Data Science vs Data Engineering

বিষয়Data ScienceData Engineering
কাজডেটা বিশ্লেষণ ও মডেলিংডেটা সংগ্রহ ও পাইপলাইন তৈরি
ফোকাসইনসাইট ও ভবিষ্যদ্বাণীডেটা যেন নির্ভরযোগ্যভাবে প্রবাহিত হয়

Data Science vs Machine Learning

Machine Learning হলো ডেটা সায়েন্সের একটা অংশ বা টুল — পুরো ক্ষেত্রটা না। ডেটা সায়েন্সে ML ছাড়াও ডেটা ক্লিনিং, বিজনেস বোঝা, ভিজুয়ালাইজেশন সবই থাকে।

Data Science vs Artificial Intelligence

AI হলো এমন সিস্টেম বানানো যা মানুষের মতো চিন্তা করতে পারে। ডেটা সায়েন্স সেই সিস্টেম বানাতে ডেটা ব্যবহার করে সাহায্য করে — তাই AI অনেক বড় একটা ছাতা, আর ডেটা সায়েন্স তার একটা গুরুত্বপূর্ণ অংশ।

Try it · Field Boundary Quiz

Scenario দেখে সঠিক discipline বাছো

প্রতিটি case-এর জন্য DA/DS/DE/BI/ML/AI থেকে best-fit role বেছে নাও।

Score0/5
Accuracy0%
Answered0
StatusReady

Data Science vs Business Intelligence (BI)

বিষয়Data ScienceBusiness Intelligence
প্রশ্ন"ভবিষ্যতে কী ঘটবে?""এতদিনে কী ঘটেছে?"
টুলসPython, ML মডেলড্যাশবোর্ড, রিপোর্ট
08

বাস্তব শিল্প-প্রয়োগ

⏱ ১০ মিনিট

🏥 স্বাস্থ্যসেবা

রোগ প্রাথমিক অবস্থায় শনাক্তকরণ, চিকিৎসার পরামর্শ

🏦 ব্যাংকিং

ঋণ ঝুঁকি বিশ্লেষণ, জালিয়াতি শনাক্তকরণ

🛍️ ই-কমার্স

প্রোডাক্ট সাজেশন, দাম নির্ধারণ

🎓 শিক্ষা

শিক্ষার্থীর দুর্বলতা চিহ্নিত করে ব্যক্তিগতকৃত শিক্ষা

🌾 কৃষি

ফলন পূর্বাভাস, মাটি বিশ্লেষণ

🏭 উৎপাদন শিল্প

মেশিন বিকল হওয়ার আগেই সতর্কতা

🚗 পরিবহন

রুট অপ্টিমাইজেশন, ভাড়া নির্ধারণ

⚽ খেলাধুলা

খেলোয়াড়ের পারফরম্যান্স বিশ্লেষণ

📱 সোশ্যাল মিডিয়া

কনটেন্ট সাজেশন, ভুয়া অ্যাকাউন্ট শনাক্তকরণ

🏛️ সরকার

নীতি প্রণয়ন, জনসংখ্যা পরিকল্পনা

09

ডেটা সায়েন্স ক্যারিয়ার রোডম্যাপ

⏱ ১০ মিনিট
পদবিমূল দায়িত্বপ্রয়োজনীয় স্কিলটুলস
Data Analystডেটা থেকে রিপোর্ট ও ইনসাইট তৈরিSQL, Excel, বিশ্লেষণী চিন্তাExcel, Power BI, SQL
Business Analystব্যবসার সমস্যা ডেটার মাধ্যমে সমাধানবিজনেস বোঝা, কমিউনিকেশনExcel, SQL, PowerPoint
Data Scientistমডেল তৈরি করে ভবিষ্যদ্বাণীPython, ML, স্ট্যাটিসটিক্সPython, Scikit-learn, Pandas
Machine Learning Engineerমডেলকে প্রোডাকশনে চালানোসফটওয়্যার ইঞ্জিনিয়ারিং, MLPython, TensorFlow, Docker
AI EngineerAI সিস্টেম ডিজাইন ও তৈরিML, Deep Learning, সিস্টেম ডিজাইনPyTorch, LLM API
Data Engineerডেটা পাইপলাইন তৈরি ও রক্ষণাবেক্ষণডেটাবেজ, ক্লাউডSQL, Spark, Airflow
Research Scientistনতুন অ্যালগরিদম গবেষণাউচ্চতর গণিত, গবেষণা দক্ষতাPython, গবেষণা পেপার
MLOps Engineerমডেল ডিপ্লয় ও মনিটরিং সিস্টেম চালানোDevOps, MLDocker, Kubernetes, CI/CD
10

সম্পূর্ণ বিজনেস গল্প: একটা অনলাইন শপিং কোম্পানি

⏱ ১০ মিনিট
📖 গল্প

ধরো "বাজারমেলা" নামে একটা অনলাইন শপিং কোম্পানি আছে। তাদের বিক্রি কমে যাচ্ছে, তারা চায় বিক্রি বাড়াতে।

সমস্যা: বিক্রি বাড়াতে হবে
কাস্টমার ডেটা সংগ্রহ
ডেটা পরিষ্কার
ডেটা বিশ্লেষণ
ML মডেল তৈরি
প্রোডাক্ট সাজেশন
বিক্রি বৃদ্ধি

বিশ্লেষণে দেখা গেলো, যারা "জুতা" কেনে তারা প্রায়ই "মোজা"ও কেনে। এই প্যাটার্ন থেকে একটা মডেল বানানো হলো, যেটা প্রতিটা কাস্টমারকে দেখিয়ে দেয় তার পছন্দ হতে পারে এমন প্রোডাক্ট। ফলাফলে, ওয়েবসাইটে "আপনার জন্য প্রস্তাবিত" সেকশন যুক্ত হলো — এবং গড় অর্ডার ভ্যালু বেড়ে গেলো।

11

মিনি Google Colab ডেমো

⏱ প্র্যাকটিক্যাল

এখন আমরা সত্যিকারের একটা ছোট ডেটাসেট দিয়ে হাতে-কলমে দেখবো। ধরে নিচ্ছি তুমি কখনো Python লেখোনি — তাই প্রতিটা লাইন ব্যাখ্যা করা হবে।

ধাপ ১: ডেটাসেট লোড করা

কোড
import pandas as pd data = { 'ছাত্রের নাম': ['রিমা', 'সাকিব', 'তানভীর', 'মিতু'], 'পড়ার সময় (ঘণ্টা)': [2, 4, 1, 5], 'নম্বর': [60, 78, 45, 90] } df = pd.DataFrame(data) print(df)
আউটপুট
ছাত্রের নাম পড়ার সময় (ঘণ্টা) নম্বর 0 রিমা 2 60 1 সাকিব 4 78 2 তানভীর 1 45 3 মিতু 5 90

লাইন-বাই-লাইন ব্যাখ্যা:

  • import pandas as pd — pandas নামের একটা টুল আনা হলো, যেটা টেবিল আকারে ডেটা সামলাতে সাহায্য করে
  • data = {...} — আমরা নিজেরাই একটা ছোট ডেটাসেট বানালাম (নাম, পড়ার সময়, নম্বর)
  • df = pd.DataFrame(data) — এই ডেটাকে একটা সুন্দর টেবিল আকারে রূপান্তর করা হলো
  • print(df) — টেবিলটা স্ক্রিনে দেখানো হলো
⚠️ শুরুর ভুল: অনেকে DataFrame বানানোর সময় ভুলে যায় যে এটাকে একটা ভ্যারিয়েবলে (df) রাখতে হয়, নাহলে পরে ব্যবহার করা যায় না।

ধাপ ২: কলামগুলো বোঝা

কোড
print(df.columns)
আউটপুট
Index(['ছাত্রের নাম', 'পড়ার সময় (ঘণ্টা)', 'নম্বর'], dtype='object')

ব্যাখ্যা: df.columns আমাদের টেবিলের সব কলামের নাম দেখায় — এখানে আমাদের ৩টা কলাম আছে।

ধাপ ৩: বেসিক পরিসংখ্যান বের করা

কোড
print(df['নম্বর'].mean()) print(df['নম্বর'].max()) print(df['নম্বর'].min())
আউটপুট
68.25 90 45

ব্যাখ্যা: .mean() গড় বের করে, .max() সর্বোচ্চ নম্বর, .min() সর্বনিম্ন নম্বর দেখায়। এখানে গড় নম্বর ৬৮.২৫, সর্বোচ্চ ৯০ (মিতু), সর্বনিম্ন ৪৫ (তানভীর)।

ধাপ ৪: সহজ ভিজ্যুয়ালাইজেশন

কোড
import matplotlib.pyplot as plt plt.scatter(df['পড়ার সময় (ঘণ্টা)'], df['নম্বর']) plt.xlabel('পড়ার সময় (ঘণ্টা)') plt.ylabel('নম্বর') plt.title('পড়ার সময় বনাম নম্বর') plt.show()
[একটা স্ক্যাটার প্লট দেখাবে যেখানে x-অক্ষে পড়ার সময় ও y-অক্ষে নম্বর — বিন্দুগুলো উপরের দিকে উঠতে থাকা একটা প্রবণতা দেখাবে]

ব্যাখ্যা: plt.scatter() দুইটা কলামের মধ্যে সম্পর্ক বিন্দু আকারে দেখায়। xlabel, ylabel, title গ্রাফটাকে বোঝার উপযোগী করে তোলে।

আবিষ্কৃত ইনসাইট

🔍 ইনসাইট

গ্রাফ থেকে স্পষ্ট দেখা যাচ্ছে — যারা বেশি সময় পড়াশোনা করেছে তাদের নম্বরও বেশি। এটাই ডেটা সায়েন্সের মূল কাজ — সংখ্যার মধ্যে লুকিয়ে থাকা সম্পর্ক খুঁজে বের করা।

⚠️ সাধারণ শুরুর ভুল সমূহ:
  • কলামের নাম ভুল বানানে লেখা (case-sensitive হওয়ায় এরর আসে)
  • লাইব্রেরি ইম্পোর্ট না করে সরাসরি ব্যবহার করার চেষ্টা করা
  • ছোট ডেটাসেট থেকেই বড় সিদ্ধান্ত নিয়ে ফেলা (এখানে মাত্র ৪ জনের ডেটা, বাস্তবে অনেক বেশি ডেটা লাগে)
12

সাধারণ ভুল ধারণা ভাঙা

⏱ আলোচনা
❌ "ডেটা সায়েন্স মানেই শুধু কোডিং"

✅ বাস্তবতা: কোডিং একটা টুল মাত্র। বেশিরভাগ সময় যায় বিজনেস সমস্যা বোঝা, ডেটা পরিষ্কার করা ও ফলাফল ব্যাখ্যা করার পেছনে।

❌ "ডেটা সায়েন্স মানেই শুধু Machine Learning"

✅ বাস্তবতা: ML হলো টুলবক্সের একটা যন্ত্র মাত্র। ডেটা ক্লিনিং, ভিজ্যুয়ালাইজেশন, বিজনেস বোঝাও সমান গুরুত্বপূর্ণ।

❌ "খুব ভালো গণিত জানতেই হবে"

✅ বাস্তবতা: শুরুতে বেসিক গণিত ও লজিক্যাল চিন্তা থাকলেই যথেষ্ট। গভীর গণিত পরে ধীরে ধীরে শেখা যায়।

❌ "AI আর ডেটা সায়েন্স একই জিনিস"

✅ বাস্তবতা: AI একটা বড় ছাতা, ডেটা সায়েন্স তার একটা গুরুত্বপূর্ণ অংশ — কিন্তু পুরোটা নয়।

❌ "শুধু Python জানলেই চলবে"

✅ বাস্তবতা: Python একটা টুল, কিন্তু সমস্যা বোঝা, স্ট্যাটিসটিক্স ও ডোমেইন জ্ঞান ছাড়া Python দিয়ে কিছুই অর্থবহ হয় না।

❌ "বেশি ডেটা মানেই ভালো ফলাফল"

✅ বাস্তবতা: ডেটার পরিমাণের চেয়ে গুণগত মান (quality) বেশি গুরুত্বপূর্ণ। নোংরা বা ভুল ডেটা বেশি থাকলে ফলাফল আরও খারাপ হতে পারে।

13

রিভিশন ও প্রশ্নোত্তর

⏱ শেষ পর্যালোচনা

📌 দ্রুত রিভিশন নোট

  • ডেটা = কাঁচা তথ্য-কণা, ইনফরমেশন = অর্থবহ প্যাটার্ন
  • Data → Information → Knowledge → Decision — এই ৪ ধাপ মনে রাখো
  • ডেটা সায়েন্স = গণিত + স্ট্যাটিসটিক্স + প্রোগ্রামিং + ডোমেইন জ্ঞান
  • লাইফসাইকেল: Business Problem → Collection → Cleaning → EDA → Feature Engineering → Model → Evaluation → Deployment → Monitoring
  • ML হলো AI-এর একটা অংশ, আর ডেটা সায়েন্সের একটা টুল

🌍 দৈনন্দিন জীবনে ডেটা সায়েন্স — ২০টি উদাহরণ

  • YouTube-এর ভিডিও সাজেশন
  • Facebook নিউজফিড সাজানো
  • Google Maps-এর দ্রুততম রাস্তা
  • মোবাইলের কিবোর্ড শব্দ প্রেডিকশন
  • Netflix মুভি সাজেশন
  • Spotify গান সাজেশন
  • ই-মেইলের স্প্যাম ফিল্টার
  • বাংক অ্যাপে জালিয়াতি সতর্কতা
  • অনলাইন শপিং প্রাইস ড্রপ অ্যালার্ট
  • ফেস আনলক ফিচার
  • রাইড শেয়ারিং অ্যাপের ভাড়া হিসাব
  • ওয়েদার অ্যাপের পূর্বাভাস
  • ফুড ডেলিভারি সময় হিসাব
  • ভয়েস অ্যাসিস্ট্যান্ট (Siri, Google Assistant)
  • অনলাইন বিজ্ঞাপন টার্গেটিং
  • হেলথ অ্যাপের স্টেপ কাউন্ট বিশ্লেষণ
  • অটোকারেক্ট ফিচার
  • ব্যাংক লোন অনুমোদন সিস্টেম
  • ই-কমার্সের "একসাথে কেনা হয়" সাজেশন
  • নিউজ অ্যাপের ব্যক্তিগতকৃত খবর

❓ ভাইভা প্রশ্ন

১. ডেটা এবং ইনফরমেশনের মধ্যে পার্থক্য কী?
ডেটা হলো কাঁচা তথ্য, আর ইনফরমেশন হলো সেই ডেটা থেকে বের করা অর্থবহ প্যাটার্ন।
২. Structured আর Unstructured ডেটার একটা করে উদাহরণ দাও।
Structured: এক্সেল শিট। Unstructured: ছবি বা ভিডিও।
৩. ডেটা সায়েন্স লাইফসাইকেলের প্রথম ধাপ কী?
Business Problem বোঝা।
৪. EDA বলতে কী বোঝায়?
Exploratory Data Analysis — ডেটার প্যাটার্ন গ্রাফ ও চার্টের মাধ্যমে অন্বেষণ করা।
৫. ডেটা সায়েন্স আর মেশিন লার্নিং কি একই জিনিস?
না। ML হলো ডেটা সায়েন্সের একটা অংশ বা টুল, পুরো ক্ষেত্র নয়।

💼 ইন্টারভিউ প্রস্তুতি — টপ ৩০টি বিগিনার লেভেল প্রশ্ন

১. ডেটা সায়েন্স কী?
ডেটা থেকে অর্থবহ সিদ্ধান্ত ও ভবিষ্যদ্বাণী বের করার একটা আন্তঃবিষয়ক (interdisciplinary) ক্ষেত্র।
২. Structured ও Unstructured ডেটার মধ্যে পার্থক্য কী?
Structured ডেটা সারি-কলামে সাজানো থাকে, Unstructured ডেটার কোনো নির্দিষ্ট কাঠামো থাকে না।
৩. Data Science-এর মূল উপাদানগুলো কী কী?
গণিত, পরিসংখ্যান, প্রোগ্রামিং, মেশিন লার্নিং, ভিজ্যুয়ালাইজেশন ও ডোমেইন জ্ঞান।
৪. EDA কেন গুরুত্বপূর্ণ?
এটা মডেল বানানোর আগে ডেটার প্যাটার্ন ও সমস্যা বুঝতে সাহায্য করে।
৫. Data Cleaning না করলে কী সমস্যা হয়?
ভুল বা নোংরা ডেটা দিয়ে বানানো মডেল ভুল ফলাফল দেবে (Garbage In, Garbage Out)।
৬. Feature Engineering কী?
কাঁচা ডেটা থেকে মডেলের জন্য উপযোগী নতুন তথ্য তৈরি করা।
৭. Model Evaluation কেন করা হয়?
মডেল বাস্তব ডেটাতে কতটা নির্ভুল কাজ করছে তা যাচাই করতে।
৮. Data Science এবং Data Analytics-এর পার্থক্য কী?
Data Science ভবিষ্যদ্বাণীর দিকে ফোকাস করে, Data Analytics অতীতের ব্যাখ্যার দিকে ফোকাস করে।
৯. Data Science এবং Data Engineering-এর পার্থক্য কী?
Data Engineering ডেটা প্রবাহ ও পাইপলাইন নিয়ে কাজ করে, Data Science বিশ্লেষণ ও মডেলিং নিয়ে।
১০. Machine Learning কি Data Science-এর অংশ?
হ্যাঁ, এটা ডেটা সায়েন্সের একটা গুরুত্বপূর্ণ টুল, তবে একমাত্র অংশ নয়।
১১. AI এবং Data Science-এর মধ্যে সম্পর্ক কী?
AI একটা বড় ক্ষেত্র, ডেটা সায়েন্স তার একটা অংশ যা ডেটা ব্যবহার করে AI সিস্টেম বানাতে সাহায্য করে।
১২. Business Intelligence (BI) কী?
অতীতের ডেটা থেকে রিপোর্ট ও ড্যাশবোর্ড তৈরি করার প্রক্রিয়া।
১৩. Recommendation System কীভাবে কাজ করে?
ব্যবহারকারীর আগের আচরণ বিশ্লেষণ করে একই ধরনের পছন্দ বুঝে সাজেশন দেয়।
১৪. Fraud Detection সিস্টেম কীভাবে কাজ করে?
স্বাভাবিক লেনদেনের প্যাটার্ন থেকে ভিন্নতা (anomaly) খুঁজে জালিয়াতি শনাক্ত করে।
১৫. NLP কী?
Natural Language Processing — কম্পিউটার দিয়ে মানুষের ভাষা বোঝার প্রযুক্তি।
১৬. Computer Vision কী?
ছবি ও ভিডিও থেকে তথ্য বুঝতে পারার প্রযুক্তি।
১৭. কেন Python ডেটা সায়েন্সে জনপ্রিয়?
সহজবোধ্য সিনট্যাক্স ও প্রচুর রেডিমেড লাইব্রেরি (Pandas, Scikit-learn) থাকার কারণে।
১৮. Statistics-কে ডেটার ভাষা বলা হয় কেন?
কারণ এটা ডেটা থেকে বিশ্বাসযোগ্য সিদ্ধান্ত টানার নিয়মকানুন সরবরাহ করে।
১৯. Domain Knowledge কেন গুরুত্বপূর্ণ?
ব্যবসা বা ক্ষেত্র সম্পর্কে জ্ঞান ছাড়া সংখ্যার সঠিক অর্থ বের করা যায় না।
২০. Deployment বলতে কী বোঝায়?
তৈরি করা মডেলকে বাস্তব অ্যাপ বা সিস্টেমে যুক্ত করে ব্যবহারযোগ্য করা।
২১. Model Monitoring কেন প্রয়োজন?
সময়ের সাথে ডেটার ধরন বদলে যেতে পারে, তাই মডেলের কার্যকারিতাও নিয়মিত যাচাই করতে হয়।
২২. Data Scientist-এর প্রধান দায়িত্ব কী?
ডেটা বিশ্লেষণ করে মডেল তৈরি করে ভবিষ্যদ্বাণী বা সিদ্ধান্তে সাহায্য করা।
২৩. Data Analyst এবং Data Scientist-এর পার্থক্য কী?
Data Analyst অতীতের ডেটা থেকে রিপোর্ট তৈরি করে, Data Scientist ভবিষ্যদ্বাণী মডেল তৈরি করে।
২৪. MLOps কী?
Machine Learning মডেলকে প্রোডাকশনে চালানো ও রক্ষণাবেক্ষণের প্রক্রিয়া ও অনুশীলন।
২৫. Predictive Analytics কী?
অতীত ডেটার ভিত্তিতে ভবিষ্যতে কী ঘটতে পারে তার আন্দাজ দেওয়া।
২৬. কেন বেশি ডেটা থাকলেই ভালো ফলাফল নিশ্চিত না?
ডেটার গুণগত মান খারাপ হলে বা অপ্রাসঙ্গিক হলে, বেশি পরিমাণেও ভুল ফলাফল আসতে পারে।
২৭. Customer Segmentation কী কাজে লাগে?
কাস্টমারদের একই ধরনের আচরণ অনুযায়ী গ্রুপ করে টার্গেটেড মার্কেটিং করতে সাহায্য করে।
২৮. Generative AI কী?
নতুন কনটেন্ট (লেখা, ছবি, কোড) তৈরি করতে সক্ষম AI প্রযুক্তি।
২৯. একটা ভালো Data Scientist-এর কোন গুণ সবচেয়ে গুরুত্বপূর্ণ?
কৌতূহল, সমস্যা সমাধানের ক্ষমতা এবং বিজনেস প্রেক্ষাপট বোঝার দক্ষতা।
৩০. একজন শিক্ষার্থী কীভাবে ডেটা সায়েন্স শেখা শুরু করতে পারে?
প্রথমে বেসিক Python ও Statistics শিখে, এরপর ছোট ছোট রিয়েল-লাইফ ডেটাসেট নিয়ে প্র্যাকটিস করে।

✅ MCQ প্র্যাকটিস

১. নিচের কোনটি Unstructured Data-এর উদাহরণ?
(ক) এক্সেল শিট (খ) ছবি (গ) ব্যাংক টেবিল (ঘ) SQL টেবিল
উত্তর: (খ) ছবি
২. ডেটা সায়েন্স লাইফসাইকেলে "EDA" এর পূর্ণরূপ কী?
(ক) Extra Data Analysis (খ) Exploratory Data Analysis (গ) Extended Data Algorithm (ঘ) Efficient Data Access
উত্তর: (খ) Exploratory Data Analysis
৩. Netflix মুভি সাজেশন কোন ধরনের প্রজেক্টের উদাহরণ?
(ক) Fraud Detection (খ) Recommendation System (গ) Data Engineering (ঘ) BI Reporting
উত্তর: (খ) Recommendation System
৪. নিচের কোনটি ডেটা সায়েন্সের উপাদান নয়?
(ক) Mathematics (খ) Statistics (গ) Advertising (ঘ) Programming
উত্তর: (গ) Advertising
৫. Data → Information → Knowledge → এর পরের ধাপ কী?
(ক) Storage (খ) Decision (গ) Cleaning (ঘ) Collection
উত্তর: (খ) Decision

🎯 ক্লাসরুম অ্যাক্টিভিটি সংকলন

অ্যাক্টিভিটি ১: প্রতিটা শিক্ষার্থী নিজের মোবাইল থেকে ৩টা অ্যাপের নাম বলবে এবং বলবে সেই অ্যাপ কী ধরনের ডেটা সংগ্রহ করে।
অ্যাক্টিভিটি ২: ছোট দলে ভাগ হয়ে একটা কাল্পনিক দোকানের জন্য Data Science Lifecycle-এর প্রতিটা ধাপ লিখতে হবে।
অ্যাক্টিভিটি ৩: ৫ মিনিটের মধ্যে যতগুলো সম্ভব দৈনন্দিন ডেটা সায়েন্স উদাহরণ লিখে ফেলতে হবে — যে দল সবচেয়ে বেশি লিখবে তারা জিতবে।

📝 হোমওয়ার্ক অ্যাসাইনমেন্ট

  1. তোমার পরিচিত যেকোনো একটা ব্যবসা (দোকান, রেস্টুরেন্ট, স্কুল) বেছে নাও এবং লিখো — সেখানে ডেটা সায়েন্স কীভাবে সাহায্য করতে পারে।
  2. আজকের ক্লাসে শেখা Data Science Lifecycle-এর ৯টা ধাপ মুখস্থ করে একটা ফ্লোচার্ট নিজে হাতে এঁকে আনো।
  3. ৫টা দৈনন্দিন উদাহরণ খুঁজে বের করো (আজকের তালিকার বাইরে থেকে) যেখানে তুমি নিজে ডেটা সায়েন্সের প্রভাব অনুভব করেছ।