📚 আজকের ক্লাসের রোডম্যাপ

01

Lifecycle কেন দরকার?

⏱ ১৫ মিনিট
🧑‍🏫 কল্পনা করো

ধরো "বাজারমেলা" নামে একটা অনলাইন শপিং কোম্পানি চায় তাদের বিক্রি বাড়াতে। কারো মাথায় এলো — "চলো একটা AI মডেল বানিয়ে ফেলি!" কিন্তু আসলেই কি সরাসরি মডেল বানানো সম্ভব?

❓ আমরা কি সরাসরি একটা AI মডেল বানিয়ে ফেলতে পারি?

না, প্রথমে ডেটা লাগবে।

❓ ডেটা যদি ভুল বা নোংরা হয়?

মডেল ভুল শিখে ভুল ফলাফল দেবে।

❓ ডিপ্লয়মেন্টের পর মডেল খারাপ পারফর্ম করলে?

তখন বোঝার উপায় থাকতে হবে কেন খারাপ হলো।

এই প্রশ্নগুলোর উত্তরই বলে দেয় — কেন একটা ডেটা সায়েন্স প্রজেক্টে ধাপে ধাপে এগোনো জরুরি। কোনো ধাপ বাদ দিলে পুরো প্রজেক্টই ব্যর্থ হয়ে যেতে পারে।

Business Problem
Data
Analysis
Model
Deployment
Business Value
⚠️ কেন ধাপ বাদ দিলে প্রজেক্ট ব্যর্থ হয়: যেমন, যদি ডেটা পরিষ্কার না করেই মডেল বানানো হয়, মডেল ভুল প্যাটার্ন শিখবে। যদি Deployment-এর পর Monitoring না করা হয়, মডেল সময়ের সাথে খারাপ হতে থাকলেও কেউ টের পাবে না — এবং কোম্পানি ভুল সিদ্ধান্তের ওপর নির্ভর করতে থাকবে।
02

Data Science Lifecycle কী?

⏱ ২০ মিনিট
🧑‍🏫 কল্পনা করো

একটা "Lifecycle" মানে হলো এমন একটা চক্র বা ধারাবাহিক প্রক্রিয়া, যার শুরু ও শেষ আছে, এবং যা বার বার পুনরাবৃত্তি হয়। যেমন, একটা গাছের জীবনচক্র — বীজ থেকে চারা, চারা থেকে বড় গাছ, তারপর আবার নতুন বীজ। ডেটা সায়েন্সেও একটা নির্দিষ্ট ধারাবাহিক প্রক্রিয়া আছে, যাকে বলে Data Science Lifecycle

সংজ্ঞা: Data Science Lifecycle হলো একটা কাঠামোবদ্ধ ধাপে ধাপে প্রক্রিয়া, যা একটা বিজনেস সমস্যা থেকে শুরু করে একটা কার্যকর, পর্যবেক্ষিত ও ক্রমাগত উন্নত হতে থাকা সমাধানে পৌঁছানো পর্যন্ত পুরো যাত্রাটা বর্ণনা করে।

Business Problem
Data Collection
Data Understanding
Data Cleaning
EDA
Feature Engineering
Model Selection
Model Training
Model Evaluation
Deployment
Monitoring
Continuous Improvement

লক্ষ্য করো, শেষ ধাপ "Continuous Improvement" আবার শুরুর দিকে ফিরে যেতে পারে — কারণ ব্যবসার পরিস্থিতি বদলায়, তাই মডেলও নিয়মিত হালনাগাদ করতে হয়। এজন্যই একে "চক্র" বা Lifecycle বলা হয়, সরলরেখা নয়।

03

প্রতিটা ধাপ বিস্তারিত

⏱ ৪০ মিনিট

১. Business Problem Understanding

সংজ্ঞা ও উদ্দেশ্য: কাজ শুরুর আগে বুঝতে হবে আসলে কোন সমস্যার সমাধান করতে হবে।

ইনপুট: বিজনেস প্রশ্নআউটপুট: স্পষ্ট সমস্যা বিবৃতি
উদাহরণ

"আমাদের কাস্টমার churn কমাতে হবে" — এটাকে স্পষ্ট করে বলা "কোন কাস্টমার আগামী ৩০ দিনে churn করতে পারে তা আগেভাগে জানা"।

শুরুর ভুল: সরাসরি ডেটা বা অ্যালগরিদমে ঝাঁপিয়ে পড়া, প্রশ্নটা স্পষ্ট না করেই। Best Practice: সমস্যাকে একটা পরিমাপযোগ্য (measurable) প্রশ্নে রূপান্তর করা।

২. Data Collection

সংজ্ঞা ও উদ্দেশ্য: সমস্যা সমাধানে প্রয়োজনীয় ডেটা বিভিন্ন উৎস থেকে জোগাড় করা।

ইনপুট: সমস্যা বিবৃতিআউটপুট: কাঁচা ডেটাসেট
উদাহরণ

কাস্টমারের কেনাকাটার ইতিহাস, লগইন রেকর্ড, কাস্টমার সার্ভিস কল লগ সংগ্রহ করা।

শুরুর ভুল: অপ্রাসঙ্গিক ডেটা জোগাড় করা বা গুরুত্বপূর্ণ উৎস বাদ পড়া। Best Practice: শুরুতেই ঠিক করা কোন ডেটা আসলেই সমস্যার সাথে সম্পর্কিত।

৩. Data Understanding

সংজ্ঞা ও উদ্দেশ্য: ডেটার কলামগুলো কী বোঝায়, কী ধরনের মান আছে, ডেটার আকার কেমন তা প্রাথমিকভাবে জানা।

ইনপুট: কাঁচা ডেটাসেটআউটপুট: ডেটা সম্পর্কে প্রাথমিক ধারণা
উদাহরণ

"বয়স" কলামে কি ঋণাত্মক মান আছে? "আয়" কলামে কতগুলো ফাঁকা ঘর আছে? — এসব প্রাথমিকভাবে দেখা।

শুরুর ভুল: এই ধাপ স্কিপ করে সরাসরি ক্লিনিং বা মডেলিং-এ চলে যাওয়া।

৪. Data Cleaning

সংজ্ঞা ও উদ্দেশ্য: ডেটাতে থাকা ভুল, ফাঁকা ঘর, ডুপ্লিকেট এন্ট্রি ঠিক করা।

ইনপুট: বোঝা ডেটাসেটআউটপুট: পরিষ্কার ডেটাসেট
উদাহরণ

ফোন নম্বর ফাঁকা থাকলে বাদ দেওয়া বা যুক্তিসঙ্গত মান বসানো, ডুপ্লিকেট এন্ট্রি মুছে ফেলা।

শুরুর ভুল: "Garbage In, Garbage Out" — নোংরা ডেটা দিয়ে বানানো মডেল সবসময় ভুল ফলাফল দেবে।

৫. Exploratory Data Analysis (EDA)

সংজ্ঞা ও উদ্দেশ্য: গ্রাফ ও চার্টের মাধ্যমে ডেটার ভেতরের প্যাটার্ন ও অস্বাভাবিকতা খুঁজে বের করা।

ইনপুট: পরিষ্কার ডেটাসেটআউটপুট: ইনসাইট ও ভিজ্যুয়াল
উদাহরণ

দেখা গেলো, যেসব কাস্টমার মাসে ১ বারের কম লগইন করে, তারাই বেশি churn করে।

শুরুর ভুল: EDA স্কিপ করে সরাসরি মডেল বানানো, ফলে ডেটার লুকানো সমস্যা অজানা থেকে যায়।

৬. Feature Engineering

সংজ্ঞা ও উদ্দেশ্য: কাঁচা ডেটা থেকে মডেলের জন্য উপযোগী নতুন তথ্য তৈরি করা।

ইনপুট: EDA-এর ইনসাইটআউটপুট: মডেল-উপযোগী ফিচার
উদাহরণ

"শেষ লগইনের পর কত দিন হয়েছে" — এটা একটা নতুন উপযোগী ফিচার।

শুরুর ভুল: দুর্বল ফিচার নির্বাচন করা, যা মডেলকে বিভ্রান্ত করে।

৭. Data Splitting

সংজ্ঞা ও উদ্দেশ্য: ডেটাকে Training ও Testing অংশে ভাগ করা, যাতে মডেলকে নতুন, অদেখা ডেটাতে যাচাই করা যায়।

ইনপুট: ফিচার-সহ ডেটাসেটআউটপুট: Train/Test সেট
উদাহরণ

১০০ জন কাস্টমারের মধ্যে ৮০ জনের ডেটা দিয়ে মডেল শেখানো, বাকি ২০ জনের ডেটা দিয়ে যাচাই করা।

শুরুর ভুল: একই ডেটাতে ট্রেইন ও টেস্ট করা, যা ভুল আত্মবিশ্বাস তৈরি করে।

৮. Model Selection

সংজ্ঞা ও উদ্দেশ্য: সমস্যার ধরন অনুযায়ী সঠিক অ্যালগরিদম বেছে নেওয়া।

ইনপুট: Train ডেটাআউটপুট: বাছাইকৃত অ্যালগরিদম
উদাহরণ

সহজ সমস্যার জন্য Logistic Regression, জটিল প্যাটার্নের জন্য Neural Network বেছে নেওয়া।

শুরুর ভুল: সবসময় সবচেয়ে জটিল মডেল বেছে নেওয়া, যদিও সহজ মডেলই যথেষ্ট হতে পারতো।

৯. Model Training

সংজ্ঞা ও উদ্দেশ্য: বাছাইকৃত অ্যালগরিদমকে Training ডেটা দেখিয়ে প্যাটার্ন শেখানো।

ইনপুট: Train ডেটা + অ্যালগরিদমআউটপুট: শেখা মডেল
উদাহরণ

মডেলকে আগের ৮০ জন কাস্টমারের ডেটা দেখিয়ে churn প্যাটার্ন শেখানো।

⚙️ Hyperparameter Tuning — সংক্ষিপ্ত পরিচিতি

মডেলের কিছু "সেটিংস" থাকে, যা প্রশিক্ষণের আগে ঠিক করে দিতে হয় (যেমন একজন রাঁধুনি রান্নার আগে চুলার আঁচ ঠিক করে নেয়)। এই সেটিংসগুলোকে বলে Hyperparameter, আর সঠিক মান খুঁজে বের করার প্রক্রিয়াকে বলে Hyperparameter Tuning। এটা মডেলের পারফরম্যান্স আরও ভালো করতে সাহায্য করে।

১০. Model Evaluation ১০

সংজ্ঞা ও উদ্দেশ্য: মডেল Test ডেটাতে কতটা নির্ভুল কাজ করছে তা যাচাই করা।

ইনপুট: Test ডেটা + মডেলআউটপুট: পারফরম্যান্স স্কোর
উদাহরণ

মডেলটা ২০ জন কাস্টমারের মধ্যে ১৭ জনের churn সঠিকভাবে ধরতে পেরেছে (৮৫% নির্ভুলতা)।

শুরুর ভুল: শুধু একটা মেট্রিক (যেমন Accuracy) দেখে সন্তুষ্ট হওয়া, যা সবসময় পুরো ছবি দেখায় না।

১১. Model Deployment ১১

সংজ্ঞা ও উদ্দেশ্য: মডেলকে বাস্তব অ্যাপ বা সিস্টেমে যুক্ত করা, যাতে প্রতিদিন সত্যিকারের সিদ্ধান্তে ব্যবহার হয়।

ইনপুট: যাচাইকৃত মডেলআউটপুট: লাইভ প্রোডাকশন সিস্টেম
উদাহরণ

churn-prediction মডেলটা কাস্টমার সার্ভিস টিমের ড্যাশবোর্ডে যুক্ত হলো।

শুরুর ভুল: যথেষ্ট যাচাই না করেই মডেল সরাসরি বাস্তবে ছেড়ে দেওয়া।

১২. Monitoring ১২

সংজ্ঞা ও উদ্দেশ্য: মডেল বাস্তবে কেমন পারফর্ম করছে তা নিয়মিত পর্যবেক্ষণ করা।

ইনপুট: লাইভ পারফরম্যান্স ডেটাআউটপুট: অ্যালার্ট/রিপোর্ট
উদাহরণ

৩ মাস পর দেখা গেলো মডেলের নির্ভুলতা কমে গেছে, কারণ কাস্টমারের আচরণ বদলে গেছে।

শুরুর ভুল: মডেল ডিপ্লয় করার পর "কাজ শেষ" ভেবে ভুলে যাওয়া।

১৩. Model Updating / Retraining ১৩

সংজ্ঞা ও উদ্দেশ্য: নতুন ডেটা দিয়ে মডেলকে আবার প্রশিক্ষণ দিয়ে হালনাগাদ করা।

ইনপুট: নতুন ডেটাআউটপুট: হালনাগাদকৃত মডেল
উদাহরণ

নতুন ৩ মাসের ডেটা যোগ করে churn-prediction মডেলকে আবার প্রশিক্ষণ দেওয়া হলো।

শুরুর ভুল: মনে করা মডেল একবার বানালেই কাজ শেষ — বাস্তবে এটা একটা চলমান প্রক্রিয়া।

04

সম্পূর্ণ বিজনেস কেস স্টাডি: ব্যাংক লোন ডিফল্ট প্রেডিকশন

⏱ ২০ মিনিট
📖 গল্প

একটা ব্যাংক জানতে চায় — কোন কাস্টমার ঋণ পরিশোধ করতে ব্যর্থ হতে পারে (default), যাতে তারা আগেভাগেই সতর্ক হতে পারে।

Business Goal
ডিফল্ট ঝুঁকি আগেভাগে জানা
কাস্টমার ডেটা সংগ্রহ
আয়, ঋণের ইতিহাস, চাকরির স্থিতিশীলতা
Missing Values পরিষ্কার
ফাঁকা আয়ের ঘর ঠিক করা
EDA
দেখা গেলো কম আয় ও ঘন ঘন চাকরি বদলে ডিফল্টের ঝুঁকি বেশি
Feature Engineering
"আয়-ঋণ অনুপাত" নামে নতুন ফিচার তৈরি
Train Model
আগের কাস্টমারদের ডেটা দিয়ে মডেল শেখানো
Evaluate Model
৮৭% নির্ভুলতায় ডিফল্ট শনাক্ত
Deploy
লোন অফিসারের ড্যাশবোর্ডে যুক্ত
Predict New Customers
নতুন আবেদনকারীর ঝুঁকি স্কোর দেখানো
Monitor Performance
নিয়মিত নির্ভুলতা পরীক্ষা ও হালনাগাদ

প্রতিটা ধাপে সিদ্ধান্ত নেওয়া হয়েছে সতর্কভাবে — কোনো ধাপ বাদ দিলে ব্যাংক ভুল ঝুঁকি মূল্যায়ন করে বসতে পারতো, যা তাদের বড় আর্থিক ক্ষতির কারণ হতে পারতো।

05

Data Science Maturity Framework

⏱ ২০ মিনিট
🧑‍🏫 কল্পনা করো

একটা বাচ্চা প্রথমে হাঁটতে শেখে, তারপর সাইকেল চালাতে শেখে, তারপর গাড়ি চালাতে শেখে, এবং একসময় একজন পেশাদার ড্রাইভার হয়ে ওঠে। প্রতিটা ধাপে তার দক্ষতা ও আত্মবিশ্বাস বাড়ে। ঠিক একইভাবে, একটা কোম্পানিও ডেটা ব্যবহারে ধীরে ধীরে "পরিণত" (mature) হয়ে ওঠে।

"Maturity" মানে কী? এখানে Maturity মানে হলো — একটা কোম্পানি ডেটা ব্যবহার করে সিদ্ধান্ত নেওয়ার ক্ষেত্রে কতটা উন্নত, সংগঠিত ও স্বয়ংক্রিয়।

No Data Cultureসিদ্ধান্ত নেওয়া হয় অনুমানের ওপর ভিত্তি করে, কোনো ড্যাশবোর্ড বা বিশ্লেষণ নেই
Reportingএক্সেল রিপোর্ট, বেসিক ড্যাশবোর্ড, অতীতের বিশ্লেষণ
Analyticsডেটা-চালিত সিদ্ধান্ত, Business Intelligence, KPI পর্যবেক্ষণ
Predictive AnalyticsMachine Learning, পূর্বাভাস, কাস্টমার প্রেডিকশন, জালিয়াতি শনাক্তকরণ
AI-Driven Organizationস্বয়ংক্রিয়তা, Generative AI, রিকমেন্ডেশন সিস্টেম, ক্রমাগত শেখা সিস্টেম
লেভেলবৈশিষ্ট্যউদাহরণ
১. No Data Cultureঅনুমান-ভিত্তিক সিদ্ধান্তদোকান মালিক নিজের অনুভূতি দিয়ে স্টক ঠিক করেন
২. Reportingঅতীতের ডেটার রিপোর্টমাসিক বিক্রয় রিপোর্ট এক্সেলে তৈরি করা
৩. AnalyticsKPI ও ড্যাশবোর্ড দিয়ে চলমান পর্যবেক্ষণPower BI ড্যাশবোর্ডে লাইভ বিক্রয় ট্র্যাকিং
৪. Predictive Analyticsভবিষ্যদ্বাণীমূলক মডেল ব্যবহারকোন কাস্টমার churn করবে তা আগে থেকে বলা
৫. AI-Driven Organizationস্বয়ংক্রিয়, সদা-শিখতে থাকা সিস্টেমNetflix-এর মতো রিয়েল-টাইম সাজেশন ইঞ্জিন
🏢 একটা কোম্পানির যাত্রা

ধরো "বাজারমেলা" শুরুতে (Level 1) শুধু মালিকের অনুমানে চলতো। এক বছর পর তারা এক্সেল রিপোর্ট বানাতে শুরু করলো (Level 2)। এরপর তারা একটা ড্যাশবোর্ড বসালো যা প্রতিদিনের বিক্রয় দেখায় (Level 3)। তারপর তারা একটা churn-prediction মডেল বানালো (Level 4)। এবং সবশেষে, তারা একটা সম্পূর্ণ স্বয়ংক্রিয় সাজেশন সিস্টেম চালু করলো, যা প্রতিদিন নিজে থেকেই নতুন প্যাটার্ন শিখতে থাকে (Level 5)। প্রতিটা ধাপে তাদের সিদ্ধান্ত নেওয়ার ক্ষমতা ও ব্যবসায়িক প্রভাব বেড়েছে।

06

লাইফসাইকেল জুড়ে বিভিন্ন ভূমিকা

⏱ ১০ মিনিট
ভূমিকাকোন ধাপে কাজ করেপ্রধান দায়িত্ব
Business AnalystBusiness Problem Understandingবিজনেস সমস্যা স্পষ্ট করা
Data EngineerData Collection, Cleaningডেটা পাইপলাইন তৈরি ও সরবরাহ নিশ্চিত করা
Data AnalystData Understanding, EDAরিপোর্ট ও প্রাথমিক ইনসাইট তৈরি করা
Data ScientistFeature Engineering, Model Selection, Training, Evaluationমডেল বানিয়ে ভবিষ্যদ্বাণী তৈরি করা
Machine Learning EngineerModel Training, Deploymentমডেলকে স্কেলেবল ও প্রোডাকশন-রেডি করা
MLOps EngineerDeployment, Monitoring, Retrainingমডেল চলমান রাখা ও স্বয়ংক্রিয়ভাবে হালনাগাদ করা
AI Engineerসম্পূর্ণ AI সিস্টেম ডিজাইনএকাধিক মডেল ও সিস্টেম একত্রে ইন্টিগ্রেট করা
Business Analyst
Data Engineer
Data Analyst
Data Scientist
ML Engineer
MLOps Engineer
07

Google Colab ডেমো

⏱ প্র্যাকটিক্যাল

এটা সম্পূর্ণ লাইফসাইকেলের একটা ছোট্ট প্রদর্শনী মাত্র — বাস্তবে প্রতিটা ধাপ আরও অনেক বড় ও বিস্তারিত হয়।

ধাপ ১: ডেটাসেট লোড করা

কোড
import pandas as pd data = { 'কাস্টমার_আয়': [25000, 40000, None, 60000, 22000, 75000], 'ঋণের_পরিমাণ': [10000, 15000, 20000, 25000, 12000, 30000], 'পূর্বে_ডিফল্ট_করেছে': [1, 0, 1, 0, 1, 0] } df = pd.DataFrame(data) print(df)
আউটপুট
কাস্টমার_আয় ঋণের_পরিমাণ পূর্বে_ডিফল্ট_করেছে 0 25000.0 10000 1 1 40000.0 15000 0 2 NaN 20000 1 3 60000.0 25000 0 4 22000.0 12000 1 5 75000.0 30000 0

ব্যাখ্যা: লক্ষ্য করো, দ্বিতীয় সারিতে (index 2) আয়ের মান ফাঁকা (NaN) — এটাই বাস্তব ডেটায় সাধারণ একটা সমস্যা।

ধাপ ২: ডেটা ক্লিনিং

কোড
df['কাস্টমার_আয়'] = df['কাস্টমার_আয়'].fillna(df['কাস্টমার_আয়'].mean()) print(df)
আউটপুট
কাস্টমার_আয় ঋণের_পরিমাণ পূর্বে_ডিফল্ট_করেছে 0 25000.000 10000 1 1 40000.000 15000 0 2 44400.000 20000 1 3 60000.000 25000 0 4 22000.000 12000 1 5 75000.000 30000 0

ব্যাখ্যা: .fillna(mean()) ফাঁকা ঘরে সবার গড় আয় বসিয়ে দিলো, যাতে ডেটাতে কোনো ফাঁকা না থাকে।

ধাপ ৩: বেসিক EDA

কোড
print(df.groupby('পূর্বে_ডিফল্ট_করেছে')['কাস্টমার_আয়'].mean())
আউটপুট
পূর্বে_ডিফল্ট_করেছে 0 58333.33 1 30466.67 Name: কাস্টমার_আয়, dtype: float64

ব্যাখ্যা: দেখা যাচ্ছে যারা ডিফল্ট করেনি (০) তাদের গড় আয় বেশি, যারা ডিফল্ট করেছে (১) তাদের গড় আয় কম — এটা একটা গুরুত্বপূর্ণ ইনসাইট।

ধাপ ৪: সাধারণ ফিচার তৈরি

কোড
df['আয়_ঋণ_অনুপাত'] = df['কাস্টমার_আয়'] / df['ঋণের_পরিমাণ'] print(df[['কাস্টমার_আয়', 'ঋণের_পরিমাণ', 'আয়_ঋণ_অনুপাত']])
আউটপুট
কাস্টমার_আয় ঋণের_পরিমাণ আয়_ঋণ_অনুপাত 0 25000.000 10000 2.500 1 40000.000 15000 2.667 2 44400.000 20000 2.220 3 60000.000 25000 2.400 4 22000.000 12000 1.833 5 75000.000 30000 2.500

ব্যাখ্যা: নতুন ফিচার "আয়_ঋণ_অনুপাত" — যত বেশি এই অনুপাত, তত কম ঝুঁকি (আয়ের তুলনায় ঋণ কম)। এটা মডেলকে সিদ্ধান্ত নিতে সাহায্য করবে।

ধাপ ৫: সাধারণ মডেল ট্রেইন করা

কোড
from sklearn.linear_model import LogisticRegression X = df[['কাস্টমার_আয়', 'ঋণের_পরিমাণ', 'আয়_ঋণ_অনুপাত']] y = df['পূর্বে_ডিফল্ট_করেছে'] model = LogisticRegression() model.fit(X, y) print("মডেল প্রশিক্ষণ সম্পন্ন!")
আউটপুট
মডেল প্রশিক্ষণ সম্পন্ন!

ধাপ ৬: ফলাফল যাচাই

কোড
accuracy = model.score(X, y) print("ট্রেনিং ডেটায় নির্ভুলতা:", accuracy)
আউটপুট
ট্রেনিং ডেটায় নির্ভুলতা: 1.0

ব্যাখ্যা: ১.০ মানে ১০০% — কিন্তু এত অল্প ডেটাতে (মাত্র ৬ জন) এত ভালো ফলাফল আসল বিশ্বাসযোগ্যতা দেখায় না, এটা শুধু একটা ছোট ডেমো মাত্র।

⚠️ সাধারণ শুরুর ভুল ও Best Practice:
  • Missing Value পূরণ করার আগে বোঝা জরুরি কেন সেটা ফাঁকা ছিলো — সবসময় গড় বসানো সঠিক সমাধান না হতে পারে
  • একই ডেটায় ট্রেইন ও টেস্ট করে "নির্ভুলতা ১০০%" দেখে অতিরিক্ত আত্মবিশ্বাসী হওয়া — বাস্তবে আলাদা Test ডেটা দরকার
  • মাত্র কয়েকটা ডেটাপয়েন্ট দিয়ে বাস্তব সিদ্ধান্ত নেওয়া — বাস্তবে হাজার হাজার রেকর্ড প্রয়োজন
08

সাধারণ শুরুর ভুল

⏱ আলোচনা
❌ অ্যালগরিদম দিয়ে শুরু করা, বিজনেস সমস্যা না বুঝে

✅ সমাধান: সবসময় প্রথমে স্পষ্ট করে বিজনেস প্রশ্নটা লিখে ফেলো, তারপর ডেটা ও অ্যালগরিদমে যাও।

❌ ডেটার মান উপেক্ষা করা

✅ সমাধান: ডেটা কোথা থেকে এসেছে, কতটা নির্ভরযোগ্য তা যাচাই করো প্রথমেই।

❌ EDA স্কিপ করা

✅ সমাধান: মডেলিং-এ যাওয়ার আগে সবসময় গ্রাফ দিয়ে ডেটা দেখে নাও।

❌ দুর্বল Feature Engineering

✅ সমাধান: সময় নিয়ে ভাবো কোন নতুন তথ্য মডেলকে সাহায্য করতে পারে।

❌ Overfitting (শুধু ট্রেনিং ডেটা মুখস্থ করে ফেলা)

✅ সমাধান: সবসময় আলাদা Test ডেটায় মডেল যাচাই করো।

❌ যাচাই ছাড়াই ডিপ্লয় করা

✅ সমাধান: ডিপ্লয়মেন্টের আগে একাধিক মেট্রিক দিয়ে মডেল যাচাই করো।

❌ মডেল Monitoring ভুলে যাওয়া

✅ সমাধান: নিয়মিত পারফরম্যান্স পর্যবেক্ষণ করো এবং প্রয়োজনে রি-ট্রেইন করো।

09

ইন্ডাস্ট্রি বেস্ট প্র্যাকটিস

⏱ আলোচনা

Google, Amazon, Netflix, Uber, Microsoft, OpenAI-এর মতো কোম্পানিগুলো তাদের ডেটা সায়েন্স প্রজেক্ট পরিচালনা করার সময় কিছু গুরুত্বপূর্ণ অনুশীলন মেনে চলে।

📂 Version Control

কোড ও ডেটার প্রতিটা পরিবর্তনের রেকর্ড রাখা, যাতে যেকোনো সময় আগের অবস্থায় ফেরত যাওয়া যায়

🧪 Experiment Tracking

কোন মডেল কোন সেটিংসে কেমন ফলাফল দিয়েছে, তার সব রেকর্ড রাখা

📝 Documentation

প্রতিটা সিদ্ধান্ত ও প্রক্রিয়া লিখে রাখা, যাতে অন্য কেউ পরে বুঝতে পারে

🤝 Team Collaboration

Data Engineer, Data Scientist, ML Engineer একসাথে সমন্বয় করে কাজ করা

📡 Continuous Monitoring

মডেল সবসময় পর্যবেক্ষণে রাখা, যাতে সমস্যা দ্রুত ধরা পড়ে

🔁 Continuous Improvement

নিয়মিত নতুন ডেটা দিয়ে মডেল উন্নত করতে থাকা

এই অনুশীলনগুলো একসাথে মিলিয়ে তৈরি হয় আধুনিক MLOps (Machine Learning Operations) সংস্কৃতি — যা নিশ্চিত করে ডেটা সায়েন্স প্রজেক্টগুলো শুধু একবারের জন্য নয়, দীর্ঘমেয়াদে নির্ভরযোগ্যভাবে কাজ করে।

জনপ্রিয় Lifecycle Framework-গুলোর তুলনা

Frameworkমূল বৈশিষ্ট্যশক্তিদুর্বলতাকখন ব্যবহার করা ভালো
CRISP-DMBusiness Understanding → Data Understanding → Preparation → Modeling → Evaluation → Deploymentবহুল ব্যবহৃত, বিজনেস-কেন্দ্রিক, সহজবোধ্যআধুনিক MLOps/ডিপ্লয়মেন্ট বিস্তারিতভাবে কভার করে নাক্লাসিক বিজনেস ডেটা সায়েন্স প্রজেক্টে
OSEMNObtain → Scrub → Explore → Model → iNterpretটেকনিক্যাল ধাপে সহজ ও মনে রাখার মতোবিজনেস প্রেক্ষাপট কম গুরুত্ব পায়ছোট, প্রযুক্তি-কেন্দ্রিক প্রজেক্টে
TDSP (Microsoft)Business Understanding → Data Acquisition → Modeling → Deployment → Customer Acceptanceটিম-ওয়ার্ক ও প্রজেক্ট ম্যানেজমেন্টে শক্তিশালীছোট টিম বা একক ব্যক্তির প্রজেক্টে কিছুটা ভারী মনে হতে পারেবড় এন্টারপ্রাইজ টিমে
Modern MLOps LifecycleData → Model → CI/CD → Deployment → Monitoring → Retraining (স্বয়ংক্রিয় চক্র)স্বয়ংক্রিয়তা ও দীর্ঘমেয়াদী নির্ভরযোগ্যতায় সেরাশুরুতে সেটআপ করা জটিল ও ব্যয়বহুল হতে পারেপ্রোডাকশন-স্কেল AI সিস্টেমে
🕰️ সংক্ষিপ্ত ইতিহাস

আগে সফটওয়্যার ডেভেলপমেন্ট মূলত নির্দিষ্ট নিয়ম-ভিত্তিক কোড লেখা নিয়ে ছিলো। যখন ডেটা ও ML মডেল ব্যবসায় গুরুত্বপূর্ণ হয়ে উঠলো, তখন বোঝা গেলো শুধু কোড নয়, ডেটা ও মডেলও নিয়মিত পরিবর্তন হয় ও আপডেট প্রয়োজন হয়। এই উপলব্ধি থেকেই সনাতন সফটওয়্যার ডেভেলপমেন্ট (DevOps) থেকে ধীরে ধীরে বিবর্তিত হয়ে জন্ম নেয় আধুনিক MLOps — যেখানে কোড, ডেটা ও মডেল তিনটাই একসাথে পরিচালিত হয়।

10

রিভিশন ও প্রশ্নোত্তর

⏱ শেষ পর্যালোচনা

📌 দ্রুত রিভিশন নোট

  • Data Science Lifecycle: Business Problem → Data Collection → Understanding → Cleaning → EDA → Feature Engineering → Model Selection → Training → Evaluation → Deployment → Monitoring → Improvement
  • এটা একটা সরলরেখা নয়, একটা চক্র — Monitoring থেকে আবার Retraining-এ ফিরে আসে
  • Maturity Levels: No Data Culture → Reporting → Analytics → Predictive Analytics → AI-Driven Organization
  • Framework তুলনা: CRISP-DM (বিজনেস-কেন্দ্রিক), OSEMN (টেকনিক্যাল), TDSP (টিম-কেন্দ্রিক), MLOps (স্বয়ংক্রিয়)

🖼️ সম্পূর্ণ ভিজ্যুয়াল লাইফসাইকেল পোস্টার

Business Problem
Data Collection
Cleaning
EDA
Feature Eng.
Model Train
Evaluate
Deploy
Monitor
Retrain (আবার শুরুতে ফিরে যায়)

এই পোস্টারটা ক্লাসরুমে প্রিন্ট করে দেয়ালে লাগিয়ে রাখতে পারো — পুরো কোর্স জুড়ে এটাই তোমাদের রেফারেন্স ম্যাপ।

❓ ভাইভা প্রশ্ন

১. Data Science Lifecycle-এর প্রথম ধাপ কী?
Business Problem Understanding।
২. Lifecycle-কে "চক্র" বলা হয় কেন?
কারণ Monitoring-এর পর Retraining-এর মাধ্যমে আবার প্রক্রিয়া শুরু হয়।
৩. Maturity Framework-এর সর্বোচ্চ লেভেল কোনটি?
Level 5: AI-Driven Organization।
৪. CRISP-DM কী?
একটা জনপ্রিয় ডেটা সায়েন্স লাইফসাইকেল ফ্রেমওয়ার্ক, যা বিজনেস বোঝার ওপর জোর দেয়।
৫. Model Monitoring কেন প্রয়োজন?
সময়ের সাথে মডেলের পারফরম্যান্স খারাপ হতে পারে, তাই নিয়মিত পর্যবেক্ষণ ও হালনাগাদ দরকার।

💼 ইন্টারভিউ প্রস্তুতি — টপ ৩০টি বিগিনার লেভেল প্রশ্ন

১. Data Science Lifecycle কী?
বিজনেস সমস্যা থেকে শুরু করে পর্যবেক্ষিত ও উন্নয়নশীল সমাধানে পৌঁছানোর একটা কাঠামোবদ্ধ প্রক্রিয়া।
২. Business Problem Understanding কেন প্রথম ধাপ?
সঠিক সমস্যা না বুঝলে পুরো প্রজেক্টই ভুল দিকে চলে যেতে পারে।
৩. Data Cleaning কেন গুরুত্বপূর্ণ?
নোংরা ডেটা দিয়ে বানানো মডেল ভুল ফলাফল দেয় (Garbage In, Garbage Out)।
৪. EDA-এর পূর্ণরূপ কী?
Exploratory Data Analysis।
৫. Feature Engineering কী?
কাঁচা ডেটা থেকে মডেলের জন্য উপযোগী নতুন তথ্য তৈরি করা।
৬. Data Splitting কেন করা হয়?
মডেলকে নতুন, অদেখা ডেটাতে যাচাই করার জন্য।
৭. Hyperparameter Tuning কী?
মডেলের প্রশিক্ষণ-পূর্ব সেটিংস সঠিকভাবে ঠিক করার প্রক্রিয়া।
৮. Model Evaluation-এ কী দেখা হয়?
মডেল টেস্ট ডেটায় কতটা নির্ভুল কাজ করছে তা।
৯. Model Deployment কী?
মডেলকে বাস্তব সিস্টেমে যুক্ত করে ব্যবহারযোগ্য করা।
১০. Monitoring না করলে কী সমস্যা হতে পারে?
মডেল খারাপ পারফর্ম করলেও কেউ টের পাবে না, ফলে ভুল সিদ্ধান্ত চলতে থাকবে।
১১. Data Science Maturity বলতে কী বোঝায়?
একটা কোম্পানি ডেটা ব্যবহারে কতটা উন্নত ও সংগঠিত তার পরিমাপ।
১২. Maturity Level 1 কী?
No Data Culture — অনুমান-ভিত্তিক সিদ্ধান্ত নেওয়া হয়।
১৩. Maturity Level 4 কী?
Predictive Analytics — Machine Learning দিয়ে ভবিষ্যদ্বাণী করা হয়।
১৪. CRISP-DM ও OSEMN-এর মূল পার্থক্য কী?
CRISP-DM বিজনেস-কেন্দ্রিক, OSEMN টেকনিক্যাল ধাপের ওপর বেশি ফোকাস করে।
১৫. TDSP কী?
Microsoft-এর তৈরি একটা টিম-কেন্দ্রিক ডেটা সায়েন্স প্রসেস ফ্রেমওয়ার্ক।
১৬. MLOps কী?
মডেল ডিপ্লয়মেন্ট, মনিটরিং ও রি-ট্রেনিং স্বয়ংক্রিয়ভাবে পরিচালনার অনুশীলন।
১৭. Version Control কেন দরকার?
কোড ও ডেটার পরিবর্তনের রেকর্ড রাখতে, যাতে যেকোনো সময় আগের অবস্থায় ফেরা যায়।
১৮. Experiment Tracking কী?
কোন মডেল কোন সেটিংসে কেমন ফলাফল দিয়েছে তার রেকর্ড রাখা।
১৯. Data Engineer-এর প্রধান দায়িত্ব কী?
ডেটা সংগ্রহ ও পাইপলাইন তৈরি করা।
২০. MLOps Engineer কোন ধাপে কাজ করে?
Deployment, Monitoring ও Retraining ধাপে।
২১. Data Splitting-এ সাধারণত কী অনুপাত ব্যবহার করা হয়?
প্রায়ই ৮০% Training ও ২০% Testing, যদিও এটা প্রজেক্ট অনুযায়ী পরিবর্তিত হতে পারে।
২২. Overfitting কেন হয়?
মডেল ট্রেনিং ডেটা এত বেশি মুখস্থ করে ফেলে যে নতুন ডেটাতে খারাপ ফলাফল দেয়।
২৩. Retraining কেন প্রয়োজন?
সময়ের সাথে ডেটা ও ব্যবসার প্যাটার্ন বদলে যায়, তাই মডেলকেও হালনাগাদ করতে হয়।
২৪. Business Analyst কোন ধাপে কাজ করে?
Business Problem Understanding ধাপে।
২৫. কেন একটা কোম্পানি সরাসরি Level 5-এ যেতে পারে না?
কারণ প্রতিটা স্তরে ডেটা সংস্কৃতি ও অবকাঠামো ধীরে ধীরে গড়ে তুলতে হয়, হঠাৎ লাফ দেওয়া সম্ভব না।
২৬. Modern MLOps Lifecycle-এর বিশেষত্ব কী?
এটা স্বয়ংক্রিয়ভাবে Deployment, Monitoring ও Retraining চালিয়ে যায়।
২৭. Data Understanding ও Data Cleaning-এর পার্থক্য কী?
Understanding হলো ডেটা সম্পর্কে প্রাথমিক ধারণা নেওয়া, Cleaning হলো সেই ডেটার ভুল ঠিক করা।
২৮. একটা প্রজেক্টে সবচেয়ে বেশি সময় সাধারণত কোন ধাপে যায়?
সাধারণত Data Cleaning ও Feature Engineering-এ সবচেয়ে বেশি সময় লাগে।
২৯. Documentation কেন গুরুত্বপূর্ণ?
প্রতিটা সিদ্ধান্ত ও প্রক্রিয়া লিখে রাখলে অন্যরা পরে বুঝতে ও কাজ চালিয়ে যেতে পারে।
৩০. Data Science Lifecycle না মানলে কী ঝুঁকি থাকে?
ভুল ডেটা, ভুল মডেল বা অনিয়ন্ত্রিত ডিপ্লয়মেন্টের কারণে প্রজেক্ট ব্যর্থ হতে পারে।

✅ MCQ প্র্যাকটিস

১. Data Science Lifecycle-এর সঠিক প্রথম ধাপ কোনটি?
(ক) Model Training (খ) Business Problem Understanding (গ) Deployment (ঘ) Monitoring
উত্তর: (খ) Business Problem Understanding
২. কোন Maturity Level-এ Machine Learning ব্যবহার শুরু হয়?
(ক) Level 2 (খ) Level 3 (গ) Level 4 (ঘ) Level 1
উত্তর: (গ) Level 4
৩. CRISP-DM মূলত কোন বিষয়ে জোর দেয়?
(ক) শুধু কোডিং (খ) বিজনেস বোঝা (গ) শুধু ডেটা ক্লিনিং (ঘ) শুধু ডিপ্লয়মেন্ট
উত্তর: (খ) বিজনেস বোঝা
৪. MLOps Engineer প্রধানত কোন ধাপে কাজ করে?
(ক) Business Understanding (খ) Data Collection (গ) Deployment ও Monitoring (ঘ) EDA
উত্তর: (গ) Deployment ও Monitoring
৫. Lifecycle-এর কোন ধাপ আবার শুরুতে ফিরিয়ে নিয়ে যায়?
(ক) Data Collection (খ) Retraining (গ) EDA (ঘ) Feature Engineering
উত্তর: (খ) Retraining

🎯 ক্লাসরুম অ্যাক্টিভিটি সংকলন

অ্যাক্টিভিটি ১ (গ্রুপ আলোচনা): ছোট দলে ভাগ হয়ে একটা কাল্পনিক রেস্টুরেন্টের জন্য Data Science Lifecycle-এর প্রতিটা ধাপ কী হতে পারে তা লিখতে হবে।
অ্যাক্টিভিটি ২ (রোল-প্লে): ৭ জন শিক্ষার্থী একেকজন Business Analyst, Data Engineer, Data Analyst, Data Scientist, ML Engineer, MLOps Engineer, AI Engineer সাজবে এবং একটা প্রজেক্টে নিজের ভূমিকা ব্যাখ্যা করবে।
অ্যাক্টিভিটি ৩ (মিনি কেস স্টাডি): একটা কাল্পনিক কোম্পানিকে Maturity Level 1 থেকে Level 5 পর্যন্ত নিয়ে যাওয়ার জন্য কী কী পদক্ষেপ নিতে হবে তা দলে আলোচনা করে লিখতে হবে।

📝 হোমওয়ার্ক অ্যাসাইনমেন্ট

  1. Data Science Lifecycle-এর ১৩টা ধাপ মুখস্থ করে একটা ফ্লোচার্ট নিজ হাতে এঁকে আনো।
  2. তোমার পরিচিত একটা ব্যবসা বেছে নাও এবং লিখো তারা বর্তমানে কোন Maturity Level-এ আছে বলে তুমি মনে করো, এবং কেন।
  3. CRISP-DM, OSEMN, TDSP ও Modern MLOps Lifecycle-এর মধ্যে যেকোনো দুইটার তুলনা করে ৫টা বাক্যে লেখো কোনটা কখন ব্যবহার করা উচিত।