ডেটা কী?
গল্প দিয়ে শুরু করি
তুমি প্রতিদিন স্কুলে যাও। যাওয়ার সময় তুমি কোন রাস্তা দিয়ে যাও, কতক্ষণ সময় লাগে, কী খাও, কার সাথে কথা বলো — এগুলো সবই একেকটা "ঘটনা"। এখন যদি কেউ এই সব ঘটনাগুলো টুকে রাখে — যেমন "সকাল ৭টায় বের হলো, ২০ মিনিট লাগলো, রুটি খেলো" — তাহলে এই টুকে রাখা জিনিসটাই হলো ডেটা।
ডেটা (Data) মানে হলো কোনো ঘটনা, কাজ বা অবস্থার কাঁচা রেকর্ড বা তথ্য-কণা। এটা সংখ্যা হতে পারে, শব্দ হতে পারে, ছবি হতে পারে, এমনকি শব্দও (audio) হতে পারে।
ডেটা কেন গুরুত্বপূর্ণ?
ধরো, একটা দোকানদার প্রতিদিন কে কী কিনছে তা মনে না রাখলে সে জানতেই পারবে না কোন জিনিস বেশি বিক্রি হয়, কোনটা কম। ডেটা রাখলে দোকানদার বুঝতে পারে — কোন জিনিস আরও আনতে হবে, কোনটা বাদ দিতে হবে। এভাবেই ডেটা আমাদের সিদ্ধান্ত নিতে সাহায্য করে।
Facebook-এ তুমি যখন কোনো পোস্টে লাইক দাও, সেই "লাইক দেওয়া" একটা ডেটা। YouTube-এ ভিডিও দেখার সময় "কতক্ষণ দেখলে" সেটাও ডেটা। এসব ছোট ছোট ডেটা জমা হয়েই কোম্পানিগুলো বোঝে তুমি কী পছন্দ করো।
ডেটা কোথা থেকে আসে?
📱 মোবাইল অ্যাপ
স্টেপ কাউন্ট, লোকেশন, অ্যাপ ব্যবহারের সময়
🛒 অনলাইন শপিং
কী কিনলে, কতবার সার্চ করলে, কার্টে কী রাখলে
🏦 ব্যাংক লেনদেন
টাকা জমা, উত্তোলন, ট্রান্সফারের রেকর্ড
🏥 হাসপাতাল রেকর্ড
রোগীর ইতিহাস, টেস্ট রিপোর্ট, ওষুধ
🎓 পরীক্ষার ফলাফল
নম্বর, উপস্থিতি, বিষয়ভিত্তিক পারফরম্যান্স
📺 YouTube
ভিউ, লাইক, ওয়াচ টাইম, কমেন্ট
ডেটার ধরন: Structured vs Semi-Structured vs Unstructured
সব ডেটা একইভাবে সাজানো থাকে না। এটাকে বোঝার জন্য একটা সহজ উদাহরণ ভাবি — তোমার আলমারি।
যদি তোমার জামাকাপড় খোপ অনুযায়ী সাজানো থাকে (শার্ট এক জায়গায়, প্যান্ট আরেক জায়গায়) — এটা Structured। যদি কিছুটা সাজানো, কিছুটা এলোমেলো থাকে — এটা Semi-Structured। আর যদি সব একসাথে স্তূপ করা থাকে — এটা Unstructured।
| ধরন | ব্যাখ্যা | উদাহরণ |
|---|---|---|
| Structured Data | সারি-কলাম আকারে সুন্দরভাবে সাজানো, যেমন এক্সেল শিট | ব্যাংক অ্যাকাউন্টের টেবিল, রেজাল্ট শিট |
| Semi-Structured Data | কিছুটা নিয়ম মেনে চলে, কিন্তু ফিক্সড টেবিল না | ইমেইল, JSON ফাইল, XML |
| Unstructured Data | কোনো নির্দিষ্ট কাঠামো নেই | ছবি, ভিডিও, অডিও, ফেসবুক পোস্টের লেখা |
Structured / Semi-Structured / Unstructured mix দেখো
নিচের স্লাইডার বদলালে dataset-এর mix chart real-time update হবে।
ভিজ্যুয়ালি বুঝি: রিয়েল লাইফ অ্যাক্টিভিটি থেকে বিজনেস ভ্যালু
ইনফরমেশন কী?
ধরো তোমার কাছে একগাদা সংখ্যা আছে: ৪৫, ৬০, ৭২, ৮৮, ৯০ — এগুলো শুধু সংখ্যা, এখনো তেমন কিছু বোঝা যাচ্ছে না। কিন্তু যদি বলি এগুলো তোমার গত ৫ সপ্তাহের পরীক্ষার নম্বর, তাহলেই বুঝতে পারো — তোমার নম্বর ধীরে ধীরে বাড়ছে। এই "বোঝা যাওয়া" অংশটাই হলো ইনফরমেশন।
অর্থাৎ, কাঁচা ডেটাকে অর্থবহভাবে সাজালে সেটা হয়ে যায় ইনফরমেশন। শুধু ডেটা থাকলেই চলে না, সেটা থেকে অর্থ বের করতে হয়।
Data → Information → Knowledge → Decision
৪৫, ৬০, ৭২, ৮৮, ৯০
নম্বর বাড়ছে
বেশি পড়াশোনা করলে নম্বর বাড়ে
প্রতিদিন ১ ঘণ্টা বেশি পড়বো
| ধাপ | মানে কী | উদাহরণ |
|---|---|---|
| Data | কাঁচা তথ্য-কণা, কোনো অর্থ এখনো স্পষ্ট নয় | একটা দোকানের প্রতিদিনের বিক্রির সংখ্যা |
| Information | ডেটা সাজিয়ে বের করা প্যাটার্ন বা অর্থ | শুক্রবারে বিক্রি সবচেয়ে বেশি হয় |
| Knowledge | কেন এমন হচ্ছে তার বোঝাপড়া | শুক্রবার ছুটির দিন বলে মানুষ বেশি কেনে |
| Decision | বোঝাপড়া থেকে নেওয়া পদক্ষেপ | শুক্রবার আরও বেশি স্টক রাখা হবে |
Data → Information → Knowledge → Decision pipeline নিজে চালাও
একটা কাঁচা ডেটার প্রেক্ষাপট বেছে নাও, সিস্টেম তোমাকে কার্যকর সিদ্ধান্ত সাজেস্ট করবে।
ডেটা সায়েন্স কী?
সংজ্ঞায় যাওয়ার আগে বোঝাপড়া
Netflix-এ তুমি একটা মুভি দেখলে, এরপর আরেকটা একই ধরনের মুভি সাজেস্ট হলো। এটা কীভাবে হলো? Netflix তোমার আগের দেখা, রেটিং, সময়, সার্চ — এই সব ডেটা বিশ্লেষণ করে বুঝেছে তুমি কী পছন্দ করো। এই পুরো প্রক্রিয়াটাই — ডেটা জমা করা, বিশ্লেষণ করা, প্যাটার্ন বের করা, এবং তার ভিত্তিতে ভবিষ্যদ্বাণী করা — এটাই ডেটা সায়েন্স।
সংজ্ঞা: ডেটা সায়েন্স হলো এমন একটা ক্ষেত্র, যেখানে গণিত, পরিসংখ্যান (statistics), প্রোগ্রামিং এবং ডোমেইন জ্ঞান একসাথে ব্যবহার করে কাঁচা ডেটা থেকে অর্থপূর্ণ সিদ্ধান্ত ও ভবিষ্যদ্বাণী বের করা হয়।
কোম্পানিগুলো কেন বিলিয়ন ডলার খরচ করে?
কারণ সঠিক সিদ্ধান্ত মানে সরাসরি লাভ। ভুল সিদ্ধান্ত মানে বিশাল ক্ষতি। ডেটা সায়েন্স অনুমান-ভিত্তিক সিদ্ধান্তকে প্রমাণ-ভিত্তিক সিদ্ধান্তে রূপান্তর করে।
| উদাহরণ | ডেটা সায়েন্স কী করে |
|---|---|
| Netflix | তোমার পছন্দ বুঝে মুভি সাজেস্ট করে |
| Amazon | "এই প্রোডাক্ট কেনা মানুষরা এটাও কিনেছেন" দেখায় |
| Google Search | কোটি কোটি পেজ থেকে সবচেয়ে প্রাসঙ্গিক ফলাফল বাছাই করে |
| Uber / Pathao | রাস্তার চাহিদা বুঝে ভাড়া ঠিক করে (surge pricing) |
| Food Delivery App | কোন খাবার কখন বেশি অর্ডার হবে তা আগে থেকেই বুঝে নেয় |
| হাসপাতাল | রোগীর লক্ষণ বিশ্লেষণ করে রোগ নির্ণয়ে সাহায্য করে |
| ব্যাংক | অস্বাভাবিক লেনদেন দেখে জালিয়াতি (fraud) ধরে ফেলে |
একটু ইতিহাস: ডেটা সায়েন্স কীভাবে এলো?
পরিসংখ্যান (Statistics)
কম্পিউটার সায়েন্স + ডেটাবেজ
Big Data ও ইন্টারনেটের বিস্ফোরণ
Machine Learning ও AI-চালিত ডেটা সায়েন্স
আগে পরিসংখ্যানবিদরা হাতে হিসাব করতেন। কম্পিউটার আসার পর প্রচুর ডেটা জমা করা সম্ভব হলো। ইন্টারনেট আসার পর ডেটার পরিমাণ কোটি কোটি গুণ বেড়ে গেলো (একে বলে Big Data)। আর এখন Machine Learning ও AI ব্যবহার করে এই বিশাল ডেটা থেকে স্বয়ংক্রিয়ভাবে প্যাটার্ন বের করা হচ্ছে।
ডেটা সায়েন্স লাইফসাইকেল
একটা ডেটা সায়েন্স প্রজেক্ট এলোমেলোভাবে হয় না — এটার একটা নির্দিষ্ট ধাপে ধাপে প্রক্রিয়া থাকে। নিচের ফ্লোচার্টে পুরো যাত্রাটা দেখানো হলো।
প্রজেক্ট goal অনুযায়ী lifecycle walkthrough
step button ক্লিক করলে প্রতিটি ধাপে লক্ষ্য, output এবং common mistake দেখাবে।
১. Business Problem — সমস্যা বোঝা
উদ্দেশ্য: কাজ শুরুর আগে বুঝতে হবে আসলে কী সমস্যার সমাধান করতে হবে।
একটা ই-কমার্স কোম্পানি চায় জানতে — কোন কাস্টমার আবার কেনাকাটা করবে না (churn), যাতে তাদের ধরে রাখা যায়।
বিজনেস গুরুত্ব: ভুল সমস্যা বেছে নিলে পুরো প্রজেক্টই মূল্যহীন হয়ে যায়। শুরুর ভুল: নতুনরা প্রায়ই সরাসরি ডেটাতে ঝাঁপিয়ে পড়ে, প্রশ্নটাই ঠিকমতো না বুঝে।
২. Data Collection — ডেটা সংগ্রহ
উদ্দেশ্য: সমস্যা সমাধানের জন্য প্রয়োজনীয় ডেটা জোগাড় করা — যেমন ডেটাবেজ, সার্ভে, ওয়েবসাইট লগ, সেন্সর ইত্যাদি থেকে।
কাস্টমারের কেনাকাটার ইতিহাস, লগইন সময়, কাস্টমার সার্ভিস কল রেকর্ড সংগ্রহ করা।
শুরুর ভুল: অপ্রাসঙ্গিক ডেটা জমা করা, বা প্রয়োজনীয় ডেটা বাদ পড়ে যাওয়া।
৩. Data Cleaning — ডেটা পরিষ্কার করা
উদ্দেশ্য: ডেটাতে থাকা ভুল, ফাঁকা ঘর, ডুপ্লিকেট এন্ট্রি ঠিক করা।
কারো বয়স লেখা আছে "-৫" অথবা কারো ফোন নম্বর ফাঁকা — এগুলো ঠিক বা বাদ দিতে হয়।
বিজনেস গুরুত্ব: নোংরা ডেটা দিয়ে বানানো মডেল সবসময় ভুল ফলাফল দেবে (Garbage In, Garbage Out)। শুরুর ভুল: এই ধাপ স্কিপ করে সরাসরি মডেল বানাতে চাওয়া।
৪. Exploratory Data Analysis (EDA) — ডেটা অন্বেষণ
উদ্দেশ্য: ডেটার ভেতরে লুকিয়ে থাকা প্যাটার্ন, ট্রেন্ড ও অস্বাভাবিকতা খুঁজে বের করা — গ্রাফ ও চার্টের মাধ্যমে।
দেখা গেলো, যেসব কাস্টমার মাসে ১ বারের কম লগইন করে, তারাই বেশি churn করে।
৫. Feature Engineering — উপযোগী উপাদান তৈরি
উদ্দেশ্য: কাঁচা ডেটা থেকে মডেলের জন্য কাজে লাগার মতো নতুন তথ্য তৈরি করা।
"শেষ লগইনের পর কত দিন হয়েছে" — এটা একটা নতুন উপযোগী ফিচার যেটা সরাসরি ডেটাতে ছিলো না, বানিয়ে নিতে হয়েছে।
৬. Model Building — মডেল তৈরি
উদ্দেশ্য: Machine Learning অ্যালগরিদম ব্যবহার করে এমন একটা সিস্টেম বানানো যেটা প্যাটার্ন শিখে ভবিষ্যদ্বাণী করতে পারে।
একটা মডেল শেখানো হলো, যেটা আগের কাস্টমারদের ডেটা দেখে বলতে পারবে নতুন কাস্টমার churn করবে কিনা।
৭. Model Evaluation — মডেল যাচাই
উদ্দেশ্য: মডেল কতটা নির্ভুল, তা পরীক্ষা করা — নতুন ডেটার ওপর প্রয়োগ করে দেখা।
মডেলটা ১০০ জন কাস্টমারের মধ্যে ৮৫ জনের churn সঠিকভাবে ধরতে পেরেছে।
শুরুর ভুল: একই ডেটাতে ট্রেইন ও টেস্ট করা, যা ভুল বিশ্বাস তৈরি করে।
৮. Deployment — বাস্তবে প্রয়োগ
উদ্দেশ্য: মডেলকে বাস্তব অ্যাপ বা সিস্টেমে যুক্ত করা, যাতে প্রতিদিন সত্যিকারের সিদ্ধান্তে ব্যবহার হয়।
churn-prediction মডেলটা কাস্টমার সার্ভিস টিমের ড্যাশবোর্ডে যুক্ত হলো, যাতে তারা ঝুঁকিতে থাকা কাস্টমারকে আগেভাগে অফার পাঠাতে পারে।
৯. Monitoring & Improvement — নজরদারি ও উন্নয়ন
উদ্দেশ্য: সময়ের সাথে সাথে মডেলের পারফরম্যান্স পর্যবেক্ষণ করা এবং প্রয়োজনে পুনরায় শেখানো (retrain)।
৬ মাস পরে কাস্টমারের আচরণ বদলে গেলে, মডেলও নতুন ডেটা দিয়ে আবার প্রশিক্ষণ দিতে হয়।
শুরুর ভুল: মনে করা যে মডেল একবার বানালেই কাজ শেষ — বাস্তবে এটা একটা চলমান প্রক্রিয়া।
ডেটা সায়েন্সের উপাদান
ডেটা সায়েন্স একটা একক বিষয় না — এটা কয়েকটা বিষয়ের সমন্বয়। প্রতিটার নিজস্ব ভূমিকা আছে।
| উপাদান | কেন দরকার |
|---|---|
| গণিত (Mathematics) | ডেটার মধ্যে সম্পর্ক ও প্যাটার্ন বোঝার ভিত্তি তৈরি করে |
| পরিসংখ্যান (Statistics) | ডেটা থেকে বিশ্বাসযোগ্য উপসংহার টানার "ভাষা" — এজন্যই একে ডেটার ভাষা বলা হয় |
| প্রোগ্রামিং (বিশেষত Python) | ডেটা প্রসেস করা, বিশ্লেষণ করা, মডেল বানানো সহজ ও দ্রুত করে — কারণ Python সহজবোধ্য এবং এতে প্রচুর রেডিমেড টুল আছে |
| Machine Learning | ডেটা থেকে নিজে নিজে প্যাটার্ন শিখে ভবিষ্যদ্বাণী করার ক্ষমতা দেয় |
| Data Visualization | সংখ্যার টেবিলের চেয়ে গ্রাফ অনেক দ্রুত গল্প বলে — মানুষ চোখে দেখে বুঝতে পারে সহজে |
| Domain Knowledge | ব্যবসা বা ক্ষেত্র সম্পর্কে জ্ঞান ছাড়া সংখ্যার সঠিক অর্থ বোঝা যায় না |
যদি বলি "বিক্রি জানুয়ারিতে কম, জুনে বেশি, ডিসেম্বরে সর্বোচ্চ" — এটা বুঝতে সময় লাগে। কিন্তু একটা লাইন গ্রাফ দেখলে চোখের পলকেই ট্রেন্ডটা বোঝা যায়।
ডেটা সায়েন্স প্রজেক্টের ধরন
| প্রজেক্ট ধরন | এটা কী করে | উদাহরণ কোম্পানি |
|---|---|---|
| Predictive Analytics | ভবিষ্যতে কী হতে পারে তার আন্দাজ দেয় | ওয়েদার অ্যাপ, বিক্রি পূর্বাভাস |
| Recommendation Systems | ব্যবহারকারীর পছন্দ অনুযায়ী জিনিস সাজেস্ট করে | Netflix, Amazon, Spotify |
| Fraud Detection | অস্বাভাবিক লেনদেন বা কার্যকলাপ ধরে ফেলে | ব্যাংক, পেমেন্ট গেটওয়ে (bKash, Visa) |
| Customer Segmentation | কাস্টমারদের ভিন্ন ভিন্ন গ্রুপে ভাগ করে | মার্কেটিং টিম, ই-কমার্স |
| Forecasting | সময়ের সাথে কী পরিবর্তন হবে তার হিসাব দেয় | স্টক মার্কেট, বিদ্যুৎ চাহিদা |
| NLP (টেক্সট অ্যানালাইসিস) | মানুষের লেখা বা কথা বুঝতে পারে | ChatGPT, গুগল ট্রান্সলেট |
| Computer Vision | ছবি বা ভিডিও দেখে বুঝতে পারে | ফেস আনলক, স্বচালিত গাড়ি |
| Generative AI | নতুন কনটেন্ট তৈরি করে (লেখা, ছবি, কোড) | ChatGPT, Midjourney |
ডেটা সায়েন্স বনাম সম্পর্কিত ক্ষেত্রসমূহ
Data Science vs Data Analytics
| বিষয় | Data Science | Data Analytics |
|---|---|---|
| কাজ | ভবিষ্যদ্বাণী ও মডেল তৈরি | অতীত ডেটা থেকে ব্যাখ্যা বের করা |
| টুলস | Python, ML লাইব্রেরি | Excel, SQL, Power BI |
| ফলাফল | "ভবিষ্যতে কী হবে" | "অতীতে কী হয়েছে" |
Data Science vs Data Engineering
| বিষয় | Data Science | Data Engineering |
|---|---|---|
| কাজ | ডেটা বিশ্লেষণ ও মডেলিং | ডেটা সংগ্রহ ও পাইপলাইন তৈরি |
| ফোকাস | ইনসাইট ও ভবিষ্যদ্বাণী | ডেটা যেন নির্ভরযোগ্যভাবে প্রবাহিত হয় |
Data Science vs Machine Learning
Machine Learning হলো ডেটা সায়েন্সের একটা অংশ বা টুল — পুরো ক্ষেত্রটা না। ডেটা সায়েন্সে ML ছাড়াও ডেটা ক্লিনিং, বিজনেস বোঝা, ভিজুয়ালাইজেশন সবই থাকে।
Data Science vs Artificial Intelligence
AI হলো এমন সিস্টেম বানানো যা মানুষের মতো চিন্তা করতে পারে। ডেটা সায়েন্স সেই সিস্টেম বানাতে ডেটা ব্যবহার করে সাহায্য করে — তাই AI অনেক বড় একটা ছাতা, আর ডেটা সায়েন্স তার একটা গুরুত্বপূর্ণ অংশ।
Scenario দেখে সঠিক discipline বাছো
প্রতিটি case-এর জন্য DA/DS/DE/BI/ML/AI থেকে best-fit role বেছে নাও।
Data Science vs Business Intelligence (BI)
| বিষয় | Data Science | Business Intelligence |
|---|---|---|
| প্রশ্ন | "ভবিষ্যতে কী ঘটবে?" | "এতদিনে কী ঘটেছে?" |
| টুলস | Python, ML মডেল | ড্যাশবোর্ড, রিপোর্ট |
বাস্তব শিল্প-প্রয়োগ
🏥 স্বাস্থ্যসেবা
রোগ প্রাথমিক অবস্থায় শনাক্তকরণ, চিকিৎসার পরামর্শ
🏦 ব্যাংকিং
ঋণ ঝুঁকি বিশ্লেষণ, জালিয়াতি শনাক্তকরণ
🛍️ ই-কমার্স
প্রোডাক্ট সাজেশন, দাম নির্ধারণ
🎓 শিক্ষা
শিক্ষার্থীর দুর্বলতা চিহ্নিত করে ব্যক্তিগতকৃত শিক্ষা
🌾 কৃষি
ফলন পূর্বাভাস, মাটি বিশ্লেষণ
🏭 উৎপাদন শিল্প
মেশিন বিকল হওয়ার আগেই সতর্কতা
🚗 পরিবহন
রুট অপ্টিমাইজেশন, ভাড়া নির্ধারণ
⚽ খেলাধুলা
খেলোয়াড়ের পারফরম্যান্স বিশ্লেষণ
📱 সোশ্যাল মিডিয়া
কনটেন্ট সাজেশন, ভুয়া অ্যাকাউন্ট শনাক্তকরণ
🏛️ সরকার
নীতি প্রণয়ন, জনসংখ্যা পরিকল্পনা
ডেটা সায়েন্স ক্যারিয়ার রোডম্যাপ
| পদবি | মূল দায়িত্ব | প্রয়োজনীয় স্কিল | টুলস |
|---|---|---|---|
| Data Analyst | ডেটা থেকে রিপোর্ট ও ইনসাইট তৈরি | SQL, Excel, বিশ্লেষণী চিন্তা | Excel, Power BI, SQL |
| Business Analyst | ব্যবসার সমস্যা ডেটার মাধ্যমে সমাধান | বিজনেস বোঝা, কমিউনিকেশন | Excel, SQL, PowerPoint |
| Data Scientist | মডেল তৈরি করে ভবিষ্যদ্বাণী | Python, ML, স্ট্যাটিসটিক্স | Python, Scikit-learn, Pandas |
| Machine Learning Engineer | মডেলকে প্রোডাকশনে চালানো | সফটওয়্যার ইঞ্জিনিয়ারিং, ML | Python, TensorFlow, Docker |
| AI Engineer | AI সিস্টেম ডিজাইন ও তৈরি | ML, Deep Learning, সিস্টেম ডিজাইন | PyTorch, LLM API |
| Data Engineer | ডেটা পাইপলাইন তৈরি ও রক্ষণাবেক্ষণ | ডেটাবেজ, ক্লাউড | SQL, Spark, Airflow |
| Research Scientist | নতুন অ্যালগরিদম গবেষণা | উচ্চতর গণিত, গবেষণা দক্ষতা | Python, গবেষণা পেপার |
| MLOps Engineer | মডেল ডিপ্লয় ও মনিটরিং সিস্টেম চালানো | DevOps, ML | Docker, Kubernetes, CI/CD |
সম্পূর্ণ বিজনেস গল্প: একটা অনলাইন শপিং কোম্পানি
ধরো "বাজারমেলা" নামে একটা অনলাইন শপিং কোম্পানি আছে। তাদের বিক্রি কমে যাচ্ছে, তারা চায় বিক্রি বাড়াতে।
বিশ্লেষণে দেখা গেলো, যারা "জুতা" কেনে তারা প্রায়ই "মোজা"ও কেনে। এই প্যাটার্ন থেকে একটা মডেল বানানো হলো, যেটা প্রতিটা কাস্টমারকে দেখিয়ে দেয় তার পছন্দ হতে পারে এমন প্রোডাক্ট। ফলাফলে, ওয়েবসাইটে "আপনার জন্য প্রস্তাবিত" সেকশন যুক্ত হলো — এবং গড় অর্ডার ভ্যালু বেড়ে গেলো।
মিনি Google Colab ডেমো
এখন আমরা সত্যিকারের একটা ছোট ডেটাসেট দিয়ে হাতে-কলমে দেখবো। ধরে নিচ্ছি তুমি কখনো Python লেখোনি — তাই প্রতিটা লাইন ব্যাখ্যা করা হবে।
ধাপ ১: ডেটাসেট লোড করা
কোডলাইন-বাই-লাইন ব্যাখ্যা:
import pandas as pd— pandas নামের একটা টুল আনা হলো, যেটা টেবিল আকারে ডেটা সামলাতে সাহায্য করেdata = {...}— আমরা নিজেরাই একটা ছোট ডেটাসেট বানালাম (নাম, পড়ার সময়, নম্বর)df = pd.DataFrame(data)— এই ডেটাকে একটা সুন্দর টেবিল আকারে রূপান্তর করা হলোprint(df)— টেবিলটা স্ক্রিনে দেখানো হলো
DataFrame বানানোর সময় ভুলে যায় যে এটাকে একটা ভ্যারিয়েবলে (df) রাখতে হয়, নাহলে পরে ব্যবহার করা যায় না।ধাপ ২: কলামগুলো বোঝা
কোডব্যাখ্যা: df.columns আমাদের টেবিলের সব কলামের নাম দেখায় — এখানে আমাদের ৩টা কলাম আছে।
ধাপ ৩: বেসিক পরিসংখ্যান বের করা
কোডব্যাখ্যা: .mean() গড় বের করে, .max() সর্বোচ্চ নম্বর, .min() সর্বনিম্ন নম্বর দেখায়। এখানে গড় নম্বর ৬৮.২৫, সর্বোচ্চ ৯০ (মিতু), সর্বনিম্ন ৪৫ (তানভীর)।
ধাপ ৪: সহজ ভিজ্যুয়ালাইজেশন
কোডব্যাখ্যা: plt.scatter() দুইটা কলামের মধ্যে সম্পর্ক বিন্দু আকারে দেখায়। xlabel, ylabel, title গ্রাফটাকে বোঝার উপযোগী করে তোলে।
আবিষ্কৃত ইনসাইট
গ্রাফ থেকে স্পষ্ট দেখা যাচ্ছে — যারা বেশি সময় পড়াশোনা করেছে তাদের নম্বরও বেশি। এটাই ডেটা সায়েন্সের মূল কাজ — সংখ্যার মধ্যে লুকিয়ে থাকা সম্পর্ক খুঁজে বের করা।
- কলামের নাম ভুল বানানে লেখা (case-sensitive হওয়ায় এরর আসে)
- লাইব্রেরি ইম্পোর্ট না করে সরাসরি ব্যবহার করার চেষ্টা করা
- ছোট ডেটাসেট থেকেই বড় সিদ্ধান্ত নিয়ে ফেলা (এখানে মাত্র ৪ জনের ডেটা, বাস্তবে অনেক বেশি ডেটা লাগে)
সাধারণ ভুল ধারণা ভাঙা
✅ বাস্তবতা: কোডিং একটা টুল মাত্র। বেশিরভাগ সময় যায় বিজনেস সমস্যা বোঝা, ডেটা পরিষ্কার করা ও ফলাফল ব্যাখ্যা করার পেছনে।
✅ বাস্তবতা: ML হলো টুলবক্সের একটা যন্ত্র মাত্র। ডেটা ক্লিনিং, ভিজ্যুয়ালাইজেশন, বিজনেস বোঝাও সমান গুরুত্বপূর্ণ।
✅ বাস্তবতা: শুরুতে বেসিক গণিত ও লজিক্যাল চিন্তা থাকলেই যথেষ্ট। গভীর গণিত পরে ধীরে ধীরে শেখা যায়।
✅ বাস্তবতা: AI একটা বড় ছাতা, ডেটা সায়েন্স তার একটা গুরুত্বপূর্ণ অংশ — কিন্তু পুরোটা নয়।
✅ বাস্তবতা: Python একটা টুল, কিন্তু সমস্যা বোঝা, স্ট্যাটিসটিক্স ও ডোমেইন জ্ঞান ছাড়া Python দিয়ে কিছুই অর্থবহ হয় না।
✅ বাস্তবতা: ডেটার পরিমাণের চেয়ে গুণগত মান (quality) বেশি গুরুত্বপূর্ণ। নোংরা বা ভুল ডেটা বেশি থাকলে ফলাফল আরও খারাপ হতে পারে।
রিভিশন ও প্রশ্নোত্তর
📌 দ্রুত রিভিশন নোট
- ডেটা = কাঁচা তথ্য-কণা, ইনফরমেশন = অর্থবহ প্যাটার্ন
- Data → Information → Knowledge → Decision — এই ৪ ধাপ মনে রাখো
- ডেটা সায়েন্স = গণিত + স্ট্যাটিসটিক্স + প্রোগ্রামিং + ডোমেইন জ্ঞান
- লাইফসাইকেল: Business Problem → Collection → Cleaning → EDA → Feature Engineering → Model → Evaluation → Deployment → Monitoring
- ML হলো AI-এর একটা অংশ, আর ডেটা সায়েন্সের একটা টুল
🌍 দৈনন্দিন জীবনে ডেটা সায়েন্স — ২০টি উদাহরণ
- YouTube-এর ভিডিও সাজেশন
- Facebook নিউজফিড সাজানো
- Google Maps-এর দ্রুততম রাস্তা
- মোবাইলের কিবোর্ড শব্দ প্রেডিকশন
- Netflix মুভি সাজেশন
- Spotify গান সাজেশন
- ই-মেইলের স্প্যাম ফিল্টার
- বাংক অ্যাপে জালিয়াতি সতর্কতা
- অনলাইন শপিং প্রাইস ড্রপ অ্যালার্ট
- ফেস আনলক ফিচার
- রাইড শেয়ারিং অ্যাপের ভাড়া হিসাব
- ওয়েদার অ্যাপের পূর্বাভাস
- ফুড ডেলিভারি সময় হিসাব
- ভয়েস অ্যাসিস্ট্যান্ট (Siri, Google Assistant)
- অনলাইন বিজ্ঞাপন টার্গেটিং
- হেলথ অ্যাপের স্টেপ কাউন্ট বিশ্লেষণ
- অটোকারেক্ট ফিচার
- ব্যাংক লোন অনুমোদন সিস্টেম
- ই-কমার্সের "একসাথে কেনা হয়" সাজেশন
- নিউজ অ্যাপের ব্যক্তিগতকৃত খবর
❓ ভাইভা প্রশ্ন
💼 ইন্টারভিউ প্রস্তুতি — টপ ৩০টি বিগিনার লেভেল প্রশ্ন
✅ MCQ প্র্যাকটিস
(ক) এক্সেল শিট (খ) ছবি (গ) ব্যাংক টেবিল (ঘ) SQL টেবিল
(ক) Extra Data Analysis (খ) Exploratory Data Analysis (গ) Extended Data Algorithm (ঘ) Efficient Data Access
(ক) Fraud Detection (খ) Recommendation System (গ) Data Engineering (ঘ) BI Reporting
(ক) Mathematics (খ) Statistics (গ) Advertising (ঘ) Programming
(ক) Storage (খ) Decision (গ) Cleaning (ঘ) Collection
🎯 ক্লাসরুম অ্যাক্টিভিটি সংকলন
📝 হোমওয়ার্ক অ্যাসাইনমেন্ট
- তোমার পরিচিত যেকোনো একটা ব্যবসা (দোকান, রেস্টুরেন্ট, স্কুল) বেছে নাও এবং লিখো — সেখানে ডেটা সায়েন্স কীভাবে সাহায্য করতে পারে।
- আজকের ক্লাসে শেখা Data Science Lifecycle-এর ৯টা ধাপ মুখস্থ করে একটা ফ্লোচার্ট নিজে হাতে এঁকে আনো।
- ৫টা দৈনন্দিন উদাহরণ খুঁজে বের করো (আজকের তালিকার বাইরে থেকে) যেখানে তুমি নিজে ডেটা সায়েন্সের প্রভাব অনুভব করেছ।