آموزش پایتون
دیتاستی که میتونید ازش استفاده کنید. روز 18_
بر اساس فایل sales_raw.csv، جواب چالش به این شکل میشود:
🐍 Day 18 — Data Cleaning & Data Preparation Result
📂 Dataset Analysis
ابتدا فایل sales_raw.csv با استفاده از Pandas خوانده شد.
import pandas as pd
df = pd.read_csv("sales_raw.csv")
Dataset Size:
Original rows: 15,150
Columns: 9
🔍 Data Quality Check
1. Missing Values
بررسی مقادیر خالی:
Region: 2510
Price: 23
2. Duplicate Rows
تعداد ردیفهای تکراری:
Duplicate rows: 150
3. Data Type Check
قبل از پاکسازی:
Date object
Price float64
Quantity int64
Revenue int64
ستون Date نیاز به تبدیل به فرمت استاندارد تاریخ داشت.
🧹 Data Cleaning Process
حذف دادههای تکراری:
df = df.drop_duplicates()
نتیجه:
Removed duplicates: 150 rows
تبدیل تاریخ:
df["Date"] = pd.to_datetime(
df["Date"],
errors="coerce"
)
تاریخهای نامعتبر:
Invalid dates: 10
حذف رکوردهای ناقص:
رکوردهایی که اطلاعات ضروری مثل:
Price
Region
Date
را نداشتند حذف شدند.
ساخت ستون Revenue:
df["Revenue"] = df["Quantity"] * df["Price"]
✅ Final Result
قبل از پاکسازی:
Rows: 15,150
بعد از پاکسازی:
Clean rows: 12,482
Missing values:
0
Duplicate rows:
0
💡 Key Learning
داده خام همیشه قابل استفاده برای Machine Learning نیست.
قبل از ساخت هر مدل AI باید:
Collect → Clean → Prepare → Train
را انجام دهیم.
یک مدل قوی با داده ضعیف نمیتواند نتیجه خوبی بدهد.
#Pandas #DataCleaning #DataScience #MachineLearning
https://eitaa.com/learnpythonicy