Python challenge️
#چالش_پایتون_در_هوش_مصنوعی
🧠 قسمت ۱۰: پاکسازی و آمادهسازی دادهها 🧹
سلام دوستان! 👋
دادههای دنیای واقعی همیشه مرتب نیستن! 😅
گاهی دادهها ناقص، تکراری یا اشتباه هستن. برای همین قبل از تحلیل یا یادگیری ماشین، باید دادهها رو پاکسازی و آمادهسازی کنیم.
---
۱. شناسایی دادههای گمشده (NaN)
import pandas as pd
import numpy as np
data = {
"نام": ["علی", "سارا", "نیما", "رضا"],
"نمره": [18, np.nan, 15, 20]
}
df = pd.DataFrame(data)
print(df)
print(df.isnull()) # نمایش مقادیر گمشده
---
۲. حذف دادههای ناقص
df_clean = df.dropna() # حذف سطرهایی که مقدار گمشده دارن
print(df_clean)
---
۳. جایگزین کردن دادههای گمشده
df["نمره"].fillna(df["نمره"].mean(), inplace=True) # جایگزینی با میانگین
print(df)
---
۴. حذف دادههای تکراری
df = pd.DataFrame({
"نام": ["علی", "سارا", "علی"],
"نمره": [18, 19, 18]
})
print("قبل از حذف:\n", df)
df = df.drop_duplicates()
print("بعد از حذف:\n", df)
---
۵. تغییر نام ستونها
df.rename(columns={"نام": "Name", "نمره": "Score"}, inplace=True)
print(df)
---
۶. پروژه کوچک
پاکسازی دادههای ناقص و محاسبه معدل:
data = {
"نام": ["علی", "سارا", "نیما", "رضا"],
"ریاضی": [18, np.nan, 15, 20],
"فیزیک": [17, 19, np.nan, 18]
}
df = pd.DataFrame(data)
# پر کردن مقادیر گمشده با میانگین هر ستون
df = df.fillna(df.mean(numeric_only=True))
# محاسبه معدل
df["معدل"] = df[["ریاضی", "فیزیک"]].mean(axis=1)
print(df)
📌 خروجی نمونه:
نام ریاضی فیزیک معدل
0 علی 18.0 17.0 17.5
1 سارا 17.7 19.0 18.3
2 نیما 15.0 18.0 16.5
3 رضا 20.0 18.0 19.0
---
👀 قسمت بعدی: تجسم دادهها با Matplotlib 🎨
🗂 مرکز آموزش پایتون
➖➖➖➖➖➖➖➖
@pythonchallenge
7 · 488 ·