본문 바로가기

TIL/데이터 분석

데이터 전처리 실습

1. iris 데이터셋을 활용해서 전처리를 해보자

import pandas as pd
import numpy as np
import matplotlib.pyplot as plt
import seaborn as sns

# iris 데이터 불러오기
iris_data = sns.load_dataset('iris')
iris_data

# 'species' 열 값이 'setosa'인 데이터 선택하기
# loc(): 레이블(이름)을 이용하여 선택
# df.loc[2, 'column_name'] -> column_name이라는 열의 인덱스가 2인 것을 출력
species_setosa = iris_data.loc[iris_data['species'] == 'setosa']
species_setosa

# 10부터 20까지의 행과 1부터 3까지의 열 선택하기
# 정수를 이용하여 선택
# df.iloc[2,3] -> 2번째 행과 3번째 열을 출력
subset = iris_data.iloc[10:21, 1:4]
subset

 

2. tips 데이터셋을 활용해서 전처리를 해보자

# tips 데이터 불러오기
tips_data = sns.load_dataset('tips')
tips_data

# total_bill이 30 이상인 데이터만 선택하기
total = tips_data.loc[tips_data['total_bill'] >= 30]
total

# 성별('sex')을 기준으로 데이터 그룹화하여 팁(tip)의 평균 계산
# groupby('그룹화를 하고 싶은 기준')['원하는 값'].연산()
group_sex = tips_data.groupby('sex')['tip'].mean()
group_sex

# 'day'와 'time'을 기준으로 데이터 그룹화하여 전체 지불 금액(total_bill)의 합 계산
group_dt = tips_data.groupby(['day', 'time'])['total_bill'].sum()
group_dt

group_mean = tips_data.groupby('day')['tip'].mean().reset_index()
df = pd.DataFrame(group_mean)

merge_date = pd.merge(tips_data, group_mean, on='day', how='left')
merge_date

'TIL > 데이터 분석' 카테고리의 다른 글

데이터 전처리  (0) 2024.01.25
데이터 분석 종합반 3주차  (0) 2023.12.21
데이터 분석 종합반 1주차 + 2주차  (0) 2023.12.18