컴퓨터과학챕터 2약 3분

Ch2. 탐색적 데이터 분석(EDA)과 데이터 전처리

O
OIYO 편집부기여자
2/8

탐색적 데이터 분석(EDA)

EDA(Exploratory Data Analysis): 분석 전에 데이터를 이해하기 위한 탐색 과정.

기술통계

지표설명
평균(Mean)합계/개수. 이상값에 민감
중앙값(Median)정렬 후 중간값. 이상값에 강건
최빈값(Mode)가장 많이 나타나는 값
표준편차(Std)평균으로부터의 평균 거리
분위수(Quantile)Q1(25%), Q2(50%), Q3(75%)

분포 형태

왜도(Skewness):

  • 왼쪽 꼬리(음수 왜도): 평균 < 중앙값
  • 오른쪽 꼬리(양수 왜도): 평균 > 중앙값

첨도(Kurtosis): 분포의 뾰족한 정도. 정규분포=3


결측값(Missing Values) 처리

원인: 데이터 수집 오류, 응답 거부, 시스템 오류

처리 방법:

방법설명적합한 경우
제거(Deletion)결측 행/열 삭제결측 비율 낮을 때(5% 미만)
평균/중앙값 대체수치형 변수에 적용왜도 없는 정규 분포
최빈값 대체범주형 변수에 적용카테고리 불균형 없을 때
예측 모델다른 변수로 예측결측이 중요 변수일 때

MCAR/MAR/MNAR: 결측 메커니즘에 따라 처리 방법이 달라집니다. 완전 무작위 결측(MCAR)은 단순 제거 가능, 비무작위 결측(MNAR)은 패턴 분석 필요.


이상값(Outlier) 탐지

IQR 방법

Q1 - 1.5×IQR ~ Q3 + 1.5×IQR 범위 밖 = 이상값
IQR = Q3 - Q1

Z-점수 방법

|Z| > 3인 값 = 이상값
Z = (x - 평균) / 표준편차

처리 방법: 제거, 대체(경계값), 변환(로그 변환), 별도 모델링


데이터 변환

정규화 vs 표준화

Min-Max 정규화:

x' = (x - min) / (max - min)
결과: 0 ~ 1 범위

Z-score 표준화:

x' = (x - 평균) / 표준편차
결과: 평균=0, 표준편차=1

로그 변환: 오른쪽 꼬리 분포를 정규 분포에 가깝게

인코딩

원-핫 인코딩(One-Hot Encoding):

색상: [빨강, 파랑, 초록]
→ 빨강: [1, 0, 0]
   파랑: [0, 1, 0]
   초록: [0, 0, 1]

레이블 인코딩:

[빨강→0, 파랑→1, 초록→2]
순서 없는 카테고리에는 부적절

상관관계 분석

피어슨 상관계수(r): 선형 관계 측정, -1 ~ +1

범위해석
0.7~1.0강한 양의 상관
0.3~0.7중간 양의 상관
-0.3~0.3약한 상관
-0.7~-0.3중간 음의 상관
-1.0~-0.7강한 음의 상관

핵심 개념 카드

평균 vs 중앙값 ★★★★★ : 이상값 있으면 중앙값이 더 대표값. 연봉 중앙값이 연봉 평균보다 실제 분포를 잘 반영.

결측값 처리 ★★★★★ : 결측 비율 5% 미만=제거, 이상=대체·예측. 수치형=평균/중앙값, 범주형=최빈값.

정규화 vs 표준화 ★★★★★ : Min-Max=0~1 스케일, Z-score=평균0 표준편차1. 이상값 있으면 Z-score 유리.


실전 퀴즈

Q1. 연봉 데이터에 억대 연봉자가 소수 포함된 경우, 일반 직원 연봉 수준을 대표하는 지표는?

중앙값(Median)이 더 적합합니다. 극단적인 고연봉자(이상값)가 평균을 끌어올려 실제 대부분 직원의 연봉 수준을 왜곡합니다. 중앙값은 이상값의 영향을 받지 않아 일반 직원의 연봉 수준을 더 잘 대표합니다.

Q2. 머신러닝 모델 학습 전 수치형 특성에 정규화가 필요한 이유는?

특성들의 스케일이 다르면(예: 나이 0~100, 연봉 0~10억) 스케일이 큰 특성이 모델에 과도한 영향을 미칩니다. KNN, SVM, 신경망 등의 거리 기반·경사하강법 기반 알고리즘은 특성 스케일에 민감합니다. 정규화/표준화로 모든 특성을 같은 스케일로 맞추면 학습이 안정적으로 됩니다.

O

OIYO 편집부

편집부

OIYO 편집부는 경제·법률·생활·자기이해 주제를 1차 자료와 공개 통계로 검증해 정리합니다. 모든 글은 출처 표기와 정기 점검을 거쳐 실용성과 정확성을 함께 유지합니다.