Ch4. 머신러닝 분류 알고리즘 — 로지스틱 회귀부터 랜덤 포레스트까지
분류(Classification)란?
입력 특성(X)으로 미리 정의된 카테고리(Y) 중 하나를 예측하는 지도학습.
예: 이메일 → 스팸/정상, 환자 데이터 → 암/정상, 이미지 → 고양이/개
주요 분류 알고리즘
로지스틱 회귀 (Logistic Regression)
선형 회귀를 이진 분류에 적용. 시그모이드 함수로 0~1 확률 출력.
P(Y=1|X) = 1 / (1 + e^(-z))
z = β₀ + β₁X₁ + β₂X₂ + ...
특징: 해석 용이, 빠름, 선형 경계만 학습.
결정 트리 (Decision Tree)
질문-대답 방식으로 데이터 분할. 직관적이고 해석 가능.
나이 < 30?
├─ 예: 소득 > 3000만원?
│ ├─ 예: 구매(Yes)
│ └─ 아니오: 비구매(No)
└─ 아니오: 구매(Yes)
지니 불순도: 분할 기준. 0에 가까울수록 순수한 노드.
랜덤 포레스트 (Random Forest)
다수의 결정 트리 앙상블. 배깅(Bagging) 방식.
훈련 데이터 → [트리 1, 트리 2, ..., 트리 N]
각 트리가 예측 → 다수결 투표 → 최종 예측
특징: 과적합 저항, 특성 중요도 제공, 높은 정확도.
앙상블의 힘: 혼자 틀리는 것은 있어도, 여러 다양한 모델이 동시에 같은 방향으로 틀릴 가능성은 낮습니다. 랜덤 포레스트가 단일 결정 트리보다 우수한 이유입니다.
SVM (Support Vector Machine)
클래스 간 마진을 최대화하는 초평면을 찾는 알고리즘.
커널 트릭: 비선형 데이터를 고차원으로 변환해 선형 분리 가능하게 함.
| 커널 | 특징 |
|---|---|
| 선형 | 선형 분리 가능한 데이터 |
| RBF(가우시안) | 범용, 비선형 |
| 다항식 | 다항식 경계 |
나이브 베이즈 (Naive Bayes)
베이즈 정리 + 특성 독립 가정.
P(Y|X) ∝ P(Y) × P(X₁|Y) × P(X₂|Y) × ...
특징: 매우 빠름, 텍스트 분류(스팸)에 탁월.
알고리즘 비교
| 알고리즘 | 장점 | 단점 | 적합한 경우 |
|---|---|---|---|
| 로지스틱 회귀 | 빠름, 해석 용이 | 선형 경계 | 선형 분리 가능 |
| 결정 트리 | 직관적, 해석 가능 | 과적합 | 해석 중요 |
| 랜덤 포레스트 | 강건, 정확 | 블랙박스 | 범용 |
| SVM | 고차원 효과적 | 느림, 확률 미제공 | 중소규모 |
| 나이브 베이즈 | 매우 빠름 | 독립 가정 | 텍스트 분류 |
핵심 개념 카드
랜덤 포레스트 ★★★★★ : 결정 트리의 앙상블. 배깅+무작위 특성 선택. 과적합 강건, 특성 중요도 제공.
SVM 커널 트릭 ★★★★☆ : 비선형 데이터를 고차원으로 투영해 선형 분리. RBF 커널이 가장 범용적.
앙상블 방법 ★★★★★ : 배깅(병렬, 분산 감소)=랜덤 포레스트, 부스팅(순차, 편향 감소)=XGBoost/LightGBM.
실전 퀴즈
Q1. 신용카드 사기 탐지 모델에서 랜덤 포레스트가 로지스틱 회귀보다 적합한 경우는?
사기 패턴이 비선형적이고 복잡한 상호작용이 있을 때 랜덤 포레스트가 유리합니다. 로지스틱 회귀는 선형 경계만 학습하므로 복잡한 패턴을 놓칩니다. 단, 로지스틱 회귀는 해석 가능성이 높아 규제 준수가 필요한 금융 환경에서 선호될 수 있습니다.
Q2. 이메일 스팸 필터에 나이브 베이즈가 자주 사용되는 이유는?
- 매우 빠른 학습과 예측. 2) 텍스트의 단어 빈도를 특성으로 쓸 때 효과적. 3) 적은 학습 데이터로도 잘 작동. 4) 해석 가능(어떤 단어가 스팸 확률을 높이는지 파악 가능). 단어 독립 가정이 실제로는 맞지 않지만 실용적으로 좋은 성능을 냅니다.
OIYO 편집부
편집부OIYO 편집부는 경제·법률·생활·자기이해 주제를 1차 자료와 공개 통계로 검증해 정리합니다. 모든 글은 출처 표기와 정기 점검을 거쳐 실용성과 정확성을 함께 유지합니다.