Ch6. 모델 평가와 최적화 — 좋은 AI 모델은 어떻게 만드는가
왜 정확도만으로 부족한가
암 진단 모델을 만든다고 합시다. 전체 데이터에서 암 환자가 1%라면, 모든 사람을 “정상”으로 예측하는 모델도 **정확도 99%**입니다. 하지만 이 모델은 쓸모가 없습니다.
실전에서는 다양한 지표를 함께 사용해야 합니다.
분류 모델 평가 지표
혼동 행렬 (Confusion Matrix)
| 예측: 양성 | 예측: 음성 | |
|---|---|---|
| 실제: 양성 | TP (진양성) | FN (위음성) |
| 실제: 음성 | FP (위양성) | TN (진음성) |
- TP: 암 환자를 암이라 예측 (정답)
- FN: 암 환자를 정상이라 예측 (위험한 오류)
- FP: 정상인을 암이라 예측 (불필요한 추가 검사)
- TN: 정상인을 정상이라 예측 (정답)
주요 지표
정밀도(Precision) = TP / (TP + FP)
- “양성이라 예측한 것 중 실제 양성의 비율”
- 스팸 필터: 정밀도가 높아야 → 정상 메일을 스팸으로 잘못 분류하면 안됨
재현율(Recall) = TP / (TP + FN)
- “실제 양성 중 모델이 양성으로 잡아낸 비율”
- 암 진단: 재현율이 높아야 → 암 환자를 놓치면 안됨
F1 점수 = 2 × (Precision × Recall) / (Precision + Recall)
- 정밀도와 재현율의 조화평균. 두 지표의 균형
Precision vs Recall 트레이드오프: 임계값을 높이면 정밀도↑ 재현율↓, 낮추면 정밀도↓ 재현율↑. 상황에 따라 어느 것을 우선할지 결정해야 합니다. 암 진단: 재현율 우선. 스팸 필터: 정밀도 우선.
ROC-AUC
- ROC 곡선: 임계값을 변화시키며 TPR(재현율) vs FPR을 그린 곡선
- AUC: 곡선 아래 면적. 1에 가까울수록 좋음. 0.5 = 무작위
- 클래스 불균형이 있을 때도 신뢰할 수 있는 지표
회귀 모델 평가 지표
MAE(평균절대오차): 예측값과 실제값 차이의 절댓값 평균 MSE(평균제곱오차): 차이의 제곱 평균 (이상치에 민감) RMSE: MSE의 제곱근 (원래 단위와 같음) R²(결정계수): 1에 가까울수록 모델이 분산을 잘 설명
교차 검증 (Cross-Validation)
단순히 데이터를 훈련/테스트로 나누면 분할 방식에 따라 성능이 달라집니다.
K-Fold 교차검증:
- 데이터를 K개 폴드로 나눔 (보통 K=5 또는 10)
- 각 폴드를 한 번씩 테스트 세트로 사용
- K번 학습·평가 후 평균 성능을 최종 지표로 사용
장점: 모든 데이터가 한 번씩 테스트에 사용, 안정적인 성능 추정
하이퍼파라미터 튜닝
모델 파라미터(학습으로 결정): 가중치, 편향 하이퍼파라미터(사람이 설정): 학습률, 배치 크기, 층 수, 노드 수, 드롭아웃 비율
주요 탐색 방법
그리드 서치(Grid Search): 모든 조합 시도. 완전하지만 비효율적
랜덤 서치(Random Search): 무작위 조합 시도. 그리드보다 효율적, 고차원에서 유리
베이지안 최적화: 이전 결과를 바탕으로 다음 탐색 위치를 스마트하게 결정. 가장 효율적
AutoML: 하이퍼파라미터 탐색을 자동화하는 도구 (Google AutoML, H2O AutoML)
학습 곡선 해석
# 에폭별 훈련/검증 손실 플롯
plt.plot(train_loss, label='Train Loss')
plt.plot(val_loss, label='Validation Loss')
| 패턴 | 진단 | 해결책 |
|---|---|---|
| 두 손실 모두 높고 비슷 | 과소적합 | 더 복잡한 모델, 더 많은 특성 |
| 훈련↓ 검증↑ (갭 큼) | 과적합 | 드롭아웃, L2 정규화, 더 많은 데이터 |
| 두 손실 모두 낮고 비슷 | 이상적 | 배포 준비 완료 |
핵심 개념 카드
Precision vs Recall ★★★★★ : Precision=내가 맞다고 한 것 중 실제 맞는 비율, Recall=실제 맞는 것 중 내가 맞다고 한 비율. 도메인에 따라 어느 것을 우선할지 달라짐.
K-Fold 교차검증 ★★★★☆ : 데이터를 K개로 나눠 K번 훈련·평가 후 평균. 안정적인 성능 추정의 표준 방법.
학습 곡선 ★★★★★ : 에폭별 훈련/검증 손실 추적. 과적합·과소적합을 시각적으로 진단하는 가장 중요한 도구.
실전 퀴즈
Q1. 재현율은 높지만 정밀도가 낮은 암 진단 모델의 문제점은?
재현율이 높다는 것은 암 환자를 거의 놓치지 않는다는 것이고, 정밀도가 낮다는 것은 암이 아닌 사람을 암이라고 많이 예측한다는 것입니다. 이 경우 불필요한 추가 검사, 환자의 심리적 충격, 의료비 낭비가 발생합니다. 따라서 정밀도도 적절히 높여야 임상적으로 유용한 모델이 됩니다.
Q2. 10-Fold 교차검증이 단순 train/test 분할보다 신뢰할 수 있는 이유는?
단순 분할은 어떻게 나누느냐에 따라 성능이 크게 달라질 수 있습니다. 10-Fold는 전체 데이터를 10번 다르게 분할해 모든 샘플이 한 번씩 테스트에 사용되며, 10개의 성능 추정치를 평균화하므로 분할 방식의 운에 의한 편향이 줄어들고 더 안정적인 성능 추정이 가능합니다.
OIYO 편집부
편집부OIYO 편집부는 경제·법률·생활·자기이해 주제를 1차 자료와 공개 통계로 검증해 정리합니다. 모든 글은 출처 표기와 정기 점검을 거쳐 실용성과 정확성을 함께 유지합니다.