컴퓨터과학챕터 6약 4분

Ch6. 모델 평가와 최적화 — 좋은 AI 모델은 어떻게 만드는가

O
OIYO 편집부기여자
6/8

왜 정확도만으로 부족한가

암 진단 모델을 만든다고 합시다. 전체 데이터에서 암 환자가 1%라면, 모든 사람을 “정상”으로 예측하는 모델도 **정확도 99%**입니다. 하지만 이 모델은 쓸모가 없습니다.

실전에서는 다양한 지표를 함께 사용해야 합니다.


분류 모델 평가 지표

혼동 행렬 (Confusion Matrix)

예측: 양성예측: 음성
실제: 양성TP (진양성)FN (위음성)
실제: 음성FP (위양성)TN (진음성)
  • TP: 암 환자를 암이라 예측 (정답)
  • FN: 암 환자를 정상이라 예측 (위험한 오류)
  • FP: 정상인을 암이라 예측 (불필요한 추가 검사)
  • TN: 정상인을 정상이라 예측 (정답)

주요 지표

정밀도(Precision) = TP / (TP + FP)

  • “양성이라 예측한 것 중 실제 양성의 비율”
  • 스팸 필터: 정밀도가 높아야 → 정상 메일을 스팸으로 잘못 분류하면 안됨

재현율(Recall) = TP / (TP + FN)

  • “실제 양성 중 모델이 양성으로 잡아낸 비율”
  • 암 진단: 재현율이 높아야 → 암 환자를 놓치면 안됨

F1 점수 = 2 × (Precision × Recall) / (Precision + Recall)

  • 정밀도와 재현율의 조화평균. 두 지표의 균형

Precision vs Recall 트레이드오프: 임계값을 높이면 정밀도↑ 재현율↓, 낮추면 정밀도↓ 재현율↑. 상황에 따라 어느 것을 우선할지 결정해야 합니다. 암 진단: 재현율 우선. 스팸 필터: 정밀도 우선.

ROC-AUC

  • ROC 곡선: 임계값을 변화시키며 TPR(재현율) vs FPR을 그린 곡선
  • AUC: 곡선 아래 면적. 1에 가까울수록 좋음. 0.5 = 무작위
  • 클래스 불균형이 있을 때도 신뢰할 수 있는 지표

회귀 모델 평가 지표

MAE(평균절대오차): 예측값과 실제값 차이의 절댓값 평균 MSE(평균제곱오차): 차이의 제곱 평균 (이상치에 민감) RMSE: MSE의 제곱근 (원래 단위와 같음) R²(결정계수): 1에 가까울수록 모델이 분산을 잘 설명


교차 검증 (Cross-Validation)

단순히 데이터를 훈련/테스트로 나누면 분할 방식에 따라 성능이 달라집니다.

K-Fold 교차검증:

  1. 데이터를 K개 폴드로 나눔 (보통 K=5 또는 10)
  2. 각 폴드를 한 번씩 테스트 세트로 사용
  3. K번 학습·평가 후 평균 성능을 최종 지표로 사용

장점: 모든 데이터가 한 번씩 테스트에 사용, 안정적인 성능 추정


하이퍼파라미터 튜닝

모델 파라미터(학습으로 결정): 가중치, 편향 하이퍼파라미터(사람이 설정): 학습률, 배치 크기, 층 수, 노드 수, 드롭아웃 비율

주요 탐색 방법

그리드 서치(Grid Search): 모든 조합 시도. 완전하지만 비효율적

랜덤 서치(Random Search): 무작위 조합 시도. 그리드보다 효율적, 고차원에서 유리

베이지안 최적화: 이전 결과를 바탕으로 다음 탐색 위치를 스마트하게 결정. 가장 효율적

AutoML: 하이퍼파라미터 탐색을 자동화하는 도구 (Google AutoML, H2O AutoML)


학습 곡선 해석

# 에폭별 훈련/검증 손실 플롯
plt.plot(train_loss, label='Train Loss')
plt.plot(val_loss, label='Validation Loss')
패턴진단해결책
두 손실 모두 높고 비슷과소적합더 복잡한 모델, 더 많은 특성
훈련↓ 검증↑ (갭 큼)과적합드롭아웃, L2 정규화, 더 많은 데이터
두 손실 모두 낮고 비슷이상적배포 준비 완료

핵심 개념 카드

Precision vs Recall ★★★★★ : Precision=내가 맞다고 한 것 중 실제 맞는 비율, Recall=실제 맞는 것 중 내가 맞다고 한 비율. 도메인에 따라 어느 것을 우선할지 달라짐.

K-Fold 교차검증 ★★★★☆ : 데이터를 K개로 나눠 K번 훈련·평가 후 평균. 안정적인 성능 추정의 표준 방법.

학습 곡선 ★★★★★ : 에폭별 훈련/검증 손실 추적. 과적합·과소적합을 시각적으로 진단하는 가장 중요한 도구.


실전 퀴즈

Q1. 재현율은 높지만 정밀도가 낮은 암 진단 모델의 문제점은?

재현율이 높다는 것은 암 환자를 거의 놓치지 않는다는 것이고, 정밀도가 낮다는 것은 암이 아닌 사람을 암이라고 많이 예측한다는 것입니다. 이 경우 불필요한 추가 검사, 환자의 심리적 충격, 의료비 낭비가 발생합니다. 따라서 정밀도도 적절히 높여야 임상적으로 유용한 모델이 됩니다.

Q2. 10-Fold 교차검증이 단순 train/test 분할보다 신뢰할 수 있는 이유는?

단순 분할은 어떻게 나누느냐에 따라 성능이 크게 달라질 수 있습니다. 10-Fold는 전체 데이터를 10번 다르게 분할해 모든 샘플이 한 번씩 테스트에 사용되며, 10개의 성능 추정치를 평균화하므로 분할 방식의 운에 의한 편향이 줄어들고 더 안정적인 성능 추정이 가능합니다.

O

OIYO 편집부

편집부

OIYO 편집부는 경제·법률·생활·자기이해 주제를 1차 자료와 공개 통계로 검증해 정리합니다. 모든 글은 출처 표기와 정기 점검을 거쳐 실용성과 정확성을 함께 유지합니다.