컴퓨터과학챕터 6약 3분

Ch6. 클러스터링과 비지도 학습

O
OIYO 편집부기여자
6/8

비지도 학습

레이블(정답) 없이 데이터 자체의 구조와 패턴을 발견.

활용: 고객 세분화, 이상 탐지, 차원 축소, 데이터 압축


K-means 클러스터링

알고리즘:

  1. K개 중심점(centroid) 무작위 초기화
  2. 각 데이터를 가장 가까운 중심점에 할당
  3. 각 클러스터의 평균으로 중심점 재계산
  4. 수렴할 때까지 2~3 반복
K=3:
중심점 초기화 → 데이터 할당 → 중심 재계산 → 할당 → ...

최적 K 선택: 엘보우 방법 (k 증가에 따라 WCSS가 크게 감소하다가 완만해지는 지점)

단점: K 지정 필요, 구형 클러스터 가정, 이상값에 민감


계층적 클러스터링

병합(Agglomerative): 각 데이터를 하나의 클러스터로 시작, 유사한 것끼리 합치는 Bottom-Up.

분리(Divisive): 전체를 하나로 시작, 계속 나누는 Top-Down.

덴드로그램: 클러스터 병합 과정을 시각화한 트리 구조.

         ┌────────────────┐
         │                │
      ┌──┴──┐          ┌──┴──┐
      │     │          │     │
    ┌─┴─┐  C₃        ┌─┴─┐  C₅
    C₁  C₂           C₄  C₆

K를 미리 지정하지 않아도 됨 - 덴드로그램에서 절단 위치로 클러스터 수 결정.


DBSCAN

밀도 기반 클러스터링. 밀집된 영역을 클러스터로, 희소한 영역을 이상값으로 처리.

핵심 개념:

  • 핵심 포인트: 반경 ε 안에 MinPts 이상의 포인트 존재
  • 경계 포인트: 핵심 포인트 이웃이지만 핵심이 아닌 것
  • 잡음 포인트: 어떤 클러스터에도 속하지 않는 이상값

장점: K 지정 불필요, 비구형 클러스터 탐지, 이상값 자동 탐지

DBSCAN vs K-means: 클러스터 수를 모른다면 DBSCAN. 이상값이 많다면 DBSCAN. 구형 클러스터라면 K-means가 빠르고 효율적.


주성분 분석(PCA)

고차원 데이터를 저차원으로 축소하는 차원 축소 기법.

원리: 분산을 최대로 보존하는 새로운 축(주성분)을 찾아 데이터 투영.

원본: 100차원
PCA: 주성분 2~3개로 시각화 가능

설명된 분산 비율: 주성분이 전체 분산 중 몇 %를 설명하는지.

  • 2~3개 주성분으로 85% 이상 설명 가능하면 효과적.

핵심 개념 카드

K-means vs DBSCAN ★★★★★ : K-means=K 지정필요, 구형, 이상값 민감. DBSCAN=K 불필요, 비구형 가능, 이상값 자동탐지.

엘보우 방법 ★★★★☆ : K가 증가할 때 WCSS(클러스터 내 분산) 감소 추세의 꺾이는 지점 = 최적 K.

PCA ★★★★★ : 분산 최대화 방향으로 차원 축소. 고차원 시각화, 다중공선성 해결, 학습 속도 향상에 활용.


실전 퀴즈

Q1. 고객을 구매 패턴에 따라 그룹화하려 한다. 클러스터 수를 미리 모를 때 어떤 알고리즘이 적합한가?

DBSCAN 또는 계층적 클러스터링이 적합합니다. 계층적 클러스터링은 덴드로그램을 통해 클러스터 수를 사후에 결정할 수 있습니다. DBSCAN은 밀도를 기반으로 자동으로 클러스터 수를 결정하고 이상 고객도 자동 탐지합니다.

Q2. 이미지 데이터(28×28=784 픽셀)를 머신러닝 모델에 입력하기 전 PCA를 적용하는 이유는?

784차원을 더 낮은 차원(예: 50~100)으로 축소해 1) 학습 속도 향상 2) 메모리 절약 3) 과적합 방지 4) 차원의 저주 완화. 주성분 50개만으로 원본 분산의 90% 이상을 보존할 수 있다면, 모델 성능 저하 없이 효율성을 크게 높입니다.

O

OIYO 편집부

편집부

OIYO 편집부는 경제·법률·생활·자기이해 주제를 1차 자료와 공개 통계로 검증해 정리합니다. 모든 글은 출처 표기와 정기 점검을 거쳐 실용성과 정확성을 함께 유지합니다.