컴퓨터과학챕터 3약 3분

Ch3. 통계학 기초 — 가설검정과 확률분포

O
OIYO 편집부기여자
3/8

확률 분포

연속형 분포

정규 분포(Normal Distribution):

  • 평균 중심의 종 모양
  • 68-95-99.7 규칙: 평균±1σ 68%, ±2σ 95%, ±3σ 99.7%
  • 많은 통계 검정의 기반

t-분포: 표본이 작을 때(n<30) 정규 분포 대신 사용. 꼬리가 두꺼움.

카이제곱 분포: 범주형 데이터 분석, 적합도 검정에 사용.

이산형 분포

이항 분포: n번 시행 중 k번 성공 확률. 동전 던지기.

포아송 분포: 일정 시간/공간에서 사건 발생 횟수. 1시간 동안 고객 수.


가설 검정 (Hypothesis Testing)

절차

  1. 귀무가설(H₀) 설정: “차이 없음”, “효과 없음”
  2. 대립가설(H₁) 설정: 입증하고자 하는 가설
  3. 유의수준(α) 결정: 보통 0.05
  4. 검정통계량 계산
  5. p값 계산
  6. 결론: p값 < α → 귀무가설 기각

p값 해석: “귀무가설이 참일 때 이 결과 이상의 극단값이 나올 확률”. p < 0.05이면 “우연으로 설명하기 어렵다” → 귀무가설 기각. p값이 작을수록 결과가 통계적으로 유의미합니다.

주요 오류

H₀ 참H₀ 거짓
H₀ 채택정상2종 오류(β)
H₀ 기각1종 오류(α)정상
  • 1종 오류(α, 유의수준): 실제로 없는 효과를 있다고 판단
  • 2종 오류(β): 실제 효과를 놓침

주요 검정 방법

t-검정

수치형 데이터의 평균 비교.

유형사용
단일 표본표본 평균 vs 기준값
독립 표본두 독립 집단 평균 비교
대응 표본같은 대상 전후 비교

ANOVA (분산분석)

세 집단 이상의 평균 비교.

F = 집단 간 분산 / 집단 내 분산
F값이 클수록 집단 간 차이가 큼

카이제곱 검정

범주형 변수 간 독립성 검정.

예: 성별과 구매 여부가 독립적인가?
   남성 구매: 60%, 여성 구매: 45% → 차이 통계적으로 유의미한가?

상관분석과 인과관계

상관관계 ≠ 인과관계

아이스크림 판매량과 익사 사고 수는 강한 양의 상관관계. 하지만 아이스크림이 익사를 유발하지 않습니다. 혼재변수(기온) 때문입니다.


핵심 개념 카드

p값 ★★★★★ : p < α(보통 0.05) → 귀무가설 기각 → 통계적으로 유의미. p값은 “귀무가설 하에서의 결과 확률”.

1종/2종 오류 ★★★★★ : 1종=없는 효과 있다고 판단(α, 유의수준), 2종=있는 효과 놓침(β). 의료에서 1종=과잉진단, 2종=미진단.

t검정 vs ANOVA vs 카이제곱 ★★★★★ : t=수치형 2집단 평균 비교, ANOVA=수치형 3집단 이상, 카이제곱=범주형 독립성.


실전 퀴즈

Q1. 새 약품이 혈압을 낮추는 효과가 있는지 검정한다. p값 = 0.03이면 결론은?

p=0.03 < α=0.05이므로 귀무가설(약품 효과 없음)을 기각합니다. 통계적으로 유의미한 혈압 감소 효과가 있다고 결론냅니다. 단, 통계적 유의성이 임상적 유의성(실제로 중요한 수준의 변화인지)을 보장하지는 않습니다.

Q2. 세 지역(서울/부산/대구)에서 마케팅 캠페인의 효과를 비교하려면 어떤 검정을 사용하는가?

일원 ANOVA(One-way ANOVA)를 사용합니다. 세 집단 이상의 평균을 동시에 비교할 때 ANOVA가 적합합니다. t검정을 반복하면 1종 오류가 누적됩니다. ANOVA가 유의미하면 어느 집단 간 차이인지 알기 위해 사후 검정(Tukey, Bonferroni)을 실시합니다.

O

OIYO 편집부

편집부

OIYO 편집부는 경제·법률·생활·자기이해 주제를 1차 자료와 공개 통계로 검증해 정리합니다. 모든 글은 출처 표기와 정기 점검을 거쳐 실용성과 정확성을 함께 유지합니다.