표본분포와 중심극한정리 — 표본으로 모집단을 추론하는 원리
모집단과 표본
모집단(Population): 연구 대상이 되는 전체 집합
표본(Sample): 모집단의 일부를 선택한 것
왜 표본을 사용하는가?
- 모집단 전수 조사는 비용·시간상 불가능
- 표본으로 모집단 특성을 추론(inference)
모수(Parameter): 모집단의 특성값 (μ, σ)
통계량(Statistic): 표본에서 계산한 값 (x̄, s)
표본 추출 방법
| 방법 | 설명 |
|---|---|
| 단순 무작위 추출 | 모든 개체 동등한 선택 확률 |
| 층화 추출 | 층(계층) 나눠 각 층에서 추출 |
| 군집 추출 | 군집 일부를 무작위로 고른 뒤 선택 군집의 전부 또는 일부를 조사. 내부에서 다시 표본을 뽑으면 다단계 추출 |
| 계통 추출 | 첫 개체 무작위 선택 후 일정 간격으로 추출 |
표본평균의 분포
같은 모집단에서 크기 n인 표본을 반복해서 추출할 때, 표본평균 x̄는 분포를 가집니다.
- 모집단: μ, σ²이라 할 때
표본평균의 E(x̄)=μ, Var(x̄)=σ²/n 모집단이 정규분포면 x̄ ~ N(μ, σ²/n) 그 밖에는 중심극한정리의 조건 아래 n이 커질수록 정규근사
- 기댓값: E(x̄) = μ
- 분산: Var(x̄) = σ²/n
- 표준오차: SE = σ/√n
핵심: 표본 크기 n이 커질수록 표본평균의 변동(표준오차)이 작아짐.
중심극한정리 (Central Limit Theorem, CLT)
통계학에서 가장 중요한 정리.
독립적으로 같은 분포에서 뽑은 관측값이 유한한 평균과 분산을 가질 때, 표본 크기가 커질수록 표본평균의 표준화 분포는 정규분포에 근사한다.
의미: 모집단이 정규분포가 아니어도 조건이 맞고 표본이 충분히 크면 표본평균을 정규분포로 근사할 수 있습니다. n≥30은 보편 정리가 아니라 흔히 쓰는 경험칙입니다. 모집단의 왜도·두꺼운 꼬리·이상치와 표본의 독립성에 따라 필요한 표본 크기가 달라지며, 모집단 자체가 정규분포라면 표본평균은 표본 크기와 관계없이 정규분포입니다.
표준오차 (Standard Error, SE)
표준편차 vs 표준오차:
- 표준편차: 개별 데이터의 변동성
- 표준오차: 표본평균의 변동성 (정확도)
n이 4배가 되면 표준오차는 절반으로 줄어듦.
직접 실험해보기
모집단 비율과 표본 크기를 바꿔가며 표본 추정치가 어떻게 흔들리는지 직접 확인해 보세요.
표본 비율의 분포
CLT에 의해 n이 크면 p̂는 정규분포에 근사.
핵심 개념 카드
중심극한정리(CLT) ★★★★★
: 독립·동일분포와 유한분산 등의 조건에서 n이 커질수록 표본평균의 표준화 분포가 정규분포에 근사. n≥30은 고정 법칙이 아님.
암기 포인트: 조건 확인 → n이 커질수록 표본평균의 정규근사 개선
표준오차(SE) ★★★★★ : 표본평균의 표준편차. SE = σ/√n. n이 클수록 SE 작아짐 → 추정 정확도 향상. 암기 포인트: SE = σ/√n, n 4배 → SE 절반
모수 vs 통계량 ★★★★☆ : 모수(μ, σ)는 고정된 모집단 값. 통계량(x̄, s)은 표본마다 달라지는 추정값. 암기 포인트: 모수=모집단, 통계량=표본
실전 퀴즈
Q. 표준편차 15인 모집단에서 n=225인 표본의 표준오차는?
SE = 15/√225 = 15/15 = 1. 표본평균의 변동이 표준편차 1 수준으로 줄어듦.
Q. 모집단이 오른쪽 편포를 가진다. n=50인 표본평균의 분포는?
중심극한정리에 의해 n=50이면 모집단 분포에 무관하게 표본평균의 분포는 정규분포에 근사. 기댓값 = 모평균, 표준편차 = 모표준편차/√50.
OIYO 편집부
편집부OIYO 편집부는 경제·법률·생활·자기이해 주제를 1차 자료와 공개 통계로 검증해 정리합니다. 모든 글은 출처 표기와 정기 점검을 거쳐 실용성과 정확성을 함께 유지합니다.