사회조사분석사 — 4강: 자료 분석과 통계 검정
기술통계
기술통계 (Descriptive Statistics):
→ 수집된 자료의 특성을 요약·기술
→ 모든 분석의 첫 단계
중심경향치:
→ 평균 (Mean): 전체 합 / 사례 수
이상치에 민감·등간·비율 척도
가중 평균: 빈도·중요도 고려
→ 중앙값 (Median): 순서 나열 시 가운데 값
이상치 영향 없음·순서 척도 이상
짝수 사례: 중간 두 값 평균
→ 최빈값 (Mode): 가장 자주 나타나는 값
명목 척도 이상·복수 가능
→ 왜도 (Skewness):
정적 편포 (+): 평균 > 중앙값·오른쪽 꼬리
부적 편포 (-): 평균 < 중앙값·왼쪽 꼬리
분산도:
→ 범위 (Range): 최댓값 - 최솟값 (이상치 영향)
→ 사분위 범위 (IQR): Q3 - Q1 (이상치 영향 없음)
→ 분산 (Variance): 편차 제곱 합 / n-1 (표본 분산)
→ 표준편차 (SD): 분산의 제곱근·원래 단위
→ 변이계수 (CV): SD / 평균 × 100%
단위 다른 집단 변동성 비교
분포 형태:
→ 정규분포: 종 모양·대칭
68-95-99.7 규칙: 평균 ± 1σ·2σ·3σ
→ 왜도·첨도 (Kurtosis): 분포 형태 수치화
→ z-점수: (X - 평균) / SD → 표준화
정규분포에서 확률 계산
교차표 (Crosstabulation):
→ 두 범주형 변수의 빈도 동시 표시
→ 행·열 주변 합계·전체 합계
→ 퍼센트: 행 퍼센트·열 퍼센트·전체 퍼센트
→ SPSS 분석: 분석 → 기술통계 → 교차분석
그래프와 시각화:
→ 막대 그래프: 범주형 변수 빈도
→ 히스토그램: 연속 변수 빈도 분포
→ 상자 그림 (Box Plot): 5수요약·이상치 식별
→ 산점도 (Scatter Plot): 두 연속 변수 관계
추론통계 기초
추론통계 (Inferential Statistics):
→ 표본 통계량으로 모집단 모수를 추정·검정
→ 전제: 표본이 모집단을 대표
표집분포 (Sampling Distribution):
→ 같은 모집단에서 반복 추출한 표본 통계량의 분포
→ 표본 평균의 표집분포:
평균: 모집단 평균 (= 모평균)
표준오차 (SE) = σ / sqrt(n)
표본 크기 클수록 SE 감소
중심극한정리 (Central Limit Theorem):
→ 모집단 분포와 관계없이 표본 크기 충분 크면 (n ≥ 30)
표본 평균의 표집분포가 정규분포에 가까워짐
→ 추론 통계의 핵심 근거
신뢰구간 (Confidence Interval):
→ 모수가 포함될 것으로 신뢰하는 구간
→ 해석: "이 방법으로 신뢰구간을 반복 계산하면
그 중 95%가 모수를 포함한다"
→ 95% CI: 표본 평균 ± 1.96 × SE
→ 신뢰수준 높을수록 구간 넓어짐
→ 표본 크기 클수록 구간 좁아짐
신뢰구간의 오해:
→ 틀린 해석: "모수가 이 구간에 있을 확률 95%"
(모수는 고정된 값·확률 있는 게 아님)
→ 올바른 해석: "이 방법으로 만든 구간이 모수를 포함할 확률 95%"
가설 검정
가설 검정 절차:
① 가설 설정:
귀무가설 (H0): 차이 없음·효과 없음·관계 없음
대립가설 (H1): 차이 있음·효과 있음·관계 있음
② 유의수준 (α) 설정: 보통 0.05 (5%)
③ 검정 통계량 계산
④ p값 계산 또는 기각역 설정
⑤ 결론: H0 기각 여부
검정 오류:
→ 1종 오류 (Type I Error):
H0 참인데 기각 (잘못된 양성·거짓 발견)
확률 = α (유의수준)
→ 2종 오류 (Type II Error):
H0 거짓인데 기각 실패 (잘못된 음성·놓친 발견)
확률 = β
→ 검정력 (Power) = 1 - β:
H0 거짓일 때 올바르게 기각하는 확률
→ 트레이드오프: α 낮추면 β 증가
p값 해석:
→ p값: 귀무가설 참이라는 가정 하에 관측된 통계량
이상의 극단적 결과가 나올 확률
→ p < 0.05: 유의수준 5%에서 통계적으로 유의
→ p값 오해:
틀린 해석: "H0이 참일 확률이 5%"
틀린 해석: "효과가 없을 확률이 5%"
올바른 해석: "H0 하에서 이런 결과가 우연히 나올 확률이 5%"
통계적 유의성 vs 실질적 의미:
→ n이 크면 작은 차이도 유의해질 수 있음
→ 효과 크기 (Cohen's d·r·eta²): 실질적 의미
Cohen's d:
d = (M1 - M2) / 합동 SD
소(0.2)·중(0.5)·대(0.8) 기준
평균 검정과 분산분석
단일 표본 t검정:
→ 표본 평균이 특정 모집단 평균과 다른가?
→ H0: mu = mu0
→ t = (x-bar - mu0) / (s / sqrt(n))
→ 자유도 = n - 1
독립 표본 t검정:
→ 두 독립 집단의 평균 차이 검정
→ H0: mu1 = mu2
→ Levene 검정: 등분산 가정 검정
등분산: 풀드 t검정 / 이분산: Welch t검정
→ SPSS: 분석 → 평균 비교 → 독립 표본 t검정
대응 표본 t검정 (Paired t-test):
→ 동일 집단의 사전-사후 측정 비교
→ 개인 차이 제거 → 검정력 높음
→ H0: mu_d = 0 (차이 평균 = 0)
→ SPSS: 분석 → 평균 비교 → 대응 표본 t검정
일원 분산분석 (One-way ANOVA):
→ 세 개 이상 집단의 평균 비교
→ H0: mu1 = mu2 = ... = muk (모든 집단 평균 같음)
→ F비 = 집단 간 분산 / 집단 내 분산 (MSB / MSW)
F가 클수록 집단 간 차이 큼
→ 유의하면 사후 검정 (Post-hoc Test):
Tukey HSD·Scheffe·Bonferroni
어느 쌍의 집단이 다른지 특정
이원 분산분석 (Two-way ANOVA):
→ 두 독립변수의 주효과 + 상호작용 효과
→ 상호작용 효과: 한 변수 효과가 다른 변수 수준에 따라 달라짐
→ 프로파일 플롯으로 시각화
공분산분석 (ANCOVA):
→ 공변량 통제 후 집단 평균 비교
→ 사전 측정값 통제 → 순수 처치 효과
비모수 검정:
→ 정규분포 가정 위반 시 대안
→ 맨-위트니 U: 독립 표본 t 대안
→ 윌콕슨 부호순위 검정: 대응 표본 t 대안
→ 크루스칼-왈리스: 일원 ANOVA 대안
범주형 자료 분석
카이제곱 검정 (Chi-square Test):
→ 범주형 변수 간 관련성·적합도 검정
카이제곱 독립성 검정:
→ 두 범주형 변수가 서로 독립인가?
→ H0: 두 변수는 독립 (관련성 없음)
→ 기대 빈도 Eij = (행 합계 × 열 합계) / 전체 합계
→ chi2 = sum( (O - E)^2 / E )
→ 자유도 = (r-1)(c-1)
→ 조건: 기대 빈도 ≥ 5 (위반 시 피셔 정확 검정)
연관성 측도:
→ Phi 계수: 2×2 교차표·-1~1
→ Cramer's V: 2×2 이상·0~1 (강도만)
→ 람다: 비대칭 연관성 예측력
카이제곱 적합도 검정:
→ 관측 빈도가 기대(이론) 분포와 다른가?
→ 주사위 공정성·분포 형태 검정
상관분석:
→ 피어슨 상관계수 (r):
두 연속 변수 선형 관계 강도·방향
-1 ~ +1 범위
r = 0.2 약·0.5 중·0.7 강 (일반 기준)
결정계수 r²: 설명 분산 비율
→ 스피어만 순위 상관: 순서 척도·비선형
SPSS 활용 요약:
→ 기술통계: 분석 → 기술통계량
→ 신뢰도 분석: 분석 → 척도 → 신뢰도 분석 (Cronbach's α)
→ 상관분석: 분석 → 상관분석 → 이변량 상관
→ t검정: 분석 → 평균 비교
→ 분산분석: 분석 → 평균 비교 → 일원배치 분산분석
→ 카이제곱: 분석 → 기술통계 → 교차분석 (통계량에서 카이제곱)
→ 회귀분석: 분석 → 회귀분석 → 선형
자주 묻는 질문
Q. 통계적으로 유의미하다는 것과 실질적으로 중요하다는 것은 왜 다른가요? A. 통계적 유의성(p < 0.05)은 관찰된 차이가 우연일 가능성이 낮다는 것을 의미하지만, 그 차이가 실제로 얼마나 큰지(중요한지)는 말해주지 않습니다. 표본 크기가 매우 크면 사소한 차이도 통계적으로 유의해집니다. 예를 들어 n = 100,000인 연구에서 두 교수법의 시험 점수 차이가 0.5점이라도 p < 0.001이 나올 수 있습니다. 그러나 0.5점 차이는 교육 실천을 바꿀 만한 실질적 의미가 없습니다. 이 때문에 현대 통계학에서는 p값과 함께 효과 크기(Cohen’s d, eta-squared, r 등)와 신뢰구간을 함께 보고하도록 권고합니다. APA는 2010년부터 효과 크기 보고를 강력히 권장합니다.
Q. 사회조사분석사 시험에서 통계 계산 문제를 푸는 가장 효율적인 방법은 무엇인가요? A. 핵심 공식과 적용 판단 기준을 숙지하는 것이 먼저입니다. 시험에서 자주 나오는 계산은 평균·분산·표준편차, t검정 통계량, 카이제곱 기대 빈도, 신뢰구간 공식입니다. 각 검정의 사용 조건(척도 수준, 집단 수, 독립/대응)을 표로 정리해두면 어떤 검정을 써야 하는지 빠르게 판단할 수 있습니다. 계산 실수를 줄이기 위해서는 공식을 단계별로 나눠 쓰는 연습이 중요합니다. 특히 분산분석의 F비 계산은 분산분해표(Sum of Squares, Mean Square)를 빠짐없이 기록하는 습관이 필요합니다. SPSS 출력 해석 문제는 출력물 형식에 익숙해지는 것이 핵심이며, 특히 t검정과 ANOVA 출력표의 F·t·p값·자유도 위치를 알아야 합니다.
OIYO 편집부
편집부OIYO 편집부는 경제·법률·생활·자기이해 주제를 1차 자료와 공개 통계로 검증해 정리합니다. 모든 글은 출처 표기와 정기 점검을 거쳐 실용성과 정확성을 함께 유지합니다.