인문학챕터 5약 6분

사회조사분석사 — 5강: 회귀분석·요인분석·신뢰도

O
OIYO 편집부기여자
5/6

단순 회귀분석

회귀분석 개념:
→ 독립변수(X)로 종속변수(Y) 예측·설명
→ 단순 회귀: 독립변수 1개
→ 다중 회귀: 독립변수 2개 이상

단순 회귀식:
→ Y-hat = b0 + b1*X
→ b0 (절편): X=0일 때 Y의 예측값
→ b1 (회귀 계수): X가 1 증가할 때 Y 변화량
→ 최소 제곱법 (OLS): 잔차 제곱합 최소화

회귀분석 가정 (LINE 가정):
→ 선형성 (Linearity): X와 Y의 선형 관계
→ 독립성 (Independence): 잔차 독립 (Durbin-Watson)
  DW 통계: 2에 가까울수록 독립성 만족
→ 정규성 (Normality): 잔차의 정규분포
  Shapiro-Wilk·Kolmogorov-Smirnov 검정
→ 등분산성 (Equal Variance, Homoscedasticity):
  잔차가 X 전반에서 균일한 분산
  Levene 검정·잔차 산점도 확인

회귀 분석 결과 해석:
→ R2 (결정 계수): 독립변수가 종속변수 변산 설명 비율
  R2 = SSR / SST = 1 - SSE / SST
→ F검정: 회귀 모형 전체 유의성
  F = MSR / MSE
→ t검정: 개별 회귀 계수 유의성
  t = b / SE(b)
→ SPSS 출력:
  모형 요약 (R·R2·조정R2·표준 오차)
  분산분석표 (F·p)
  계수 표 (B·베타·t·p)

표준화 회귀 계수 (베타):
→ 독립변수들 간 상대적 영향력 비교
→ 단위 표준화 후 회귀 계수
→ 베타 절댓값 클수록 종속변수에 큰 영향

다중 회귀분석

다중 회귀:
→ Y-hat = b0 + b1*X1 + b2*X2 + ... + bk*Xk
→ 각 bi: 다른 변수 통제 후 Xi 효과 (부분 회귀 계수)
→ 조정 R2: 독립변수 수가 다를 때 모형 비교

다중공선성 (Multicollinearity):
→ 독립변수 간 강한 선형 관계
→ 문제: 개별 계수 추정 불안정·표준 오차 증가
→ 탐지 방법:
  VIF (분산 팽창 지수): 10 이상이면 문제
  공차 (Tolerance) = 1/VIF: 0.1 이하이면 문제
→ 해결: 변수 제거·주성분 분석·릿지 회귀

더미 변수 (Dummy Variable):
→ 범주형 독립변수를 0·1 이진 변수로 변환
→ k 범주 → k-1개 더미 변수 (참조 집단 설정)
→ 예: 교육 수준 (중졸·고졸·대졸)
  D1=1 (고졸), D2=1 (대졸), 참조=중졸
→ b1: 중졸 대비 고졸의 Y 차이 (다른 변수 통제 후)

변수 선택법:
→ 전진 선택법 (Forward): F통계 기준 변수 추가
→ 후진 제거법 (Backward): F통계 기준 변수 제거
→ 단계적 선택법 (Stepwise): 추가·제거 동시 고려
→ 정보 기준: AIC (낮을수록 좋음)·BIC

상호작용 (Interaction):
→ 한 독립변수 효과가 다른 변수 수준에 따라 다름
→ Y = b0 + b1*X1 + b2*X2 + b3*(X1*X2)
→ b3 유의하면 상호작용 효과 존재
→ SPSS에서 곱 변수 직접 생성 후 포함

로지스틱 회귀분석

로지스틱 회귀 (Logistic Regression):
→ 종속변수가 이분형 (0/1·성공/실패)
→ 확률 p 예측: 0~1 범위
→ 로짓 변환: ln(p/(1-p)) = b0 + b1*X1 + ...
→ 오즈 (Odds): p/(1-p)
→ 오즈비 (Odds Ratio, OR): exp(bi)
  OR=1: 영향 없음 / OR>1: 증가 / OR<1: 감소

로지스틱 회귀 해석:
→ b1=0.5 → OR=exp(0.5)=1.65
  X1 1 증가 → 오즈가 1.65배
→ OR 95% 신뢰구간이 1 포함하면 유의하지 않음
→ SPSS 출력: B·S.E.·Wald·df·Sig·Exp(B)

모형 적합도:
→ -2LL (-2 Log Likelihood): 낮을수록 좋음
→ 호스머-레메쇼 검정:
  p > 0.05 = 모형 적합 (귀무가설: 모형 적합)
→ 분류표: 예측 정확도 (전체 분류 정확도 %)
→ ROC 곡선·AUC: 판별 능력 평가
  AUC = 0.5: 무작위 / AUC = 1.0: 완벽

다항 로지스틱 회귀:
→ 종속변수 3개 이상 범주
→ 참조 집단 대비 각 범주의 로짓 모형
→ SPSS: 분석 → 회귀분석 → 다항 로지스틱

요인분석

요인분석 (Factor Analysis):
→ 여러 변수의 공통 요인 탐색
→ 탐색적 요인분석 (EFA): 요인 구조 탐색
→ 확인적 요인분석 (CFA): 가설 모형 검증

탐색적 요인분석:
→ 추출 방법:
  주성분 분석 (PCA): 전체 분산 설명
  공통 요인 분석: 공통 분산만 설명
→ 회전 방법:
  직교 회전 (Varimax): 요인 간 독립
    각 변수를 1개 요인에 고부하
  사교 회전 (Oblimin·Promax): 요인 간 상관 허용
→ 요인 수 결정:
  고유값 1 이상 기준
  스크리 도표 (Scree Plot): 꺾이는 점
  설명 분산 누적 60% 이상

요인 적재량 (Factor Loading):
→ 변수와 요인 간 상관 정도
→ 기준: 0.4 이상 (0.5 이상 권장)
→ 교차 부하: 한 변수가 여러 요인에 높게 부하
  문제: 변수 제거 또는 재구성 검토
→ 공통성 (Communality): 요인들이 변수 설명 비율

SPSS 요인분석:
→ 분석 → 차원 감소 → 요인 분석
→ 설명된 총분산: 각 요인의 고유값·설명 분산
→ 성분 행렬: 회전 전 요인 적재량
→ 회전된 성분 행렬: 회전 후 요인 적재량 (주로 이것 사용)
→ 요인 점수: 각 케이스의 요인 점수 저장 가능

신뢰도 분석

신뢰도 (Reliability):
→ 측정의 일관성·안정성·정확성
→ 오류 분류:
  체계적 오류: 일관되게 같은 방향 오류 (타당도 문제)
  비체계적 오류: 무작위 오류 (신뢰도 문제)

신뢰도 측정 방법:
→ 검사-재검사 신뢰도: 동일 대상 두 번 측정 상관
  안정계수: 시간 간격 짧으면 높게 나옴 (기억 효과)
→ 동형 검사 신뢰도: 동등한 두 검사 상관
→ 내적 일관성 신뢰도:
  크론바흐 알파 (Cronbach's alpha): 가장 많이 사용
  스피어만-브라운 공식: 반분 신뢰도 교정

크론바흐 알파:
→ 척도 내 문항 간 평균 상관을 기반
→ 범위: 0~1 (1에 가까울수록 높은 신뢰도)
→ 해석 기준:
  0.9 이상: 매우 높음
  0.8~0.9: 좋음
  0.7~0.8: 수용 가능
  0.6~0.7: 보통
  0.6 미만: 낮음 (재검토 필요)
→ 문항 수 많을수록 알파 높아짐
→ SPSS: 분석 → 척도 → 신뢰도 분석
  항목이 삭제된 경우의 알파: 어느 문항 제거 시 알파 향상하는지 확인

타당도 (Validity):
→ 내용 타당도: 전문가 판단 (측정 대상 내용 포괄)
→ 구성 타당도: 이론적 구성 개념 측정 여부
  수렴 타당도: 유사 척도와 높은 상관
  판별 타당도: 다른 척도와 낮은 상관
→ 준거 타당도:
  동시 타당도: 현재 준거와 상관
  예측 타당도: 미래 준거와 상관

자주 묻는 질문

Q. 회귀분석에서 R2가 높으면 좋은 모형인가요? A. R2(결정 계수)가 높을수록 독립변수들이 종속변수 변산을 많이 설명한다는 의미이지만, 높은 R2가 반드시 좋은 모형을 의미하지는 않습니다. 첫째, 과적합(Overfitting) 문제입니다. 독립변수를 무작정 추가하면 R2는 항상 증가하지만, 새 데이터에 대한 예측력은 오히려 낮아질 수 있습니다. 이 때문에 변수 수에 대한 패널티를 포함한 조정 R2(Adjusted R2)를 사용합니다. 둘째, 적합성 검토입니다. R2가 높더라도 회귀 가정(선형성·독립성·정규성·등분산성)을 위반하면 계수가 왜곡됩니다. 잔차 분석을 항상 함께 해야 합니다. 셋째, 분야별 기대치가 다릅니다. 자연과학 실험 데이터는 R2 0.9 이상을 기대하지만, 사회과학 서베이 데이터에서 R2 0.3~0.4이면 충분히 의미 있는 모형입니다. 사회 현상은 측정 오류·복잡한 요인으로 인해 높은 R2가 나오기 어렵습니다.

Q. 요인분석과 주성분 분석(PCA)은 어떻게 다른가요? A. 두 방법은 자주 혼동되지만 목적과 가정이 다릅니다. 주성분 분석(PCA)은 변수 전체의 분산을 설명하는 선형 결합(주성분)을 찾습니다. 정보 손실을 최소화하면서 차원을 축소하는 것이 목적으로, 변수 간 구조보다는 데이터 압축에 초점을 둡니다. 반면 공통 요인 분석은 변수들이 공유하는 공통 분산(공통성)만 설명하는 잠재 요인을 찾습니다. 변수 뒤에 있는 이론적 구성 개념을 탐색하는 것이 목적입니다. 사회조사분석사 시험에서는 두 방법 모두 “요인분석”이라는 큰 틀에서 다루지만, SPSS에서 기본값은 주성분 분석입니다. 실무에서는 척도 개발(잠재 변수 탐색)에는 공통 요인 분석, 단순 차원 축소·데이터 전처리 목적으로는 PCA가 더 적합합니다. 시험에서는 두 방법의 차이(전체 분산 vs 공통 분산)와 고유값 해석이 자주 출제됩니다.

O

OIYO 편집부

편집부

OIYO 편집부는 경제·법률·생활·자기이해 주제를 1차 자료와 공개 통계로 검증해 정리합니다. 모든 글은 출처 표기와 정기 점검을 거쳐 실용성과 정확성을 함께 유지합니다.