통계학챕터 4약 3분

상관관계와 회귀분석: 관계의 과학

O
Oiyo기여자
4/10

상관관계와 회귀분석: 데이터의 연결고리

데이터는 혼자 존재하지 않습니다. 키와 몸무게, 교육 수준과 소득, 기온과 아이스크림 판매량처럼 서로 영향을 주고받는 경우가 많습니다. 통계학은 이 ‘관계’를 수치화하고 미래를 예측하는 데 활용합니다.

상관관계 vs 회귀분석 — 개념 비교
구분상관관계 (Correlation)회귀분석 (Regression)
질문두 변수가 관련이 있는가?하나의 변수로 다른 변수를 예측할 수 있는가?
결과물상관계수 r (-1 ~ +1)회귀방정식 y = ax + b
방향성없음 (X↔Y 동등)있음 (X → Y, 독립변수 → 종속변수)
활용 예시키와 몸무게의 관련성 측정공부시간으로 시험점수 예측

1. 상관관계의 수치화 — 피어슨 상관계수 (rr)

두 변수가 함께 변하는 정도를 나타냅니다. 상관계수 rr은 -1에서 +1 사이의 값을 가집니다.

r=(xixˉ)(yiyˉ)(xixˉ)2(yiyˉ)2r = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum (x_i - \bar{x})^2 \cdot \sum (y_i - \bar{y})^2}}
상관계수(r)의 해석 기준
r 값 범위관계의 방향강도 해석사례
r ≈ +1.0양의 상관완전 양의 상관측정 오차 없는 물리 실험
+0.7 ~ +0.9양의 상관강한 양의 상관학습시간 → 성적
+0.3 ~ +0.7양의 상관중간 수준소득 → 주택 규모
−0.1 ~ +0.1없음거의 무상관신발 사이즈 → 지능
−0.3 ~ −0.7음의 상관중간 수준실업률 → 소비 지출
r ≈ −1.0음의 상관완전 음의 상관결근율 → 생산성

2. 단순 선형 회귀분석 (Simple Linear Regression)

상관관계가 단순히 “관련이 있다”를 보여준다면, 회귀분석은 “얼마나 관련이 있고, 미래를 어떻게 예측하는가”를 보여줍니다.

y^=β^0+β^1x\hat{y} = \hat{\beta}_0 + \hat{\beta}_1 x

최소자승법(OLS: Ordinary Least Squares)을 사용하여 잔차(Residuals)의 제곱합을 최소화하는 계수를 추정합니다.

공부 시간과 시험 점수의 관계 — 회귀 예시
공부 시간 (x)실제 점수 (y)예측 점수 (ŷ)잔차 (y−ŷ)
2시간55점58점−3점
5시간75점73점+2점
8시간92점88점+4점
10시간95점98점−3점

3. 회귀모델의 성능 평가: R2R^2 (결정계수)

R2=1(yiy^i)2(yiyˉ)2=회귀로 설명된 분산전체 분산R^2 = 1 - \frac{\sum (y_i - \hat{y}_i)^2}{\sum (y_i - \bar{y})^2} = \frac{\text{회귀로 설명된 분산}}{\text{전체 분산}}

R2R^2는 0에서 1 사이의 값으로, 회귀모델이 데이터 변동의 몇 %를 설명하는지 나타냅니다.

R² 값의 해석 가이드
R² 범위설명력활용 분야판단 기준
0.9 이상매우 높음 (90%+)물리·공학 실험뛰어난 모델
0.7 ~ 0.9높음경제학 계량 모델우수한 모델
0.5 ~ 0.7중간사회과학 연구수용 가능
0.3 ~ 0.5낮음심리학·마케팅참고 수준
0.3 미만매우 낮음복잡 시스템개선 필요

4. 회귀분석의 한계와 주의사항

회귀분석 사용 시 주의해야 할 함정
함정내용탐지 방법
다중공선성독립변수들이 서로 강하게 상관됨 → 계수 추정 불안정VIF(분산팽창지수) 확인
이분산성잔차의 분산이 일정하지 않음잔차 산점도 확인
자기상관시계열 데이터에서 잔차가 독립적이지 않음Durbin-Watson 검정
과적합훈련 데이터에만 잘 맞고 새 데이터 예측 실패교차검증(Cross-Validation)
외삽의 오류데이터 범위 밖의 예측은 신뢰 불가예측 구간(Prediction Interval) 명시
O

Oiyo

편집부

OIYO 편집부는 경제·법률·생활·자기이해 주제를 1차 자료와 공개 통계로 검증해 정리합니다. 모든 글은 출처 표기와 정기 점검을 거쳐 실용성과 정확성을 함께 유지합니다.