컴퓨터과학챕터 3약 3분

Ch3. 딥러닝 기초 — 신경망의 구조와 작동 원리

O
OIYO 편집부기여자
3/8

딥러닝이란?

**딥러닝(Deep Learning)**은 여러 층(Layer)의 인공신경망을 사용해 데이터에서 계층적인 특성을 자동으로 학습하는 머신러닝의 하위 분야입니다.

“딥(Deep)“은 신경망의 층 수를 의미합니다. 전통적 ML이 사람이 수동으로 특성(Feature)을 추출했다면, 딥러닝은 원시 데이터에서 특성을 자동으로 학습합니다.


인공신경망의 구조

입력층 → [은닉층 1] → [은닉층 2] → ... → [은닉층 N] → 출력층
(Input)   (Hidden)                            (Hidden)    (Output)

뉴런(Neuron)의 작동 원리

  1. 이전 층의 출력값들을 **가중치(Weight)**와 곱해 합산
  2. **편향(Bias)**을 더함
  3. **활성화 함수(Activation Function)**를 통과시켜 비선형성 추가
출력 = 활성화함수(∑(가중치 × 입력) + 편향)

주요 활성화 함수

함수수식특징주요 사용처
Sigmoid1/(1+e⁻ˣ)출력 0~1, 기울기 소실 문제이진 분류 출력층
Tanh(eˣ-e⁻ˣ)/(eˣ+e⁻ˣ)출력 -1~1, Sigmoid보다 강건RNN 은닉층
ReLUmax(0, x)계산 빠름, 기울기 소실 감소대부분의 은닉층 표준
Leaky ReLUmax(0.01x, x)음수 영역 기울기 보존ReLU 대체재
Softmaxeˣⁱ/∑eˣʲ합이 1인 확률 분포다중 분류 출력층

ReLU가 표준이 된 이유: Sigmoid/Tanh는 입력이 크면 기울기가 0에 수렴(기울기 소실)해 깊은 네트워크 학습이 어렵습니다. ReLU는 양수 영역에서 기울기가 1로 유지되어 깊은 네트워크에서도 학습이 가능합니다.


학습 과정: 순전파와 역전파

1. 순전파 (Forward Propagation)

입력 데이터가 입력층 → 은닉층 → 출력층으로 전달되며 예측값 생성

2. 손실 계산 (Loss Calculation)

예측값과 실제값의 차이를 **손실 함수(Loss Function)**로 계산

문제 유형손실 함수
회귀MSE(평균제곱오차), MAE
이진 분류Binary Cross-Entropy
다중 분류Categorical Cross-Entropy

3. 역전파 (Backpropagation)

손실을 줄이는 방향으로 **경사하강법(Gradient Descent)**을 이용해 가중치 업데이트

가중치 ← 가중치 - 학습률 × ∂손실/∂가중치

주요 딥러닝 아키텍처

CNN (Convolutional Neural Network)

  • 특징: 공간적 계층 구조를 학습하는 합성곱 연산
  • 응용: 이미지 분류, 객체 탐지, 의료 영상 분석
  • 핵심 층: Convolution → Pooling → Fully Connected

RNN / LSTM (Recurrent Neural Network)

  • 특징: 순서가 있는 시계열 데이터에 특화, 이전 상태를 기억
  • 응용: 자연어처리, 주가 예측, 음성 인식
  • LSTM: 장기 의존성 문제를 게이트 구조로 해결

Transformer

  • 특징: 어텐션(Attention) 메커니즘으로 전체 시퀀스를 병렬 처리
  • 응용: GPT(텍스트 생성), BERT(이해), ViT(이미지), 멀티모달
  • 현재 AI의 핵심: ChatGPT, Gemini, Claude 모두 Transformer 기반

딥러닝 학습 최적화 기법

드롭아웃(Dropout): 학습 중 랜덤하게 뉴런을 비활성화해 과적합 방지

배치 정규화(Batch Normalization): 각 층의 입력 분포를 정규화해 학습 안정화

Adam 옵티마이저: 학습률을 적응적으로 조정하는 현재 가장 널리 쓰이는 최적화 알고리즘

전이 학습(Transfer Learning): 대규모 데이터로 사전 훈련된 모델을 특정 작업에 미세 조정


핵심 개념 카드

역전파 ★★★★★ : 손실의 기울기를 출력층→입력층으로 역방향 전파해 가중치를 업데이트하는 알고리즘. 딥러닝 학습의 핵심.

ReLU ★★★★★ : 현재 은닉층 표준 활성화 함수. max(0, x)로 기울기 소실 문제 완화.

CNN vs RNN vs Transformer ★★★★★ : CNN=이미지(공간), RNN=시계열(순서), Transformer=언어·멀티모달(어텐션). 각 아키텍처의 적용 도메인이 다름.


실전 퀴즈

Q1. 이미지 분류에 RNN 대신 CNN을 사용하는 이유는?

이미지는 공간적 구조(픽셀 간 위치 관계)를 가진다. CNN의 합성곱 연산은 이러한 공간적 패턴(엣지, 텍스처, 형태)을 효과적으로 포착한다. RNN은 순서가 있는 시계열 데이터에 최적화되어 있어 이미지의 2D 공간 구조 처리에는 적합하지 않다.

Q2. 기울기 소실(Vanishing Gradient) 문제란 무엇이며 어떻게 해결하는가?

역전파 과정에서 기울기가 층을 거칠수록 0에 수렴해 초기 층의 가중치가 거의 업데이트되지 않는 현상. 해결책: ReLU 활성화 함수(양수 영역 기울기 1 유지), LSTM(게이트로 기울기 제어), 배치 정규화, 잔차 연결(ResNet).

O

OIYO 편집부

편집부

OIYO 편집부는 경제·법률·생활·자기이해 주제를 1차 자료와 공개 통계로 검증해 정리합니다. 모든 글은 출처 표기와 정기 점검을 거쳐 실용성과 정확성을 함께 유지합니다.