컴퓨터과학챕터 7약 3분

Ch7. 생성형 AI — GAN, 확산 모델, ChatGPT의 작동 원리

O
OIYO 편집부기여자
7/8

생성형 AI란?

**생성형 AI(Generative AI)**는 새로운 데이터를 생성하는 AI 모델입니다. 이미지, 텍스트, 오디오, 비디오, 코드 등을 사람이 만든 것처럼 생성할 수 있습니다.

구분:

  • 판별 모델(Discriminative): 입력 → 레이블 (예: “이것은 고양이입니까?”)
  • 생성 모델(Generative): 입력 → 새로운 데이터 (예: “고양이 이미지 생성”)

GAN: 적대적 생성 신경망

**GAN(Generative Adversarial Network)**은 2014년 이안 굿펠로우가 제안한 혁신적 아키텍처입니다.

핵심 아이디어: 경쟁

생성자(Generator) ←→ 판별자(Discriminator)
  가짜 이미지 생성        진짜/가짜 구분
  ↓ 더 잘 속이도록 학습    ↓ 더 잘 구분하도록 학습
  • 생성자: 랜덤 노이즈 → 가짜 이미지 생성. 판별자를 속이는 것이 목표
  • 판별자: 진짜/가짜 이미지를 구분. 생성자에게 속지 않는 것이 목표
  • 균형점: 생성자가 진짜 같은 이미지를 만들고, 판별자가 50% 확률로 구분할 수 없게 되면 성공

GAN의 비유: 위조지폐범(생성자)과 경찰(판별자)의 게임. 위조범은 더 정교한 위조지폐를 만들고, 경찰은 더 예리하게 구분하며 서로를 강화합니다. 결국 판별 불가능한 수준에 이릅니다.

GAN의 응용

  • StyleGAN: 존재하지 않는 사람의 사진(thispersondoesnotexist.com)
  • DeepFake: 영상에서 얼굴 교체
  • 이미지 초해상도: 저화질 → 고화질
  • 이미지-이미지 변환: 낮 사진 → 밤 사진, 스케치 → 사진

확산 모델: Stable Diffusion의 원리

**확산 모델(Diffusion Model)**은 현재 이미지 생성 AI의 주류입니다. Stable Diffusion, DALL-E 3, Midjourney가 이 원리를 사용합니다.

핵심 아이디어: 노이즈 제거

훈련:
원본 이미지 → 점진적 노이즈 추가 → 순수 노이즈
                ↓ 이 과정을 역으로 배움
생성:
순수 노이즈 → 점진적 노이즈 제거 → 생성된 이미지
  1. 순방향 과정: 깨끗한 이미지에 가우시안 노이즈를 T번 단계적으로 추가
  2. 역방향 과정(학습): 노이즈가 추가된 이미지에서 노이즈를 예측하는 신경망 학습
  3. 생성 시: 완전한 랜덤 노이즈에서 출발해 T번의 노이즈 제거 스텝을 거쳐 이미지 생성

텍스트-이미지 생성

“우주를 유영하는 고양이, 인상주의 스타일” 같은 텍스트 프롬프트를 이미지로 변환합니다. CLIP 모델로 텍스트를 이미지 특성 공간에 매핑한 뒤 확산 모델로 생성합니다.


GPT 계열: 텍스트 생성 AI

GPT(Generative Pre-trained Transformer)는 텍스트 생성 AI의 대표 모델입니다.

핵심 원리

입력: "한국의 수도는"
출력: " 서울" (다음 토큰 예측)
      " 입니다" (또 다음 토큰 예측)
      ...

자기회귀(Autoregressive): 이미 생성된 텍스트를 조건으로 다음 토큰을 예측하는 과정을 반복.

GPT의 발전

모델파라미터주요 특징
GPT-11.17억언어 모델 + 전이학습
GPT-215억범용 텍스트 생성
GPT-31750억퓨샷 학습 능력
GPT-4비공개멀티모달(텍스트+이미지)

VAE: 잠재 공간 학습

**변분 오토인코더(VAE)**는 이미지를 저차원 잠재 벡터로 압축 후 복원하는 구조입니다.

이미지 → 인코더 → 잠재 벡터 z → 디코더 → 재구성된 이미지

잠재 공간에서 두 이미지 사이를 보간하면 자연스러운 중간 이미지를 생성할 수 있습니다.


핵심 개념 카드

GAN ★★★★★ : 생성자-판별자가 경쟁적으로 학습하는 구조. 위조지폐범 vs 경찰의 게임. 고품질 이미지 생성의 선구자.

확산 모델 ★★★★★ : 노이즈 추가→제거를 학습. Stable Diffusion, DALL-E 3, Midjourney의 원리. 현재 이미지 생성 AI의 주류.

GPT (자기회귀 언어 모델) ★★★★★ : 이전 토큰들을 조건으로 다음 토큰을 예측하는 과정을 반복해 텍스트 생성. ChatGPT의 핵심 원리.


실전 퀴즈

Q1. GAN 훈련에서 가장 흔한 문제인 ‘모드 붕괴(Mode Collapse)‘란 무엇인가?

생성자가 판별자를 속이기 위해 다양한 이미지가 아닌 특정 패턴의 이미지만 반복 생성하는 현상입니다. 예를 들어 오직 한 가지 얼굴 유형만 생성하는 것. 생성자가 훈련 데이터의 다양성을 학습하지 못한 것으로, Wasserstein GAN 등으로 완화할 수 있습니다.

Q2. 확산 모델이 GAN보다 이미지 다양성 측면에서 유리한 이유는?

GAN은 생성자와 판별자의 불안정한 균형에 의존하며 모드 붕괴에 취약합니다. 확산 모델은 노이즈 제거 과정에서 확률적 샘플링을 사용하므로 같은 프롬프트에서도 매번 다른 이미지가 생성됩니다. 학습이 더 안정적이고 다양성도 높습니다.

O

OIYO 편집부

편집부

OIYO 편집부는 경제·법률·생활·자기이해 주제를 1차 자료와 공개 통계로 검증해 정리합니다. 모든 글은 출처 표기와 정기 점검을 거쳐 실용성과 정확성을 함께 유지합니다.