컴퓨터과학챕터 4약 3분

Ch4. 자연어처리(NLP) — Transformer와 대형언어모델의 작동 원리

O
OIYO 편집부기여자
4/8

자연어처리(NLP)란?

**자연어처리(Natural Language Processing, NLP)**는 컴퓨터가 인간의 언어(텍스트·음성)를 이해하고 생성하는 AI 분야입니다. 기계 번역, 감성 분석, 질의응답, 텍스트 요약, 챗봇 등 다양한 응용이 있습니다.


NLP의 핵심 개념

1. 토큰화 (Tokenization)

텍스트를 모델이 처리할 수 있는 단위(토큰)로 분할

원문: "ChatGPT는 강력한 AI입니다."
토큰: ["Chat", "G", "PT", "는", " ", "강", "력한", " ", "AI", "입니다", "."]

현대 LLM은 서브워드 토크나이저(BPE, WordPiece)를 사용해 희귀 단어도 처리 가능

2. 임베딩 (Embedding)

단어·토큰을 고차원 수치 벡터로 변환

"왕" → [0.2, 0.8, -0.3, ...]  (예: 300차원 벡터)
"여왕" → [0.1, 0.9, -0.2, ...]
"왕" - "남자" + "여자" ≈ "여왕"  (Word2Vec의 유명한 예)

의미적으로 유사한 단어는 벡터 공간에서 가깝게 위치


Transformer: 현대 NLP의 핵심

2017년 Google의 “Attention Is All You Need” 논문으로 제안된 Transformer는 현대 AI의 기반 아키텍처입니다.

어텐션 메커니즘 (Attention Mechanism)

어텐션의 핵심 아이디어: 문장의 각 단어가 다른 모든 단어와의 관련성을 동시에 계산합니다. “은행에 갔다”에서 “은행”이 금융 기관인지 강변인지를 문맥 전체를 봐서 판단합니다.

셀프 어텐션(Self-Attention): 입력 시퀀스의 각 요소가 다른 모든 요소와의 관계를 계산

어텐션 점수 = softmax(QKᵀ/√d) × V
Q(Query), K(Key), V(Value) = 입력으로부터 학습된 행렬

Transformer의 장점

  • RNN과 달리 병렬 처리 가능 → GPU 활용도 극대화
  • 장거리 의존성 포착 용이 (문장 처음과 끝의 관계)
  • 확장성: 더 많은 파라미터·데이터로 성능이 지속 향상

BERT vs GPT: 두 가지 Transformer 패러다임

비교 항목BERTGPT
방향양방향 (Bidirectional)단방향 (Left-to-Right)
사전학습마스크 언어 모델링 (MLM)다음 토큰 예측
강점이해 (분류, QA)생성 (텍스트 작성)
대표 모델BERT, RoBERTa, ELECTRAGPT-4, Claude, Gemini
개발사GoogleOpenAI / Anthropic / Google

대형언어모델(LLM)의 작동 원리

ChatGPT, Claude, Gemini 같은 LLM은 세 단계로 훈련됩니다:

1단계: 사전학습 (Pretraining)

  • 인터넷 텍스트 수조 개 토큰으로 “다음 단어 예측” 학습
  • 언어의 패턴, 지식, 추론 능력을 내재화

2단계: 지도 미세조정 (SFT, Supervised Fine-Tuning)

  • 사람이 직접 작성한 고품질 대화 데이터로 미세조정
  • 원하는 응답 형식·스타일 학습

3단계: RLHF (인간 피드백 강화학습)

  • 사람이 모델 응답을 평가하고 순위를 매김
  • 더 도움이 되고 안전한 응답을 학습

프롬프트 엔지니어링

LLM의 성능은 입력(프롬프트)의 품질에 크게 좌우됩니다.

기법설명예시
제로샷예시 없이 바로 질문”이 문장을 요약하세요.”
퓨샷몇 가지 예시 제공”다음 예시처럼 분류하세요: [예시 3개]“
Chain-of-Thought단계별 추론 유도”단계적으로 생각해보세요.”
시스템 프롬프트역할·맥락 설정”당신은 전문 법률 자문가입니다.”

핵심 개념 카드

어텐션 메커니즘 ★★★★★ : 시퀀스의 각 요소가 다른 모든 요소와의 관련성을 계산. RNN의 순차 처리 한계를 극복.

BERT vs GPT ★★★★★ : BERT=양방향 이해(분류/QA), GPT=단방향 생성(텍스트 작성). 용도에 맞는 아키텍처 선택이 중요.

RLHF ★★★★☆ : 인간 피드백으로 LLM을 정렬(Alignment)하는 기법. ChatGPT가 유용하고 안전한 이유.


실전 퀴즈

Q1. BERT가 GPT보다 텍스트 분류에 더 적합한 이유는?

BERT는 양방향 어텐션으로 문장 전체 맥락을 동시에 고려해 텍스트의 의미를 더 잘 이해한다. GPT는 왼쪽에서 오른쪽 방향으로만 처리해 생성에는 적합하지만, 전체 문맥을 한 번에 보는 분류·이해 작업에서는 BERT보다 불리하다.

Q2. LLM이 “환각(Hallucination)“을 생성하는 이유는?

LLM은 다음 토큰을 확률적으로 예측하는 통계 모델이다. 정확한 사실을 저장하는 데이터베이스가 아니라 패턴을 학습한 것이므로, 그럴듯하지만 사실과 다른 내용을 생성할 수 있다. 훈련 데이터에 없는 정보나 모호한 질문에서 특히 발생하기 쉽다.

O

OIYO 편집부

편집부

OIYO 편집부는 경제·법률·생활·자기이해 주제를 1차 자료와 공개 통계로 검증해 정리합니다. 모든 글은 출처 표기와 정기 점검을 거쳐 실용성과 정확성을 함께 유지합니다.