Ch4. 자연어처리(NLP) — Transformer와 대형언어모델의 작동 원리
자연어처리(NLP)란?
**자연어처리(Natural Language Processing, NLP)**는 컴퓨터가 인간의 언어(텍스트·음성)를 이해하고 생성하는 AI 분야입니다. 기계 번역, 감성 분석, 질의응답, 텍스트 요약, 챗봇 등 다양한 응용이 있습니다.
NLP의 핵심 개념
1. 토큰화 (Tokenization)
텍스트를 모델이 처리할 수 있는 단위(토큰)로 분할
원문: "ChatGPT는 강력한 AI입니다."
토큰: ["Chat", "G", "PT", "는", " ", "강", "력한", " ", "AI", "입니다", "."]
현대 LLM은 서브워드 토크나이저(BPE, WordPiece)를 사용해 희귀 단어도 처리 가능
2. 임베딩 (Embedding)
단어·토큰을 고차원 수치 벡터로 변환
"왕" → [0.2, 0.8, -0.3, ...] (예: 300차원 벡터)
"여왕" → [0.1, 0.9, -0.2, ...]
"왕" - "남자" + "여자" ≈ "여왕" (Word2Vec의 유명한 예)
의미적으로 유사한 단어는 벡터 공간에서 가깝게 위치
Transformer: 현대 NLP의 핵심
2017년 Google의 “Attention Is All You Need” 논문으로 제안된 Transformer는 현대 AI의 기반 아키텍처입니다.
어텐션 메커니즘 (Attention Mechanism)
어텐션의 핵심 아이디어: 문장의 각 단어가 다른 모든 단어와의 관련성을 동시에 계산합니다. “은행에 갔다”에서 “은행”이 금융 기관인지 강변인지를 문맥 전체를 봐서 판단합니다.
셀프 어텐션(Self-Attention): 입력 시퀀스의 각 요소가 다른 모든 요소와의 관계를 계산
어텐션 점수 = softmax(QKᵀ/√d) × V
Q(Query), K(Key), V(Value) = 입력으로부터 학습된 행렬
Transformer의 장점
- RNN과 달리 병렬 처리 가능 → GPU 활용도 극대화
- 장거리 의존성 포착 용이 (문장 처음과 끝의 관계)
- 확장성: 더 많은 파라미터·데이터로 성능이 지속 향상
BERT vs GPT: 두 가지 Transformer 패러다임
| 비교 항목 | BERT | GPT |
|---|---|---|
| 방향 | 양방향 (Bidirectional) | 단방향 (Left-to-Right) |
| 사전학습 | 마스크 언어 모델링 (MLM) | 다음 토큰 예측 |
| 강점 | 이해 (분류, QA) | 생성 (텍스트 작성) |
| 대표 모델 | BERT, RoBERTa, ELECTRA | GPT-4, Claude, Gemini |
| 개발사 | OpenAI / Anthropic / Google |
대형언어모델(LLM)의 작동 원리
ChatGPT, Claude, Gemini 같은 LLM은 세 단계로 훈련됩니다:
1단계: 사전학습 (Pretraining)
- 인터넷 텍스트 수조 개 토큰으로 “다음 단어 예측” 학습
- 언어의 패턴, 지식, 추론 능력을 내재화
2단계: 지도 미세조정 (SFT, Supervised Fine-Tuning)
- 사람이 직접 작성한 고품질 대화 데이터로 미세조정
- 원하는 응답 형식·스타일 학습
3단계: RLHF (인간 피드백 강화학습)
- 사람이 모델 응답을 평가하고 순위를 매김
- 더 도움이 되고 안전한 응답을 학습
프롬프트 엔지니어링
LLM의 성능은 입력(프롬프트)의 품질에 크게 좌우됩니다.
| 기법 | 설명 | 예시 |
|---|---|---|
| 제로샷 | 예시 없이 바로 질문 | ”이 문장을 요약하세요.” |
| 퓨샷 | 몇 가지 예시 제공 | ”다음 예시처럼 분류하세요: [예시 3개]“ |
| Chain-of-Thought | 단계별 추론 유도 | ”단계적으로 생각해보세요.” |
| 시스템 프롬프트 | 역할·맥락 설정 | ”당신은 전문 법률 자문가입니다.” |
핵심 개념 카드
어텐션 메커니즘 ★★★★★ : 시퀀스의 각 요소가 다른 모든 요소와의 관련성을 계산. RNN의 순차 처리 한계를 극복.
BERT vs GPT ★★★★★ : BERT=양방향 이해(분류/QA), GPT=단방향 생성(텍스트 작성). 용도에 맞는 아키텍처 선택이 중요.
RLHF ★★★★☆ : 인간 피드백으로 LLM을 정렬(Alignment)하는 기법. ChatGPT가 유용하고 안전한 이유.
실전 퀴즈
Q1. BERT가 GPT보다 텍스트 분류에 더 적합한 이유는?
BERT는 양방향 어텐션으로 문장 전체 맥락을 동시에 고려해 텍스트의 의미를 더 잘 이해한다. GPT는 왼쪽에서 오른쪽 방향으로만 처리해 생성에는 적합하지만, 전체 문맥을 한 번에 보는 분류·이해 작업에서는 BERT보다 불리하다.
Q2. LLM이 “환각(Hallucination)“을 생성하는 이유는?
LLM은 다음 토큰을 확률적으로 예측하는 통계 모델이다. 정확한 사실을 저장하는 데이터베이스가 아니라 패턴을 학습한 것이므로, 그럴듯하지만 사실과 다른 내용을 생성할 수 있다. 훈련 데이터에 없는 정보나 모호한 질문에서 특히 발생하기 쉽다.
OIYO 편집부
편집부OIYO 편집부는 경제·법률·생활·자기이해 주제를 1차 자료와 공개 통계로 검증해 정리합니다. 모든 글은 출처 표기와 정기 점검을 거쳐 실용성과 정확성을 함께 유지합니다.