Ch5. 컴퓨터 비전 — 컴퓨터가 세상을 보는 방법
컴퓨터 비전이란?
**컴퓨터 비전(Computer Vision)**은 컴퓨터가 이미지나 비디오에서 의미 있는 정보를 추출하고 이해하는 AI 분야입니다. 인간의 시각 시스템을 모방하지만, 특정 작업에서는 인간을 능가합니다.
응용 분야: 자율주행차, 의료 영상 진단, 얼굴인식, 품질 검사, 증강현실(AR), 위성 이미지 분석.
CNN: 이미지 처리의 핵심 구조
**합성곱 신경망(CNN, Convolutional Neural Network)**은 현대 컴퓨터 비전의 핵심 아키텍처입니다.
합성곱 연산(Convolution)
이미지에서 패턴(엣지, 텍스처, 형태)을 탐지하는 핵심 연산:
입력 이미지: 228×228×3 (높이×너비×RGB채널)
필터(커널): 3×3 크기의 학습 가능한 가중치
출력: 각 위치에서 필터가 얼마나 활성화되는지 (특성 맵)
핵심 아이디어: 같은 필터를 이미지 전체에 적용(파라미터 공유). 사진 어디에 있든 고양이 귀 패턴은 같은 필터로 탐지.
풀링(Pooling)
특성 맵의 크기를 줄이면서 중요한 특성 유지:
- MaxPooling: 2×2 영역의 최댓값 선택
- 위치 불변성(평행이동에 강건): 패턴이 조금 이동해도 같은 특성 유지
CNN의 계층 구조
입력 이미지
→ Conv(엣지 탐지) → Conv(텍스처 탐지) → Conv(패턴 탐지) → Conv(고수준 특성)
→ Flatten → Fully Connected → 출력(분류/회귀)
하층: 엣지, 선 같은 저수준 특성 상층: 눈, 코, 얼굴 같은 고수준 특성
전이 학습(Transfer Learning): ImageNet으로 사전학습된 ResNet, VGG, EfficientNet 모델을 가져와 자신의 데이터로 미세조정하는 것이 실무 표준입니다. 처음부터 학습하는 것보다 훨씬 적은 데이터와 시간으로 높은 성능을 달성합니다.
주요 컴퓨터 비전 태스크
1. 이미지 분류 (Image Classification)
이미지 전체를 하나의 카테고리로 분류.
- 예: 사진이 고양이인가, 개인가?
- 대표 모델: AlexNet(2012), VGG, ResNet, EfficientNet
2. 객체 탐지 (Object Detection)
이미지 내 여러 객체의 위치(바운딩 박스)와 클래스를 동시 탐지.
- 예: 자율주행차가 보행자, 신호등, 차선을 동시에 탐지
- 대표 모델: YOLO 시리즈, Faster R-CNN, SSD
| 모델 | 속도 | 정확도 | 주 용도 |
|---|---|---|---|
| YOLO | 매우 빠름 | 좋음 | 실시간 탐지 |
| Faster R-CNN | 느림 | 매우 좋음 | 정밀 분석 |
3. 시맨틱 세그멘테이션 (Semantic Segmentation)
픽셀 단위로 카테고리 분류.
- 예: 자율주행차가 도로/보행자/차량을 픽셀 단위로 구분
- 대표 모델: U-Net(의료영상), DeepLab
4. 인스턴스 세그멘테이션
시맨틱 세그멘테이션 + 개별 객체 구분.
- 예: 군중에서 각 사람을 개별적으로 구분
의료 영상 분야의 혁명
컴퓨터 비전이 가장 큰 임팩트를 내는 분야 중 하나가 의료 영상입니다.
피부암 진단: 스탠퍼드 연구팀이 CNN으로 피부암을 전문의 수준으로 진단(2017년 Nature 발표).
망막 질환: Google의 DeepMind가 50가지 이상의 망막 질환을 전문가 수준으로 진단.
COVID-19 폐 CT: 컴퓨터 비전으로 CT 영상에서 폐렴 패턴 자동 탐지.
주요 데이터셋
- ImageNet: 1000개 카테고리 120만 장. 딥러닝 혁명의 시발점
- COCO: 객체 탐지·세그멘테이션 벤치마크
- Pascal VOC: 초기 객체 탐지 표준 벤치마크
핵심 개념 카드
CNN ★★★★★ : 합성곱(Conv)→풀링(Pool)→분류(FC)의 계층 구조로 이미지에서 계층적 특성 학습. 파라미터 공유로 효율적.
YOLO ★★★★☆ : “You Only Look Once.” 이미지를 한 번의 순전파로 탐지하는 실시간 객체 탐지 모델. 자율주행·CCTV 분석에 필수.
전이 학습 ★★★★★ : 대규모 데이터로 사전학습된 모델을 내 작업에 미세조정. 적은 데이터로도 높은 성능. 실무의 표준.
실전 퀴즈
Q1. YOLO가 Faster R-CNN보다 실시간 응용에 적합한 이유는?
YOLO는 이미지 전체를 그리드로 나눠 한 번의 신경망 통과로 모든 박스와 클래스를 동시에 예측합니다. Faster R-CNN은 먼저 객체 후보 영역을 제안하고(RPN), 각 영역을 다시 분류하는 2단계 방식입니다. YOLO가 훨씬 빠르지만 정밀도는 약간 낮습니다.
Q2. 의료 영상 분석에서 U-Net이 자주 사용되는 이유는?
U-Net은 인코더-디코더 구조와 스킵 연결(skip connection)을 통해 저해상도의 문맥 정보와 고해상도의 위치 정보를 결합합니다. 적은 학습 데이터로도 정밀한 픽셀 단위 세그멘테이션이 가능해 의료 영상처럼 레이블 데이터가 귀한 분야에 적합합니다.
OIYO 편집부
편집부OIYO 편집부는 경제·법률·생활·자기이해 주제를 1차 자료와 공개 통계로 검증해 정리합니다. 모든 글은 출처 표기와 정기 점검을 거쳐 실용성과 정확성을 함께 유지합니다.