컴퓨터과학챕터 5약 3분

컴퓨터 비전 — 컴퓨터가 세상을 보는 방법

O
OIYO 편집부기여자
5/8

컴퓨터 비전이란?

컴퓨터 비전(Computer Vision)은 컴퓨터가 이미지나 비디오에서 의미 있는 정보를 추출하고 이해하는 AI 분야입니다. 인간의 시각 시스템을 모방하지만, 특정 작업에서는 인간을 능가합니다.

응용 분야: 자율주행차, 의료 영상 진단, 얼굴인식, 품질 검사, 증강현실(AR), 위성 이미지 분석.


CNN: 이미지 처리의 핵심 구조

합성곱 신경망(CNN, Convolutional Neural Network)은 현대 컴퓨터 비전의 핵심 아키텍처입니다.

합성곱 연산(Convolution)

이미지에서 패턴(엣지, 텍스처, 형태)을 탐지하는 핵심 연산:

  • 입력 이미지: 228×228×3 (높이×너비×RGB채널)
  • 필터(커널): 3×3 크기의 학습 가능한 가중치
  • 출력: 각 위치에서 필터가 얼마나 활성화되는지 (특성 맵)

핵심 아이디어: 같은 필터를 이미지 전체에 적용(파라미터 공유). 사진 어디에 있든 고양이 귀 패턴은 같은 필터로 탐지.

풀링(Pooling)

특성 맵의 크기를 줄이면서 중요한 특성 유지:

  • MaxPooling: 2×2 영역의 최댓값 선택
  • 위치 불변성(평행이동에 강건): 패턴이 조금 이동해도 같은 특성 유지

CNN의 계층 구조

입력 이미지

  • Conv(엣지 탐지) → Conv(텍스처 탐지) → Conv(패턴 탐지) → Conv(고수준 특성)
  • Flatten → Fully Connected → 출력(분류/회귀)

하층: 엣지, 선 같은 저수준 특성 상층: 눈, 코, 얼굴 같은 고수준 특성


주요 컴퓨터 비전 태스크

1. 이미지 분류 (Image Classification)

이미지 전체를 하나의 카테고리로 분류.

  • 예: 사진이 고양이인가, 개인가?
  • 대표 모델: AlexNet(2012), VGG, ResNet, EfficientNet

2. 객체 탐지 (Object Detection)

이미지 내 여러 객체의 위치(바운딩 박스)와 클래스를 동시 탐지.

  • 예: 자율주행차가 보행자, 신호등, 차선을 동시에 탐지
  • 대표 모델: YOLO 시리즈, Faster R-CNN, SSD
모델속도정확도주 용도
YOLO매우 빠름좋음실시간 탐지
Faster R-CNN느림매우 좋음정밀 분석

3. 시맨틱 세그멘테이션 (Semantic Segmentation)

픽셀 단위로 카테고리 분류.

  • 예: 자율주행차가 도로/보행자/차량을 픽셀 단위로 구분
  • 대표 모델: U-Net(의료영상), DeepLab

4. 인스턴스 세그멘테이션

시맨틱 세그멘테이션 + 개별 객체 구분.

  • 예: 군중에서 각 사람을 개별적으로 구분

의료 영상 분야의 혁명

컴퓨터 비전이 가장 큰 임팩트를 내는 분야 중 하나가 의료 영상입니다.

피부암 진단: 스탠퍼드 연구팀이 CNN으로 피부암을 전문의 수준으로 진단(2017년 Nature 발표).

망막 질환: Google의 DeepMind가 50가지 이상의 망막 질환을 전문가 수준으로 진단.

COVID-19 폐 CT: 컴퓨터 비전으로 CT 영상에서 폐렴 패턴 자동 탐지.


주요 데이터셋

  • ImageNet: 1000개 카테고리 120만 장. 딥러닝 혁명의 시발점
  • COCO: 객체 탐지·세그멘테이션 벤치마크
  • Pascal VOC: 초기 객체 탐지 표준 벤치마크

핵심 개념 카드

CNN ★★★★★ : 합성곱(Conv)→풀링(Pool)→분류(FC)의 계층 구조로 이미지에서 계층적 특성 학습. 파라미터 공유로 효율적.

YOLO ★★★★☆ : “You Only Look Once.” 이미지를 한 번의 순전파로 탐지하는 실시간 객체 탐지 모델. 자율주행·CCTV 분석에 필수.

전이 학습 ★★★★★ : 대규모 데이터로 사전학습된 모델을 내 작업에 미세조정. 적은 데이터로도 높은 성능. 실무의 표준.


실전 퀴즈

Q1. YOLO가 Faster R-CNN보다 실시간 응용에 적합한 이유는?

YOLO는 이미지 전체를 그리드로 나눠 한 번의 신경망 통과로 모든 박스와 클래스를 동시에 예측합니다. Faster R-CNN은 먼저 객체 후보 영역을 제안하고(RPN), 각 영역을 다시 분류하는 2단계 방식입니다. YOLO가 훨씬 빠르지만 정밀도는 약간 낮습니다.

Q2. 의료 영상 분석에서 U-Net이 자주 사용되는 이유는?

U-Net은 인코더-디코더 구조와 스킵 연결(skip connection)으로 저해상도의 문맥 정보와 고해상도의 위치 정보를 결합합니다. 적은 학습 데이터로도 정밀한 픽셀 단위 세그멘테이션이 가능해 의료 영상처럼 레이블 데이터가 귀한 분야에 적합합니다.

O

OIYO 편집부

편집부

OIYO 편집부는 경제·법률·생활·자기이해 주제를 1차 자료와 공개 통계로 검증해 정리합니다. 모든 글은 출처 표기와 정기 점검을 거쳐 실용성과 정확성을 함께 유지합니다.