컴퓨터과학챕터 1약 3분

Ch1. 빅데이터분석기사 — 시험 개요와 빅데이터 개념

O
OIYO 편집부기여자
1/8

빅데이터분석기사란?

빅데이터분석기사는 한국데이터산업진흥원(KDATA)이 주관하는 국가기술자격입니다. 빅데이터 이해와 활용 능력을 검증합니다.

시험 구성:

  • 필기: 4개 과목, 각 20문항 (80문항, 5지선다)
    • 빅데이터 분석 기획
    • 빅데이터 탐색
    • 빅데이터 모델링
    • 빅데이터 결과 해석
  • 실기: 작업형(Python/R 코드 작성) + 단답형

합격 기준: 필기 각 과목 40점 이상, 평균 60점 이상 / 실기 60점 이상


빅데이터의 정의: 3V

Volume(양): 기존 데이터베이스로 처리·저장하기 어려운 대용량 데이터

Velocity(속도): 실시간·빠른 속도로 생성되고 처리되는 데이터

Variety(다양성): 정형(DB), 반정형(JSON, XML), 비정형(텍스트, 이미지, 동영상) 데이터

추가된 V들:

  • Veracity(정확성): 데이터의 신뢰성과 품질
  • Value(가치): 데이터에서 추출하는 비즈니스 가치

빅데이터 처리 파이프라인

데이터 수집 → 저장 → 처리 → 분석 → 시각화 → 의사결정

1. 수집

  • 배치 수집: 일정 주기로 대량 수집 (Sqoop, Flume)
  • 실시간 스트리밍: 연속적 데이터 수집 (Kafka, Kinesis)
  • 크롤링: 웹 데이터 수집

2. 저장

  • HDFS: Hadoop 분산 파일 시스템
  • 데이터 레이크: 원시 데이터 그대로 저장 (S3, ADLS)
  • 데이터 웨어하우스: 분석용 정형 데이터 (Redshift, BigQuery)
  • NoSQL: 비정형/반정형 (MongoDB, Cassandra, HBase)

3. 처리

  • 배치 처리: Hadoop MapReduce, Spark
  • 실시간 처리: Spark Streaming, Flink, Kafka Streams

데이터 유형

유형특징예시
정형행과 열, 스키마 명확RDB, CSV
반정형구조 있으나 유연JSON, XML, HTML
비정형구조 없음텍스트, 이미지, 영상

시험 핵심: 현재 생성되는 데이터의 80~90%가 비정형 데이터입니다. 텍스트 마이닝, 이미지 인식 등 비정형 데이터 처리 기술이 빅데이터 분석의 핵심입니다.


Hadoop 에코시스템

컴포넌트역할
HDFS분산 파일 저장
MapReduce분산 배치 처리
YARN클러스터 자원 관리
HiveSQL-like 쿼리
Spark인메모리 고속 처리
HBaseNoSQL 컬럼 DB
SqoopRDB ↔ HDFS 이전
Kafka메시지 스트리밍

핵심 개념 카드

빅데이터 5V ★★★★★ : Volume(양), Velocity(속도), Variety(다양성), Veracity(정확성), Value(가치). 3V가 기본.

정형 vs 비정형 ★★★★★ : 정형=RDB·CSV(구조 명확), 반정형=JSON·XML, 비정형=텍스트·이미지. 현실 데이터의 80%가 비정형.

Hadoop vs Spark ★★★★★ : Hadoop=디스크 기반 배치(안정, 저렴), Spark=인메모리(100배 빠름). 현재 Spark가 주류.


실전 퀴즈

Q1. 소셜미디어 텍스트, 이미지, 동영상 데이터는 어떤 유형인가?

비정형 데이터입니다. 고정된 스키마나 구조 없이 다양한 형태로 존재합니다. 분석을 위해서는 자연어 처리(NLP), 이미지 인식 등 특별한 기술이 필요합니다.

Q2. 실시간으로 발생하는 IoT 센서 데이터를 수집하고 처리할 때 적합한 기술 스택은?

수집에는 Kafka(메시지 스트리밍), 처리에는 Spark Streaming 또는 Flink, 저장에는 HBase(실시간 쓰기) 또는 S3(장기 보관)가 적합합니다. 배치 처리로는 실시간 대응이 불가능하므로 스트리밍 아키텍처가 필요합니다.

O

OIYO 편집부

편집부

OIYO 편집부는 경제·법률·생활·자기이해 주제를 1차 자료와 공개 통계로 검증해 정리합니다. 모든 글은 출처 표기와 정기 점검을 거쳐 실용성과 정확성을 함께 유지합니다.