Ch1. 빅데이터분석기사 — 시험 개요와 빅데이터 개념
빅데이터분석기사란?
빅데이터분석기사는 한국데이터산업진흥원(KDATA)이 주관하는 국가기술자격입니다. 빅데이터 이해와 활용 능력을 검증합니다.
시험 구성:
- 필기: 4개 과목, 각 20문항 (80문항, 5지선다)
- 빅데이터 분석 기획
- 빅데이터 탐색
- 빅데이터 모델링
- 빅데이터 결과 해석
- 실기: 작업형(Python/R 코드 작성) + 단답형
합격 기준: 필기 각 과목 40점 이상, 평균 60점 이상 / 실기 60점 이상
빅데이터의 정의: 3V
Volume(양): 기존 데이터베이스로 처리·저장하기 어려운 대용량 데이터
Velocity(속도): 실시간·빠른 속도로 생성되고 처리되는 데이터
Variety(다양성): 정형(DB), 반정형(JSON, XML), 비정형(텍스트, 이미지, 동영상) 데이터
추가된 V들:
- Veracity(정확성): 데이터의 신뢰성과 품질
- Value(가치): 데이터에서 추출하는 비즈니스 가치
빅데이터 처리 파이프라인
데이터 수집 → 저장 → 처리 → 분석 → 시각화 → 의사결정
1. 수집
- 배치 수집: 일정 주기로 대량 수집 (Sqoop, Flume)
- 실시간 스트리밍: 연속적 데이터 수집 (Kafka, Kinesis)
- 크롤링: 웹 데이터 수집
2. 저장
- HDFS: Hadoop 분산 파일 시스템
- 데이터 레이크: 원시 데이터 그대로 저장 (S3, ADLS)
- 데이터 웨어하우스: 분석용 정형 데이터 (Redshift, BigQuery)
- NoSQL: 비정형/반정형 (MongoDB, Cassandra, HBase)
3. 처리
- 배치 처리: Hadoop MapReduce, Spark
- 실시간 처리: Spark Streaming, Flink, Kafka Streams
데이터 유형
| 유형 | 특징 | 예시 |
|---|---|---|
| 정형 | 행과 열, 스키마 명확 | RDB, CSV |
| 반정형 | 구조 있으나 유연 | JSON, XML, HTML |
| 비정형 | 구조 없음 | 텍스트, 이미지, 영상 |
시험 핵심: 현재 생성되는 데이터의 80~90%가 비정형 데이터입니다. 텍스트 마이닝, 이미지 인식 등 비정형 데이터 처리 기술이 빅데이터 분석의 핵심입니다.
Hadoop 에코시스템
| 컴포넌트 | 역할 |
|---|---|
| HDFS | 분산 파일 저장 |
| MapReduce | 분산 배치 처리 |
| YARN | 클러스터 자원 관리 |
| Hive | SQL-like 쿼리 |
| Spark | 인메모리 고속 처리 |
| HBase | NoSQL 컬럼 DB |
| Sqoop | RDB ↔ HDFS 이전 |
| Kafka | 메시지 스트리밍 |
핵심 개념 카드
빅데이터 5V ★★★★★ : Volume(양), Velocity(속도), Variety(다양성), Veracity(정확성), Value(가치). 3V가 기본.
정형 vs 비정형 ★★★★★ : 정형=RDB·CSV(구조 명확), 반정형=JSON·XML, 비정형=텍스트·이미지. 현실 데이터의 80%가 비정형.
Hadoop vs Spark ★★★★★ : Hadoop=디스크 기반 배치(안정, 저렴), Spark=인메모리(100배 빠름). 현재 Spark가 주류.
실전 퀴즈
Q1. 소셜미디어 텍스트, 이미지, 동영상 데이터는 어떤 유형인가?
비정형 데이터입니다. 고정된 스키마나 구조 없이 다양한 형태로 존재합니다. 분석을 위해서는 자연어 처리(NLP), 이미지 인식 등 특별한 기술이 필요합니다.
Q2. 실시간으로 발생하는 IoT 센서 데이터를 수집하고 처리할 때 적합한 기술 스택은?
수집에는 Kafka(메시지 스트리밍), 처리에는 Spark Streaming 또는 Flink, 저장에는 HBase(실시간 쓰기) 또는 S3(장기 보관)가 적합합니다. 배치 처리로는 실시간 대응이 불가능하므로 스트리밍 아키텍처가 필요합니다.
OIYO 편집부
편집부OIYO 편집부는 경제·법률·생활·자기이해 주제를 1차 자료와 공개 통계로 검증해 정리합니다. 모든 글은 출처 표기와 정기 점검을 거쳐 실용성과 정확성을 함께 유지합니다.