통계적 분류
통계적 분류(Statistical Classification)는 관측된 데이터의 특성(feature)을 바탕으로 대상이 속할 수 있는 사전 정의된 범주(class) 중 하나를 예측하거나 할당하는 방법론을 의미한다. 이 과정은 확률 모델, 결정 규칙, 혹은 알고리즘을 이용해 수행되며, 일반적으로 지도학습(supervised learning) 형태의 패턴 인식 및 머신러닝 분야에서 핵심적인 역할을 한다.
주요 개념
| 개념 | 설명 |
|---|---|
| 클래스(class) | 대상이 속할 수 있는 사전 정의된 범주(예: 스팸/비스팸, 고양이/개 등) |
| 특성(feature) | 분류를 위해 관측된 데이터의 속성 또는 변수(예: 이미지 픽셀 값, 텍스트 단어 빈도) |
| 학습(training) | 라벨이 부착된 데이터(학습 데이터)를 이용해 모델의 파라미터를 추정하는 과정 |
| 예측(prediction) | 학습된 모델을 이용해 새로운 데이터에 대한 클래스 레이블을 추정하는 과정 |
| 오차율(error rate) | 모델이 잘못 예측한 사례의 비율로, 성능 평가에 사용됨 |
대표적인 통계적 분류 기법
- 베이즈 분류기 (Naive Bayes)
- 베이즈 정리를 기반으로 각 특성이 독립적이라고 가정하여 사후 확률을 계산한다.
- 선형 판별 분석 (Linear Discriminant Analysis, LDA)
- 클래스 간 분산을 최소화하고 클래스 내 분산을 최대화하는 선형 결합을 찾는다.
- 판별 함수 (Discriminant Function) 기반 분류
- 로지스틱 회귀, 서포트 벡터 머신(SVM) 등이 이에 속한다.
- 트리 기반 방법
- 결정 트리, 랜덤 포레스트, 그래디언트 부스팅 트리 등은 데이터 분할 규칙을 학습한다.
- 인공신경망 (Neural Networks)
- 다층 퍼셉트론(MLP)이나 컨볼루션 신경망(CNN) 등 복잡한 비선형 관계를 모델링한다.
적용 분야
- 문서 분류: 스팸 메일 필터링, 감성 분석 등
- 이미지 인식: 물체 인식, 얼굴 인식 등
- 의료 진단: 질병 여부 판별, 병리학적 이미지 분석
- 금융: 신용 위험 평가, 사기 탐지
평가 지표
- 정확도(Accuracy), 정밀도(Precision), 재현율(Recall), F1 점수, ROC-AUC 등
- 교차 검증(k-fold cross‑validation) 등을 통해 모델의 일반화 성능을 추정한다.
어원 및 용어 형성
- 통계적: ‘통계(統計)’에 형용사형 어미 ‘-적’을 붙여 ‘statistics에 관한, 통계적인’이라는 의미를 만든다.
- 분류: ‘분(分)’+‘류(類)’로 구성된 한자어이며, ‘범주를 나누어 정리한다’는 뜻이다.
참고 문헌 (대표적인 교과서·논문)
- Fisher, R. A. (1936). “The use of multiple measurements in taxonomic problems.” Annals of Eugenics.
- Duda, R. O., Hart, P. E., & Stork, D. G. (2000). Pattern Classification (2nd ed.). Wiley.
- Bishop, C. M. (2006). Pattern Recognition and Machine Learning. Springer.
통계적 분류는 통계학과 컴퓨터 과학이 교차하는 영역에서, 데이터를 기반으로 의사결정을 자동화하거나 지원하는 핵심 기술로 널리 활용되고 있다.