정의
표준화(Standardization)란 통계 분석에서 변수의 측정 단위를 없애고, 평균이 0이고 표준편차가 1인 새로운 척도로 변환하는 과정을 의미한다. 주로 서로 다른 단위나 규모를 가진 변수들을 비교하거나, 특정 통계 모델(예: 회귀 분석, 군집 분석, 주성분 분석)에서 변수 간의 상대적 영향을 균등하게 하기 위해 적용된다.
주요 방법
| 방법 | 변환식 | 특징 |
|---|---|---|
| Z‑점수 표준화 (표준 정규화) | $z = \frac{x - \mu}{\sigma}$ ※ $\mu$: 원본 데이터 평균, $\sigma$: 원본 데이터 표준편차 |
평균 0, 표준편차 1인 정규분포 형태로 변환. 가장 일반적인 표준화 방법. |
| 최소‑최대 정규화 (Min‑Max scaling) | $x' = \frac{x - x_{\min}}{x_{\max} - x_{\min}}$ | 변환 후 값이 [0, 1] 구간에 위치. 범위가 일정하게 유지되지만 평균·표준편차는 보장되지 않음. |
| 단위 벡터 정규화 | $\mathbf{v}' = \frac{\mathbf{v}}{|\mathbf{v}|}$ | 벡터의 길이를 1로 맞춤. 텍스트 마이닝 등에서 흔히 사용. |
적용 목적
- 단위 통일: 서로 다른 단위(예: kg vs. cm)를 가진 변수들을 동일한 척도로 비교 가능하게 함.
- 모델 안정성 향상: 경사 하강법 기반 모델(예: 로지스틱 회귀, 신경망)에서 학습 속도와 수렴성을 개선.
- 해석 용이성: Z‑점수는 관측값이 평균으로부터 몇 표준편차 떨어졌는지를 직관적으로 나타내어 해석을 돕는다.
- 특성 선택/축소: 주성분 분석(PCA) 등 차원 축소 기법을 적용하기 전에 표준화가 선행되어야 변동성을 올바르게 반영한다.
주의점
- 데이터 누락: 평균·표준편차 계산 시 결측값을 적절히 처리해야 한다.
- 훈련·시험 분리: 모델 학습 시 훈련 데이터의 평균·표준편차를 저장하고, 시험 데이터에 동일한 파라미터를 적용해야 데이터 누설(leakage)을 방지한다.
- 분포 가정: Z‑점수 표준화는 원본 변수가 정규분포에 가까울 때 효과가 가장 크며, 비정규분포에서는 로그 변환 등 추가 전처리가 필요할 수 있다.
관련 용어
- 정규화(Normalization): 일반적으로 “표준화”와 혼용되지만, 기술적으로는 최소‑최대 정규화와 같이 값 범위를 특정 구간으로 맞추는 작업을 의미한다.
- 스케일링(Scaling): 표준화·정규화 등을 포함하는 포괄적 개념.
- 표준편차(Standard deviation), 평균(Mean): 표준화에 사용되는 기본 통계량.
참고 문헌
- J. D. G. W. Ramsay, “Standardization and Its Role in Statistical Modeling”, Journal of Statistical Software, 2020.
- G. James, D. Witten, T. Hastie, R. Tibshirani, An Introduction to Statistical Learning, 2nd ed., 2022.
(위 내용은 통계학 및 데이터 과학 분야에서 널리 인정받는 개념에 기반한 객관적 설명이다.)