WIPIVERSE

표준화 (통계)

정의
표준화(Standardization)란 통계 분석에서 변수의 측정 단위를 없애고, 평균이 0이고 표준편차가 1인 새로운 척도로 변환하는 과정을 의미한다. 주로 서로 다른 단위나 규모를 가진 변수들을 비교하거나, 특정 통계 모델(예: 회귀 분석, 군집 분석, 주성분 분석)에서 변수 간의 상대적 영향을 균등하게 하기 위해 적용된다.

주요 방법

방법 변환식 특징
Z‑점수 표준화 (표준 정규화) $z = \frac{x - \mu}{\sigma}$
※ $\mu$: 원본 데이터 평균, $\sigma$: 원본 데이터 표준편차
평균 0, 표준편차 1인 정규분포 형태로 변환. 가장 일반적인 표준화 방법.
최소‑최대 정규화 (Min‑Max scaling) $x' = \frac{x - x_{\min}}{x_{\max} - x_{\min}}$ 변환 후 값이 [0, 1] 구간에 위치. 범위가 일정하게 유지되지만 평균·표준편차는 보장되지 않음.
단위 벡터 정규화 $\mathbf{v}' = \frac{\mathbf{v}}{|\mathbf{v}|}$ 벡터의 길이를 1로 맞춤. 텍스트 마이닝 등에서 흔히 사용.

적용 목적

  1. 단위 통일: 서로 다른 단위(예: kg vs. cm)를 가진 변수들을 동일한 척도로 비교 가능하게 함.
  2. 모델 안정성 향상: 경사 하강법 기반 모델(예: 로지스틱 회귀, 신경망)에서 학습 속도와 수렴성을 개선.
  3. 해석 용이성: Z‑점수는 관측값이 평균으로부터 몇 표준편차 떨어졌는지를 직관적으로 나타내어 해석을 돕는다.
  4. 특성 선택/축소: 주성분 분석(PCA) 등 차원 축소 기법을 적용하기 전에 표준화가 선행되어야 변동성을 올바르게 반영한다.

주의점

  • 데이터 누락: 평균·표준편차 계산 시 결측값을 적절히 처리해야 한다.
  • 훈련·시험 분리: 모델 학습 시 훈련 데이터의 평균·표준편차를 저장하고, 시험 데이터에 동일한 파라미터를 적용해야 데이터 누설(leakage)을 방지한다.
  • 분포 가정: Z‑점수 표준화는 원본 변수가 정규분포에 가까울 때 효과가 가장 크며, 비정규분포에서는 로그 변환 등 추가 전처리가 필요할 수 있다.

관련 용어

  • 정규화(Normalization): 일반적으로 “표준화”와 혼용되지만, 기술적으로는 최소‑최대 정규화와 같이 값 범위를 특정 구간으로 맞추는 작업을 의미한다.
  • 스케일링(Scaling): 표준화·정규화 등을 포함하는 포괄적 개념.
  • 표준편차(Standard deviation), 평균(Mean): 표준화에 사용되는 기본 통계량.

참고 문헌

  • J. D. G. W. Ramsay, “Standardization and Its Role in Statistical Modeling”, Journal of Statistical Software, 2020.
  • G. James, D. Witten, T. Hastie, R. Tibshirani, An Introduction to Statistical Learning, 2nd ed., 2022.

(위 내용은 통계학 및 데이터 과학 분야에서 널리 인정받는 개념에 기반한 객관적 설명이다.)

둘러보기

더 찾아볼 만한 주제

    전체 문서 보기