통계학에서 편향(bias)은 결과와 실제 사실 간의 차이를 유발하는 체계적인 경향을 의미한다. 편향은 데이터의 출처, 추정량의 선택, 데이터 분석 방법 등 데이터 분석 과정의 여러 단계에서 발생할 수 있다.
추정량의 편향
추정량의 편향(bias of an estimator)은 추정량의 기댓값과 추정 대상이 되는 모수(parameter)의 실제 값 간의 차이로 정의된다. 모수 θ를 추정하기 위한 추정량 \hat{θ}가 있을 때, 편향은 다음과 같이 정의된다.
Bias(\hat{θ}) = E[\hat{θ}] - θ
편향이 0인 추정량을 불편추정량(unbiased estimator)이라고 하며, 편향이 0이 아닌 추정량을 편의추정량(biased estimator)이라고 한다. 이론적으로는 불편추정량이 선호되지만, 실제 통계 실무에서는 다음과 같은 이유로 편향이 작은 편의추정량이 자주 사용된다. 첫째, 추가적인 가정 없이는 불편추정량이 존재하지 않는 경우가 있다. 둘째, 불편추정량이 계산하기 어려운 경우가 있다. 셋째, 편의추정량이 평균제곱오차(MSE) 측면에서 더 낮은 값을 가질 수 있어 전체적으로 더 정확한 추정이 가능할 수 있다.
편향의 유형
통계적 편향은 발생 단계에 따라 여러 유형으로 구분된다.
선택 편향(selection bias)은 특정 개체가 다른 개체보다 연구 대상으로 선택될 가능성이 더 높아 표본이 모집단을 대표하지 못하게 되는 현상이다. 이는 표본 추출 과정에서 발생하는 체계적 왜곡을 의미한다.
추정량 편향(estimator bias)은 앞서 설명한 바와 같이 추정량의 기댓값과 실제 모수 간의 차이에서 비롯된다.
보고 편향(reporting bias)은 특정 종류의 관측 결과가 다른 결과보다 보고될 가능성이 더 높아 데이터의 가용성에 왜곡이 생기는 현상이다.
편향과 오차의 구분
편향은 정확성 문제(기기 고장이나 부적절한 측정), 데이터 부족, 혹은 필사 과정의 실수(오타) 등과 같은 다른 유형의 오류와 구별된다. 편향은 데이터의 선택이나 수집 기준 자체에 체계적인 왜곡이 있음을 의미한다. 또한 통계적 가설 검정에서의 1종 오류(귀무가설이 참이나 기각되는 경우)와 2종 오류(귀무가설이 거짓이나 기각되지 않는 경우)는 편향과는 별개의 개념이다.
편향과 분산의 관계
추정량의 정확성을 평가하는 지표인 평균제곱오차(MSE)는 다음과 같이 편향의 제곱과 분산의 합으로 분해된다.
MSE(\hat{θ}) = (Bias(\hat{θ}))² + Var(\hat{θ})
이 관계는 편향-분산 상충관계(bias-variance tradeoff)로 알려져 있으며, 편향을 약간 허용함으로써 분산을 크게 줄여 전체적인 추정 오차를 감소시킬 수 있음을 보여준다.