편차(偏差, deviation)는 통계학에서 관측값과 평균(또는 중앙값)의 차이를 뜻하는 개념이다. 편차 점수(deviation score)라고도 한다.
정의
어떤 변인 $y$에서 특정 사례의 편차 $d$는 다음과 같이 나타낼 수 있다.
$$ d = y - \overline{y} $$
여기서 $\overline{y}$는 자료의 평균을 의미한다. 편차는 양수일 수도 있고 음수일 수도 있으며, 이는 해당 관측값이 평균보다 크거나 작은 정도를 나타낸다. 편차 값의 절댓값이 클수록 그 관측값이 평균으로부터 멀리 떨어져 있음을 의미한다.
수학적 특징
-
편차의 합은 항상 0이다. 주어진 자료에서 모든 편차를 더하면 항상 0이 된다. 즉, $\Sigma(y - \overline{y}) = 0$이 성립한다. 이 때문에 편차를 그대로 평균내어 산포도를 구할 수 없으며, 편차를 제곱하여 평균을 구한 값인 분산(variance)을 사용한다.
-
편차의 표준편차는 원자료의 표준편차와 같다. 편차 $D$의 표준편차는 원래 변인 $Y$의 표준편차와 동일한 값을 가진다.
관련 개념
-
분산(variance): 관측값에서 평균을 뺀 값(편차)을 제곱하여 모두 더한 뒤 전체 개수로 나눈 값이다. 편차의 합이 항상 0이 되기 때문에, 부호 문제를 해소하기 위해 제곱하여 평균을 구한다.
-
표준편차(standard deviation): 분산의 양의 제곱근이다. 분산을 제곱하여 왜곡된 값을 원래 단위로 되돌아오게 한다.
-
절대 편차(absolute deviation): 관측값에서 평균 또는 중앙값을 뺀 차이에 절댓값을 취하여 그 값들의 대푯값을 구한 것이다.
-
잔차(residual)와 오류(error): 모집단 평균에서의 편차는 오류(error)로 부르고, 표본 평균에서의 편차는 잔차(residual)로 구분하여 부르기도 한다.
용어의 어원
'편차'라는 한자어는 '어긋날 편(偏)'과 '다를 차(差)'의 결합으로, "치우쳐 있거나 벗어난 차이"라는 의미를 담고 있다. 영어 'deviation'은 라틴어 'deviare'(길에서 벗어나다)에서 유래한 것으로, 기준점으로부터 벗어난 정도를 나타내는 의미를 지닌다.
활용 분야
편차는 통계학의 기초 개념으로, 데이터의 산포도(흩어짐의 정도)를 측정하는 기초가 된다. 표준편차와 분산의 계산을 통해 교육평가, 품질관리, 심리측정, 경제·금융 분석 등 다양한 분야에서 자료의 변동성을 파악하는 데 활용된다.