WIPIVERSE

더빈-왓슨 통계량

더빈-왓슨 통계량(Durbin–Watson statistic)은 통계학, 특히 회귀 분석에서 잔차(residual)들 사이의 자기상관(autocorrelation) 존재 여부를 검정하는 데 사용되는 검정통계량이다. 영국의 통계학자 제임스 더빈(James Durbin)과 제프리 왓슨(Geoffrey Watson)이 1950년과 1951년에 제안하였으며, 이 비율의 작은 표본 분포는 존 폰 노이만(John von Neumann)이 1941년에 먼저 도출한 바 있다.

더빈-왓슨 통계량은 주로 시계열 데이터를 사용하는 회귀 모형에서 오차항이 서로 독립적인지, 즉 인접한 관측치 간에 1차 자기상관(first-order autocorrelation)이 있는지를 판별하는 데 활용된다. 회귀 분석의 주요 가정 중 하나는 오차항의 독립성이며, 이를 위반할 경우 추정된 회귀 계수의 유의성 검정이 타당하지 않게 될 수 있기 때문에 이 검정이 필요하다.

계산식

더빈-왓슨 통계량 $d$는 다음과 같이 정의된다.

$$ d = \frac{\sum_{t=2}^{T}(e_t - e_{t-1})^2}{\sum_{t=1}^{T} e_t^2} $$

여기서 $e_t$는 t 시점의 잔차(residual)이며, $T$는 관측치의 총 개수이다. 표본 크기가 클 경우 $d$는 근사적으로 $2(1 - \hat{\rho})$와 같아지는데, $\hat{\rho}$는 지연 1(lag 1)에서의 잔차 표본 자기상관계수이다.

해석

더빈-왓슨 통계량은 항상 0과 4 사이의 값을 가진다.

  • $d \approx 2$ : 자기상관이 없음을 나타낸다.
  • $d$가 0에 가까울수록 : 양의 자기상관(positive autocorrelation)이 존재함을 의미한다. 즉, 연속적인 오차항이 양의 상관관계를 가진다.
  • $d$가 4에 가까울수록 : 음의 자기상관(negative autocorrelation)이 존재함을 의미한다. 즉, 연속적인 오차항이 음의 상관관계를 가진다.

일반적인 경험 법칙으로, $d$가 1.0보다 작으면 양의 계열 상관에 대한 경고 신호로 간주된다.

검정 절차

더빈-왓슨 검정은 귀무 가설($H_0$: 오차항에 자기상관이 없음)과 대립 가설($H_1$: 오차항에 1차 자기상관이 있음)을 설정한다. 검정통계량 $d$는 하한 임계값($d_{L,\alpha}$) 및 상한 임계값($d_{U,\alpha}$)과 비교된다.

  • 양의 자기상관 검정: $d < d_{L,\alpha}$이면 귀무 가설을 기각한다.
  • 음의 자기상관 검정: $4 - d < d_{L,\alpha}$이면 귀무 가설을 기각한다.
  • $d_{L,\alpha} \leq d \leq d_{U,\alpha}$ 또는 $4 - d_{U,\alpha} \leq d \leq 4 - d_{L,\alpha}$ 구간에 속하면 판정이 불확실한 영역(결정 불가)이 된다.

임계값은 유의수준($\alpha$), 관측치 수, 회귀 변수의 수(자유도)에 따라 달라지며, 일반적으로 통계 서적의 부록에서 확인할 수 있다.

한계 및 대안

더빈-왓슨 검정은 오직 1차 자기상관(lag 1)만을 검정한다는 한계가 있다. 더 높은 차수의 자기상관을 검정하기 위해서는 브로이쉬-고드프리 검정(Breusch–Godfrey test) 또는 륭-박스 검정(Ljung–Box test)이 사용될 수 있다. 또한, 설명 변수에 종속 변수의 시차 변수가 포함된 경우(자기회귀 모형)에는 더빈-왓슨 통계량이 편향될 수 있으므로, 이러한 경우 더빈의 $h$ 통계량(Durbin's h statistic)을 사용하는 것이 적절하다.

활용 분야

더빈-왓슨 통계량은 경제학, 금융, 계량경제학, 환경과학 등 시계열 데이터를 다루는 다양한 분야의 회귀 분석에서 모형 진단 도구로 널리 사용된다. SAS, R, Python(Statsmodels), SPSS, Minitab 등 대부분의 통계 소프트웨어에서 기본적으로 제공된다.

둘러보기

더 찾아볼 만한 주제

    전체 문서 보기