WIPIVERSE

표본 오차

정의
표본 오차(sample error)는 모집단 전체를 조사하지 않고, 일부 표본을 통해 얻은 통계량이 실제 모집단의 모수와 차이가 나는 현상을 말한다. 이는 표본이 모집단을 완전히 대표하지 못하기 때문에 발생한다.

발생 원인

  1. 표본 크기의 제한: 표본 크기가 작을수록 무작위 변동에 의해 추정값이 모집단 모수와 크게 달라질 가능성이 높다.
  2. 표본 추출 방식: 단순 무작위 추출이 아닌 편향된 방법(예: 편의추출, 층화 미실시)으로 표본을 구성하면 오차가 증대한다.
  3. 우연 변동: 동일한 모집단에서 동일한 크기의 표본을 여러 번 추출하면 각각 다른 결과가 나타나는 것이 정상이며, 이는 통계적 우연에 기인한다.

표본 오차의 측정
표본 평균 $\bar{x}$와 모집단 평균 $\mu$ 사이의 표준오차(standard error, SE)는 다음과 같이 계산된다.

$$ SE = \frac{s}{\sqrt{n}} $$

  • $s$: 표본 표준편차
  • $n$: 표본 크기

표본 비율 $p$에 대한 표준오차는

$$ SE(p) = \sqrt{\frac{p(1-p)}{n}} $$

이와 같이 표본 오차는 표본 크기와 표본 분산에 의존한다.

표본 오차와 신뢰구간
신뢰구간(confidence interval)은 표본 오차를 고려하여 모집단 모수가 특정 구간 안에 있을 확률을 제시한다. 예를 들어 95 % 신뢰구간은

$$ \bar{x} \pm 1.96 \times SE $$

와 같이 표본 평균에 표준오차를 곱한 값을 더하고 빼어 구한다.

표본 오차 감소 방법

  1. 표본 크기 확대: $n$을 늘리면 표준오차가 $\sqrt{n}$에 반비례해 감소한다.
  2. 표본 설계 개선: 층화추출(stratified sampling), 군집추출(cluster sampling) 등 체계적인 방법을 사용해 편향을 최소화한다.
  3. 반복 측정: 동일한 표본을 여러 번 추출해 평균값을 구함으로써 우연 변동을 상쇄한다.

예시
전체 인구 1,000,000명 중 55 %가 특정 정책에 찬성한다는 가설을 검증하기 위해 1,000명을 무작위 표본으로 조사했다. 표본에서 찬성 비율이 53 %로 나타났다면, 표본 비율의 표준오차는

$$ SE = \sqrt{\frac{0.53 \times 0.47}{1000}} \approx 0.0158 ;(1.58%) $$

따라서 95 % 신뢰구간은 $0.53 \pm 1.96 \times 0.0158$ ≈ 0.499 ~ 0.561, 즉 49.9 % ~ 56.1 %가 된다. 이는 실제 모집단의 찬성 비율이 55 %와 차이가 있을 수 있음을 나타낸다.

관련 용어

  • 표본 편향(bias): 표본이 특정 방향으로 일관되게 모집단을 왜곡하는 경우.
  • 표준오차(standard error): 표본통계량의 표준편차로, 표본 오차의 정량적 측정값.
  • 신뢰구간(confidence interval): 표본 오차를 감안한 모수 추정 범위.

요약
표본 오차는 통계 조사에서 필연적으로 발생하는 현상이며, 표본 크기와 추출 방법에 따라 크기가 달라진다. 표본 오차를 정량화하고 최소화하는 절차는 신뢰성 있는 추정과 의사결정을 위해 핵심적인 통계 기법이다.

둘러보기

더 찾아볼 만한 주제

    전체 문서 보기