WIPIVERSE

표본 분포

표본 분포(sampling distribution) 또는 표집분포는 통계학에서, 크기 n의 확률 표본(random sample)으로부터 계산된 통계량(statistic)의 확률 분포를 의미한다. 표본 통계량이란 표본 평균, 표본 분산, 표본 비율 등 표본의 특성을 나타내는 대푯값을 말하며, 이들 통계량은 표본에 따라 값이 달라지는 확률 변수이므로 그 자체로 하나의 분포를 갖는다. 표본 분포는 모집단의 특성을 추정하거나 통계적 가설을 검정하는 데 핵심적인 기반이 되는 개념이다.

표본 평균의 분포

표본 분포의 대표적인 예는 표본 평균의 분포이다. 모집단이 정규 분포 N(μ, σ²)를 따르고, 그로부터 크기 n인 임의 표본을 추출할 때, 표본 평균 X̄의 분포에 대하여 다음이 성립한다.

  • 표본 평균의 기댓값은 모평균과 같다. 즉 E(X̄) = μ이다.
  • 표본 평균의 분산은 모분산을 표본 크기로 나눈 값이다. 즉 V(X̄) = σ²/n이다.
  • 표본 평균 X̄의 분포는 X̄ ~ N(μ, σ²/n)을 따른다.
  • 모집단이 정규 분포를 따르지 않더라도 표본 크기 n이 충분히 크면 위의 성질이 근사적으로 성립한다.

이 마지막 성질은 중심 극한 정리(central limit theorem)의 주요한 내용으로, 모집단의 분포 형태와 무관하게 표본 크기가 충분히 크면 표본 평균의 분포가 정규 분포에 수렴함을 보장한다. 이를 바탕으로 통계적 추론이 이루어진다.

표준 오차

표본 분포의 표준 편차를 표준 오차(standard error)라고 한다. 표본 평균의 표준 오차는 σ/√n으로 표현되며, 표본 크기가 커질수록 표본 평균의 분포가 모평균 주변에 더욱 밀집하게 된다. 표집 오차(sampling error)는 모집단의 표준 편차에 근사한다.

표집 분포와의 관계

표집 분포(sampling distribution)는 연구 대상이 되는 모집단에서 다중 복수의 표본을 추출하여 얻은 자료를 통해 통계적 가설을 검증할 때 필요한 분포를 가리킨다. 모집단으로부터 충분히 여러 번 표집하여 얻은 표본 평균들은 표집 분포를 형성하며, 이 표집 분포의 평균은 모집단의 평균에 수렴한다. 즉 μ_X̄ = μ가 성립한다.

활용

표본 분포는 모평균 추정, 신뢰 구간 설정, 가설 검정 등 추론 통계학의 여러 영역에서 기본적인 도구로 사용된다. 이항 분포의 경우 표본 크기 n이 충분히 클 때(보통 np > 5, nq > 5) 정규 분포 N(np, npq)로 근사할 수 있다. 또한 표본 분산의 분포는 카이제곱 분포, 표본 평균의 분포는 t 분포 등과 같은 다양한 분포와 연결되어 통계적 분석에 활용된다.

둘러보기

더 찾아볼 만한 주제

    전체 문서 보기