F값 (통계)
F값(F-value)은 통계학에서 사용되는 검정 통계량(test statistic)의 하나로, 두 분산의 비율로 정의된다. 주로 분산분석(ANOVA), 회귀분석, 분산비검정 등에서 집단 간 차이의 통계적 유의성을 평가하는 데 사용된다. F값은 영국의 통계학자 로널드 피셔(Ronald A. Fisher)의 이름을 따 명명된 F-분포(F-distribution)를 따르며, 이 분포는 조지 스네데커(George W. Snedecor)에 의해 체계화되어 피셔-스네데커 분포(Fisher–Snedecor distribution)라고도 불린다.
정의
F값은 독립적인 두 카이제곱분포(χ²)를 각각의 자유도로 나눈 값의 비로 정의된다. 즉,
$$ F = \frac{U_1 / u_1}{U_2 / u_2} \sim F_{ u_1, u_2} $$
여기서 $U_1 \sim \chi^2_{ u_1}$, $U_2 \sim \chi^2_{ u_2}$이며, $ u_1$은 분자에 해당하는 카이제곱분포의 자유도, $ u_2$는 분모에 해당하는 카이제곱분포의 자유도이다.
분산분석에서의 F값
분산분석(ANOVA)에서 F값은 집단 간 분산(between-group variance)과 집단 내 분산(within-group variance)의 비율로 계산된다.
$$ F = \frac{s^2_{bet}}{s^2_{wit}} $$
- 집단 간 분산($s^2_{bet}$): 각 집단 평균이 전체 평균으로부터 얼마나 떨어져 있는지를 나타내는 분산으로, 표본 크기 $n$과 표본 평균의 표준오차를 이용하여 $s^2_{bet} = n s^2_{\bar{X}}$로 계산된다.
- 집단 내 분산($s^2_{wit}$): 각 집단 내 개별 관측값들이 해당 집단 평균 주위에 흩어진 정도를 나타내는 분산으로, 각 집단의 표본분산을 산술평균하여 추정한다.
F값이 1에 가까우면 집단 간 차이가 집단 내 변동성과 유사한 수준임을 의미하며, 이는 집단 평균들이 동일한 모집단에서 추출되었을 가능성이 높다는 귀무가설을 지지한다. 반면 F값이 1보다 충분히 크면 집단 간 변동이 집단 내 변동보다 크다는 것을 의미하며, 이는 적어도 하나의 집단 평균이 다른 집단과 유의하게 다를 가능성을 시사한다.
F-분포와 유의성 검정
F값 자체만으로는 통계적 유의성을 판단할 수 없으며, F-분포를 이용하여 해당 F값이 관측될 확률(p-value)을 계산해야 한다. F-분포는 두 자유도 $ u_1, u_2$에 의해 형태가 결정되는 연속 확률분포로, 항상 양의 값을 가지며 일반적으로 오른쪽으로 긴 꼬리를 갖는 비대칭 분포이다.
계산된 F값이 F-분포상에서 상위 5% 또는 1% 등 사전에 설정된 유의수준(α)에 해당하는 임계값보다 클 경우, 귀무가설을 기각하고 집단 간 평균 차이가 통계적으로 유의하다고 판단한다.
t값과의 관계
두 집단을 비교하는 경우, F값은 t값의 제곱과 정확히 일치한다($F = t^2$). 이때 F분포의 분자 자유도는 1, 분모 자유도는 t분포의 자유도와 동일하다($F_{1, u} = t^2_{ u}$). 이러한 관계는 t-검정이 분산분석의 특수한 경우(두 집단)임을 보여준다.
주요 활용
- 분산분석(ANOVA): 세 개 이상의 집단 간 평균 차이를 검정할 때 사용된다.
- 회귀분석: 회귀모형 전체의 유의성을 평가하는 F-검정에 사용되며, 독립변수들이 종속변수의 분산을 유의미하게 설명하는지 판단한다.
- 분산비검정(variance ratio test): 두 모집단의 분산이 동일한지 검정할 때 사용된다.
성질
- F분포에서 분자와 분모의 자유도가 서로 바뀐 두 분포 사이에는 $F_{ u_1, u_2, \alpha} = \frac{1}{F_{ u_2, u_1, 1-\alpha}}$의 관계가 성립한다.
- F분포의 평균은 $E(X) = \frac{ u_2}{ u_2 - 2}$ (단, $ u_2 > 2$)이며, 분산은 $Var(X) = \frac{2 u_2^2( u_1 + u_2 - 2)}{ u_1( u_2 - 2)^2( u_2 - 4)}$ (단, $ u_2 > 4$)이다.