WIPIVERSE

점별 상호정보량

점별 상호정보량(Pointwise Mutual Information, PMI)은 통계학, 확률론, 정보 이론에서 사용되는 상관 관계의 척도이다. 두 사건이 함께 발생할 확률을, 두 사건이 서로 독립적이라고 가정했을 때의 확률과 비교하여 측정한다.

이 개념은 1961년 로버트 파노(Robert Fano)가 처음 제시하였으며, 이후 자연어 처리(Natural Language Processing, NLP) 분야에서 단어 간 연관성을 평가하는 핵심 개념 중 하나로 자리잡았다. 특히 긍정 점별 상호정보량(Positive PMI, PPMI) 변형이 널리 사용된다.

정의

두 이산 확률 변수 X와 Y에 대해, 특정 사건 x와 y의 점별 상호정보량은 다음과 같이 정의된다.

$$ PMI(x, y) = \log_2 \frac{P(x, y)}{P(x) P(y)} $$

여기서 $P(x, y)$는 x와 y가 동시에 발생할 결합 확률, $P(x)$와 $P(y)$는 각각 x와 y가 발생할 개별 확률이다.

해석

  • PMI 값이 0이면 두 사건이 서로 독립적임을 의미한다. 즉, 두 사건이 동시에 발생할 확률이 우연히 기대되는 수준과 같다.
  • PMI 값이 양수이면 두 사건이 독립 가정보다 더 자주 함께 발생함을 의미하며, 이는 두 사건 사이에 양의 상관관계가 있음을 나타낸다.
  • PMI 값이 음수이면 두 사건이 독립 가정보다 덜 자주 함께 발생함을 의미하며, 이는 두 사건 사이에 음의 상관관계(상호 배타적 관계)가 있음을 나타낸다.

자연어 처리에서의 활용

NLP에서 PMI는 주로 말뭉치(corpus) 내에서 두 단어 간의 연관성을 측정하는 데 사용된다. 예를 들어, "코카"와 "콜라"라는 두 단어가 개별적으로는 드물게 등장하지만, 함께 등장하는 빈도가 높다면 PMI 값이 높게 산출된다. 이는 두 단어가 강한 연관성을 가짐을 정량적으로 보여준다.

긍정 점별 상호정보량(PPMI)

실제 응용에서는 음수 PMI 값이 신뢰성이 낮은 경우가 많아, 음수 값을 0으로 대체한 PPMI(Pointwise Positive Mutual Information)가 자주 사용된다.

$$ PPMI(x, y) = \max(PMI(x, y), 0) $$

상호정보량(MI)과의 관계

점별 상호정보량(PMI)이 특정 사건 쌍에 대한 값이라면, 상호정보량(Mutual Information, MI)은 모든 가능한 사건 쌍에 대한 PMI의 기댓값(평균)으로 정의된다. 즉, MI는 확률 변수 전체의 의존성을 측정하는 반면, PMI는 개별 사건 쌍 간의 관계를 측정한다.

둘러보기

더 찾아볼 만한 주제

    전체 문서 보기