정의
TF-IDF(Term Frequency–Inverse Document Frequency)는 정보 검색 및 텍스트 마이닝 분야에서 단어의 중요도를 평가하기 위해 사용되는 가중치 통계이다. 특정 문서 내에서 단어가 얼마나 자주 등장하는지를 나타내는 Term Frequency(TF)와, 해당 단어가 전체 문서 집합 전체에서 얼마나 드물게 나타나는지를 나타내는 Inverse Document Frequency(IDF)를 곱하여 계산한다.
계산식
- TF(t, d): 단어 t가 문서 d에 등장한 횟수를 문서 d의 총 단어 수로 나눈 값(또는 로그 스케일 등 변형 가능).
- IDF(t, D): 전체 문서 집합 D에서 단어 t가 포함된 문서 수 *df(t)*에 대해
$$ \text{IDF}(t, D) = \log\left(\frac{|D|}{1 + df(t)}\right) $$
(분모에 1을 더해 0으로 나누는 상황을 방지한다.) - TF‑IDF(t, d, D):
$$ \text{TF‑IDF}(t, d, D) = \text{TF}(t, d) \times \text{IDF}(t, D) $$
주요 활용 분야
- 문서 검색: 검색어와 문서 간의 유사도를 벡터 공간 모델에서 코사인 유사도 등으로 측정할 때 기본 가중치로 사용된다.
- 텍스트 분류 및 클러스터링: 문서를 특징 벡터로 변환하여 기계 학습 알고리즘의 입력으로 활용한다.
- 키워드 추출: 문서 내에서 의미 있는 키워드를 자동으로 선정하는 작업에 적용된다.
- 추천 시스템: 사용자의 관심도와 아이템(문서, 기사 등)의 특성을 매칭하는 데 활용될 수 있다.
역사와 배경
TF-IDF는 1970년대 초반부터 정보 검색 연구에서 도입된 개념이며, 특히 1972년 Karen Spärck‑Jones의 연구에서 역문서 빈도(IDF)의 아이디어가 제시된 이후 널리 확산되었다. 이후 여러 변형(예: BM25, 확대 TF, 정규화 TF 등)이 개발되었지만, 기본적인 TF와 IDF의 곱 형태는 현재까지도 많이 사용된다.
제한점
- 문맥 무시: 단어 순서와 문맥 정보를 반영하지 않으므로, 동일한 단어라도 의미가 다를 경우 구분이 어려울 수 있다.
- 희소성: 대규모 코퍼스에서는 대부분의 TF‑IDF 값이 0에 가깝게 되어 차원 축소가 필요할 수 있다.
- 빈도 편향: 매우 짧은 문서나 특정 도메인에 특화된 용어는 가중치가 과대/과소 평가될 가능성이 있다.
관련 기술
- BM25: TF‑IDF를 기반으로 하면서 문서 길이 보정 및 다른 파라미터를 추가한 확장 모델.
- Word Embedding: Word2Vec, GloVe 등은 단어 간 의미적 유사성을 벡터로 학습하며, TF‑IDF와 결합해 하이브리드 특성 표현에 활용되기도 한다.
요약
TF‑IDF는 단어 빈도와 역문서 빈도를 결합하여 텍스트 데이터 내에서 단어의 상대적 중요성을 정량화하는 기법으로, 검색, 분류, 클러스터링 등 다양한 자연어 처리 작업에서 기본적인 특성 추출 방법으로 널리 채택되고 있다.