WIPIVERSE

잠재 의미 분석

잠재 의미 분석(Latent Semantic Analysis, LSA)은 자연어 처리(Natural Language Processing, NLP) 및 분포 의미론(Distributional Semantics) 분야에서 사용되는 기술로, 문서 집합과 해당 문서에 포함된 용어들 간의 관계를 분석하여 문서와 용어와 관련된 개념 집합을 생성하는 방법이다. 정보 검색(Information Retrieval) 맥락에서는 잠재 의미 색인(Latent Semantic Indexing, LSI)이라고도 불린다.

LSA의 기본 가정은 의미가 유사한 단어는 유사한 텍스트 부분에 나타난다는 분포 가설(Distributional Hypothesis)에 기반한다. 이 방법은 문서-용어 행렬(Document-Term Matrix, DTM)을 구성한 후, 선형대수학의 특잇값 분해(Singular Value Decomposition, SVD)를 적용하여 고차원의 희소 행렬을 저차원의 밀집 행렬로 축소한다. 이 과정에서 원래 행렬의 차원을 축소하면서도 문서 간 유사성 구조는 최대한 보존하게 된다. 축소된 저차원 공간에서 문서 간 유사도는 코사인 유사도(Cosine Similarity)를 통해 측정되며, 1에 가까울수록 유사한 문서, 0에 가까울수록 상이한 문서로 판단한다.

LSA는 1988년 스콧 디어웨스터(Scott Deerwester), 수잔 뒤메이스(Susan Dumais), 조지 퍼나스(George Furnas), 리처드 하쉬먼(Richard Harshman), 토머스 랜다우어(Thomas Landauer), 카렌 로크바움(Karen Lochbaum), 린 스트리터(Lynn Streeter)에 의해 특허를 받았으며(미국 특허 4,839,853, 현재 만료됨), 이후 자연어 처리와 정보 검색 분야에서 널리 활용되었다.

LSA의 주요 응용 분야로는 문서 분류 및 군집화, 정보 검색, 문서 요약, 교차 언어 정보 검색(Cross-Language Information Retrieval), 자동 에세이 평가, 특허 선행 기술 검색 등이 있다. 또한 인간의 기억 연구, 특히 자유 회상(Free Recall) 과제에서 단어 간 의미적 유사성과 회상 확률 간의 상관관계를 분석하는 데에도 사용되었다.

LSA의 한계점으로는 다음과 같은 사항이 지적된다. 첫째, 차원 축소 후 생성된 차원들이 해석하기 어려운 경우가 많다. 둘째, 동음이의어(Polysemy)를 완전히 포착하지 못하는데, 이는 동일한 단어가 문맥에 따라 다른 의미를 가지더라도 하나의 벡터로 표현되기 때문이다. 셋째, 단어의 순서를 고려하지 않는 BoW(Bag of Words) 모델의 한계를 그대로 지닌다. 넷째, LSA의 확률적 모델이 실제 데이터의 분포(푸아송 분포)와 일치하지 않는다는 비판이 있으며, 이에 대한 대안으로 확률적 잠재 의미 분석(Probabilistic Latent Semantic Analysis, pLSA)이나 잠재 디리클레 할당(Latent Dirichlet Allocation, LDA) 등의 방법이 제안되었다.

LSA는 오픈 소스 소프트웨어로도 구현되어 있으며, 대표적으로 Python 기반의 Gensim 라이브러리에서 대규모 행렬에 대한 LSA 구현을 제공한다.

둘러보기

더 찾아볼 만한 주제

    전체 문서 보기