WIPIVERSE

유사도 측정

통계학 및 관련 분야에서 유사도 측정(Similarity measure)은 두 개체 간의 유사성을 정량화하는 실수 값 함수를 의미한다. 유사도 함수(Similarity function) 또는 유사도 지표(Similarity metric)라고도 불린다. 유사성에 대한 단일 정의는 존재하지 않지만, 일반적으로 이러한 측정값은 어떤 의미에서 거리 함수의 역으로 간주된다. 즉, 유사한 개체에 대해서는 큰 값을 가지며, 매우 다른 개체에 대해서는 0 또는 음수 값을 가진다.

유사도 측정은 비교 대상의 유형에 따라 다양한 공식이 존재한다. 데이터 포인트 간의 유사성을 측정하는 방법으로는 유클리드 거리, 맨해튼 거리, 민코프스키 거리, 체비쇼프 거리 등이 있다. 문자열 간의 유사도를 측정하기 위해서는 편집 거리, 레벤슈타인 거리, 해밍 거리, 자로 거리 등이 사용된다. 두 확률 분포 간의 유사도 측정에는 바타차리아 거리와 헬링거 거리가, 두 집합 간의 유사도 측정에는 자카드 지수와 쇠렌센-다이스 계수가 활용된다. 시계열 데이터의 경우 동적 시간 워핑(DTW)이 사용된다.

코사인 유사도는 실수 값 벡터에 일반적으로 사용되는 유사도 측정값으로, 정보 검색 분야에서 벡터 공간 모델의 문서 유사성을 평가하는 데 널리 활용된다. 기계 학습에서 방사 기저 함수 커널과 같은 커널 함수 역시 유사도 함수의 일종으로 볼 수 있다.

유사도 측정은 군집화(클러스터 분석)에서 핵심적인 역할을 한다. K-평균 알고리즘, 계층적 군집화, 스펙트럼 군집화 등 다양한 군집화 기법에서 데이터 포인트 간의 유사도를 기반으로 그룹을 형성한다. 또한 추천 시스템에서도 사용자와 항목 간의 유사도를 계산하여 개인화된 추천을 제공하는 데 사용된다. 생물정보학 분야에서는 서열 정렬(sequence alignment)을 위한 유사도 행렬이 사용되는데, 뉴클레오타이드 서열에는 단순한 일치/불일치 행렬이, 아미노산 서열에는 PAM 행렬이나 BLOSUM 행렬과 같은 더 복잡한 유사도 행렬이 활용된다.

둘러보기

더 찾아볼 만한 주제

    전체 문서 보기