클러스터 분석(cluster analysis)은 군집 분석, 클러스터링(clustering), 또는 군집화라고도 불리며, 자료 집합의 대상들을 그룹으로 분할하여 같은 그룹(이 그룹을 군집 또는 클러스터라고 함) 내의 대상들이 다른 그룹의 대상들보다 서로 더 많은 유사성을 보이도록 하는 데이터 분석 기법이다. 이는 탐색적 자료 분석의 주요 과제이자 통계적 데이터 분석의 일반적인 기법으로, 패턴 인식, 이미지 분석, 정보 검색, 생물정보학, 데이터 압축, 컴퓨터 그래픽스, 기계 학습 등 여러 분야에서 사용된다.
클러스터 분석은 하나의 특정 알고리즘이라기보다 일련의 알고리즘과 과제들을 통칭한다. "군집"이라는 개념은 정확하게 정의될 수 없는데, 이것이 군집 알고리즘이 매우 많은 이유 중 하나이다. 연구자마다 서로 다른 군집 모델을 사용하며, 각 모델에 대해 다시 서로 다른 알고리즘이 존재할 수 있다. 전형적인 군집 모델로는 연결성 모델(계층적 군집화), 무게 중심 모델(K-평균 알고리즘), 분포 모델(기댓값 최대화 알고리즘), 밀도 모델(DBSCAN, OPTICS), 부분공간 모델, 그래프 기반 모델, 신경망 모델 등이 있다.
군집화는 크게 하드 군집화(각 객체가 군집에 속하거나 속하지 않음)와 소프트 군집화(각 객체가 특정 정도로 각 군집에 속함)로 구분된다. 또한 엄격한 분할 군집화, 이상치를 포함한 분할 군집화, 중첩 군집화, 계층적 군집화 등으로 더 세분화된다.
객관적으로 "올바른" 군집화 알고리즘은 존재하지 않으며, 특정 문제에 가장 적합한 알고리즘은 대개 실험적으로 선택되어야 한다. 클러스터 분석은 1932년 드라이버(Driver)와 크로버(Kroeber)에 의해 인류학에서 기원하였으며, 1938년 조셉 주빈(Joseph Zubin)과 1939년 로버트 트라이언(Robert Tryon)에 의해 심리학에 도입되었다.
주요 군집화 알고리즘으로는 계층적 군집화(hierarchical clustering), K-평균 군집화(k-means clustering), DBSCAN(밀도 기반 군집화), 가우시안 혼합 모델(Gaussian mixture model) 등이 있다. 군집 결과의 평가는 군집화 자체만큼이나 어려우며, 내부 평가(실루엣 계수, 데이비스-볼딘 지수, 던 지수 등), 외부 평가(랜드 지수, F-척도, 상호정보 등), 인간 전문가 평가 등이 사용된다.
클러스터 분석은 생물학(유전자 발현 패턴 분석, 계통분류학), 의학(의료 영상 분석), 시장 조사(소비자 세분화), 사회 연결망 분석(커뮤니티 탐지), 이미지 분할, 추천 시스템, 이상 탐지, 문서 군집화, 범죄 분석, 기후학 등 다양한 분야에서 활용되고 있다.