정준상관분석(正準相關分析, Canonical Correlation Analysis, CCA)은 두 개의 변수 집합(Variable Set) 간의 선형 관계성을 파악하기 위한 다변량 통계 기법이다. 하나의 종속 변수와 여러 독립 변수 간의 관계를 보는 회귀 분석이나, 두 변수 집합 간의 일반적인 상관관계를 보는 단순 상관분석과 달리, 두 변수 집합 각각을 대표하는 선형 결합(정준 변수)을 구성하여 이 두 선형 결합 간의 상관관계를 최대화하는 방향을 찾는 방법론이다.
1. 기본 개념 및 목적 정준상관분석의 주된 목적은 두 변수 집단(예: 심리검사 변수 집단과 학업성취 변수 집단) 사이에 존재하는 공통된 차원이나 구조를 파악하는 것이다. 이때 각 변수 집단을 대표하는 선형 결합을 '정준 변수(Canonical Variate)'라 하며, 첫 번째 정준 변수 쌍은 최대 상관관계를 가지도록, 두 번째 정준 변수 쌍은 첫 번째와 직교(독립)하면서 그 다음으로 높은 상관관계를 가지도록 추출된다.
2. 주요 용어
- 정준 변수(Canonical Variate): 원 변수들의 가중치 합으로 만들어진 새로운 합성 변수. X 집단과 Y 집단 각각에 대해 생성된다.
- 정준 상관계수(Canonical Correlation): 추출된 X 정준 변수와 Y 정준 변수 사이의 상관계수. 0에서 1 사이의 값을 가지며, 높을수록 두 변수 집합 간의 설명력이 높음을 의미한다.
- 정준 계수(Canonical Coefficient/Weight): 원 변수를 정준 변수로 변환할 때 적용되는 가중치. 표준화 계수와 비표준화 계수로 나뉜다.
- 정준 부하량(Canonical Loading/Structure Coefficient): 원 변수와 정준 변수 사이의 상관계수. 해당 원 변수가 정준 변수를 구성하는 데 얼마나 기여하는지(해석에 얼마나 중요한지)를 나타낸다.
3. 분석 절차
- 자료 적합성 검토: 표본 크기, 다중공선성, 정규성, 선형성 등 가정 충족 여부 확인.
- 정준 함수 추출: 고유값 분해 등을 통해 정준 상관계수와 정준 계수 산출. 변수 수 중 적은 쪽의 수만큼 정준 함수 쌍이 추출 가능하나, 통계적으로 유의미한 것만 해석한다.
- 유의성 검정: 윌크스 람다(Wilks' Lambda) 등 다변량 검정 통계량을 통해 각 정준 함수의 통계적 유의미성 검증.
- 결과 해석: 유의미한 정준 함수에 대해 정준 상관계수 크기, 정준 계수(비표준화/표준화), 정준 부하량, 교차 부하량(Cross-loading), 공통분산(Redundancy Index) 등을 종합하여 두 변수 집단 간의 관계 의미 해석.
- 공통분산(Redundancy Analysis) 산출: 한 변수 집단의 변동량이 다른 변수 집단의 정준 변수에 의해 얼마나 설명되는지 나타내는 지표로, 실질적 설명력을 평가하는 데 사용.
4. 장점 및 한계
- 장점: 두 변수 집합 간의 복잡한 다차원적 관계를 종합적으로 파악할 수 있으며, 변수 간 다중공선성 문제가 있어도 분석이 가능하다.
- 한계: 결과 해석이 복잡하고 주관적일 수 있으며, 인과관계를 입증하는 것이 아니라 단순히 선형적 연관성의 강도와 구조를 보여줄 뿐이다. 표본 크기에 민감하며, 이상치(Outlier)의 영향을 크게 받는다.
5. 활용 분야 심리학(검사 도구 간 타당도 검증), 교육학(교수법 변인과 학습 결과 변인 간 관계), 생태학(환경 요인 군과 생물 군집 군 간 관계), 마케팅(소비자 특성 변인과 구매 행동 변인 간 관계), 유전체학(유전자 발현 데이터와 표현형 데이터 간 연관성) 등 다양한 학문 분야에서 두 변수 집합 간의 구조적 관계를 탐색하는 데 널리 쓰인다.