연관 규칙 학습법(Association Rule Learning)은 대규모 데이터베이스에서 변수들 간의 흥미로운 관계를 발견하기 위한 규칙 기반 기계 학습 방법이다. 이는 데이터 마이닝 분야에서 널리 사용되는 기법으로, 관심의 정도를 측정하는 다양한 척도를 사용하여 데이터베이스에서 발견된 강력한 규칙을 식별하는 것을 목적으로 한다.
이 개념은 라케시 아그라왈(Rakesh Agrawal), 토마즈 이미엘린스키(Tomasz Imieliński), 애런 스와미(Arun Swami)에 의해 처음 도입되었다. 이들은 슈퍼마켓의 POS(Point-of-Sale) 시스템으로 기록된 대규모 거래 데이터에서 제품 간 규칙성을 발견하기 위한 연관 규칙을 제안하였다. 예를 들어, 슈퍼마켓 판매 데이터에서 발견된 {감자, 양파} ⇒ {햄버거} 규칙은 감자와 양파를 함께 구매한 손님이 햄버거 고기도 함께 구매할 가능성이 높음을 의미한다. 이러한 정보는 가격 프로모션이나 제품 배치와 같은 마케팅 활동의 의사 결정에 기초 자료로 활용될 수 있다.
연관 규칙 학습법의 기본 정의는 다음과 같다. I = {i₁, i₂, ..., iₙ}이 n개의 이진 속성(항목)들의 집합이고, D = {d₁, d₂, ..., dₙ}이 데이터베이스 내 일련의 거래(트랜잭션)라고 할 때, 각 거래는 고유한 거래 ID를 가지며 I의 부분집합을 포함한다. 규칙은 X ⇒ Y의 형식으로 정의되며, 여기서 X와 Y는 I의 부분집합이고, X는 선행 사건(antecedent, 왼쪽 부분), Y는 결과(consequent, 오른쪽 부분)라고 불린다.
연관 규칙의 주요 평가 척도로는 지지도(Support), 신뢰도(Confidence), 향상도(Lift)가 있다. 대표적인 알고리즘으로는 아프리오리(Apriori) 알고리즘, FP-Growth, Eclat 등이 있다.
장바구니 분석(Market Basket Analysis)이 가장 대표적인 응용 사례이며, 그 외에도 웹 사용 마이닝(Web Usage Mining), 침입 탐지(Intrusion Detection), 지속적 생산(Continuous Production), 생물정보학(Bioinformatics) 등 다양한 분야에서 활용된다. 순차 패턴 마이닝(Sequence Mining)과 달리, 연관 규칙 학습법은 일반적으로 거래 내에서 항목들의 순서를 고려하지 않는다.
다만, 연관 규칙 알고리즘은 다양한 매개변수로 구성되어 있어 데이터 마이닝에 대한 전문 지식이 없는 사용자가 실행하기 어려울 수 있으며, 생성되는 규칙의 수가 많아 해석에 어려움이 있을 수 있다는 한계가 있다.