다중서열정렬(multiple sequence alignment, MSA)은 생물정보학(bioinformatics)의 핵심 분석 기법 중 하나로, 다양한 생명체에서 동일한 기능을 수행하는 단백질 서열(아미노산 서열) 또는 핵산 서열(DNA, RNA 염기서열)이 여러 개 존재할 때, 이들을 한꺼번에 묶어서 서로 간의 유사성과 차이점이 드러나도록 수직적으로 배열하는 방법이다.
목적 및 의의
다중서열정렬을 통해 정렬된 서열의 각 열(column) 위치별로 진화적으로 잘 보존되어 온 잔기(conserved residues)와 변이가 일어난 잔기(variable residues)를 비교할 수 있다. 일반적으로 보존성이 높은 영역은 해당 단백질 또는 핵산의 기능이나 구조 유지에 중요한 역할을 하는 부분으로 해석된다. 이러한 정보는 진화적 관계 추론, 단백질 구조 예측, 기능적 모티프(motif) 발견 등 다양한 생물학적 연구에 활용된다.
대표적인 알고리즘 및 도구
다중서열정렬을 수행하는 대표적인 알고리즘으로는 ClustalW가 널리 알려져 있다. 이 외에도 MUSCLE(Multiple Sequence Comparison by Log-Expectation), MAFFT, Clustal-Omega, PRANK 등 다양한 도구들이 개발되어 사용되고 있다. 이들 도구는 각각 속도와 정확성 측면에서 차이가 있으며, 분석 대상 데이터의 규모와 특성에 따라 선택적으로 활용된다.
계통수 및 시각화와의 연계
다중서열정렬의 결과는 계통수(phylogenetic tree)를 작성하는 기초 자료로 사용된다. 정렬된 서열 간의 유사도를 바탕으로 생물 종 간의 진화적 거리를 계산하고, 이를 시각화하여 계통 관계를 파악할 수 있다. 또한 WebLogo와 같은 도구를 이용하여 각 위치별 염기 또는 아미노산의 보존 패턴을 그래픽으로 표현할 수 있다.
최신 연구 동향
보존성이 높은 열(column)들 간의 상호관계를 분석하여 서로 연관되어 진화하는 부분(co-evolving residues)이 단백질의 구조 및 기능에 중요하다는 연구가 진행되었으며, 이의 대표적인 분석 방법으로 SCA(Statistical Coupling Analysis)가 있다. 또한 최근에는 인공지능 기반 단백질 구조 예측 모델인 알파폴드(AlphaFold)에서도 다중서열정렬 결과가 입력 특징값으로 활용되어, 단백질의 3차원 구조 예측 정확도를 높이는 데 기여하고 있다.
관련 분야
다중서열정렬은 쌍서열정렬(pairwise sequence alignment)과 함께 서열 정렬(sequence alignment)의 한 유형으로 분류된다. 쌍서열정렬이 두 개의 서열을 비교하는 데 초점을 맞추는 반면, 다중서열정렬은 셋 이상의 서열을 동시에 비교한다는 점에서 차이가 있다.