Attention Is All You Need는 2017년 Google Brain과 Google Research 소속 연구자 8명(Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, Illia Polosukhin)이 NeurIPS(Neural Information Processing Systems) 학회에 발표한 논문이다. 이 논문은 기계 번역 분야에서 기존의 순환 신경망(RNN)이나 합성곱 신경망(CNN)을 완전히 배제하고, 오직 어텐션(attention) 메커니즘만으로 구성된 새로운 신경망 아키텍처인 트랜스포머(Transformer)를 제안하였다.
배경 및 동기
2017년 이전까지 시퀀스 변환(sequence transduction) 작업, 특히 기계 번역 분야에서는 LSTM이나 GRU와 같은 순환 신경망이 주류를 이루었다. 이러한 모델들은 입력 시퀀스를 순차적으로 처리해야 했기 때문에 학습 과정에서 병렬화가 불가능하였고, 시퀀스 길이가 길어질수록 앞부분의 정보가 소실되는 장기 의존성(long-range dependency) 문제가 존재하였다. 어텐션 메커니즘은 이러한 문제를 완화하기 위해 이미 사용되고 있었으나, 대부분의 경우 순환 신경망 위에 추가적인 구성 요소로 활용되었다. 본 논문은 순환 신경망 없이 어텐션만으로도 시퀀스 모델링이 가능함을 최초로 입증하였다.
모델 구조
트랜스포머는 인코더-디코더(encoder-decoder) 구조를 채택한다. 인코더와 디코더는 각각 6개의 동일한 레이어로 구성된다. 각 인코더 레이어는 두 개의 서브 레이어로 이루어져 있다: 첫 번째는 멀티-헤드 셀프-어텐션(multi-head self-attention) 메커니즘이고, 두 번째는 위치별(position-wise) 완전 연결 피드포워드 네트워크(feed-forward network)이다. 각 서브 레이어에는 잔차 연결(residual connection)과 레이어 정규화(layer normalization)가 적용된다. 디코더는 인코더와 동일한 두 개의 서브 레이어 외에도, 인코더 출력에 대해 멀티-헤드 어텐션을 수행하는 세 번째 서브 레이어를 추가로 포함한다. 디코더의 셀프-어텐션은 미래 위치의 정보를 참조하지 못하도록 마스킹(masking) 처리되어 자기회귀(auto-regressive) 속성을 유지한다.
핵심 기술
스케일드 닷-프로덕트 어텐션(Scaled Dot-Product Attention): 쿼리(query), 키(key), 값(value)이라는 세 가지 벡터를 사용하여 어텐션을 계산한다. 쿼리와 키의 내적(dot product)을 계산한 후, 키의 차원(d_k)의 제곱근으로 나누어 스케일링하고, 소프트맥스(softmax) 함수를 적용하여 가중치를 구한 뒤 값과의 가중합을 출력한다. 스케일링을 수행하는 이유는 차원이 커질수록 내적 값의 분산이 커져 소프트맥스 함수의 기울기가 소실되는 현상을 방지하기 위함이다.
멀티-헤드 어텐션(Multi-Head Attention): 단일 어텐션 함수를 사용하는 대신, 쿼리, 키, 값을 서로 다른 선형 변환(linear projection)을 통해 h번(논문에서는 h=8) 투영한 후 병렬로 어텐션을 수행하고, 그 결과를 연결(concatenate)하여 다시 선형 변환한다. 이를 통해 모델이 서로 다른 표현 부분 공간(representation subspace)에서 다양한 위치의 정보에 동시에 주목할 수 있게 된다.
포지셔널 인코딩(Positional Encoding): 트랜스포머는 순환 구조가 없으므로 시퀀스 내 토큰의 순서 정보를 자체적으로 알 수 없다. 이를 해결하기 위해 사인(sine)과 코사인(cosine) 함수를 사용한 위치 인코딩을 입력 임베딩에 더해준다. 이 방식은 학습 데이터보다 긴 시퀀스에 대해서도 일반화가 가능하다는 장점이 있다.
실험 결과
WMT 2014 영어-독일어 번역 작업에서 트랜스포머(big 모델)는 28.4 BLEU 점수를 기록하여 기존 최고 성능(앙상블 모델 포함)을 2 BLEU 이상 초과하였다. WMT 2014 영어-프랑스어 번역 작업에서는 41.0 BLEU 점수를 기록하여 단일 모델 기준 새로운 최고 성능을 달성하였다. 학습에는 8개의 NVIDIA P100 GPU가 사용되었으며, big 모델의 학습에는 약 3.5일이 소요되었다. 이는 기존 최고 모델 대비 훨씬 적은 학습 비용에 해당한다.
영향 및 의의
"Attention Is All You Need"는 현대 인공지능 연구에서 가장 많이 인용된 논문 중 하나로, 발표 이후 수십만 회 이상 인용되었다. 이 논문에서 제안된 트랜스포머 아키텍처는 이후 BERT(2018, Google), GPT 시리즈(2018~, OpenAI), T5(2019, Google) 등 거의 모든 주요 대규모 언어 모델(LLM)의 기반이 되었다. 또한 자연어 처리 분야를 넘어 컴퓨터 비전(Vision Transformer, ViT), 음성 인식, 단백질 구조 예측(AlphaFold 2) 등 다양한 분야로 확장되어 적용되었다. 이 논문은 딥러닝 역사에서 가장 영향력 있는 연구 중 하나로 평가된다.