WIPIVERSE

BERT (언어 모델)

BERT는 Bidirectional Encoder Representations from Transformers의 약자로, 2018년 구글(Google) AI 언어팀에 의해 발표된 사전학습 기반 자연어 처리(NLP) 모델이다. Transformer 구조의 인코더를 양방향으로 활용하여 문맥을 양쪽 방향에서 동시에 학습한다는 점에서 기존의 단방향 언어 모델과 차별화된다.

주요 특징

  1. 양방향 사전학습

    • 입력 토큰의 일부를 마스크(Masked) 처리하고, 이를 예측하도록 학습(Masked Language Modeling)한다.
    • 두 문장 사이의 관계를 예측하는 Next Sentence Prediction 과제를 함께 수행한다.
  2. Transformer 인코더 기반

    • Multi‑Head Self‑Attention 메커니즘을 이용해 토큰 간의 장거리 의존성을 효율적으로 모델링한다.
  3. Fine‑tuning 적용 용이

    • 사전학습된 가중치를 그대로 가져와 특정 과제(예: 감성 분석, 질의응답, 명명인식 등)에 맞게 몇 개의 추가 층만 학습시키면 높은 성능을 얻을 수 있다.

활용 사례

  • 문장 분류(Sentiment Analysis, Spam Detection 등)
  • 질의응답(Question Answering) 시스템
  • 자연어 추론(Natural Language Inference)
  • 명명된 개체 인식(Named Entity Recognition)
  • 문장 유사도 측정 및 다중 선택형 문제 등

파생 모델

BERT의 구조와 학습 방법을 바탕으로 여러 변형 모델이 개발되었다. 대표적인 예로는 RoBERTa(Facebook AI), ALBERT(Google), DistilBERT(Hugging Face) 등이 있다. 이들 모델은 학습 데이터 규모, 학습 목표, 모델 압축 등에서 차이를 두어 BERT의 성능을 개선하거나 경량화를 목표로 한다.

기술적 상세

  • 모델 크기: 기본 BERT‑Base는 12개의 Transformer 블록, 768 차원의 은닉 상태, 110 M 파라미터를 갖는다. BERT‑Large는 24개의 블록, 1024 차원의 은닉 상태, 340 M 파라미터를 보유한다.
  • 학습 데이터: 영어 기준으로 Wikipedia(약 2,500 M 토큰)와 BookCorpus(약 800 M 토큰) 등을 이용해 사전학습하였다.

한계와 비판

  • 대규모 사전학습에 필요한 계산 자원과 에너지 소모가 크다.
  • 마스크 토큰이 실제 문맥과 다르게 처리되는 경우, 사전학습 목표와 실제 응용 과제 사이에 불일치가 발생할 수 있다.
  • 언어별 데이터 불균형으로 인해 다국어 버전(Multilingual BERT)의 성능이 언어마다 차이를 보인다.

참고 문헌

  • Devlin, J., Chang, M.-W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv preprint arXiv:1810.04805.

(이 문서는 객관적·중립적인 서술을 목표로 하며, 공개된 학술 자료와 구글의 공식 발표를 바탕으로 작성되었다.)

둘러보기

더 찾아볼 만한 주제

    전체 문서 보기