BLEU(Bilingual Evaluation Understudy)는 기계 번역 시스템의 출력 품질을 자동으로 평가하기 위해 사용되는 정량적 지표이다. 2002년 IBM 연구원인 쿠시마(Kishore Papineni)와 동료들이 제안했으며, 기계 번역 결과와 하나 이상의 인간 번역 참조 문장 사이의 n-그램 일치 정도를 기반으로 점수를 산출한다.
주요 특징
- n‑그램 일치
- 1‑gram(단어)부터 4‑gram까지의 일치 비율을 계산한다.
- 정밀도와 짧은 문장 페널티
- 각 n‑gram에 대한 정밀도를 구한 뒤 기하 평균을 취하고, 번역문이 참조문보다 현저히 짧을 경우 Brevity Penalty(BP)를 적용한다.
- 최종 BLEU 점수는
BLEU = BP * exp(∑_{n=1}^{N} w_n log p_n)형태로 표현된다. 여기서p_n은 n‑gram 정밀도,w_n은 보통 1/4씩 균등 가중치를 갖는다.
- 다중 참조
- 여러 개의 참조 번역이 제공될 경우, 각 n‑gram에 대해 가장 높은 일치 횟수를 사용한다.
장점
- 자동화: 인간 평가자 없이 대규모 코퍼스에 대해 빠르게 점수를 산출할 수 있다.
- 재현 가능성: 동일한 데이터와 설정을 사용하면 일관된 결과를 얻는다.
- 표준화: 기계 번역 연구에서 널리 채택된 벤치마크 지표로, 모델 간 비교가 용이하다.
제한점
- 문맥·의미 고려 부족: n‑gram 일치만을 기준으로 하므로 의미적 정확성이나 문체의 자연스러움은 충분히 반영되지 않는다.
- 길이 편향: 짧은 번역이 높은 정밀도를 얻을 수 있어, Brevity Penalty가 필요하지만 완전히 보정되지 않을 수 있다.
- 언어 특수성: 형태소가 풍부한 언어나 어순이 자유로운 언어에서는 n‑gram 매칭이 어려워 점수 해석에 주의가 필요하다.
활용 사례
- 기계 번역 시스템 개발: 신경망 기계 번역(NMT), 통계적 기계 번역(SMT) 등 다양한 모델의 성능을 비교·조정하는 데 사용된다.
- 번역 품질 모니터링: 실제 서비스 환경에서 번역 품질 변화를 추적하기 위한 지표로 활용된다.
어원 및 용어 설명
- BLEU는 “Bilingual Evaluation Understudy”의 약자로, “이중 언어 평가 대역(대체) 모델”이라는 의미를 내포한다.
- “understudy”는 원래 연극에서 주역을 대신할 배우를 가리키는 단어이며, 여기서는 인간 평가자를 대체한다는 의미로 채택되었다.
참고 사항
BLEU는 기계 번역 품질을 정량적으로 평가하는 데 널리 사용되는 표준 지표이며, 다수의 학술 논문 및 산업 프로젝트에서 구현·활용되고 있다. 다만, 인간의 주관적 평가와는 차이가 있을 수 있음을 인식하고, 필요에 따라 METEOR, TER, chrF 등 보완적인 평가 지표와 함께 사용하는 것이 권장된다.