언어 코드는 특정 언어를 식별하기 위해 국제적으로 표준화된 문자열 표기이다. 대표적인 표준에는 다음이 포함된다.
-
ISO 639
- ISO 639‑1: 두 자리 알파벳 코드(예:
en= 영어,ko= 한국어). - ISO 639‑2 및 ISO 639‑3: 세 자리 알파벳 코드(예:
eng= 영어,kor= 한국어). ISO 639‑3은 거의 모든 기존 언어에 대한 코드를 제공한다.
- ISO 639‑1: 두 자리 알파벳 코드(예:
-
IETF 언어 태그 (BCP 47)
- ISO 639 코드에 국가·지역 코드(ISO 3166‑1 α‑2)와 스크립트 코드(ISO 15924) 등을 결합하여 보다 상세한 언어 변형을 지정한다. 예시:
en-US(미국 영어),zh-Hant-TW(대만의 전통 중국어).
- ISO 639 코드에 국가·지역 코드(ISO 3166‑1 α‑2)와 스크립트 코드(ISO 15924) 등을 결합하여 보다 상세한 언어 변형을 지정한다. 예시:
-
기타 표준
- UN M.49는 지역 코드(예:
001= 전 세계,150= 유럽)와 결합해 언어 사용 범위를 기술한다. - CLDR (Common Locale Data Repository)는 위 표준을 바탕으로 로케일 데이터와 서식 정보를 제공한다.
- UN M.49는 지역 코드(예:
활용 분야
- 웹·소프트웨어 국제화: HTML
lang속성, HTTPAccept-Language헤더, 프로그래밍 언어의 로케일 설정 등에 사용된다. - 데이터베이스·메타데이터: 도서관·아카이브의 기록, 다국어 콘텐츠 관리 시스템 등에서 언어를 메타데이터로 명시한다.
- 머신러닝·자연어 처리: 언어별 모델 선택·학습, 데이터 전처리 단계에서 언어 코드를 기준으로 분류한다.
제한 사항 및 주의점
- ISO 639‑1 코드는 2 % 미만의 언어만 포함하므로, 대부분의 언어를 식별하려면 ISO 639‑3 또는 BCP 47 형식을 사용해야 한다.
- 동일 언어라도 지역·스크립트·방언에 따라 서로 다른 태그가 필요할 수 있다(예:
pt-BRvspt-PT).
참고 문헌
- ISO 639 표준 (International Organization for Standardization)
- RFC 5646 – BCP 47: Tags for Identifying Languages (IETF)
- Unicode CLDR (Unicode Consortium)
위 내용은 공인된 국제 표준 문서와 기술 사양에 근거한 객관적인 설명이다.