WIPIVERSE

언어 코드

언어 코드는 특정 언어를 식별하기 위해 국제적으로 표준화된 문자열 표기이다. 대표적인 표준에는 다음이 포함된다.

  1. ISO 639

    • ISO 639‑1: 두 자리 알파벳 코드(예: en = 영어, ko = 한국어).
    • ISO 639‑2 및 ISO 639‑3: 세 자리 알파벳 코드(예: eng = 영어, kor = 한국어). ISO 639‑3은 거의 모든 기존 언어에 대한 코드를 제공한다.
  2. IETF 언어 태그 (BCP 47)

    • ISO 639 코드에 국가·지역 코드(ISO 3166‑1 α‑2)와 스크립트 코드(ISO 15924) 등을 결합하여 보다 상세한 언어 변형을 지정한다. 예시: en-US (미국 영어), zh-Hant-TW (대만의 전통 중국어).
  3. 기타 표준

    • UN M.49는 지역 코드(예: 001 = 전 세계, 150 = 유럽)와 결합해 언어 사용 범위를 기술한다.
    • CLDR (Common Locale Data Repository)는 위 표준을 바탕으로 로케일 데이터와 서식 정보를 제공한다.

활용 분야

  • 웹·소프트웨어 국제화: HTML lang 속성, HTTP Accept-Language 헤더, 프로그래밍 언어의 로케일 설정 등에 사용된다.
  • 데이터베이스·메타데이터: 도서관·아카이브의 기록, 다국어 콘텐츠 관리 시스템 등에서 언어를 메타데이터로 명시한다.
  • 머신러닝·자연어 처리: 언어별 모델 선택·학습, 데이터 전처리 단계에서 언어 코드를 기준으로 분류한다.

제한 사항 및 주의점

  • ISO 639‑1 코드는 2 % 미만의 언어만 포함하므로, 대부분의 언어를 식별하려면 ISO 639‑3 또는 BCP 47 형식을 사용해야 한다.
  • 동일 언어라도 지역·스크립트·방언에 따라 서로 다른 태그가 필요할 수 있다(예: pt-BR vs pt-PT).

참고 문헌

  • ISO 639 표준 (International Organization for Standardization)
  • RFC 5646 – BCP 47: Tags for Identifying Languages (IETF)
  • Unicode CLDR (Unicode Consortium)

위 내용은 공인된 국제 표준 문서와 기술 사양에 근거한 객관적인 설명이다.

둘러보기

더 찾아볼 만한 주제

    전체 문서 보기