WIPIVERSE

한중일 통합 한자 확장 B 목록 (20000-215FF)

개요
한중일 통합 한자 확장 B 목록(20000‑215FF)은 유니코드 표준에서 정의된 “CJK 통합 한자 확장 B”(CJK Unified Ideographs Extension B) 블록의 초기에 해당하는 코드 포인트 구간을 말한다. 이 구간은 U+20000부터 U+215FF까지이며, 제2 보조 평면(Supplementary Ideographic Plane, SIP)에 위치한다. 확장 B 블록은 기존 기본 평면( BMP, U+0000‑U+FFFF)에 포함되지 않은 드문 한자, 고어 한자, 변형 형태, 그리고 고전 문헌에서 사용된 문자들을 포괄한다.

역사 및 배경

  • 제정 배경: 유니코드 3.0(1999년)에서 처음 도입된 확장 B 블록은 한자(한·중·일) 사용 국가들의 문자 요구를 충족시키기 위해 마련되었다. 기존 BMP에 포함된 20 960개의 CJK 통합 한자 외에도, 고문헌·사전·문화유산 등에 필요하는 수만 개의 추가 한자를 수록하기 위해 확장 B가 설계되었다.
  • 코드 할당: 초기 할당은 U+20000‑U+215FF(약 5 760개의 코드 포인트)로 시작했으며, 이후 확장 B 전체는 U+20000‑U+2A6DF(≈ 42 720개)까지 확대되었다.

특징

항목 내용
범위 U+20000 – U+215FF (5 760 코드 포인트)
평면 제2 보조 평면 (SIP)
문자 종류 - 고대·중세 한자 (예: 갑골문, 금문, 석본 등)
- 변형·보조 문자 (예: 異体字, 異形字)
- 국제 표준 사전에 수록된 희귀 문자
사용 언어 한자 사용 국가(중국, 일본, 한국) 전반에 걸친 고전 텍스트, 학술 연구, 디지털 아카이브 등
표기 방식 UTF‑16에서는 서러게이트 쌍(surrogate pair)으로 인코딩되며, UTF‑8에서는 4바이트 시퀀스로 표현된다.
지원 상황 최신 운영체제와 주요 폰트(예: Noto Sans CJK, Source Han Serif)에서 일부 문자에 대한 글리프가 제공된다. 하지만 모든 문자에 대한 완전한 폰트 지원은 아직 제한적이다.

활용 예시

  1. 학술 연구: 고전 문헌 전자화 프로젝트(예: 중국 고전 전집 디지털화)에서 원문 그대로 기록하기 위해 확장 B 문자를 사용한다.
  2. 디지털 인코딩: XML, JSON 등 텍스트 기반 데이터 포맷에서 한자 고유 번호를 보존하기 위해 U+20000‑U+215FF 범위의 코드를 직접 삽입한다.
  3. 글꼴 개발: 한자 전용 글꼴 제작 시 확장 B에 포함된 희귀 문자를 수록함으로써 전통 문서의 가독성을 확보한다.

제한점 및 현재 상황

  • 글리프 가용성: 일부 문자에 대한 글리프가 아직 주요 상용 폰트에 포함되지 않아 표시가 “□”(문자 없음)으로 나타날 수 있다.
  • 입력 지원: 일반적인 입력기에서는 확장 B 문자를 직접 입력하기 어려워, 코드 포인트 복사·붙여넣기 방식이 주로 활용된다.
  • 표준화: 유니코드 협회는 지속적으로 신규 한자와 변형문자를 평가·수록하고 있으며, 확장 B 외에도 확장 C, D, E, F 등이 추가로 정의되어 있다.

참고문헌

  • Unicode Consortium, The Unicode Standard, Version 15.0 (2022).
  • “CJK Unified Ideographs Extension B”. Wikipedia, The Free Encyclopedia.
  • “Unicode Ideographic Description Sequences”. Unicode Technical Report #36.

요약
한중일 통합 한자 확장 B 목록(20000‑215FF)은 유니코드 제2 보조 평면에 위치한, 한자 사용 국가들의 고전·희귀 문자를 포괄하는 문자 집합의 초기 구간이다. 주로 학술·디지털 아카이브 분야에서 원문 보존을 위해 활용되며, 최신 폰트와 시스템에서 점차 지원이 확대되고 있다.

둘러보기

더 찾아볼 만한 주제

    전체 문서 보기