개요
한중일 통합 한자 확장 B 목록(20000‑215FF)은 유니코드 표준에서 정의된 “CJK 통합 한자 확장 B”(CJK Unified Ideographs Extension B) 블록의 초기에 해당하는 코드 포인트 구간을 말한다. 이 구간은 U+20000부터 U+215FF까지이며, 제2 보조 평면(Supplementary Ideographic Plane, SIP)에 위치한다. 확장 B 블록은 기존 기본 평면( BMP, U+0000‑U+FFFF)에 포함되지 않은 드문 한자, 고어 한자, 변형 형태, 그리고 고전 문헌에서 사용된 문자들을 포괄한다.
역사 및 배경
- 제정 배경: 유니코드 3.0(1999년)에서 처음 도입된 확장 B 블록은 한자(한·중·일) 사용 국가들의 문자 요구를 충족시키기 위해 마련되었다. 기존 BMP에 포함된 20 960개의 CJK 통합 한자 외에도, 고문헌·사전·문화유산 등에 필요하는 수만 개의 추가 한자를 수록하기 위해 확장 B가 설계되었다.
- 코드 할당: 초기 할당은 U+20000‑U+215FF(약 5 760개의 코드 포인트)로 시작했으며, 이후 확장 B 전체는 U+20000‑U+2A6DF(≈ 42 720개)까지 확대되었다.
특징
| 항목 | 내용 |
|---|---|
| 범위 | U+20000 – U+215FF (5 760 코드 포인트) |
| 평면 | 제2 보조 평면 (SIP) |
| 문자 종류 | - 고대·중세 한자 (예: 갑골문, 금문, 석본 등) - 변형·보조 문자 (예: 異体字, 異形字) - 국제 표준 사전에 수록된 희귀 문자 |
| 사용 언어 | 한자 사용 국가(중국, 일본, 한국) 전반에 걸친 고전 텍스트, 학술 연구, 디지털 아카이브 등 |
| 표기 방식 | UTF‑16에서는 서러게이트 쌍(surrogate pair)으로 인코딩되며, UTF‑8에서는 4바이트 시퀀스로 표현된다. |
| 지원 상황 | 최신 운영체제와 주요 폰트(예: Noto Sans CJK, Source Han Serif)에서 일부 문자에 대한 글리프가 제공된다. 하지만 모든 문자에 대한 완전한 폰트 지원은 아직 제한적이다. |
활용 예시
- 학술 연구: 고전 문헌 전자화 프로젝트(예: 중국 고전 전집 디지털화)에서 원문 그대로 기록하기 위해 확장 B 문자를 사용한다.
- 디지털 인코딩: XML, JSON 등 텍스트 기반 데이터 포맷에서 한자 고유 번호를 보존하기 위해 U+20000‑U+215FF 범위의 코드를 직접 삽입한다.
- 글꼴 개발: 한자 전용 글꼴 제작 시 확장 B에 포함된 희귀 문자를 수록함으로써 전통 문서의 가독성을 확보한다.
제한점 및 현재 상황
- 글리프 가용성: 일부 문자에 대한 글리프가 아직 주요 상용 폰트에 포함되지 않아 표시가 “□”(문자 없음)으로 나타날 수 있다.
- 입력 지원: 일반적인 입력기에서는 확장 B 문자를 직접 입력하기 어려워, 코드 포인트 복사·붙여넣기 방식이 주로 활용된다.
- 표준화: 유니코드 협회는 지속적으로 신규 한자와 변형문자를 평가·수록하고 있으며, 확장 B 외에도 확장 C, D, E, F 등이 추가로 정의되어 있다.
참고문헌
- Unicode Consortium, The Unicode Standard, Version 15.0 (2022).
- “CJK Unified Ideographs Extension B”. Wikipedia, The Free Encyclopedia.
- “Unicode Ideographic Description Sequences”. Unicode Technical Report #36.
요약
한중일 통합 한자 확장 B 목록(20000‑215FF)은 유니코드 제2 보조 평면에 위치한, 한자 사용 국가들의 고전·희귀 문자를 포괄하는 문자 집합의 초기 구간이다. 주로 학술·디지털 아카이브 분야에서 원문 보존을 위해 활용되며, 최신 폰트와 시스템에서 점차 지원이 확대되고 있다.