유니코드 코드 포인트 범위 U+2B000–U+2BFFF에 대한 개요
- 범위: U+2B000부터 U+2BFFF까지 총 4,096개의 연속 코드를 포함한다.
- Unicode 표준에서의 배정
- CJK 통합 한자 확장 C (CJK Unified Ideographs Extension C): U+2A700–U+2B73F 중 U+2B000–U+2B73F에 해당하는 부분이 이 범위에 포함된다.
- CJK 통합 한자 확장 D (CJK Unified Ideographs Extension D): U+2B740–U+2B81F가 포함된다.
- 그 외: U+2B820–U+2BFFF는 CJK 통합 한자 확장 E (Extension E) 와 확장 F (Extension F) 의 시작 부분에 해당하거나 아직 할당되지 않은 코드 포인트로 남아 있다.
- 문자 종류
- 주로 한자(漢字) 로, 고대·중세 중국어, 일본어, 베트남어(한자)에서 사용된 희귀·전통 문자들을 포함한다.
- 일부 문자에 대해서는 한자 사전이나 학술 자료에만 등재되어 일반 텍스트에서는 거의 사용되지 않는다.
- 스크립트 및 블록
- 스크립트: Han (한자)
- 블록: CJK Unified Ideographs Extension C, Extension D, Extension E 등 여러 블록이 겹쳐 있다.
- 인코딩 특성
- UTF‑8 인코딩 시 4바이트(예:
0xF0 0xAB 0x80 0x80이상)로 표현된다. - UTF‑16에서는 서러게이트 쌍(
U+D840–U+DBFF와U+DC00–U+DFFF)을 사용한다.
- UTF‑8 인코딩 시 4바이트(예:
- 활용 예시
- 학술·문헌 연구: 고문서 디지털화, 고대 사서 전자화 프로젝트 등에서 필요하다.
- 표준화: 국제 표준 문자 집합에 포함되어, 한자 관련 국제 표준(예: ISO/IEC 10646)에서 정의된다.
- 표준 문서
- Unicode Consortium이 발행한 Unicode Standard, Version 15.0(2022)와 최신 업데이트에 해당 범위의 코드 할당표가 수록되어 있다.
- 공식 코드 차트: [Unicode Code Charts – CJK Unified Ideographs Extension C] 및 [Extension D, E] 페이지에서 확인 가능.
주요 참고 사항
- 위 범위에 속한 다수의 문자들은 일반적인 컴퓨팅 환경에서 폰트 지원이 제한적일 수 있다.
- 일부 코드 포인트는 아직 할당되지 않음(unassigned) 상태로 남아 있으며, 향후 Unicode 버전에서 새로운 문자에 할당될 가능성이 있다.
본 내용은 Unicode Consortium이 제공하는 공개 자료에 근거한 객관적 서술이며, 확인되지 않은 추정은 포함하지 않았다.