WIPIVERSE

CJK

CJK는 중국어(Chinese), 일본어(Japanese), 한국어(Korean)의 영문 약칭을 결합한 용어로, 주로 정보 처리(internationalization, 국제화) 분야에서 이 세 언어의 문자 체계를 함께 지칭할 때 사용된다. 베트남어(Chữ Nôm)까지 포함할 경우 CJKV, 좡어의 쓰임까지 포함하면 CJKVZ로 표기하기도 한다.

세 언어의 쓰기 체계는 모두 한자(漢字, Han ideograph)에 기반을 두거나 이를 일부 사용한다는 공통점이 있다. 중국어는 거의 전적으로 한자로 표기되며, 일반적 문해에 약 3,000자 이상이 요구된다. 일본어는 한자 사용 빈도가 상대적으로 낮아 기본 문해에 약 2,136자가 요구되며, 한국어에서의 한자 사용은 점차 감소 추세에 있으나 고유명사 등에서 여전히 사용된다. 다만 이들 언어에서 함께 쓰이는 음소 문자(중국어의 주음부호·병음, 일본어의 히라가나·가타카나, 한국어의 한글 등)는 엄밀한 의미의 'CJK 문자'에 해당하지 않지만, 해당 언어의 완전한 처리에는 필수 요소로 포함된다.

컴퓨터 문자 인코딩 측면에서 CJK 문자 집합은 그 수가 매우 많다는 점에서 중요한 의미를 갖는다. 필요한 문자의 총수가 8비트(256자) 인코딩 공간에 담을 수 없으므로, 16비트 고정 폭 또는 다중 바이트 가변 길이 인코딩이 사용된다. 대표적인 CJK 인코딩으로는 Big5, GB 2312, GB 18030, Shift-JIS, EUC-JP, EUC-KR, KS X 1001, Unicode 등이 있다. 각 인코딩은 동아시아 각국 정부와 소프트웨어 기업이 별도로 개발하여 상호 호환되지 않는 경우가 많았으며, 유니코드는 이를 하나의 통합 문자 집합으로 묶는 '한자 통합(Han unification)' 과정을 통해 해결하고자 하였다.

유니코드에서 CJK 문자는 전체 배정 코드 공간의 상당 부분을 차지한다. 'CJK Unified Ideographs' 블록이 대표적인 예이며, 유니코드 17.0 기준 한자(Han) 문자 약 101,996자가 수록되어 있다. 한자 통합 과정에서는 중국·일본의 서로 다른 문자 집합을 하나의 통합 문자로 매핑하는 방식의 기술적 타당성을 두고 일본 전문가들 사이에서 논란이 있기도 하였다.

'CJK'라는 약칭은 1980년대 초 도서관계의 문자 인코딩 표준 협력 과정에서 유래한 것으로 알려져 있다. 켄 런드(Ken Lunde)에 따르면 이 약칭은 한때 미국 도서관 연구 그룹(Research Libraries Group, 이후 OCLC와 합병)의 등록 상표였으며, OCLC가 1987년부터 2009년까지 소유한 이 상표권은 현재 만료되었다.

둘러보기

더 찾아볼 만한 주제

    전체 문서 보기