KS X 1001은 한국산업표준(Korean Industrial Standards, KSA) 중 하나로, 한글 및 한자를 포함한 문자 집합을 정의한다. 원래는 KS C 5601(대한민국 국가표준)이라는 명칭으로 제정되었으며, 1998년 표준 번호 체계 개편에 따라 현재의 KS X 1001로 명칭이 변경되었다.
개요
- 제정 및 개정
- 최초 제정: 1987년 (KS C 5601‑1987)
- 주요 개정: 1992년, 1998년 (KS X 1001‑1998)
- 표준 범위
- 8비트(1바이트) 코드 체계로, 94 × 94의 두 자릿수 코드 행·열(※ 각 자리 0xA1–0xFE)로 구성된 8,822개의 코드 포인트를 제공한다.
- 포함 문자:
- 현대 한글 음절(11,172자 중 2,350자)
- 한자(약 5,000자)
- 라틴 문자, 기호, 구두점 등 기타 문자
- 구조
- 1~94행: 라틴 문자·기호·괄호·구두점 등
- 2~94행: 한글 조합음절 및 한자 등
- 인코딩 형태
- EUC‑KR(Extended Unix Code for Korean)에서 기본 문자 집합으로 사용된다.
- 마이크로소프트의 CP949(Windows‑949) 및 IBM의 CP936 등 파생 인코딩이 KS X 1001을 기반으로 추가 문자 영역을 확장한 형태이다.
국제 표준과의 관계
- KS X 1001은 ISO/IEC 2022의 “ISO‑IR 149” 레지스터와 호환되는 코드 포인트 집합을 정의한다.
- Unicode(유니코드)와는 별개의 인코딩이지만, 1992년 이후 Unicode 1.1에 KS X 1001에 포함된 문자들이 매핑되어 현재 대부분의 현대 시스템에서는 Unicode로 변환하여 사용한다.
실용적 활용
- 운영체제·소프트웨어: Windows 95 이후의 한국어 버전, 리눅스 배포판, 웹 서버 등에서 EUC‑KR을 기본 인코딩으로 지원한다.
- 문서·데이터 교환: 전자우편, 웹 페이지, 데이터베이스 등에서 UTF‑8이 보편화되기 전까지 한국어 텍스트 교환 표준으로 널리 사용되었다.
- 산업·학술 분야: 한국어 전용 데이터베이스, 전자출판, 문자 인식(OCR) 등에 여전히 KS X 1001 기반 코드 변환 로직이 포함되는 경우가 있다.
현재 상황
- Unicode(특히 UTF‑8) 사용이 국제적으로 표준화됨에 따라 신규 시스템에서는 KS X 1001 대신 Unicode를 채택하는 경우가 대부분이다.
- 그러나 레거시 시스템·문서·소프트웨어와의 호환성을 위해 KS X 1001 정의는 한국표준협회(KSA)의 공식 웹사이트에서 최신 버전으로 제공되고 있다.
참고
- Korean Standards Association (KSA) 공식 문서 “KS X 1001:1998 – Information technology – Character set for Korean”
- “EUC‑KR” 및 “CP949” 인코딩 사양, ISO/IEC 2022 규격 문서.