WIPIVERSE

KS X 1001

KS X 1001은 한국산업표준(Korean Industrial Standards, KSA) 중 하나로, 한글 및 한자를 포함한 문자 집합을 정의한다. 원래는 KS C 5601(대한민국 국가표준)이라는 명칭으로 제정되었으며, 1998년 표준 번호 체계 개편에 따라 현재의 KS X 1001로 명칭이 변경되었다.

개요

  • 제정 및 개정
    • 최초 제정: 1987년 (KS C 5601‑1987)
    • 주요 개정: 1992년, 1998년 (KS X 1001‑1998)
  • 표준 범위
    • 8비트(1바이트) 코드 체계로, 94 × 94의 두 자릿수 코드 행·열(※ 각 자리 0xA1–0xFE)로 구성된 8,822개의 코드 포인트를 제공한다.
    • 포함 문자:
      • 현대 한글 음절(11,172자 중 2,350자)
      • 한자(약 5,000자)
      • 라틴 문자, 기호, 구두점 등 기타 문자
  • 구조
    • 1~94행: 라틴 문자·기호·괄호·구두점 등
    • 2~94행: 한글 조합음절 및 한자 등
  • 인코딩 형태
    • EUC‑KR(Extended Unix Code for Korean)에서 기본 문자 집합으로 사용된다.
    • 마이크로소프트의 CP949(Windows‑949) 및 IBM의 CP936 등 파생 인코딩이 KS X 1001을 기반으로 추가 문자 영역을 확장한 형태이다.

국제 표준과의 관계

  • KS X 1001은 ISO/IEC 2022의 “ISO‑IR 149” 레지스터와 호환되는 코드 포인트 집합을 정의한다.
  • Unicode(유니코드)와는 별개의 인코딩이지만, 1992년 이후 Unicode 1.1에 KS X 1001에 포함된 문자들이 매핑되어 현재 대부분의 현대 시스템에서는 Unicode로 변환하여 사용한다.

실용적 활용

  • 운영체제·소프트웨어: Windows 95 이후의 한국어 버전, 리눅스 배포판, 웹 서버 등에서 EUC‑KR을 기본 인코딩으로 지원한다.
  • 문서·데이터 교환: 전자우편, 웹 페이지, 데이터베이스 등에서 UTF‑8이 보편화되기 전까지 한국어 텍스트 교환 표준으로 널리 사용되었다.
  • 산업·학술 분야: 한국어 전용 데이터베이스, 전자출판, 문자 인식(OCR) 등에 여전히 KS X 1001 기반 코드 변환 로직이 포함되는 경우가 있다.

현재 상황

  • Unicode(특히 UTF‑8) 사용이 국제적으로 표준화됨에 따라 신규 시스템에서는 KS X 1001 대신 Unicode를 채택하는 경우가 대부분이다.
  • 그러나 레거시 시스템·문서·소프트웨어와의 호환성을 위해 KS X 1001 정의는 한국표준협회(KSA)의 공식 웹사이트에서 최신 버전으로 제공되고 있다.

참고

  • Korean Standards Association (KSA) 공식 문서 “KS X 1001:1998 – Information technology – Character set for Korean”
  • “EUC‑KR” 및 “CP949” 인코딩 사양, ISO/IEC 2022 규격 문서.
둘러보기

더 찾아볼 만한 주제

    전체 문서 보기