ISO/IEC 8859‑6은 ISO / IEC 8859 시리즈에 속하는 8비트 단일 바이트 문자 인코딩 중 하나로, 아랍어 표기에 사용된다. 공식 명칭은 “ISO 8859‑6: Latin/Arabic”이며, 1987년에 최초 표준화되었다.
개요
- 표준화 기관: 국제표준화기구(ISO)와 국제전기표준회의(IEC)
- 범위: 0x00‑0x7F 영역은 ASCII와 동일하며, 0xA0‑0xFF 영역에 아랍어 문자와 기호를 할당한다.
- 주요 문자: 아랍어 기본 자음(ا, ب, ت 등), 모음 기호, 숫자, 구두점, 그리고 아랍어 특수 기호(예: 샤다, 타마리브 등).
기술적 특징
| 구분 | 내용 |
|---|---|
| 코드 포맷 | 8비트(1바이트) 고정 길이 |
| 인코딩 방식 | 싱글 바이트, 각 바이트가 직접 문자에 매핑 |
| 대응 Unicode 영역 | 주로 U+0600‑U+06FF (아랍어 블록) 및 U+0750‑U+077F (아랍 보조 블록) |
| 호환성 | 0x00‑0x7F는 라틴 1(ISO‑8859‑1)과 동일, 0xA0‑0xFF는 아랍어 전용 문자 집합 |
구현 및 활용
- 운영체제 및 소프트웨어: 초기 UNIX 시스템, 일부 Windows 환경(코드 페이지 28596), IBM 메인프레임(Code page 819) 등에서 지원되었다.
- 통신 프로토콜: 이메일(MIME) 헤더에
charset=ISO-8859-6형태로 명시되어 사용된 사례가 있다. - 현대 대체: UTF‑8 등 유니코드 기반 인코딩이 보편화되면서 신규 시스템에서는 거의 사용되지 않으며, 레거시 시스템 및 오래된 데이터베이스에서만 찾아볼 수 있다.
표준 문서
- ISO/IEC 8859‑6:1999 – 최신 개정판, 기존 문자 집합에 대한 재정리와 오류 정정을 포함한다.
- ITU‑T.51 – 아랍어 문자 인코딩에 대한 국제 전기통신 연합(ITU) 권고와 연계된 부분이 있다.
제한 사항
- 문맥 의존형 서체: 아랍어는 문자 형태가 문맥에 따라 변하지만, ISO/IEC 8859‑6은 코드 포인트 수준에서 형태 변환 정보를 제공하지 않는다. 따라서 실제 표시를 위해서는 별도의 렌더링 엔진이 필요하다.
- 다중 문자 결합: 일부 아랍어 기호는 조합이 필요하므로, 단순 8비트 인코딩만으로는 완전한 표현이 어려울 수 있다.
참고
ISO/IEC 8859‑6은 아랍어 기반 시스템의 초기 국제 표준 중 하나였으며, 현재는 유니코드(특히 UTF‑8)로 대체되는 추세이다. 기존 데이터와 레거시 애플리케이션의 호환성을 유지하기 위해 여전히 지원되는 경우가 있다.