정의
순서형 데이터(ordinal data)는 통계학 및 데이터 과학에서 사용되는 데이터 유형 중 하나로, 값들 사이에 명확한 순서(서열)가 존재하지만 그 간격이 일정하거나 측정 가능한 수치적 차이를 갖지는 않는 데이터를 말한다. 예를 들어, 설문 조사에서의 ‘매우 만족’, ‘만족’, ‘보통’, ‘불만족’, ‘매우 불만족’과 같은 응답 옵션은 순서는 정의되지만, 각 옵션 사이의 차이가 정량적으로 동일하다고 가정할 수 없다.
특징
| 특징 | 설명 |
|---|---|
| 서열 존재 | 값들 간에 앞뒤 관계가 명확히 정의된다. |
| 간격 불명 | 인접 값 사이의 차이가 일정하거나 의미가 명확하지 않다. |
| 연산 제한 | 평균·표준편차 등 수치적 연산은 일반적으로 부적합하며, 중앙값·분위수·빈도 등 순위 기반 통계가 주로 사용된다. |
| 측정 수준 | 측정 척도의 네 단계 중 ‘서열(Ordinal)’ 수준에 해당한다. |
| 분류 방식 | 명목형 데이터와 구분되며, 명목형은 순서 자체가 없고, 연속형(비율/구간) 데이터는 간격이 정량적으로 정의된다. |
주요 활용 사례
- 사회과학 설문: 만족도, 의견 강도, 교육 수준(예: 고졸, 대졸, 대학원) 등.
- 의료 연구: 통증 강도(경증, 중증, 고통), 질병 진행 단계.
- 마케팅: 구매 의향(매우 그렇다/그렇다/보통/그렇지 않다/전혀 아니다).
- 교육 평가: 학점(A, B, C, D, F) 또는 등급(상, 중, 하).
분석 방법
- 비모수 검정: Mann‑Whitney U, Kruskal‑Wallis, Wilcoxon 부호 검정 등.
- 서열 회귀: 순위 로짓 모델, 순위 프로빗 모델 등.
- 통계 요약: 중앙값, 사분위수, 빈도분포, 누적 빈도.
관련 개념과의 구분
- 명목형 데이터(Nominal data): 카테고리 간에 순서가 없으며, 예) 성별, 혈액형.
- 구간형 데이터(Interval data): 순서와 일정한 간격을 가지고 있지만 절대 영점이 없다. 예) 섭씨 온도.
- 비율형 데이터(Ratio data): 순서, 일정한 간격, 절대 영점 모두 존재. 예) 길이, 무게, 금액.
어원 및 용어 형성
- 순서형(順序形): ‘순서(順序)’는 ‘서열·정렬’을 의미하고, ‘형(形)’은 ‘형태·형식’을 뜻한다. 즉, ‘순서가 있는 형태’를 나타낸다.
- 데이터(data): 라틴어 datum(주어진 것)에서 온 영어 ‘data’가 한국어에 차용된 형태이다.
참고 사항
- 순서형 데이터는 그 자체가 ‘데이터의 서열적 특성을 강조한 범주형 데이터’이며, 통계적 분석 시 적절한 비모수 방법이나 서열 전용 모델을 사용하는 것이 일반적이다.
- 특정 경우에는 순서를 수치적으로 변환(예: 1~5 점 척도)하여 분석에 활용하기도 하지만, 변환 과정에서 간격이 동일하다는 가정을 명시적으로 검토해야 한다.