WIPIVERSE

데이터 품질

데이터 품질(Data Quality)은 데이터가 의도된 목적에 적합하게 활용될 수 있는 정도를 의미하는 개념이다. 데이터 품질은 데이터의 정확성, 완전성, 일관성, 신뢰성 등 다양한 기준을 종합적으로 평가하여 정의된다.

데이터 품질은 절대적인 의미에서 데이터가 "올바른지" 여부만을 의미하지 않으며, 데이터가 운영, 의사 결정, 계획 수립 등 특정 용도에 얼마나 적합하게 사용될 수 있는지(fitness for use)를 중심으로 판단된다. 데이터가 실제 세계의 대상을 정확히 반영하는 경우 일반적으로 높은 품질의 데이터로 간주된다.

정의

데이터 품질의 정의는 데이터가 사용되는 맥락과 이해관계자(최종 사용자, 생산자, 관리자)의 관점에 따라 다양하게 제시된다. 주요 정의는 다음과 같다.

  • 소비자 관점: "데이터 소비자가 사용하기에 적합한 데이터", "소비자의 기대를 충족하거나 초과하는 데이터"
  • 비즈니스 관점: "운영, 의사 결정 및 기타 역할에서 '사용에 적합한' 데이터", "설정된 기준에 부합하는 데이터"
  • 표준 기반 관점: "객체(데이터)의 고유한 특성(품질 차원)이 요구 사항을 충족하는 정도"

데이터 품질 차원(Dimensions)

데이터 품질을 측정하고 평가하기 위해 여러 특성 또는 차원이 사용된다. 대표적인 데이터 품질 차원은 다음과 같다.

  • 정확성(Accuracy): 데이터가 실제 값을 정확히 반영하는 정도
  • 완전성(Completeness): 필요한 모든 데이터가 누락 없이 존재하는 정도
  • 일관성(Consistency): 데이터가 상호 모순 없이 일관되게 유지되는 정도
  • 유효성(Validity): 데이터가 정의된 형식, 범위, 규칙에 부합하는 정도
  • 적시성(Timeliness): 데이터가 필요한 시점에 적절히 제공되는 정도
  • 유일성(Uniqueness): 중복된 데이터가 존재하지 않는 정도
  • 신뢰성(Reliability): 데이터의 출처와 내용이 신뢰할 수 있는 정도
  • 접근성(Accessibility): 데이터가 필요한 사용자에게 접근 가능한 정도

국제 표준

데이터 품질과 관련된 주요 국제 표준으로 ISO 8000이 있다. 국제표준화기구(ISO)에서 관리하는 ISO 8000은 데이터 품질의 원칙, 용어, 측정 방법, 데이터 거버넌스, 데이터 품질 관리 및 평가 등에 관한 사항을 규정한다. 또한 ISO/IEC 25012는 데이터 품질 모델에 관한 국제 표준으로, 데이터 품질의 핵심 특성과 측정 기준을 정의한다.

데이터 품질 관리

데이터 품질 관리(Data Quality Management, DQM)는 조직 데이터의 품질을 향상하고 유지하기 위한 관행과 프로세스의 집합이다. 주요 활동으로는 데이터 프로파일링(Data Profiling), 데이터 표준화(Data Standardization), 데이터 정제(Data Cleansing), 중복 데이터 매칭 및 제거, 데이터 품질 모니터링 등이 포함된다.

데이터 품질 보증(Data Quality Assurance)은 데이터의 불일치와 이상을 발견하기 위한 데이터 프로파일링과 데이터 품질 개선 활동을 수행하는 과정이다. 데이터 품질 관리(Data Quality Control)는 애플리케이션이나 프로세스에서 데이터 사용을 통제하는 과정으로, 데이터의 심각도, 불완전성, 정확성 등을 평가하여 해당 데이터의 사용 가능 여부를 결정한다.

데이터 거버넌스와의 관계

데이터 품질은 데이터 거버넌스(Data Governance)의 핵심 요소 중 하나이다. 데이터 거버넌스는 조직이 데이터 품질을 보장하기 위해 데이터의 정의, 생산, 사용에 관한 표준과 정책을 수립하고 관리하는 체계를 의미한다. 효과적인 데이터 거버넌스를 통해 데이터 품질 기준과 정의에 대한 조직 차원의 합의를 도출할 수 있다.

중요성

데이터 기반 의사 결정과 인공지능(AI) 활용이 증가함에 따라 데이터 품질의 중요성은 더욱 높아지고 있다. 낮은 품질의 데이터는 잘못된 분석 결과와 비효율적인 의사 결정으로 이어질 수 있으며, 이는 조직에 상당한 비용 손실을 초래할 수 있다. 한 산업 연구에 따르면 데이터 품질 문제로 인한 미국 경제의 연간 총비용은 6,000억 달러 이상으로 추산된 바 있다.

역사

데이터 품질 관리의 기원은 대형 메인프레임 컴퓨터를 이용한 우편 주소 데이터 관리에서 시작되었다. 우편물의 정확한 경로 지정을 위해 일반적인 철자 오류와 오타를 교정하고, 이사, 사망, 결혼 등 생활 변화를 추적하는 비즈니스 규칙이 사용되었다. 이후 데이터 저장 비용이 낮아지고 서버 기술이 발전하면서 데이터 품질 관리는 기업 내부로 확산되었으며, 현재는 공급망 데이터, 거래 데이터, 헬스케어 데이터, 공공 데이터 등 다양한 분야에서 데이터 품질 관리가 수행되고 있다.

둘러보기

더 찾아볼 만한 주제

    전체 문서 보기