WIPIVERSE

데이터 레이크

데이터 레이크(Data Lake)는 일반적으로 원시 데이터를 본래의 자연스러운 형식 그대로 저장하는 대규모 중앙 저장소 시스템을 의미한다. 이 용어는 2011년 당시 펜타호(Pentaho)의 최고 기술 책임자(CTO)였던 제임스 딕슨(James Dixon)이 데이터 마트(Data Mart)와 대비되는 개념으로 처음 고안하였다. 딕슨은 데이터 마트를 정제되고 포장된 생수에 비유한 반면, 데이터 레이크는 보다 자연스러운 상태의 대규모 수체(水體)에 비유하여 설명하였다.

데이터 레이크는 정형 데이터(관계형 데이터베이스의 행과 열), 반정형 데이터(CSV, 로그, XML, JSON), 비정형 데이터(이메일, 문서, PDF), 바이너리 데이터(이미지, 오디오, 비디오) 등 모든 형식의 데이터를 수용할 수 있다. 기존의 데이터 웨어하우스(Data Warehouse)가 데이터 저장 전에 엄격한 스키마를 적용하는 '스키마 온 라이트(schema-on-write)' 방식을 사용하는 반면, 데이터 레이크는 데이터를 읽을 때 스키마를 적용하는 '스키마 온 리드(schema-on-read)' 방식을 채택하여 데이터 수집의 유연성과 속도를 높인다.

초기 데이터 레이크는 주로 아파치 하둡 분산 파일 시스템(HDFS)을 기반으로 온프레미스 환경에서 구축되었으나, 현대의 데이터 레이크는 아마존 S3, 마이크로소프트 애저 Blob 스토리지, 구글 클라우드 스토리지, IBM 클라우드 오브젝트 스토리지와 같은 클라우드 객체 스토리지 서비스를 활용하는 경우가 많다. 클라우드 기반 데이터 레이크는 확장성과 비용 효율성에서 장점을 가진다.

데이터 레이크 아키텍처는 일반적으로 수집 계층, 스토리지 계층, 데이터 카탈로그 및 메타데이터 계층, 처리 및 분석 계층, 보안 및 거버넌스 계층, 액세스 계층으로 구성된다. 스토리지와 컴퓨팅이 분리되어 있어 각각을 독립적으로 확장할 수 있다는 특징이 있다.

데이터 레이크의 주요 이점으로는 유연한 데이터 수집, 비용 및 리소스 최적화, 확장성, 조직 내 데이터 사일로(data silo) 해소를 통한 협업 강화 등이 꼽힌다. 반면, 적절한 데이터 거버넌스와 메타데이터 관리가 이루어지지 않을 경우 데이터 레이크는 '데이터 늪(data swamp)'으로 변질될 위험이 있으며, 이는 데이터를 찾고 활용하기 어려운 상태를 의미한다. 또한 내장된 처리 및 쿼리 도구가 부족하여 데이터 웨어하우스에 비해 분석 성능이 저하될 수 있다는 한계도 지적된다.

데이터 레이크는 데이터 백업 및 아카이빙, 고급 분석 및 인공지능(AI)·머신러닝(ML) 워크로드, 데이터 통합, 사물인터넷(IoT) 데이터 관리 등 다양한 용도로 활용된다. 이후 데이터 레이크의 유연한 저장 기능과 데이터 웨어하우스의 고성능 분석 기능을 결합한 데이터 레이크하우스(Data Lakehouse)라는 하이브리드 아키텍처도 등장하였다.

둘러보기

더 찾아볼 만한 주제

    전체 문서 보기