웹 아카이빙(Web Archiving)은 월드 와이드 웹(World Wide Web) 상의 자료를 체계적으로 수집하여 보존하고, 연구자 및 일반 대중이 접근할 수 있도록 제공하는 일련의 과정이다. 웹은 본질적으로 휘발성(volatile)이 강하여 페이지가 수시로 변경되거나 사라지므로, 웹 아카이빙은 디지털 문화유산과 정보 자원을 후대에 전승하기 위한 핵심적인 활동으로 자리잡고 있다.
개요
웹 아카이빙의 궁극적 목표는 웹상의 정보가 연구와 대중을 위한 아카이브 형식으로 영구 보존되도록 보장하는 것이다. 웹에서 생성되고 기록되는 인간 문화의 비중이 날로 커짐에 따라, 도서관·기록관·박물관 등 다양한 기관이 웹 아카이빙의 과제에 직면하고 있다. 웹 기록물관리사(web archivist)는 일반적으로 자동화된 웹 크롤러(web crawler)를 사용하여 방대한 양의 정보를 캡처하며, 수집된 자료는 HTML·CSS·자바스크립트·이미지·비디오 등 웹 콘텐츠 전반과 함께 접속 일시, MIME 유형, 콘텐츠 길이 등의 메타데이터를 포함한다.
역사
최초의 대규모 웹 아카이빙 프로젝트는 브루스터 케일(Brewster Kahle)이 1996년에 설립한 비영리 단체 인터넷 아카이브(Internet Archive)이다. 인터넷 아카이브는 2001년에 아카이브된 웹 콘텐츠를 열람할 수 있는 검색 엔진인 웨이백 머신(Wayback Machine)을 출시하였으며, 2018년 기준 약 40페타바이트(PB)의 데이터를 보관하고 있다. 거의 동시대에 시작된 주요 프로젝트로는 캐나다 국립도서관의 웹 아카이빙, 호주의 판도라(PANDORA), 스웨덴의 Kulturarw3 등이 있다.
2003년에는 국제 인터넷 보존 컨소시엄(IIPC, International Internet Preservation Consortium)이 설립되어 웹 아카이브 생성을 위한 표준 및 오픈소스 도구 개발의 국제적 협력을 촉진하였다. 2004년에는 유럽 연합 집행위원회의 지원으로 인터넷 메모리 재단(Internet Memory Foundation)이 설립되어 유럽 웹을 아카이빙하는 데 기여하였다.
수집 방식
웹 아카이빙의 수집 방식은 크게 다음과 같이 구분된다.
- 원격 수집(Remote harvesting): 웹 크롤러가 HTTP를 통해 웹사이트를 탐색하며 페이지와 연결된 리소스를 다운로드한다. 대표적인 크롤러 도구로는 Heritrix(인터넷 아카이브 개발), HTTrack, Offline Explorer 등이 있다.
- 트랜잭션 아카이빙(Transactional archiving): 웹 서버와 웹 브라우저 사이에 발생하는 실제 HTTP 요청과 응답을 가로채어 기록하는 이벤트 중심 접근 방식이다. 특정 날짜에 실제로 사용자가 본 콘텐츠의 증거를 보존하는 데 유용하며, 법적·규제 요구사항을 준수해야 하는 조직에서 활용된다.
- 납본(Deposit): 법적 납본 제도에 따라 웹 출판물을 의무적으로 제출받는 방식이다. 영국·프랑스·덴마크 등 일부 국가는 법률 개정을 통해 전자출판물과 웹 자원을 납본 대상에 포함시켰다.
주요 기관 및 프로젝트
- 인터넷 아카이브(Internet Archive): 미국 샌프란시스코에 본부를 둔 비영리 단체. 웹 전체를 망라적으로 수집하며, 웨이백 머신을 통해 누구나 무료로 과거 웹페이지를 열람할 수 있다.
- 미국 의회도서관 MINERVA: Mapping the Internet Electronic Resources Virtual Archive. 대통령 선거, 9·11 테러, 이라크 전쟁 등 특정 주제를 선정하여 수집한다.
- 호주 PANDORA: Preserving and Accessing Networked Documentary Resources of Australia. 저작권자의 동의를 받아 호주 관련 웹 자원을 수집·보존하는 모범적 사례로 꼽힌다.
- 영국 UKWAC(UK Web Archiving Consortium): 영국국립도서관, 스코틀랜드국립도서관, 웨일즈국립도서관, 국립보존소, JISC, Wellcome Trust 등 6개 기관이 협력하는 컨소시엄.
- 국립중앙도서관 OASIS: 대한민국 국립중앙도서관이 운영하는 온라인 자료 아카이빙 시스템.
기술적 과제와 한계
웹 아카이빙은 다음과 같은 기술적·법적 난관에 직면한다.
- 로봇 배제 프로토콜(robots.txt): 웹사이트 소유자가 크롤러의 접근을 제한할 수 있다.
- 딥 웹(Deep Web): 검색 양식 뒤에 숨겨진 페이지는 크롤러가 접근하기 어렵다.
- 크롤러 트랩(Crawler trap): 달력·무한 스크롤 등 무한한 페이지를 생성하는 구조는 크롤러에 과부하를 유발한다.
- 동적 콘텐츠: 자바스크립트·AJAX 등으로 렌더링되는 현대 웹 페이지는 정적 크롤링만으로 완전히 캡처되기 어렵다.
- 웹의 규모와 변화 속도: 웹은 너무 방대하고 빠르게 변하여 크롤링이 완료되기도 전에 내용이 변경된다.
- 저작권 문제: 웹은 공공 자원으로 간주되지만 저작권이 존재하므로, 아카이빙 기관은 콘텐츠를 복제할 법적 권리를 확보해야 한다. 일부 기관은 저작권자의 삭제 요청을 수용하고 있다.
관련 용어
- 디지털 아카이빙(Digital Archiving): 디지털 객체 전반을 장기 보존하는 포괄적 개념.
- 웨이백 머신(Wayback Machine): 인터넷 아카이브가 제공하는 웹페이지 타임머신 서비스.
- 웹 크롤러(Web Crawler): 웹 페이지를 자동으로 탐색·수집하는 소프트웨어.
- Archive.today: 웹페이지의 스냅샷을 저장하는 온라인 아카이빙 서비스.
- WebCite: 학술 인용을 위한 웹 아카이빙 서비스.
참고 자료
- 국립중앙도서관, "웹 아카이빙(Web Archiving)", 사서지원서비스 도서관 용어 해설
- Wikipedia, "Web Archiving"
- International Internet Preservation Consortium (IIPC), "Web Archiving"