WIPIVERSE

심층 웹

심층 웹(深層 Web, 영어: deep web, invisible web, hidden web)은 일반적인 검색 엔진으로는 색인(인덱싱)되지 않아 드러나지 않는, 표층 웹(surface web)에 속하지 않는 월드 와이드 웹 콘텐츠를 가리키는 용어이다.

검색 엔진(구글, 네이버, 빙 등)은 웹 크롤러(또는 봇)를 통해 링크를 따라가며 웹페이지를 수집하고 색인하는데, 심층 웹에 속하는 콘텐츠는 다음과 같은 이유로 이러한 크롤링 대상에서 제외된다.

  • 로그인이나 인증이 필요한 페이지: 은행 계좌 정보, 개인 이메일, 기업 인트라넷, 소셜 미디어 비공개 프로필 등
  • 유료 구독 기반 콘텐츠: 학술 데이터베이스(예: JSTOR, 한국학술정보), 유료 뉴스 아카이브 등
  • 동적으로 생성되는 페이지: 사용자의 입력이나 세션에 따라 실시간으로 결과가 생성되는 웹페이지
  • 비 HTML 콘텐츠: 특정 파일 형식(데이터베이스, 압축 파일 등)이나 스크립트에 의해 접근이 제한된 콘텐츠
  • 의도적으로 링크되지 않은 페이지

심층 웹이라는 용어는 종종 다크 웹(dark web)이나 다크넷(darknet)과 혼용되어 사용되나, 이는 개념상 차이가 있다. 다크넷은 Tor, I2P, Freenet과 같이 특정 소프트웨어나 설정을 통해서만 접속할 수 있는 오버레이 네트워크를 의미하며, 다크 웹은 그러한 다크넷 상에 존재하는 웹 콘텐츠만을 가리킨다. 다크넷과 다크 웹은 심층 웹의 일부분이지만, 심층 웹 전체가 불법적이거나 익명적인 영역은 아니다. 실제로 심층 웹의 대부분은 합법적인 개인 데이터, 학술 자료, 행정 문서 등으로 구성되어 있다.

2001년 캘리포니아 대학교 버클리 캠퍼스의 연구에 따르면 당시 심층 웹의 콘텐츠는 약 7,500테라바이트 규모였으며, 표층 웹보다 수백 배 더 방대한 정보를 포함하고 있는 것으로 추정되었다. 1999년 Bin He 등의 연구에서는 약 890만 개의 심층 웹 사이트가 존재하는 것으로 파악되었고, 2006년 데니스 셰스타코프(Denis Shestakov)는 14,000여 개의 러시아 심층 웹 사이트를 발견한 바 있다.

심층 웹은 그 콘텐츠가 검색 엔진에 색인되지 않는다는 성질 자체만으로 정의되므로, 합법적 일상 용도(전자상거래 마이페이지, 클라우드 저장소, 온라인 뱅킹, 학술 DB 등)에서부터 일부 불법적 영역(다크 웹 상의 불법 거래 등)에 이르기까지 다양한 범위를 포괄하는 개념이다.

둘러보기

더 찾아볼 만한 주제

    전체 문서 보기