WIPIVERSE

텍스트 마이닝

텍스트 마이닝
텍스트 마이닝은 자연어 텍스트 데이터를 대상으로 통계·기계학습·규칙 기반 기법을 적용하여 유의미한 패턴, 정보, 지식을 자동으로 추출하는 과정이다. 데이터 마이닝·정보 검색·자연어 처리(NLP) 분야와 교차하며, 비정형 텍스트를 구조화된 형태로 변환하거나 텍스트 내에 숨겨진 감정·주제·관계 등을 식별한다.

주요 단계

  1. 데이터 수집 – 웹 페이지, 뉴스 기사, 소셜 미디어, 논문 등 다양한 출처에서 텍스트를 수집한다.
  2. 전처리 – 토큰화, 형태소 분석, 불용어 제거, 어간 추출·표제어 추출 등을 수행하여 분석에 적합한 형태로 정제한다.
  3. 특징 추출 – 단어 출현 빈도(TF), 역문서 빈도(IDF), n-그램, 워드 임베딩(Word2Vec, GloVe) 등 텍스트를 수치 벡터로 변환한다.
  4. 분석·모델링 – 군집화(K‑means, 계층적 군집), 분류(서포트 벡터 머신, 딥러닝), 토픽 모델링(LDA), 감성 분석, 연관 규칙 학습 등을 적용한다.
  5. 평가·시각화 – 모델 성능을 정확도·정밀도·재현율 등으로 평가하고, 워드 클라우드·연관 네트워크·시계열 그래프 등으로 결과를 시각화한다.

응용 분야

  • 고객 의견 분석 : 제품 리뷰, SNS 게시물 등에서 감성 및 트렌드 파악.
  • 보건·의료 : 의학 논문·임상 기록에서 질병·약물 상관관계 추출.
  • 법률·특허 : 판례·특허 문서 검색 및 요약.
  • 언론·정책 : 뉴스 기사에서 주제 변화 및 여론 동향 분석.
  • 학술 연구 : 문헌 조사·인용 네트워크 분석.

관련 기술·학문
텍스트 마이닝은 데이터 마이닝, 기계 학습, 통계학, 언어학(특히 코퍼스 언어학)과 밀접하게 연관된다. 최근에는 딥러닝 기반 언어 모델(예: BERT, GPT) 등을 활용한 사전학습 모델이 텍스트 마이닝 효율성을 크게 향상시키고 있다.

어원
‘텍스트(text)’는 영어에서 차용한 그대로 ‘문자·문서’를 의미하고, ‘마이닝(mining)’은 ‘탐굴·채굴’을 뜻하는 영어 동사에서 파생된 명사 형태로, 데이터에서 유용한 정보를 “채굴”한다는 의미로 사용된다. 따라서 ‘텍스트 마이닝’은 ‘문자 데이터를 탐색·추출한다’는 의미의 합성어이다.

둘러보기

더 찾아볼 만한 주제

    전체 문서 보기