WIPIVERSE

언어 자원

언어 자원
정의
언어 자원은 인간 언어의 연구·교육·응용을 위해 수집·정리·보존된 자료를 의미한다. 여기에는 텍스트, 음성, 영상, 어휘 목록, 문법 규칙, 언어학적 주석 등이 포함된다.

주요 유형

유형 설명
코퍼스(Corpus) 실제 언어 사용 사례를 체계적으로 수집한 대규모 텍스트·음성 집합. 예: British National Corpus, 한국어 말뭉치(Korean Corpus)
어휘·사전(Lexicon, Dictionary) 단어·형태소·표현의 의미·용법·품사 정보를 구조화한 데이터베이스.
주석 데이터(Annotated Data) 형태소, 구문, 의미역, 감정 등 다양한 언어 현상을 라벨링한 자료.
음성·음향 자료 발화 음성 파일 및 그에 대한 전사·음향 특징 정보.
영상·멀티모달 자료 영상 속 대화·텍스트·음성이 결합된 데이터셋.
규칙·문법 자원 형식 문법, 구문 규칙, 통사론적 패턴을 기술한 자료.

활용 분야

  • 자연어 처리(NLP): 기계 번역, 음성 인식, 텍스트 분류, 질의응답 시스템 등에서 모델 학습·평가에 활용.
  • 언어학 연구: 통계적·계량적 분석, 언어 변화·접촉 연구, 의미론·화용론 등.
  • 교육·시험: 어휘 학습, 시험 문제 개발, 언어 능력 평가.
  • 문화·보전: 소수 언어·사투리 보존, 디지털 아카이빙.

공개·공유 방법

  • 오픈 라이선스: CC BY, CC BY-SA 등 저작자 표시·공유 조건을 명시한 형태.
  • 전용 포털: LDC(언어 데이터 코퍼스), ELRA, 한국어 말뭉치센터 등에서 제공.

한계 및 고려 사항

  • 프라이버시·저작권: 개인 정보가 포함된 자료는 비식별화·동의 절차가 필요.
  • 언어 다양성: 주요 언어에 비해 저자원 언어가 상대적으로 부족.
  • 품질 관리: 오류·편향을 최소화하기 위한 검증 절차가 요구됨.

관련 용어

  • 코퍼스(corpus), 어휘 사전(lexicon), 주석(annotated), 멀티모달 데이터(multi‑modal data) 등.

참고

  • 언어 자원은 학계·산업계 모두에서 필수적인 인프라로 인식되며, 지속적인 구축·개선이 이루어지고 있다.
  • 구체적인 사례·통계는 각 국가·기관별 자료를 참조한다.
둘러보기

더 찾아볼 만한 주제

    전체 문서 보기