언어 자원
정의
언어 자원은 인간 언어의 연구·교육·응용을 위해 수집·정리·보존된 자료를 의미한다. 여기에는 텍스트, 음성, 영상, 어휘 목록, 문법 규칙, 언어학적 주석 등이 포함된다.
주요 유형
| 유형 | 설명 |
|---|---|
| 코퍼스(Corpus) | 실제 언어 사용 사례를 체계적으로 수집한 대규모 텍스트·음성 집합. 예: British National Corpus, 한국어 말뭉치(Korean Corpus) |
| 어휘·사전(Lexicon, Dictionary) | 단어·형태소·표현의 의미·용법·품사 정보를 구조화한 데이터베이스. |
| 주석 데이터(Annotated Data) | 형태소, 구문, 의미역, 감정 등 다양한 언어 현상을 라벨링한 자료. |
| 음성·음향 자료 | 발화 음성 파일 및 그에 대한 전사·음향 특징 정보. |
| 영상·멀티모달 자료 | 영상 속 대화·텍스트·음성이 결합된 데이터셋. |
| 규칙·문법 자원 | 형식 문법, 구문 규칙, 통사론적 패턴을 기술한 자료. |
활용 분야
- 자연어 처리(NLP): 기계 번역, 음성 인식, 텍스트 분류, 질의응답 시스템 등에서 모델 학습·평가에 활용.
- 언어학 연구: 통계적·계량적 분석, 언어 변화·접촉 연구, 의미론·화용론 등.
- 교육·시험: 어휘 학습, 시험 문제 개발, 언어 능력 평가.
- 문화·보전: 소수 언어·사투리 보존, 디지털 아카이빙.
공개·공유 방법
- 오픈 라이선스: CC BY, CC BY-SA 등 저작자 표시·공유 조건을 명시한 형태.
- 전용 포털: LDC(언어 데이터 코퍼스), ELRA, 한국어 말뭉치센터 등에서 제공.
한계 및 고려 사항
- 프라이버시·저작권: 개인 정보가 포함된 자료는 비식별화·동의 절차가 필요.
- 언어 다양성: 주요 언어에 비해 저자원 언어가 상대적으로 부족.
- 품질 관리: 오류·편향을 최소화하기 위한 검증 절차가 요구됨.
관련 용어
- 코퍼스(corpus), 어휘 사전(lexicon), 주석(annotated), 멀티모달 데이터(multi‑modal data) 등.
참고
- 언어 자원은 학계·산업계 모두에서 필수적인 인프라로 인식되며, 지속적인 구축·개선이 이루어지고 있다.
- 구체적인 사례·통계는 각 국가·기관별 자료를 참조한다.