LLM은 "Large Language Model"의 약자로, 한국어로는 대규모 언어 모델 또는 거대 언어 모델이라고 한다. LLM은 수많은 파라미터(보통 수십억 개 이상의 가중치)를 보유한 인공 신경망으로 구성된 언어 모델을 의미한다.
LLM은 방대한 양의 텍스트 데이터를 자기 지도 학습(self-supervised learning) 또는 반자기 지도 학습(semi-supervised learning) 방식으로 훈련받아, 인간의 언어를 이해하고 생성하는 능력을 갖춘 AI 모델이다. 대부분의 현대 LLM은 2017년 구글 연구진이 발표한 논문 "Attention Is All You Need"에서 소개된 트랜스포머(Transformer) 아키텍처를 기반으로 한다.
LLM의 핵심 작동 원리는 다음 토큰 예측(next token prediction)이다. 입력된 토큰(단어 또는 하위 단어) 시퀀스를 기반으로, 가장 확률이 높은 다음 토큰을 순차적으로 예측하여 텍스트를 생성한다. 트랜스포머의 셀프 어텐션(self-attention) 메커니즘을 통해 입력 텍스트 내에서 서로 멀리 떨어진 토큰 간의 관계와 문맥을 효과적으로 파악할 수 있다.
LLM의 주요 특징과 구성 요소는 다음과 같다.
- 파라미터(Parameter): 모델의 학습 가능한 내부 변수로, 수십억에서 수조 개에 이른다. 파라미터 수가 많을수록 모델의 표현력이 증가하지만, 학습 및 추론에 더 많은 계산 자원이 필요하다.
- 토큰화(Tokenization): 입력 텍스트를 모델이 처리할 수 있는 단위(토큰)로 분할하는 과정이다. 토큰은 단어, 하위 단어, 또는 문자 단위가 될 수 있다.
- 사전 학습(Pre-training): 레이블이 없는 대규모 말뭉치를 사용하여 언어의 패턴, 문법, 지식을 학습하는 단계이다.
- 미세 조정(Fine-tuning): 사전 학습된 모델을 특정 작업이나 도메인에 맞게 추가로 학습시키는 과정이다.
- 컨텍스트 창(Context Window): 모델이 한 번에 처리할 수 있는 최대 토큰 수로, 최신 LLM은 수십만 개의 토큰을 처리할 수 있다.
LLM의 주요 응용 분야로는 텍스트 생성, 문서 요약, 언어 번역, 질의응답, 코드 생성, 감정 분석, 챗봇 등이 있다. 대표적인 LLM으로는 OpenAI의 GPT 시리즈(GPT-3, GPT-4), Google의 BERT, PaLM, Meta의 LLaMA, Anthropic의 Claude, DeepSeek의 R1, Mistral AI의 Mistral 등이 있다.
LLM의 한계로는 환각(Hallucination) 현상이 지적된다. 이는 모델이 사실이 아닌 정보를 그럴듯하게 생성하는 현상으로, 학습 데이터의 통계적 패턴에 기반해 문장을 생성하는 과정에서 발생한다. 이를 완화하기 위한 대표적 기법으로 검색 증강 생성(RAG, Retrieval-Augmented Generation)이 있으며, 모델이 답변 생성 전에 외부 문서에서 관련 정보를 검색해 참조하도록 하는 방식이다.
LLM은 2018년 BERT와 GPT의 등장 이후 급속도로 발전하였으며, 2022년 ChatGPT의 출시로 대중의 광범위한 관심을 받게 되었다. 2023년 이후에는 이미지나 오디오 등 여러 형태의 데이터를 함께 처리할 수 있는 대형 멀티모달 모델(LMM, Large Multimodal Model)로 발전하는 추세이다.