GPT (Generative Pre-trained Transformer)
개요 GPT는 오픈에이아이(OpenAI)에서 개발한 대규모 언어 모델(LLM) 시리즈를 지칭하는 약어이다. '생성적 사전 학습 변환기(Generative Pre-trained Transformer)'의 앞글자를 땄다. 트랜스포머(Transformer) 아키텍처를 기반으로 하며, 대량의 텍스트 데이터를 이용한 비지도 학습(사전 학습) 이후 특정 과제에 맞춰 지도 학습(미세 조정)하는 방식을 사용한다.
주요 특징
- 아키텍처: 디코더(Decoder) 전용 트랜스포머 구조를 사용하여 이전 문맥을 바탕으로 다음 토큰을 예측하는 자기 회귀(Auto-regressive) 방식으로 텍스트를 생성한다.
- 학습 방식: 1단계로 대규모 코퍼스에서 언어 모델링 목표(다음 단어 예측)로 사전 학습을 수행하고, 2단계로 인간 피드백 기반 강화 학습(RLHF) 등의 기법을 통해 사용자 의도에 부합하도록 정렬(Alignment) 과정을 거친다.
- 확장성: 모델의 크기(매개변수 수)와 학습 데이터 양을 늘릴수록 성능이 향상되는 '스케일링 법칙(Scaling Laws)'이 관측되었다.
주요 버전 연혁
- GPT-1 (2018): 트랜스포머 디코더를 언어 모델에 적용한 초기 모델.
- GPT-2 (2019): 15억 매개변수 모델로, 다양한 제로샷(Zero-shot) 태스크 수행 능력을 보임. 초기에는 악용 우려로 전체 모델 공개가 지연됨.
- GPT-3 (2020): 1,750억 매개변수로 확장되어 소량의 예시만으로 과제를 수행하는 소수샷(Few-shot) 학습 능력이 두드러짐. API 형태로 상용화 시작.
- InstructGPT / GPT-3.5 (2022): 인간 피드백 기반 강화 학습(RLHF)을 적용하여 지시 수행 능력과 안전성을 강화. 챗GPT(ChatGPT)의 기반 모델로 활용됨.
- GPT-4 (2023): 멀티모달(텍스트 및 이미지 입력) 처리 가능, 추론 능력 및 신뢰도 대폭 향상. 전문가 수준의 학술 및 전문 시험에서 상위권 성적 기록.
- GPT-4o / o1 시리즈 (2024~): 실시간 음성/비전 멀티모달 처리, 추론 특화 모델 등 파생 모델 지속 출시.
활용 분야 자연어 생성, 요약, 번역, 코드 생성, 질의응답, 창작 보조, 챗봇, 에이전트 시스템 구축 등 자연어 처리(NLP) 전반과 소프트웨어 개발, 교육, 콘텐츠 제작 등 다양한 산업 분야에서 활용된다.
한계 및 논점
- 환각(Hallucination): 사실과 다른 정보를 그럴듯하게 생성하는 현상 발생 가능.
- 편향성(Bias): 학습 데이터에 내재된 사회적 편향 반영 가능성.
- 지식 마감일(Cutoff): 학습 시점 이후의 최신 정보 부재(단, 검색 증강 생성(RAG) 또는 브라우징 도구 연계로 보완 가능).
- 자원 소모: 거대 모델 추론 및 학습에 막대한 연산 자원과 에너지 필요.
- 저작권 및 윤리: 학습 데이터 출처 투명성, 생성물 저작권 귀속, 악용(딥페이크, 스팸, 사이버 공격 등) 방지 등 사회적 논의 지속.