WIPIVERSE

파운데이션 모델

파운데이션 모델(foundation model)은 광범위한 데이터에 대해 훈련된 기계 학습 또는 딥 러닝 모델로, 다양한 다운스트림 작업에 적용될 수 있는 범용 인공지능 모델을 의미한다. 이 용어는 2021년 8월 스탠퍼드 대학교 인간 중심 인공지능 연구소(Stanford HAI) 산하 파운데이션 모델 연구 센터(CRFM)에서 처음 만들어 대중화하였다. 기존의 '대형 언어 모델(LLM)'이라는 용어는 언어에만 초점이 맞춰져 있어 너무 좁고, '자기 지도 모델'은 훈련 목표에 지나치게 한정적이며, '사전 훈련 모델'은 본질적인 행동이 사전 훈련 이후에만 일어난다는 오해를 줄 수 있다는 판단 아래 '파운데이션 모델'이라는 새로운 용어가 도입되었다.

파운데이션 모델의 대표적인 예로는 오픈AI의 GPT 시리즈, 구글의 BERT와 같은 대형 언어 모델, 이미지 생성 모델인 DALL-E와 스테이블 디퓨전, 음악 생성 모델인 뮤직젠(MusicGen), 로봇 제어 모델인 RT-2 등이 있다. 이러한 모델들은 텍스트뿐 아니라 이미지, 오디오, 비디오, 코드 등 다양한 데이터 양식(modality)에 걸쳐 개발되고 있으며, 천문학, 방사선학, 유전체학, 시계열 예측, 수학 등 전문 분야를 위한 파운데이션 모델도 구축되고 있다.

파운데이션 모델의 구축은 매우 높은 자원을 필요로 한다. 가장 고도화된 모델의 경우 데이터 수집 및 처리, 훈련에 필요한 컴퓨팅 비용만 수억 달러에 달한다. 이는 고성능 GPU와 같은 첨단 하드웨어, 장기간의 훈련 시간, 정교한 인프라가 필요하기 때문이다. 반면, 기존의 파운데이션 모델을 특정 작업에 맞게 조정(미세 조정, fine-tuning)하거나 직접 사용하는 것은 상대적으로 비용이 훨씬 저렴하다.

기술적으로 파운데이션 모델은 심층 신경망(deep neural network), 전이 학습(transfer learning), 자기 지도 학습(self-supervised learning)과 같은 확립된 기계 학습 기술을 기반으로 구축된다. 이전의 작업별 맞춤형 모델과 달리 재사용 가능한 인프라 역할을 하는 범용 모델이라는 점에서 차별화된다. 현재 트랜스포머(Transformer) 아키텍처가 다양한 양식에 걸쳐 파운데이션 모델을 구축하기 위한 사실상의 표준으로 사용되고 있다.

파운데이션 모델의 정확성과 능력은 모델의 크기와 훈련 데이터의 양에 따라 예측 가능하게 확장되는 경향이 있으며, 이를 스케일링 법칙(scaling law)이라고 한다. 모델의 규모는 연산량, 데이터셋 크기, 매개변수 수에 의해 정의되며, 이들은 최종 성능과 거듭제곱 법칙 관계를 나타낸다.

각국 정부는 파운데이션 모델을 규제하기 위한 법적 정의를 마련하고 있다. 미국의 행정 명령은 '광범위한 데이터로 훈련되고, 일반적으로 자기 지도 학습을 사용하며, 최소 수백억 개의 매개변수를 포함하고, 광범위한 맥락에 적용 가능한 AI 모델'로 정의한다. 유럽 연합의 EU AI Act는 '대규모 광범위한 데이터로 훈련되고, 출력의 일반성을 위해 설계되었으며, 광범위한 고유한 작업에 적용될 수 있는 AI 모델'로 정의한다. 영국 경쟁시장청은 '막대한 양의 데이터로 훈련되어 다양한 작업 및 운영에 적용될 수 있는 인공지능 기술 유형'으로 정의한다.

파운데이션 모델 중에서도 공공 안전에 심각한 위험을 초래할 수 있는 고도로 발전된 모델은 '프론티어 모델(frontier model)'이라고 구분하기도 한다. 이러한 모델은 새로운 생물학적 또는 화학적 무기 설계, 맞춤형 허위 정보 생산 및 전파, 전례 없는 사이버 공격 능력 활용, 인간 통제 회피 등의 위험한 능력을 가질 가능성이 있다고 논의된다.

파운데이션 모델은 API를 통한 출시, 직접 모델 다운로드(개방형 출시), 조직 내부 전용(폐쇄형 출시) 등 다양한 방식으로 배포된다. 개방형 파운데이션 모델은 연구 개발을 촉진하지만 오용에 더 취약한 반면, 폐쇄형 출시는 안전성은 높지만 연구 커뮤니티에 기여하는 바가 제한적이다.

둘러보기

더 찾아볼 만한 주제

    전체 문서 보기