WIPIVERSE

PaLM

PaLM (Pathways Language Model)

PaLM(Pathways Language Model)은 구글 AI(Google AI)가 개발한 대규모 언어 모델(large language model, LLM)이다. 5400억 개의 매개변수(540 billion parameters)를 가진 밀집(dense) 디코더 전용 트랜스포머 모델로, 2022년 4월에 처음 발표되었다. 연구진은 모델 규모의 영향을 검증하기 위해 80억 개 및 620억 개의 매개변수를 가진 소형 버전도 함께 훈련시켰다.

주요 특징

PaLM은 상식 추론, 산술 추론, 농담 설명, 코드 생성, 번역 등 다양한 작업을 수행할 수 있다. 사고 사슬(chain-of-thought) 프롬프팅과 결합하면 다단계 추론이 필요한 데이터셋에서 특히 우수한 성능을 보였다. 훈련에 사용된 데이터는 7800억 개의 토큰으로 구성된 고품질 코퍼스이며, 여기에는 필터링된 웹페이지, 도서, 위키백과 문서, 뉴스 기사, GitHub의 오픈소스 저장소에서 얻은 소스 코드, 소셜 미디어 대화가 포함된다. 소셜 미디어 대화 데이터가 전체 코퍼스의 50%를 차지하여 대화 능력 향상에 기여하였다. 이 데이터셋은 구글의 이전 모델인 LaMDA를 훈련하는 데 사용된 데이터셋을 기반으로 한다.

훈련 방식

PaLM 540B는 각각 3,072개의 TPU v4 칩과 768개의 호스트로 구성된 두 개의 TPU v4 팟(Pod)에서 훈련되었으며, 총 6,144개의 칩을 사용하여 모델 병렬화와 데이터 병렬화를 결합한 방식으로 학습되었다. 이는 당시 가장 큰 TPU 구성이었고, 하드웨어 FLOPs 활용률 57.8%를 기록하여 이 규모의 LLM 훈련 중 가장 높은 훈련 효율성을 달성한 것으로 보고되었다.

후속 모델 및 응용

  • Med-PaLM: 구글과 딥마인드(DeepMind)가 PaLM 540B를 의료 데이터로 미세 조정(fine-tuning)한 버전으로, 미국 의사 면허 시험에서 합격점을 처음으로 획득한 것으로 알려졌다.
  • PaLM-E: 비전 트랜스포머를 결합한 비전-언어 모델로, 재훈련이나 미세 조정 없이 로봇 조작에 활용될 수 있도록 설계되었다.
  • PaLM 2: 2023년 5월 구글 I/O 행사에서 발표된 후속 모델로, 약 3400억 개의 매개변수와 3.6조 개의 토큰으로 훈련된 것으로 보고되었다.
  • AudioPaLM: 2023년 6월에 발표된 음성 대 음성 번역 모델로, PaLM-2 아키텍처와 초기화 방식을 사용한다.

공개 이력

PaLM은 2022년 4월에 처음 발표되었으나 비공개 상태를 유지하다가, 2023년 3월 구글이 API를 출시하면서 개발자들에게 제공되기 시작했다. API는 처음에는 대기자 명단에 등록한 제한된 수의 개발자에게만 공개되었다. PaLM의 전신은 LaMDA이며, 후속 모델로는 구글 제미니(Gemini)가 있다.

이 문서는 위키백과의 PaLM 항목 및 구글 리서치 발표 자료를 기반으로 작성되었다.

둘러보기

더 찾아볼 만한 주제

    전체 문서 보기