WIPIVERSE

근위 정책 최적화

근위 정책 최적화(Proximal Policy Optimization, PPO)는 지능형 에이전트를 훈련하기 위한 강화 학습(Reinforcement Learning, RL) 알고리즘이다. 구체적으로, 정책 네트워크가 매우 큰 경우 심층 강화 학습에 자주 사용되는 정책 그래디언트(Policy Gradient) 방법에 속한다.

PPO는 2017년 John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, Oleg Klimov가 OpenAI에서 발표한 논문 "Proximal Policy Optimization Algorithms"(arXiv: 1707.06347)을 통해 처음 소개되었다. PPO의 전신은 2015년에 발표된 신뢰 영역 정책 최적화(Trust Region Policy Optimization, TRPO)이다. TRPO는 기존 정책과 새 정책 간의 KL 발산(Kullback-Leibler divergence)을 제한하여 학습의 불안정성 문제를 해결했으나, 헤시안 행렬(Hessian matrix) 계산이 필요하여 대규모 문제에 비효율적이라는 한계가 있었다.

PPO는 이러한 TRPO의 한계를 극복하기 위해 개발되었다. PPO의 핵심 아이디어는 KL 발산 제약 조건을 명시적으로 계산하는 대신, 정책 그래디언트를 단순히 클리핑(clipping)하여 근사화하는 것이다. 구체적으로 PPO는 클리핑된 대리 목적 함수(Clipped Surrogate Objective)를 사용하여 정책 업데이트가 과도하게 커지는 것을 방지하며, 이를 통해 1차 최적화(Adam 등)만으로도 TRPO에 필적하는 안정성을 달성한다.

PPO의 주요 특징은 다음과 같다. 첫째, 구현이 TRPO에 비해 현저히 단순하다. 둘째, 동일한 롤아웃(rollout) 데이터로 여러 에폭(epoch) 동안 미니배치 SGD 업데이트를 수행할 수 있어 샘플 효율이 높다. 셋째, 아키텍처 제약이 없어 다양한 실험 설정에 적용 가능하다.

2018년 이후 PPO는 OpenAI의 기본 강화 학습 알고리즘으로 채택되었으며, 로봇 팔 제어, 도타 2(Dota 2)에서 프로 선수를 이긴 OpenAI Five, 아타리(Atari) 게임, 그리고 최근에는 인간 피드백 기반 강화 학습(RLHF, Reinforcement Learning from Human Feedback)을 통한 대규모 언어 모델(LLM) 정렬 등 다양한 분야에 적용되었다.

둘러보기

더 찾아볼 만한 주제

    전체 문서 보기