한 줄 정의
별도의 가치 네트워크(Critic)나 Reward Model 없이 동일한 프롬프트에 대해 여러 답변을 생성한 뒤 그룹 내 상대적 점수를 기준으로 PPO를 개선하여 학습하는 강화학습 최적화 알고리즘.
핵심 요지
- 2024년 DeepSeek-R1 논문에서 소개되었으며, PPO가 필요로 하던 막대한 메모리와 계산 비용을 크게 절감했다.
- 정답이나 오답이 명확한 작업(수학 문제, 코드 실행 등)에서 스스로 사고(Reasoning)하는 능력을 극대화하는 데 탁월한 효과를 보였다.
- LLM의 추론 성능을 강화학습만으로 OpenAI o1 수준으로 끌어올린 일등 공신 기술이다.
상세
일반적인 강화학습(특히 PPO)에서는 행동을 평가하기 위해 가치 함수를 측정하는 Critic 네트워크를 동원해야 한다. 이는 대규모 언어 모델(LLM) 환경에서 막대한 추가 메모리와 연산 리소스를 요구한다. GRPO(Group Relative Policy Optimization)는 이 Critic을 과감히 제거했다. 대신, 모델이 하나의 질문에 대해 여러 개(G개)의 답변 그룹을 생성하고, 룰 기반 평가나 정답 확인을 거쳐 이 그룹 내부의 ‘상대적 점수(Advantage)‘를 바탕으로 PPO의 클리핑 목적함수를 업데이트한다.
예시
어떤 수학 프롬프트 에 대해 4개의 답변 를 도출한다. 각 답변이 정답 형식에 맞게 도출되었는지 채점하여 보상 를 구한다. 그 보상들의 평균값을 계산한 뒤, 각 답변의 보상에서 평균을 빼서 어느 답변이 상대적으로 더 훌륭했는가()를 구하고, 이를 토대로 모델의 가중치를 업데이트한다.
충돌
- 보상 산정의 한계: 코딩이나 수학처럼 정답을 알고리즘으로 명확히 자동 채점할 수 있는 태스크(Reasoning)에서는 강력하지만, 인간의 미묘한 취향(감성적 대화, 창의적 글쓰기)이나 주관성이 개입되는 영역에서는 전통적인 RLHF(별도의 Reward Model 활용)보다 구현이 더 까다롭거나 효과가 떨어질 수 있다.
- 다중 샘플 생성 부하: 한 프롬프트에 대해 그룹(예: 4~8개) 단위의 답변을 한 번에 생성해야 하므로 추론 타임(Inference time)의 배치 사이즈와 메모리 관리 전략이 매우 중요하다.