GRPO 원리 정리: PPO의 비평가 신경망을 그룹 평균과 표준편차로 대체한 강화학습 기법
PPO가 메모리에 올리던 네 개의 신경망 가운데 비평가를 통째로 없앤 GRPO의 작동 방식을 정리했다. 같은 질문에 여러 답변을 한꺼번에 뽑아 그 평균과 표준편차로 기준선을 대신하는 것이 핵심 아이디어다.
핵심 내용 읽기 →AI TOPIC
DeepSeek-R1 관련 핵심 뉴스와 활용 인사이트 5편을 최신순으로 모았습니다.

PPO가 메모리에 올리던 네 개의 신경망 가운데 비평가를 통째로 없앤 GRPO의 작동 방식을 정리했다. 같은 질문에 여러 답변을 한꺼번에 뽑아 그 평균과 표준편차로 기준선을 대신하는 것이 핵심 아이디어다.
핵심 내용 읽기 →
긴 사고 과정을 쓰는 추론 모델은 어떤 원리로 학습될까. CMU 강의는 STaR와 DeepSeek R1, GRPO 손실함수, 응답 길이 폭주 문제, 강화학습이 지도학습보다 잘 전이되는 이유까지 차례로 짚는다.
핵심 내용 읽기 →
o1과 DeepSeek-R1 같은 추론 모델이 답 대신 '생각'을 먼저 전개하는 이유, 테스트타임 컴퓨트 스케일링, 그리고 강화학습만으로 사고연쇄를 스스로 익히는 원리를 쉽게 풀었다.
핵심 내용 읽기 →
DeepSeek-R1 논문을 따라 언어모델과 강화학습의 연결, GRPO 알고리즘, 규칙 기반 보상과 보상 해킹 방지, 그리고 큰 모델의 지식을 작은 모델로 옮기는 증류까지 초보자도 이해하도록 차근차근 풀어봤다.
핵심 내용 읽기 →
o1·DeepSeek-R1 같은 추론형 LLM은 혁신적 신기술이 아니라 훈련 방식의 차이일 뿐이다. 추론 모델을 만드는 네 가지 접근법과 규칙 기반 강화학습, DeepSeek-R1의 단계별 학습 과정을 정리했다.
핵심 내용 읽기 →