LLM Wiki
Search
검색
다크 모드
라이트 모드
탐색기
rl
6건의 항목
2026년 7월 21일
GRPO
rl
reinforcement-learning
llm
2026년 7월 21일
강화학습 기초
rl
reinforcement-learning
mdp
ppo
dpo
grpo
2026년 7월 21일
강화학습 보상 해킹 (Reward Hacking in Reinforcement Learning)
rl
reward-hacking
alignment
rlhf
2026년 5월 16일
Reasoning Models
llm
reasoning
rl
test-time-compute
2026년 5월 16일
검증 가능한 도메인
llm
rl
evaluation
startup
2026년 5월 11일
PPO와 정책 최적화
rl
ppo
algorithm