LLM Wiki

ppo

2건의 항목

  • 2026년 7월 21일

    강화학습 기초

    • rl
    • reinforcement-learning
    • mdp
    • ppo
    • dpo
    • grpo
  • 2026년 5월 11일

    PPO와 정책 최적화

    • rl
    • ppo
    • algorithm

Created with Quartz v5.0.0 © 2026

  • GitHub