LLM Wiki

rl

6건의 항목

  • 2026년 7월 21일

    GRPO

    • rl
    • reinforcement-learning
    • llm
  • 2026년 7월 21일

    강화학습 기초

    • rl
    • reinforcement-learning
    • mdp
    • ppo
    • dpo
    • grpo
  • 2026년 7월 21일

    강화학습 보상 해킹 (Reward Hacking in Reinforcement Learning)

    • rl
    • reward-hacking
    • alignment
    • rlhf
  • 2026년 5월 16일

    Reasoning Models

    • llm
    • reasoning
    • rl
    • test-time-compute
  • 2026년 5월 16일

    검증 가능한 도메인

    • llm
    • rl
    • evaluation
    • startup
  • 2026년 5월 11일

    PPO와 정책 최적화

    • rl
    • ppo
    • algorithm

Created with Quartz v5.0.0 © 2026

  • GitHub