Study note

Hands-On Modern RL

Properties

Type
Blogs
Status
待读
Domain
AI / ML
Category
深度学习、自动微分与实践
Source
github.com
Vault note
library/articles/ai_ml/Hands-On-Modern-RL-e44122495784ef79.md

Summary

开源 hands-on RL 课程,目标是从基础强化学习概念过渡到 LLM alignment、RLVR 和 agentic systems,覆盖 PPO、RLHF、DPO、GRPO 等现代主题。

Highlights

代码优先,适合把强化学习理论、LLM 对齐和 agent 训练方法串成可运行实践。

Notes

从 PPO 到 RLHF、DPO、GRPO、Agentic RL 的代码优先教程。

Comments

Loading comments...