强化学习
| 资源 | 类型 | 简介 | 资料 |
|---|---|---|---|
| 强化学习的数学原理 | 教材 / 课程 | 西湖大学赵世钰从数学角度讲解强化学习,覆盖贝尔曼方程、值迭代、策略迭代、Monte Carlo、时序差分、Sarsa、Q-learning、值函数近似、策略梯度与 Actor-Critic,并以 Grid World 串联概念和算法。 | 英文教材 PDF · 中文版(清华大学出版社) · 课件 · 中文视频 |
| 动手学强化学习 | 教程 | 张伟楠、沈键、俞勇编写的中文教程,通过图文和 Jupyter Notebook 实现动态规划、时序差分、DQN、Actor-Critic、PPO、DDPG 与 SAC,并延伸到模仿学习、离线 RL 和多智能体 RL。 | 代码 · 视频课程 |
| Hands-on Modern RL | 开源教程 | 以可运行代码串联经典强化学习、大模型后训练与 Agentic RL,覆盖 DQN、Actor-Critic、PPO、RLHF、DPO、GRPO、RLVR、推理模型及工具调用智能体;项目仍在持续更新,仓库提示内容尚未全面审稿。 | GitHub · PDF / EPUB |
| Awesome-ML-SYS-Tutorial(中文版) | 学习笔记合集 | 以 RL Infra 为主线的中文 ML Systems 学习笔记,涵盖 slime、AReaL、verl、OpenRLHF、Agentic RL、训推一致性、权重更新、FSDP/Megatron 训练后端,并延伸到 SGLang 推理系统与 AI Infra 基础 |
