一套面向 Obsidian 阅读 + GitHub 展示 的强化学习学习笔记,内容覆盖基础概念、值函数方法、策略梯度方法、信任域方法,以及部分基于模型的方法。
如果是第一次学习,推荐顺序是:
MDP -> Bellman方程 -> MC与TD对比Q-learning -> Sarsa -> DQNREINFORCE -> Actor-Critic -> TRPO -> PPOLQR -> MBRL隐空间模型
- 笔记主要为个人学习整理,排版优先适配 Obsidian。
- 仓库中的双链
[[...]]主要服务于 Obsidian 内部跳转。 - GitHub 中建议从 强化学习算法全景 开始阅读。
本仓库内容采用 CC BY-NC 4.0 许可协议:
- 允许转载、分享、改编
- 需要保留署名
- 不允许商业使用