BreakRL#
从失败中学强化学习。
BreakRL 是一份双语、失败优先的强化学习讲义。每章先讲清一个机制,再把它去掉,让你看见失败。
三分钟上手#
阅读不需要装任何东西。页面渲染已保存的输出,不会训练。下表是其余各章;从上面这三步开始,不必从第 1 章读起。
怎么读#
读正文,看问题、公式和机制;
打开实验 notebook,在小任务上看算法怎么跑;
对比消融:跑完了不等于方法可用。
训练不收敛时,按症状查 RL 失败模式图鉴(「症状 → 机制 → 复现 → 修复」)。
全部章节#
# |
章节 |
正文 |
实验 |
运行 |
|---|---|---|---|---|
1 |
多臂老虎机:探索与利用 |
|||
2 |
马尔可夫决策过程:序列决策形式化 |
|||
3 |
时序差分学习:长期价值估计 |
|||
4 |
DQN:神经网络价值学习 |
|||
5 |
Policy Gradient / REINFORCE:直接优化策略 |
|||
6 |
Actor-Critic / A2C:价值辅助策略更新 |
|||
7 |
PPO:约束策略更新 |
|||
8 |
SAC:最大熵连续控制 |
|||
9 |
离线强化学习:CQL 与 IQL |
|||
10 |
模型式强化学习:从环境模型到 Dyna-Q |
|||
11 |
Decision Transformer:序列建模的强化学习 |
|||
12 |
RLHF:从偏好到奖励 |
|||
13 |
DPO:不训奖励模型的偏好优化 |
|||
14 |
GRPO 与 RLVR:可验证奖励 |
第 12–14 章用玩具序列任务和两位数加法讲机制,不能替代真实的 RLHF、DPO 或 GRPO 训练。
站点展示已保存的 notebook 输出,阅读时不会训练模型。要运行实验,用上表的 Colab,或按 README 装本地环境。