BreakRL#

从失败中学强化学习。

BreakRL 是一份双语、失败优先的强化学习讲义。每章先讲清一个机制,再把它去掉,让你看见失败。

三分钟上手#

  1. 打开最小演示,拖动覆盖率滑块(教学示意图,不训练模型);

  2. 打开 失败图鉴第 8 条(离线损失正常,回报塌缩);

  3. 读离线强化学习章:正文 PDF 与已保存的实验。

阅读不需要装任何东西。页面渲染已保存的输出,不会训练。下表是其余各章;从上面这三步开始,不必从第 1 章读起。

怎么读#

  1. 读正文,看问题、公式和机制;

  2. 打开实验 notebook,在小任务上看算法怎么跑;

  3. 对比消融:跑完了不等于方法可用。

训练不收敛时,按症状查 RL 失败模式图鉴(「症状 → 机制 → 复现 → 修复」)。

全部章节#

#

章节

正文

实验

运行

1

多臂老虎机:探索与利用

PDF

Notebook

Colab

2

马尔可夫决策过程:序列决策形式化

PDF

Notebook

Colab

3

时序差分学习:长期价值估计

PDF

Notebook

Colab

4

DQN:神经网络价值学习

PDF

Notebook

Colab

5

Policy Gradient / REINFORCE:直接优化策略

PDF

Notebook

Colab

6

Actor-Critic / A2C:价值辅助策略更新

PDF

Notebook

Colab

7

PPO:约束策略更新

PDF

Notebook

Colab

8

SAC:最大熵连续控制

PDF

Notebook

Colab

9

离线强化学习:CQL 与 IQL

PDF

Notebook

Colab

10

模型式强化学习:从环境模型到 Dyna-Q

PDF

Notebook

Colab

11

Decision Transformer:序列建模的强化学习

PDF

Notebook

Colab

12

RLHF:从偏好到奖励

PDF

Notebook

Colab

13

DPO:不训奖励模型的偏好优化

PDF

Notebook

Colab

14

GRPO 与 RLVR:可验证奖励

PDF

Notebook

Colab

第 12–14 章用玩具序列任务和两位数加法讲机制,不能替代真实的 RLHF、DPO 或 GRPO 训练。

站点展示已保存的 notebook 输出,阅读时不会训练模型。要运行实验,用上表的 Colab,或按 README 装本地环境。