Skip to main content
Back to top
Ctrl
+
K
Search
Ctrl
+
K
Search
Ctrl
+
K
BreakRL
Search
Ctrl
+
K
中文版
最小演示
多臂老虎机:探索与利用
马尔可夫决策过程:序列决策形式化
时序差分学习:长期价值估计
DQN:神经网络价值学习
Policy Gradient / REINFORCE:直接优化策略
Actor-Critic / A2C:价值辅助策略更新
PPO:约束策略更新
SAC:最大熵连续控制
离线强化学习:CQL 与 IQL
模型式强化学习:从环境模型到 Dyna-Q
Decision Transformer:序列建模的强化学习
RLHF:从偏好到奖励
DPO:不训奖励模型的偏好优化
GRPO 与 RLVR:可验证奖励
离线强化学习正文(PDF)
RL 失败模式图鉴
English
Home
Minimum demo
Multi-Armed Bandits: Exploration vs Exploitation
Markov Decision Processes
Temporal-Difference Learning
DQN: Neural Value Learning
Policy Gradient / REINFORCE
Actor-Critic / A2C
PPO: Constrained Policy Updates
SAC: Maximum-Entropy Continuous Control
Offline RL: CQL and IQL
Model-Based RL: Dyna-Q
Decision Transformer: RL as Sequence Modeling
RLHF: From Preferences to Rewards
DPO: Preference Optimization without a Reward Model
GRPO and RLVR: Verifiable Rewards
Offline RL chapter (PDF)
Failure Atlas
Index