最小演示

最小演示#

损失下降,回报却塌缩

离线数据没有覆盖的动作,会被 Q 学习的贪心目标高估。于是训练损失看起来正常,策略却学会了数据中从未出现过的动作。

低覆盖率:未见动作更容易被 Q 值高估。

损失下降与实际回报 低数据覆盖率下,损失曲线继续下降,实际回报曲线在训练后段塌缩。
失败模式:损失下降,但实际回报在训练后段塌缩。 最终回报 0.08 · TD loss 0.11
TD loss(越低越好) 实际回报(越高越好) 行为克隆基线

这是一个固定的教学示意,不会训练模型,也不代表某次实验的具体数值。同一条失败模式:最小演示 → 图鉴第 8 条 → 离线强化学习章。