Skip to content

第6章:强化学习与探索

不知道模型时怎样决策

MDP 规划假定转移和奖励已知,强化学习从交互中估计价值或策略。数据受到当前策略影响:从未尝试的行动不会自动提供可靠的效果估计。

多臂老虎机没有长期状态转移,却已包含探索与利用的矛盾。只选择当前样本均值最大的臂,可能因早期噪声永远错过更好的臂。探索机制为未知行动继续提供样本。

时序差分

对固定策略,TD(0) 用下一状态价值代替完整未来回报:

V(s)V(s)+α[r+γV(s)V(s)].V(s)\leftarrow V(s)+\alpha[r+\gamma V(s')-V(s)].

括号内是 TD 误差。蒙特卡洛方法等到完整回合结束才获得回报样本;TD 可以边走边更新,但目标依赖当前价值估计。

Q-learning 与 SARSA

Q-learning 更新

Q(s,a)Q(s,a)+α[r+γmaxaQ(s,a)Q(s,a)].Q(s,a)\leftarrow Q(s,a)+\alpha\left[r+\gamma\max_{a'}Q(s',a')-Q(s,a)\right].

它用贪心目标估计最优动作价值,可由其他探索策略采样,因此是离策略方法。SARSA 用实际选取的下一动作值 Q(s,a)Q(s',a'),评估当前行为策略,包括它的探索风险。

例如旧值为 2,即时奖励 1,下一状态最大动作值 4,γ=0.9,α=0.5\gamma=0.9,\alpha=0.5,则新值为 2+0.5(1+3.62)=3.32+0.5(1+3.6-2)=3.3。终止状态的后续价值取零,不能继续自举普通非终止状态的值。

收敛条件与函数逼近

有限表格情形的经典收敛结论要求足够访问各状态动作对、合适的学习率序列等条件。常见条件包括每对的 tαt=\sum_t\alpha_t=\inftytαt2<\sum_t\alpha_t^2<\infty。固定学习率、有限样本并不自动具有同样的精确收敛保证。

神经网络可共享参数以处理巨大状态空间,但函数逼近、自举和离策略学习结合时可能不稳定。经验回放、目标网络等改善训练过程,不能作为任意环境收敛的证明。

奖励与部署

奖励设计不完整时,智能体可能学到高分却不符合要求的行为。评估应包含未见环境、不同随机种子、约束违反率和基线,并区分训练回报与部署回报。

练习

  1. 为什么低探索率可能提高短期回报,却降低最终学得策略的质量?
  2. 在悬崖行走任务中,解释 SARSA 与 Q-learning 对探索风险的不同处理。
  3. 一次高分训练曲线为什么不足以说明算法稳定有效?

上次更新: