Appearance
第6章:强化学习与探索
不知道模型时怎样决策
MDP 规划假定转移和奖励已知,强化学习从交互中估计价值或策略。数据受到当前策略影响:从未尝试的行动不会自动提供可靠的效果估计。
多臂老虎机没有长期状态转移,却已包含探索与利用的矛盾。只选择当前样本均值最大的臂,可能因早期噪声永远错过更好的臂。探索机制为未知行动继续提供样本。
时序差分
对固定策略,TD(0) 用下一状态价值代替完整未来回报:
括号内是 TD 误差。蒙特卡洛方法等到完整回合结束才获得回报样本;TD 可以边走边更新,但目标依赖当前价值估计。
Q-learning 与 SARSA
Q-learning 更新
它用贪心目标估计最优动作价值,可由其他探索策略采样,因此是离策略方法。SARSA 用实际选取的下一动作值 ,评估当前行为策略,包括它的探索风险。
例如旧值为 2,即时奖励 1,下一状态最大动作值 4,,则新值为 。终止状态的后续价值取零,不能继续自举普通非终止状态的值。
收敛条件与函数逼近
有限表格情形的经典收敛结论要求足够访问各状态动作对、合适的学习率序列等条件。常见条件包括每对的 、。固定学习率、有限样本并不自动具有同样的精确收敛保证。
神经网络可共享参数以处理巨大状态空间,但函数逼近、自举和离策略学习结合时可能不稳定。经验回放、目标网络等改善训练过程,不能作为任意环境收敛的证明。
奖励与部署
奖励设计不完整时,智能体可能学到高分却不符合要求的行为。评估应包含未见环境、不同随机种子、约束违反率和基线,并区分训练回报与部署回报。
练习
- 为什么低探索率可能提高短期回报,却降低最终学得策略的质量?
- 在悬崖行走任务中,解释 SARSA 与 Q-learning 对探索风险的不同处理。
- 一次高分训练曲线为什么不足以说明算法稳定有效?