Appearance
第1章:智能体、模型与任务
智能体与环境
智能体接收观测,选择行动,环境据此演化。观测不一定等于完整状态:机器人可以测到相机图像,却不知道物体的全部位置和速度。历史信息有时是推断当前状态的必要依据。
任务通常要明确状态、动作、转移、观测与评价标准。路径规划中的状态可以是位置,动作是移动;游戏中的状态包含棋盘和轮到谁;诊断任务的隐藏状态是疾病,观测是检查结果。
| 问题 | 已知信息 | 要求输出 |
|---|---|---|
| 搜索 | 状态转移、起点与目标 | 一条路径或动作序列 |
| 概率推断 | 概率模型与证据 | 未观测变量的分布 |
| 决策 | 后果概率与效用 | 当前行动或完整策略 |
| 学习 | 数据、模型族、训练目标 | 参数、预测器或策略 |
学习得到的模型可用于规划;规划也可使用人工给定的模型。它们不是按年代相互替代的概念。
表示决定能够回答什么
一个导航状态若只记录位置,而代价还取决于剩余电量,状态就可能不足以预测后续可行行动。把电量纳入状态会扩大搜索空间,却使模型更符合问题。
状态满足马尔可夫性质,意味着给定当前状态和动作后,后续状态分布不再依赖更早历史。这是模型的条件独立假设,不是所有现实观测天然具有的性质。
目标与理性
最小化路程、时间和碰撞风险通常不是同一个目标。将它们加权为一个代价,需要说明权重代表怎样的取舍。算法在某个代价下最优,不证明目标本身符合人的需求。
设行动 A 一定获得 4,行动 B 以一半概率获得 10、另一半为 0。最大化期望收益会选 B;若效用是 ,A 的效用为 2,B 的期望效用约为 1.58,就会选 A。风险偏好属于效用建模,不是概率计算出了矛盾。
模型误差与计算限制
系统表现由表示、数据、推断算法和行动执行共同决定。准确求解一个错误模型仍可能导致失败;正确模型过大时,也可能只能采用近似算法。
因此要区分模型是否覆盖现实、算法是否正确求解模型,以及评估数据是否代表使用环境。三者需要不同的验证方法。
练习
- 为自动仓库车写出状态、观测、动作和目标,指出哪些量不可直接观测。
- “预测下一步人的动作”与“选择机器下一步的动作”有什么不同?
- 改变效用函数会不会改变环境的真实概率?