Skip to content

第1章:智能体、模型与任务

智能体与环境

智能体接收观测,选择行动,环境据此演化。观测不一定等于完整状态:机器人可以测到相机图像,却不知道物体的全部位置和速度。历史信息有时是推断当前状态的必要依据。

任务通常要明确状态、动作、转移、观测与评价标准。路径规划中的状态可以是位置,动作是移动;游戏中的状态包含棋盘和轮到谁;诊断任务的隐藏状态是疾病,观测是检查结果。

问题已知信息要求输出
搜索状态转移、起点与目标一条路径或动作序列
概率推断概率模型与证据未观测变量的分布
决策后果概率与效用当前行动或完整策略
学习数据、模型族、训练目标参数、预测器或策略

学习得到的模型可用于规划;规划也可使用人工给定的模型。它们不是按年代相互替代的概念。

表示决定能够回答什么

一个导航状态若只记录位置,而代价还取决于剩余电量,状态就可能不足以预测后续可行行动。把电量纳入状态会扩大搜索空间,却使模型更符合问题。

状态满足马尔可夫性质,意味着给定当前状态和动作后,后续状态分布不再依赖更早历史。这是模型的条件独立假设,不是所有现实观测天然具有的性质。

目标与理性

最小化路程、时间和碰撞风险通常不是同一个目标。将它们加权为一个代价,需要说明权重代表怎样的取舍。算法在某个代价下最优,不证明目标本身符合人的需求。

设行动 A 一定获得 4,行动 B 以一半概率获得 10、另一半为 0。最大化期望收益会选 B;若效用是 u(r)=ru(r)=\sqrt r,A 的效用为 2,B 的期望效用约为 1.58,就会选 A。风险偏好属于效用建模,不是概率计算出了矛盾。

模型误差与计算限制

系统表现由表示、数据、推断算法和行动执行共同决定。准确求解一个错误模型仍可能导致失败;正确模型过大时,也可能只能采用近似算法。

因此要区分模型是否覆盖现实、算法是否正确求解模型,以及评估数据是否代表使用环境。三者需要不同的验证方法。

练习

  1. 为自动仓库车写出状态、观测、动作和目标,指出哪些量不可直接观测。
  2. “预测下一步人的动作”与“选择机器下一步的动作”有什么不同?
  3. 改变效用函数会不会改变环境的真实概率?

上次更新: