Skip to content

第8章:神经网络与系统评估

组合函数与反向传播

前馈网络把线性变换与非线性函数组合。例如 h=ReLU(Wx+b)h=\operatorname{ReLU}(Wx+b),输出 z=vThz=v^Th。没有非线性,多层线性变换仍可合并成一层,不能因此表达更丰富的非线性函数。

若损失对输出的导数为 gg,则

v=gh,W=(gv1Wx+b>0)xT.\frac{\partial\ell}{\partial v}=gh,\qquad \frac{\partial\ell}{\partial W}=\left(gv\odot\mathbf1_{Wx+b>0}\right)x^T.

反向传播按链式法则复用中间导数。它是计算梯度的算法,梯度下降才是利用梯度更新参数的优化方法。

表示学习与注意力

隐藏表示由训练目标塑造,可以把输入中的有用模式转成更易预测的特征。表示维度很高并不保证含有任务需要的全部信息。

注意力的一个常见形式是

Attention(Q,K,V)=softmax(QKTd)V.\operatorname{Attention}(Q,K,V)=\operatorname{softmax}\left(\frac{QK^T}{\sqrt d}\right)V.

每个查询根据与键的匹配程度加权汇总值。因果掩码限制位置不能使用未来 token;位置表示提供序列顺序信息。这里的加权关系不能直接当作因果解释或可信推理证据。

生成模型与行动系统

语言模型通过条件分布逐步生成 token。预测文本概率与验证事实、执行动作、维持长期状态是不同功能。一个包含检索、工具调用和规划的系统,还需要处理外部数据质量、权限、失败恢复和结果验证。

模型输出能表达一个正确答案,不意味着每次采样都可靠;模型能生成操作步骤,也不意味着步骤已经执行。评估需要针对最终任务的成功条件。

完整系统的评估

假设一个机器人先识别物体,再规划抓取路径,最后控制执行。分类准确率只评估其中一环,不能代替抓取成功率。还要分别检查分布变化、不可达目标、传感器误差和控制失败。

消融实验移除或替换一个组件,用于判断其贡献,但应尽量控制训练预算、数据和其他配置。单次结果存在随机波动,需要重复试验并报告不确定性。

综合练习

  1. 对一个两层、两个隐藏单元的网络手算一次前向和反向过程,再用有限差分核对一个非零、非折点处的梯度。
  2. 设计一个客服系统的评估集,分别测检索、事实回答、拒绝越权操作和任务完成。
  3. 为同一个导航问题比较已知模型规划、监督模仿和强化学习:各需要什么数据,分别可能在哪里失败?

上次更新: