Appearance
第8章:神经网络与系统评估
组合函数与反向传播
前馈网络把线性变换与非线性函数组合。例如 ,输出 。没有非线性,多层线性变换仍可合并成一层,不能因此表达更丰富的非线性函数。
若损失对输出的导数为 ,则
反向传播按链式法则复用中间导数。它是计算梯度的算法,梯度下降才是利用梯度更新参数的优化方法。
表示学习与注意力
隐藏表示由训练目标塑造,可以把输入中的有用模式转成更易预测的特征。表示维度很高并不保证含有任务需要的全部信息。
注意力的一个常见形式是
每个查询根据与键的匹配程度加权汇总值。因果掩码限制位置不能使用未来 token;位置表示提供序列顺序信息。这里的加权关系不能直接当作因果解释或可信推理证据。
生成模型与行动系统
语言模型通过条件分布逐步生成 token。预测文本概率与验证事实、执行动作、维持长期状态是不同功能。一个包含检索、工具调用和规划的系统,还需要处理外部数据质量、权限、失败恢复和结果验证。
模型输出能表达一个正确答案,不意味着每次采样都可靠;模型能生成操作步骤,也不意味着步骤已经执行。评估需要针对最终任务的成功条件。
完整系统的评估
假设一个机器人先识别物体,再规划抓取路径,最后控制执行。分类准确率只评估其中一环,不能代替抓取成功率。还要分别检查分布变化、不可达目标、传感器误差和控制失败。
消融实验移除或替换一个组件,用于判断其贡献,但应尽量控制训练预算、数据和其他配置。单次结果存在随机波动,需要重复试验并报告不确定性。
综合练习
- 对一个两层、两个隐藏单元的网络手算一次前向和反向过程,再用有限差分核对一个非零、非折点处的梯度。
- 设计一个客服系统的评估集,分别测检索、事实回答、拒绝越权操作和任务完成。
- 为同一个导航问题比较已知模型规划、监督模仿和强化学习:各需要什么数据,分别可能在哪里失败?