Appearance
第7章:监督学习、损失与泛化
从样本拟合到总体预测
给定样本 ,选择模型族 和损失 ,经验风险最小化求
第一项衡量训练拟合,第二项施加正则化。真正关心的是新数据分布上的期望损失,训练损失只是有限样本估计。二者接近需要关于抽样、模型复杂度等假设。
训练集用于估计参数,验证集用于选超参数,测试集用于最终评估。反复查看测试结果并据此改模型,会使测试集实际参与选择,乐观偏差随之产生。
线性回归与概率解释
线性回归 配平方损失。假设观测为 ,独立噪声服从同方差高斯分布,则最大似然等价于最小化平方误差。
这不是说现实噪声一定高斯,而是说明损失隐含怎样的模型偏好。异常值较大时,平方损失惩罚很强;绝对值或 Huber 损失具有不同的鲁棒性和优化性质。
分类与交叉熵
二分类逻辑回归使用 ,负对数似然为
对 logit 求导得到 ,因此样本梯度为 。分类阈值影响精确率和召回率,但不改变模型输出的概率本身。
若阳性只占 1%,恒预测阴性也能达到 99% 准确率,却可能完全无用。需要按任务选择指标,并检查概率校准与不同错误的成本。
过拟合与数据泄漏
模型可把训练噪声当规律,尤其在容量大、样本少时。正则化、早停和数据增广改变可学函数或训练过程,但不能补救测试数据已泄漏进训练的实验设计。
时间预测任务应避免随机切分使未来信息进入训练;同一人的多份近重复记录也不应轻易跨训练和测试集。分割单位要对应实际希望泛化到的对象。
练习
- 从高斯似然推导平方损失,指出可丢掉哪些与参数无关的项。
- 一个稀有疾病检测器准确率 99%,还需哪些数据才能判断它有用?
- 为什么标准化参数通常应只由训练集估计?