Skip to content

第7章:监督学习、损失与泛化

从样本拟合到总体预测

给定样本 (xi,yi)(x_i,y_i),选择模型族 fθf_\theta 和损失 \ell,经验风险最小化求

minθ1ni=1n(fθ(xi),yi)+λΩ(θ).\min_\theta\frac1n\sum_{i=1}^n\ell(f_\theta(x_i),y_i)+\lambda\Omega(\theta).

第一项衡量训练拟合,第二项施加正则化。真正关心的是新数据分布上的期望损失,训练损失只是有限样本估计。二者接近需要关于抽样、模型复杂度等假设。

训练集用于估计参数,验证集用于选超参数,测试集用于最终评估。反复查看测试结果并据此改模型,会使测试集实际参与选择,乐观偏差随之产生。

线性回归与概率解释

线性回归 fw(x)=wTxf_w(x)=w^Tx 配平方损失。假设观测为 y=wTx+ϵy=w^Tx+\epsilon,独立噪声服从同方差高斯分布,则最大似然等价于最小化平方误差。

这不是说现实噪声一定高斯,而是说明损失隐含怎样的模型偏好。异常值较大时,平方损失惩罚很强;绝对值或 Huber 损失具有不同的鲁棒性和优化性质。

分类与交叉熵

二分类逻辑回归使用 p=σ(wTx)p=\sigma(w^Tx),负对数似然为

=ylogp(1y)log(1p).\ell=-y\log p-(1-y)\log(1-p).

对 logit z=wTxz=w^Tx 求导得到 /z=py\partial\ell/\partial z=p-y,因此样本梯度为 (py)x(p-y)x。分类阈值影响精确率和召回率,但不改变模型输出的概率本身。

若阳性只占 1%,恒预测阴性也能达到 99% 准确率,却可能完全无用。需要按任务选择指标,并检查概率校准与不同错误的成本。

过拟合与数据泄漏

模型可把训练噪声当规律,尤其在容量大、样本少时。正则化、早停和数据增广改变可学函数或训练过程,但不能补救测试数据已泄漏进训练的实验设计。

时间预测任务应避免随机切分使未来信息进入训练;同一人的多份近重复记录也不应轻易跨训练和测试集。分割单位要对应实际希望泛化到的对象。

练习

  1. 从高斯似然推导平方损失,指出可丢掉哪些与参数无关的项。
  2. 一个稀有疾病检测器准确率 99%,还需哪些数据才能判断它有用?
  3. 为什么标准化参数通常应只由训练集估计?

上次更新: