什么是正则化
在机器学习中,过拟合(Overfitting)是最常见也最隐蔽的问题之一:模型在训练数据上表现近乎完美,一遇到没见过的新数据就明显失准。它并没有真正"学会规律",而是"背下了答案"。正则化(Regularization)就是用来抑制这种死记硬背、让模型学到更通用规律的一类方法。
为什么模型会"死记硬背"
当模型参数足够多、训练数据又有限时,模型完全可以靠记住每个样本的细节把训练误差压到接近零。但真实世界里真正有用的往往是那些平滑、稳定的趋势,而不是训练样本中的噪声。正则化的核心思路,就是在训练目标里额外加一项"惩罚",约束模型不要为了迁就个别样本而把参数调得过于极端。
常见做法
L2 正则(权重衰减)
在损失函数里加上参数平方和的惩罚项,让权重整体趋向于小。它对应统计学里的岭回归(Ridge),能让决策边界更平滑,是最常用的默认手段。
L1 正则
惩罚项改为参数绝对值之和,对应 Lasso。它的特点是会把一部分权重直接压成 0,从而起到特征选择的作用——适合想顺便挑出关键特征的场景。
Dropout
训练时随机"关掉"一部分神经元,迫使网络不能过度依赖某几个节点。这相当于同时训练了海量不同的子网络,并在推理时做集成,是深度学习里非常流行的正则化手段。
早停(Early Stopping)
在验证集误差不再下降时及时停止训练。它不额外增加参数,却能有效避免模型在训练集上越跑越偏。数据增强(对图片做翻转、裁剪等)同样是一种间接的正则化。
一句话总结
正则化的本质是"用一点训练误差,换更好的泛化能力"。它不是让模型学得更少,而是让它学到更值得学的部分。实际工作中,L2 权重衰减、Dropout 与早停往往会一起使用。
【参考来源】综合整理自公开发布的机器学习教材与行业资料。
机器学习