返回首页

损失函数(Loss Function)入门:AI 模型是怎么衡量“错了多少”的

2026年10月8日 13:31来源: 润百AI0 条留言技术教程

什么是损失函数

训练模型时,我们总得有个“打分”的办法:当前这组参数到底预测得有多离谱?损失函数(Loss Function,也叫代价函数)就是回答这个问题的尺子。它把模型的预测值和真实标签之间的差距,折算成一个可比较的数字。数字越小,说明模型在这批数据上“错得越少”。

把训练过程想象成下山,损失函数的取值就是海拔高度——梯度下降负责找路,损失函数负责告诉它现在站在多高的地方。

为什么不能只看“对了几个”

最直觉的指标是准确率:预测对了几个。但它有两个致命问题。其一,它不可微,无法求梯度,也就没法用梯度下降去优化;其二,它丢掉了“错了多少”的信息——把 0.51 判成 1 和把 0.99 判成 1,在准确率眼里完全一样,但后者其实更该被纠正。所以训练时用的是光滑、可导的损失函数,准确率只留作最终评估。

常见损失函数

  • 均方误差(MSE):回归任务的常客,把每个样本的误差平方后取平均。对大误差惩罚更重,因为平方会放大它。
  • 平均绝对误差(MAE):取误差绝对值再平均,对离群点更稳健,代价是零点附近不平滑。
  • 交叉熵(Cross-Entropy):分类任务的主流。它衡量的是模型给出的概率分布与真实标签分布之间的差异,常配合 Softmax 输出使用。预测得越自信却越错,惩罚就越大。
  • 合页损失(Hinge Loss):支持向量机(SVM)的经典选择,只关心样本有没有分对且留足间隔。

怎么选

一句话的经验法则:回归问题看误差分布——有离群点用 MAE,追求平滑可导用 MSE 或 Huber;分类问题基本闭眼选交叉熵,多分类配 Softmax、二分类配 Sigmoid。真正重要的不是哪个“更高级”,而是它是否与你关心的目标一致。

小结

损失函数是模型训练的指南针:它把“好”与“坏”翻译成一个可以求导、可以优化的数。选对了尺子,模型才知道该往哪个方向进步。

【参考来源】综合整理自公开发布的行业信息(Ian Goodfellow 等《Deep Learning》,MIT Press;scikit-learn 官方文档;Stanford CS231n 课程讲义)。

机器学习
留言讨论

留言 (0)

暂无留言,来写第一条吧

发表留言