为什么模型需要“下山”
训练一个 AI 模型,本质上是找一组让预测误差最小的参数。把误差(损失)想象成一片山地的高低起伏,参数就是你的位置,而目标是走到山谷最低点。梯度下降(Gradient Descent)就是最常用的“下山”策略:每走一步,先看清当前位置哪个方向最陡(梯度),再朝着下降最快的方向迈一小步。
梯度:告诉你“哪边在下坡”
梯度是损失函数对每个参数的偏导数组成的向量,它指向函数上升最快的方向。所以只要沿着梯度的反方向走,损失就会下降。步长由学习率(learning rate)控制:步子太大容易越过谷底来回震荡,太小则下山太慢、训练很久也到不了底。
三种常见的梯度下降
- 批量梯度下降(BGD):用全部训练数据算一次梯度再更新,方向稳但每次都很慢、内存吃紧。
- 随机梯度下降(SGD):每次只用一条样本,更新快但方向抖动大,反而有助于跳出局部最优。
- 小批量梯度下降(Mini-batch):折中方案,每次用一小批(如 32、128 条)样本,兼顾速度与稳定,是今天深度学习的事实标准。
为什么实际训练不止“顺着梯度走”
真实损失面往往不是光滑的碗,而是布满沟壑与鞍点。为此出现了动量(Momentum)、AdaGrad、RMSProp、Adam 等改进:动量像给下山的小球加了惯性,能冲过小坑;自适应方法则给每个参数单独调整步长,让稀疏更新的参数也能稳步前进。
几个容易踩的坑
学习率设得过大,损失会震荡甚至发散;过小则收敛极慢。实践中常用学习率预热(warmup)与衰减(cosine、step)来兼顾前期稳定与后期精细。此外,梯度爆炸时会用梯度裁剪兜底,显存不足时则用梯度累积凑出等效大批量。
小结
梯度下降并不神秘:它就是“看方向、迈小步、反复走”的迭代过程。理解梯度的来源(反向传播)、步长(学习率)与批量大小这三件事,基本就握住了模型训练的主线。
【参考来源】综合整理自公开发布的机器学习教材与行业技术资料。
机器学习