返回首页

梯度下降(Gradient Descent)入门:AI 是怎么一步步“下山”找到最优解的

2026年10月8日 08:02来源: 润百AI0 条留言技术教程

为什么模型需要“下山”

训练一个 AI 模型,本质上是找一组让预测误差最小的参数。把误差(损失)想象成一片山地的高低起伏,参数就是你的位置,而目标是走到山谷最低点。梯度下降(Gradient Descent)就是最常用的“下山”策略:每走一步,先看清当前位置哪个方向最陡(梯度),再朝着下降最快的方向迈一小步。

梯度:告诉你“哪边在下坡”

梯度是损失函数对每个参数的偏导数组成的向量,它指向函数上升最快的方向。所以只要沿着梯度的反方向走,损失就会下降。步长由学习率(learning rate)控制:步子太大容易越过谷底来回震荡,太小则下山太慢、训练很久也到不了底。

三种常见的梯度下降

  • 批量梯度下降(BGD):用全部训练数据算一次梯度再更新,方向稳但每次都很慢、内存吃紧。
  • 随机梯度下降(SGD):每次只用一条样本,更新快但方向抖动大,反而有助于跳出局部最优。
  • 小批量梯度下降(Mini-batch):折中方案,每次用一小批(如 32、128 条)样本,兼顾速度与稳定,是今天深度学习的事实标准。

为什么实际训练不止“顺着梯度走”

真实损失面往往不是光滑的碗,而是布满沟壑与鞍点。为此出现了动量(Momentum)、AdaGrad、RMSProp、Adam 等改进:动量像给下山的小球加了惯性,能冲过小坑;自适应方法则给每个参数单独调整步长,让稀疏更新的参数也能稳步前进。

几个容易踩的坑

学习率设得过大,损失会震荡甚至发散;过小则收敛极慢。实践中常用学习率预热(warmup)与衰减(cosine、step)来兼顾前期稳定与后期精细。此外,梯度爆炸时会用梯度裁剪兜底,显存不足时则用梯度累积凑出等效大批量。

小结

梯度下降并不神秘:它就是“看方向、迈小步、反复走”的迭代过程。理解梯度的来源(反向传播)、步长(学习率)与批量大小这三件事,基本就握住了模型训练的主线。

【参考来源】综合整理自公开发布的机器学习教材与行业技术资料。

机器学习
留言讨论

留言 (0)

暂无留言,来写第一条吧

发表留言