AI Rookies

SGD — 随机梯度下降

事实

用小批数据反复更新参数的优化方法。

人话

它像爬山时起大雾:看不见整座山,就先探脚下这一小步,哪边更往下,下一步就朝哪边挪。

它是训练模型的基础优化法,常用于预训练、微调,也是很多优化器的起点。

相关概念

Parameter
SGD 的工作就是反复调整参数,让模型输出更接近目标。

Pretraining
预训练阶段要靠 SGD 这类优化方法持续更新模型权重。

Adam
Adam 是在 SGD 思路上发展的,更会自己调步子大小。

Deep-learning
深度学习模型能学会东西,离不开 SGD 这类优化器。