用小批数据反复更新参数的优化方法。
它像爬山时起大雾:看不见整座山,就先探脚下这一小步,哪边更往下,下一步就朝哪边挪。
它是训练模型的基础优化法,常用于预训练、微调,也是很多优化器的起点。
ParameterSGD 的工作就是反复调整参数,让模型输出更接近目标。
Pretraining预训练阶段要靠 SGD 这类优化方法持续更新模型权重。
AdamAdam 是在 SGD 思路上发展的,更会自己调步子大小。
Deep-learning深度学习模型能学会东西,离不开 SGD 这类优化器。