一种利用历史梯度加速参数更新的优化方法。
动量像下棋起势:这步既然方向对,后面就顺着攻,别被眼前一两手小波动带偏。
它常用来加快收敛、减少震荡,尤其适合深度网络训练。
SGD动量常作为 SGD 的增强版,帮它更新得更稳更快。
Gradient Descent它改进梯度下降的更新轨迹,减少锯齿式震荡。
AdamAdam 吸收了动量思想,并叠加自适应学习率。