让模型参数朝更优目标不断调整的过程。
像煎饼摊师傅调面糊火候:稀一点焦了,厚一点夹生,得一遍遍试到那张皮最对劲。
它贯穿模型训练,负责把参数一步步调到更好的位置。
Gradient Descent梯度下降是优化最经典、最基础的实现方式。
SGDSGD 是优化的常见做法,用小批量数据更新参数。
AdamAdam 是常用优化器,收敛通常比基础方法更快。
Backpropagation反向传播先算出梯度,优化再据此更新参数。