梯度下降是所有深度学习训练的基础算法。核心思想:站在山上(高误差),环顾四周找到最陡的下山方向(梯度),走一步,重复直到到达山谷(最小误差)。
主要变体:
- SGD(随机梯度下降):每次用一小批数据计算梯度
- Adam:自适应学习率,目前最常用的优化器
- AdamW:Adam+权重衰减,大模型训练主流选择
梯度下降是所有深度学习训练的基础算法。核心思想:站在山上(高误差),环顾四周找到最陡的下山方向(梯度),走一步,重复直到到达山谷(最小误差)。
主要变体:
除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。