栏目三 · 优化参数

调参:让模型“学得好”

损失函数给了方向,优化器负责沿方向更新参数。 学习率、Batch Size、动量等“超参数”就是你要拧的旋钮——拧对了收敛快又稳,拧错了要么学不动要么崩。

核心旋钮一览

参数作用太大 / 太小会怎样
学习率 LR每步更新的步长太大震荡发散 / 太小慢或卡住
Batch Size每步看多少样本太大显存爆、泛化差 / 太小 noisy
Epochs遍历数据几轮太多过拟合 / 太少学不充分
动量 Momentum积累历史梯度方向太大冲过头 / 太小难逃局部
权重衰减正则,抑制过大权重太大欠拟合 / 太小易过拟合

常见优化器

更新公式(SGD + 动量示意):v ← β·v − η·∇L; θ ← θ + v (η=学习率,β=动量系数,∇L=损失梯度)。动量让方向更“平滑”。

学习率调度(Schedule)

固定学习率不够用,常用“先大后小”的策略:

📈

Step / Multi

每隔若干 epoch 把 LR 乘 0.1,简单常用。

📊

Cosine

LR 随余弦曲线平滑下降到接近 0,现代训练常选。

🔥

Warmup

开头先用小 LR 预热几步,避免初期不稳定。

可视化:学习率如何影响收敛

下面用“损失随训练步数下降”的示意曲线,演示不同学习率的效果。调节滑块看曲线变化。

🎚️ 学习率收敛演示

蓝线=当前参数;灰线=参考“合适 LR + 动量”。学习率过大会在谷底附近来回震荡(发散感), 过小则下降缓慢。

实用调参建议(新手友好)

没有“万能参数”。调参是观察曲线 + 假设 + 实验的循环,本页演示是简化模型,真实曲面更复杂。