正则化
一系列通过约束模型复杂度来防止过拟合、提高泛化能力的技术。权重衰减和 Dropout 是最常见的方法。
正则化 (Regularization) 涵盖了通过约束学习过程来防止过拟合的各种技术。方法包括在损失函数中添加惩罚项、随机网络扰动以及数据操作。当模型容量远超训练数据所需时,正则化尤为关键。
- L2 正则化(权重衰减,Weight Decay):在损失函数中添加权重平方和的惩罚项 λΣw²,促使权重趋向较小值,引导模型学习更平滑的函数。等效于对权重施加高斯先验。图像分类中 λ 的典型取值为 0.0001-0.001
- L1 正则化:添加权重绝对值之和的惩罚项 λΣ|w|,促使部分权重精确变为 0,实现特征选择和模型稀疏化
- Dropout:训练时以概率 p(通常为 0.5)随机将神经元输出置零,迫使网络学习冗余表示,可视为集成学习的一种近似,能防止对特定通路的过度依赖。推理时使用全部神经元但按 (1-p) 缩放
- 批归一化:对各层输入进行归一化以缓解内部协变量偏移。它本身也带有正则化效果,因此有时不与 Dropout 同时使用
- 数据增强:通过对训练数据施加随机变换(翻转、裁剪、色彩抖动等)隐式正则化模型
- 早停:监控验证集损失,在其开始上升时停止训练,防止对训练集过度拟合
在图像识别领域,现代架构通常组合使用多种正则化技术。例如 ResNet 的训练同时采用 L2 正则化(权重衰减 = 0.0001)和数据增强,EfficientNet 在此基础上再加入 Dropout 和 Stochastic Depth。选择合适的正则化强度需要通过验证集性能来调优。
近年来越来越多的研究把数据增强本身定位为强有力的正则化手段。Mixup(对两张图像做线性插值)、CutMix(用另一张图像替换局部区域)和 RandAugment(自动搜索变换组合)都展现出显著的正则化效果。