返回学习地图
trainingPhase D · 第 27

D2.4 混合精度训练(AMP)

省 50% 显存,提速 1.5-3 倍

2 个章节·按类别展开/折叠
代码

PyTorch 2.x AMP 用法

知识

AMP 原理

参数和激活用 FP16(半精度,2 字节),Loss 计算用 FP32(避免下溢),Optimizer 状态保持 FP32。

效果:

  • 显存节省 ~50%
  • 训练速度提升 1.5-3x

bfloat16 比 float16 好:同样的 2 字节,8 位指数(fp16 是 5 位),数值范围大,不容易 overflow。现代 GPU(A100/H100)原生支持 bfloat16。