2 个章节·按类别展开/折叠
代码
PyTorch 2.x AMP 用法
知识
AMP 原理
参数和激活用 FP16(半精度,2 字节),Loss 计算用 FP32(避免下溢),Optimizer 状态保持 FP32。
效果:
- 显存节省 ~50%
- 训练速度提升 1.5-3x
bfloat16 比 float16 好:同样的 2 字节,8 位指数(fp16 是 5 位),数值范围大,不容易 overflow。现代 GPU(A100/H100)原生支持 bfloat16。
参数和激活用 FP16(半精度,2 字节),Loss 计算用 FP32(避免下溢),Optimizer 状态保持 FP32。
效果:
bfloat16 比 float16 好:同样的 2 字节,8 位指数(fp16 是 5 位),数值范围大,不容易 overflow。现代 GPU(A100/H100)原生支持 bfloat16。