返回学习地图
trainingPhase D · 第 27

D2.5 Gradient Checkpointing

用时间换空间,训练时省激活值显存

2 个章节·按类别展开/折叠
知识

原理

用时间换空间:训练时不保存中间激活,反向传播时重新计算。

显存节省:激活从 O(L^2) 降到 O(L),L = 层数。

代价:训练速度慢 30%(额外一次前向计算)。

适用:训练大模型(>7B)、长序列(>4096)、显存不够时。

类比:考试时只记答案,不记所有草稿。检查时重做一遍。

代码

开启方法