2 个章节·按类别展开/折叠
知识
原理
用时间换空间:训练时不保存中间激活,反向传播时重新计算。
显存节省:激活从 O(L^2) 降到 O(L),L = 层数。
代价:训练速度慢 30%(额外一次前向计算)。
适用:训练大模型(>7B)、长序列(>4096)、显存不够时。
类比:考试时只记答案,不记所有草稿。检查时重做一遍。
代码
用时间换空间:训练时不保存中间激活,反向传播时重新计算。
显存节省:激活从 O(L^2) 降到 O(L),L = 层数。
代价:训练速度慢 30%(额外一次前向计算)。
适用:训练大模型(>7B)、长序列(>4096)、显存不够时。
类比:考试时只记答案,不记所有草稿。检查时重做一遍。