返回学习地图
trainingPhase D · 第 26

D1.3 Multi-Head Attention(多头)

为什么不是 1 个注意力而是 8/16/32 个?

3 个章节·按类别展开/折叠
知识

Multi-Head 为什么比单头好

单头注意力的局限:一个注意力头只能捕捉一种关系(比如「主谓」或「动宾」)。但语言有多种关系。

Multi-Head 思路:把 d_model=512 拆成 h=8 个头,每个头 64 维,独立学习一种关系。最后 concat 起来。

类比:足球队 11 个人,每个人负责不同位置(守门员、前锋、中场)。如果只有 1 个人,他只能踢前锋,赢不了比赛。

代码

Multi-Head 代码实现

知识

为什么有效

每个头可以学不同模式。某个头学语法,某个头学实体识别,某个头学情感。GPT-2 有 12 层 x 12 头 = 144 个独立的注意力模式。

经验:GPT-3 用了 96 层 x 96 头 = 9216 个独立模式,能学到非常复杂的语言结构。