3 个章节·按类别展开/折叠
知识
Multi-Head 为什么比单头好
单头注意力的局限:一个注意力头只能捕捉一种关系(比如「主谓」或「动宾」)。但语言有多种关系。
Multi-Head 思路:把 d_model=512 拆成 h=8 个头,每个头 64 维,独立学习一种关系。最后 concat 起来。
类比:足球队 11 个人,每个人负责不同位置(守门员、前锋、中场)。如果只有 1 个人,他只能踢前锋,赢不了比赛。
代码
Multi-Head 代码实现
知识
为什么有效
每个头可以学不同模式。某个头学语法,某个头学实体识别,某个头学情感。GPT-2 有 12 层 x 12 头 = 144 个独立的注意力模式。
经验:GPT-3 用了 96 层 x 96 头 = 9216 个独立模式,能学到非常复杂的语言结构。