模型架构Transformer、注意力与混合专家等模型结构

自注意力

序列内部元素两两计算相关性的注意力机制。

自注意力让每个位置都能直接「看到」序列中其他位置,从而理解词与词、句与句之间的关系,是理解上下文的关键。其计算量随序列长度平方增长,是长上下文优化的主要瓶颈。

相关术语