模型架构Transformer、注意力与混合专家等模型结构

KV 缓存

推理时缓存已算好的键值向量,避免重复计算的优化手段。

生成每个新 Token 时,模型需注意力到之前所有 Token;KV 缓存把历史键值存下来,使增量解码大幅提速。缓存占用随上下文长度线性增长,是长上下文推理成本的重要部分。

相关术语