TL;DR
Transformer 是 2017 年论文《Attention Is All You Need》提出的神经网络架构,用自注意力机制替代循环结构,实现并行计算与长程依赖建模,是现代大语言模型的基础。
核心要点
- 自注意力(Self-Attention):每个 token 生成 Query/Key/Value,通过 Q·K 相似度加权聚合其他 token 的信息;
- 多头注意力(Multi-Head):多组注意力并行,捕捉不同子空间的关系;
- 位置编码:注意力本身无序,需注入位置信息(正弦编码或可学习编码,现代模型常用 RoPE 旋转位置编码);
- 块结构:注意力 + 前馈网络 + 残差连接 + LayerNorm;
- 两种形态:Encoder-Decoder(翻译、T5)与 Decoder-only(GPT 等大模型);LLM 主流是 decoder-only 自回归。
- 为什么快:token 间计算可并行,相较 RNN 显著提升训练效率;代价是注意力为 O(n²) 计算量。
扩展知识
- 缩放定律(Scaling Laws):模型、数据、算力同步扩大,能力可预测提升;
- KV Cache:推理时缓存历史 Key/Value 以避免重复计算;
- 稀疏注意力、线性注意力等用于降低长上下文成本。
来源
- Vaswani et al., "Attention Is All You Need"(2017)
- Wikipedia: Transformer (deep learning architecture)
- 各模型技术报告(GPT、Llama、DeepSeek 等)