论文:Attention Is All You Need
会议:NeurIPS 2017
核心结论:序列建模不必依赖 RNN 或 CNN;只使用注意力机制,也能获得更好的质量、更高的并行度和更低的训练成本。
结论先行
这篇论文真正改变行业的,并不只是提出了一个新的 Attention 变体,而是完成了三次结构性替换:
- 用 Self-Attention 替换 RNN 的时间递归;
- 用 Multi-Head Attention 替换单一表示空间;
- 用高度规则的矩阵计算图,替换难以并行的序列执行图。
论文中的原始 Transformer 是面向机器翻译的 Encoder–Decoder 模型。今天的 GPT、Llama、Qwen、Claude 等主流大语言模型主要采用 Decoder-only 结构,但其核心计算单元仍然来自这篇论文:注意力、前馈网络、残差连接、归一化、位置表示和自回归掩码。
从研究影响看,它不仅是一篇 NLP 论文,而是现代生成式 AI 的基础设施论文。
论文评分
| 维度 | 评分 | 说明 |
|---|---|---|
| 原始创新性 | 10/10 | 首次构建完全不依赖循环和卷积的主流序列转换架构 |
| 工程价值 | 10/10 | 计算图天然适合 GPU/TPU 上的大规模矩阵并行 |
| 理论启发 | 9/10 | 将“依赖建模”重新表述为全局内容寻址 |
| 长期影响 | 10/10 | 直接奠定 LLM、ViT、多模态模型和生成模型的架构基础 |
| 复现难度 | 6/10 | 核心结构清晰,但训练稳定性与数据流水线仍有工程门槛 |
| 2026 年阅读价值 | 10/10 | 理解现代模型架构和推理优化的必读起点 |
1. 研究背景:RNN 的问题不只是“慢”
2017 年以前,机器翻译和语言建模主要依赖 RNN、LSTM、GRU 或卷积序列模型。
RNN 的状态转移可以简化为:
这种结构有三个根本问题。
1.1 训练过程无法充分并行
第 个位置依赖第 个隐藏状态,因此同一序列中的时间步必须顺序执行。即使单个矩阵乘法很快,整个序列仍受到串行链约束。
序列越长,训练的并行效率越差。
1.2 长距离依赖路径过长
在 RNN 中,位置 1 的信息要影响位置 ,通常需要经过 次状态传递。每一步都会引入信息压缩、梯度衰减和优化难度。
LSTM 缓解了梯度问题,却没有消除串行执行和长路径问题。
1.3 计算结构不适合现代硬件
GPU 和 TPU 擅长大规模规则矩阵运算,而不擅长跨时间步的细粒度依赖调度。RNN 的算法结构与硬件优势并不匹配。
Transformer 的突破,是把序列建模改造成大规模矩阵乘法问题。
2. 核心思想:内容寻址代替时间递归
Transformer 不再沿时间轴逐步压缩历史,而是让每个位置直接查看其他位置,并根据内容相关性聚合信息。
对于序列中某个 token,模型生成三类向量:
- Query:当前位置正在寻找什么;
- Key:每个位置可以用什么特征被匹配;
- Value:匹配成功后应提取什么信息。
直观上,它类似一个可微分数据库查询:
Query 负责提出查询
Key 负责建立索引
Value 负责承载结果
Softmax 负责将匹配分数转成权重
这使任意两个位置可以在一层内直接建立联系。
3. Transformer 总体架构
原论文采用标准 Encoder–Decoder 结构:
flowchart LR
A[输入 Token] --> B[Embedding + Positional Encoding]
B --> C[Encoder × 6]
C --> D[Encoder Memory]
E[已生成的目标 Token] --> F[Shifted Embedding + Positional Encoding]
F --> G[Masked Decoder Self-Attention]
D --> H[Encoder-Decoder Attention]
G --> H
H --> I[Decoder FFN]
I --> J[Linear + Softmax]
J --> K[下一个 Token 概率]
3.1 Encoder
每个 Encoder Layer 包含两个子层:
- Multi-Head Self-Attention
- Position-wise Feed-Forward Network
原论文使用 6 层 Encoder,每层隐藏维度 。
3.2 Decoder
每个 Decoder Layer 包含三个子层:
- Masked Multi-Head Self-Attention
- Encoder–Decoder Cross-Attention
- Position-wise Feed-Forward Network
Decoder Self-Attention 使用因果掩码,禁止当前位置看到未来 token。
3.3 Add & Norm
原始论文对子层使用:
这是典型的 Post-Norm 设计:先做残差相加,再归一化。
现代大模型更常采用 Pre-Norm 或 RMSNorm:
原因是深层网络训练通常更稳定。
4. Scaled Dot-Product Attention
论文最重要的公式是:
其计算过程可以拆分为四步。
4.1 计算相关性
表示第 个 Query 与第 个 Key 的匹配程度。
4.2 缩放
当维度 增大时,点积方差也随之增大,Softmax 容易进入饱和区域,导致梯度过小。除以 可以稳定数值范围。
假设 Query 和 Key 的每个分量独立、均值为 0、方差为 1,则点积:
其方差约为 ,因此标准差约为 。缩放因子并非经验装饰,而是直接来自方差控制。
4.3 Softmax 归一化
每一行形成对所有 Key 的概率分布。
4.4 聚合 Value
最终输出是 Value 的加权和。
flowchart LR
Q[Q] --> M[QKᵀ]
K[K] --> M
M --> S[除以 √dₖ]
S --> X[加入 Mask]
X --> P[Softmax]
P --> W[与 V 相乘]
V[V] --> W
W --> O[Attention Output]
5. Multi-Head Attention
单头注意力只能在一个投影空间中计算关系。Multi-Head Attention 将表示拆分到多个子空间:
原论文配置:
多个头可以学习不同模式,例如:
- 局部相邻关系;
- 主谓依赖;
- 指代关系;
- 长距离语义关联;
- 位置或边界模式。
需要注意的是,不应把每个头机械解释为固定语言学功能。大量后续研究表明,部分头高度专门化,也有部分头冗余或可被裁剪。
Multi-Head Attention 的本质,是增加关系建模的子空间数量,而不是简单“重复计算多次”。
6. 三种 Attention 的职责
原始 Transformer 中有三种 Attention。
| 类型 | Query 来源 | Key/Value 来源 | 作用 |
|---|---|---|---|
| Encoder Self-Attention | Encoder 当前层 | Encoder 当前层 | 对输入序列建立全局表示 |
| Decoder Masked Self-Attention | Decoder 当前层 | Decoder 当前层 | 建模已生成目标序列 |
| Cross-Attention | Decoder | Encoder 输出 | 让译文对齐并读取源语言 |
现代 Decoder-only LLM 通常只保留 Masked Self-Attention,不再使用独立 Encoder 和 Cross-Attention。
7. Causal Mask:为什么模型看不到未来
自回归生成要求:
因此第 个位置只能访问它之前的位置。
常见掩码矩阵为:
最终计算:
由于未来位置加上 ,经过 Softmax 后权重变为 0。
这一机制至今仍是 GPT 类模型自回归生成的基础。
8. Position-wise Feed-Forward Network
每个位置独立经过相同的两层 MLP:
原论文配置:
- 输入输出维度:512
- 中间维度:2048
- 激活函数:ReLU
Attention 负责 token 之间的信息混合,FFN 负责每个 token 内部的特征变换。
可以把两者理解为:
Attention:跨位置通信
FFN:逐位置计算
现代 LLM 常将 ReLU 替换为 GELU、SwiGLU 或 GeGLU。以 SwiGLU 为例:
它通常能以更高参数效率获得更好效果。
9. Positional Encoding
Self-Attention 本身对输入排列具有置换等变性。若不加入位置信息,模型无法区分:
猫追狗
狗追猫
原论文使用固定正弦位置编码:
不同维度使用不同频率,使位置形成多尺度表示。
作者选择正弦编码的一个动机,是固定偏移 的位置向量可以通过线性关系从当前位置表示中推导,从而有利于学习相对位置。
9.1 现代演进
今天主流 LLM 已很少直接使用原始正弦绝对位置编码。
| 方法 | 核心思路 | 典型用途 |
|---|---|---|
| Learned Absolute Position | 直接学习每个位置向量 | 早期 BERT、GPT |
| Relative Position Bias | 在 Attention 分数中加入相对距离偏置 | T5 |
| RoPE | 对 Q/K 施加旋转,将相对位置信息编码进点积 | Llama、Qwen 等 |
| ALiBi | 根据距离加入线性偏置 | 长上下文模型 |
| RoPE Scaling | 扩展 RoPE 可用上下文 | 长上下文 LLM |
RoPE 能自然融合进 Attention 点积,因此成为现代 Decoder-only 模型的主流选择。
10. 为什么 Self-Attention 有效
原论文从三个维度比较 Self-Attention、RNN 和 CNN:
- 每层计算复杂度;
- 最少顺序操作数;
- 任意位置之间的最大路径长度。
| 层类型 | 每层复杂度 | 顺序操作数 | 最大路径长度 |
|---|---|---|---|
| Self-Attention | |||
| Recurrent | |||
| Convolution | |||
| Restricted Attention |
10.1 最大路径长度是关键指标
Self-Attention 中任意两个 token 在一层内即可直接交互,最大路径长度为 。
这降低了学习长距离依赖的优化难度。
10.2 二次复杂度也是主要缺陷
Attention 分数矩阵大小为 ,因此时间和显存复杂度随上下文长度二次增长。
这在短序列翻译任务中不是严重问题,却成为长上下文 LLM 的核心瓶颈。
后续工作大致沿四条路线优化:
- 精确 Attention 的 IO 优化:FlashAttention;
- 局部或稀疏 Attention:Sliding Window、Block Sparse;
- 状态压缩:Linear Attention、RetNet;
- 替代序列架构:Mamba、SSM 和混合模型。
11. 训练策略
11.1 优化器
论文使用 Adam:
11.2 Warmup 学习率
学习率公式为:
其中 warmup steps 为 4000。
训练早期学习率线性升高,之后按步数平方根倒数衰减。
Warmup 后来成为训练大型 Transformer 的标准组件。它解决的不是“学习率不够大”,而是训练初期参数、梯度统计和归一化状态尚不稳定的问题。
11.3 Dropout
Base 模型 dropout 为 0.1,用于:
- 子层输出;
- Embedding 与位置编码之和;
- Attention 权重等位置。
11.4 Label Smoothing
论文使用 的 Label Smoothing。
它会让模型不再把目标 token 概率推到绝对 1,从而改善泛化和 BLEU,但可能使困惑度指标看起来变差。
12. 实验结果
论文主要评估 WMT 2014 机器翻译任务。
| 模型 | EN-DE BLEU | EN-FR BLEU |
|---|---|---|
| Transformer Base | 27.3 | 38.1 |
| Transformer Big | 28.4 | 41.8 |
主要结论:
- 英德翻译达到 28.4 BLEU;
- 英法翻译达到 41.8 BLEU;
- Big 模型在 8 张 P100 GPU 上训练约 3.5 天;
- Base 模型以显著更低训练成本超过此前多个模型和集成系统。
论文还将 Transformer 应用于英文成分句法分析,说明它并非只对翻译任务有效。
真正重要的不是单一 BLEU 数字,而是质量、训练成本和并行效率同时改善。
13. Ablation:哪些设计真正重要
论文对注意力头数、Key 维度、模型大小、Dropout 和位置编码等进行了对照。
可提炼出几条结论:
- 单头通常劣于多头,说明多个表示子空间有效;
- 头数并非越多越好,单头维度过小也会损害性能;
- 更大的模型通常带来更好结果;
- Dropout 对泛化很重要;
- 学习式位置编码与正弦位置编码结果接近;
- 缩放点积比未缩放点积更稳定。
这些结论在后续模型中并非全部保持不变。例如,现代大模型会通过 GQA 或 MQA 减少 KV 头数,以降低推理成本。
14. 这篇论文为什么改变了 AI
14.1 它解除序列计算的串行约束
Transformer 让训练中的 token 维度可以并行处理,极大提升硬件利用率。
没有这一点,很难形成后来“扩大数据、参数和算力即可持续提升”的规模化训练范式。
14.2 它提供了统一架构
相同的基本模块可以处理:
- 文本;
- 图像 patch;
- 音频帧;
- 视频 token;
- 蛋白质序列;
- 多模态 token;
- Agent 轨迹与工具调用记录。
Transformer 的输入并不要求是自然语言,只要求能被离散或连续地表示为 token 序列。
14.3 它使 Scaling Law 成为工程现实
RNN 理论上也能扩大,但训练效率、梯度传播和硬件利用率限制了规模。
Transformer 的规则矩阵计算图与分布式训练天然适配,最终催生了大模型时代。
15. 从原始 Transformer 到现代 LLM
timeline
title Transformer 架构演进
2017 : Transformer
: Encoder–Decoder
2018 : GPT
: Decoder-only 预训练
: BERT Encoder-only
2019 : T5
: Text-to-Text
2020 : Vision Transformer
: 图像 Patch Token
2021 : Switch Transformer
: 大规模 MoE
2022 : PaLM / Chinchilla
: Scaling 与计算最优训练
2023 : Llama
: RoPE / RMSNorm / SwiGLU
: FlashAttention 普及
2024 : GQA / 长上下文
: 多模态统一模型
2025 : MLA / Hybrid Attention
: 推理成本优化
2026 : Attention + SSM 混合
: Agentic 与多模态长上下文
15.1 GPT:只保留 Decoder
GPT 将 Transformer Decoder 中最适合生成的部分抽取出来:
- Causal Self-Attention;
- 自回归 next-token prediction;
- 大规模无监督预训练。
严格来说,GPT 的 block 通常不再包含原论文的 Encoder–Decoder Cross-Attention。
15.2 BERT:只保留 Encoder
BERT 使用双向 Self-Attention,并通过 Masked Language Modeling 预训练,更适合理解和表示学习。
15.3 T5:回归 Encoder–Decoder
T5 将所有 NLP 任务统一成 Text-to-Text 形式,继续使用 Encoder–Decoder,但引入相对位置偏置和大规模预训练。
15.4 ViT:图像也是序列
Vision Transformer 将图像切分成 patch,并将每个 patch 视作 token。它证明 Transformer 是通用表示架构,而非仅限 NLP。
16. 原始设计与现代 LLM 的差异
| 组件 | 2017 Transformer | 现代主流 LLM |
|---|---|---|
| 架构 | Encoder–Decoder | 多数为 Decoder-only |
| Norm | LayerNorm、Post-Norm | RMSNorm、Pre-Norm |
| 激活 | ReLU | SwiGLU / GELU |
| 位置编码 | Sin/Cos Absolute PE | RoPE 为主 |
| Attention | MHA | MHA / GQA / MQA / MLA |
| 上下文 | 数百 token | 数万到百万 token |
| 推理 | 翻译 Beam Search | 自回归采样 + KV Cache |
| 训练目标 | 有监督翻译 | 海量 next-token 预训练 |
| 稀疏化 | 无 | MoE、稀疏 Attention |
| 内核优化 | 常规矩阵计算 | FlashAttention、融合算子 |
因此,现代 LLM 不是“原论文模型的简单放大”,而是保留基本拓扑后,对训练稳定性、位置表示和推理效率进行了系统重构。
17. 推理阶段最关键的新问题:KV Cache
训练时,一个序列中的所有位置可以并行计算;生成时,token 必须逐个产生。
若每生成一个 token 都重新计算全部历史 Key 和 Value,成本会非常高。因此推理系统保存历史 KV:
历史 token → 已计算 K/V → KV Cache
新 token → 只计算新的 Q/K/V
新 Q 与全部缓存 K 做 Attention
对于每层,KV Cache 大致占用:
其中:
- :层数;
- :上下文长度;
- :KV 头数;
- :每头维度;
- :每个数值占用字节;
- 系数 2:Key 和 Value。
这解释了为什么现代推理架构引入:
- MQA:所有 Query 头共享一组 KV;
- GQA:多个 Query 头共享一组 KV;
- MLA:压缩 KV 表示;
- KV Cache Quantization;
- Paged Attention;
- Prefix Cache。
Attention 最初解决训练并行问题,后来又产生了推理内存问题。
18. FlashAttention 的真实价值
标准 Attention 往往需要将完整 分数矩阵写入显存,再读取回来进行 Softmax 和与 相乘。
FlashAttention 并不改变数学结果,而是通过分块和在线 Softmax 减少 HBM 读写:
- 避免完整中间 Attention 矩阵落入显存;
- 提高 SRAM / shared memory 复用;
- 将多个步骤融合成更高效内核;
- 降低显存占用并提高吞吐。
它说明现代模型性能优化不能只看 FLOPs,还必须看内存带宽和数据搬运。
对于 LocalEngine、llama.cpp、MLX 或移动端推理,这一点尤其重要。
19. 论文的局限
19.1 二次复杂度
全局 Self-Attention 对序列长度的复杂度为 。长上下文下,Attention 分数计算和 KV Cache 都会快速增长。
19.2 原始位置编码外推有限
论文认为正弦位置编码可能外推到更长序列,但“可计算”不等于“模型能可靠理解”。长上下文能力仍需要训练分布、位置缩放和注意力模式共同支持。
19.3 Post-Norm 不利于超深网络
原始 Add & Norm 在深层模型中更容易出现训练不稳定。现代架构广泛使用 Pre-Norm。
19.4 原始模型针对翻译优化
论文尚未证明:
- 大规模无监督预训练;
- In-context Learning;
- Chain-of-Thought;
- Tool Calling;
- 多模态统一;
- 超长上下文;
- Agent 工作流。
这些能力来自后续训练目标、数据规模、对齐技术和系统工程,而不是 Transformer 结构自动保证的。
19.5 Attention 权重不等于完整解释
Attention 可视化有一定分析价值,但不能把某个权重直接等同于模型的因果解释。信息还经过多层残差、FFN 和多个头传播。
20. 如果今天重新设计 Transformer
以 2026 年工程实践重新设计一个通用 Decoder-only 模型,常见选择会是:
architecture: decoder-only
normalization: RMSNorm
norm_placement: pre-norm
position_encoding: RoPE
attention: GQA
attention_kernel: FlashAttention
activation: SwiGLU
ffn: gated-mlp
cache: paged-kv-cache
context:
training: long-context curriculum
inference: rope-scaling + sliding-window optional
precision:
training: bf16
inference: int8/int4 weights + optional kv quantization
optional:
- mixture-of-experts
- local-global hybrid attention
- state-space layers
但这些改造仍保留了原论文的核心循环:
Norm
→ Attention
→ Residual
→ Norm
→ FFN
→ Residual
这正是论文生命力的体现。
21. 对 LocalEngine 的直接启发
21.1 将 Prefill 与 Decode 分开优化
Transformer 推理有两个性质不同的阶段:
| 阶段 | 特点 | 优化重点 |
|---|---|---|
| Prefill | 一次处理整段 Prompt | 矩阵吞吐、FlashAttention、批处理 |
| Decode | 每次生成一个 token | 内存带宽、KV Cache、低延迟 |
LocalEngine 的性能指标应至少拆分为:
- Prompt processing tokens/s;
- Generation tokens/s;
- Time to First Token;
- Peak memory;
- KV Cache bytes/token。
只报告一个 tokens/s 容易掩盖瓶颈。
21.2 模型元数据应描述架构能力
模型 manifest 可增加:
{
"architecture": "decoder-only",
"attentionType": "gqa",
"queryHeads": 32,
"kvHeads": 8,
"headDimension": 128,
"contextLength": 32768,
"positionEncoding": "rope",
"ropeScaling": {
"type": "yarn",
"factor": 4
},
"slidingWindow": null,
"kvCacheDType": ["f16", "q8_0"],
"supportsFlashAttention": true
}
这些字段直接影响:
- 是否能启用特定内核;
- KV Cache 预估;
- 最大上下文;
- 设备内存检查;
- 性能参数推荐。
21.3 重点优化内存流而不只是算力
Apple Silicon 使用统一内存,减少 CPU/GPU 拷贝,但总带宽仍是 Decode 阶段的重要瓶颈。
应重点考虑:
- 权重量化;
- KV Cache 量化;
- GQA 模型优先;
- Metal/MLX 融合内核;
- 避免重复分配;
- Prompt Cache;
- mmap 与按需加载;
- 按设备动态选择 context 上限。
21.4 移动端默认模型应优先考虑 GQA
在 iPhone 上,较长上下文的 KV Cache 可能比模型权重更快挤占可用内存。默认模型选型不仅要看参数量和量化大小,还要看 KV 头数。
相同参数规模下,GQA/MQA 模型通常更适合端侧长对话。
22. 对 ProviderKit 与 AgentKit 的启发
Transformer 将模型输入统一为 token 流,这对上层 Agent 架构有两个意义。
22.1 ProviderKit 不应假设所有模型能力相同
模型差异可能包括:
- 最大上下文;
- 是否支持工具调用;
- 是否支持结构化输出;
- 是否支持多模态 token;
- 是否支持 Prefix Cache;
- 是否支持 Reasoning Token;
- 是否支持并行 Tool Calls。
ProviderKit 应暴露 capability,而不是只提供统一 chat() 接口。
22.2 AgentKit 需要管理上下文预算
Self-Attention 的上下文成本意味着 Agent 不能无限追加历史。
需要提供:
- Context Compaction;
- Memory Retrieval;
- Tool Result Truncation;
- Summary Checkpoint;
- Prefix Cache Reuse;
- Token Budget Policy;
- 对话、系统指令和工具 Schema 的优先级管理。
Transformer 让模型拥有全局读取能力,但 Agent Runtime 必须决定“哪些信息值得放进全局上下文”。
23. 对 Privy 产品线的启发
PrivyPDF
长文档问答不能只依赖扩大上下文。更稳定的方案是:
文档解析
→ 结构化切分
→ Embedding/Retrieval
→ 相关片段重排
→ 有预算地注入上下文
→ 生成与引用校验
Attention 能在注入片段之间建立全局关系,但检索层仍负责控制二次复杂度和噪声。
PrivyTranslate
翻译是原论文的起点。端侧翻译优化应关注:
- Encoder–Decoder 模型与 Decoder-only 模型的吞吐差异;
- 目标语言约束;
- Beam Search 与 Greedy Decode;
- KV Cache 是否能复用;
- 短句批处理;
- 术语表和 Translation Memory 的上下文组织。
PrivyFeed
Feed 摘要适合使用分层摘要:
单篇局部摘要
→ 多篇主题聚合
→ 跨文章全局总结
避免一次把大量全文全部塞入上下文。
PrivyAgent
Agent 的 Tool Calling 本质上仍是 token 生成。可靠性主要取决于:
- 工具 Schema 是否清晰;
- 输出是否受语法约束;
- 上下文是否包含正确状态;
- 执行结果是否验证;
- 失败后是否重新规划。
Transformer 提供通用推理接口,但不能替代 Agent Runtime 的确定性控制。
24. 常见误解
误解一:论文发明了 Attention
Attention 在此之前已经存在。论文的关键贡献是构建完全以 Attention 为核心、去除序列对齐 RNN/CNN 的完整架构。
误解二:Transformer 完全并行
训练时同一序列的 token 可以并行计算;自回归推理仍必须逐 token 生成。
误解三:Self-Attention 天生理解顺序
它本身不包含顺序,需要位置编码或位置偏置。
误解四:Attention 就是模型解释
Attention 权重只反映某层某头中的一类信息路由,不等于模型全部推理依据。
误解五:长上下文只需扩大位置编码
真正的长上下文能力还取决于训练数据、Attention 模式、KV 内存、位置外推和信息检索能力。
25. 推荐阅读顺序
时间有限时,建议按以下顺序:
- Abstract 与 Introduction;
- Figure 1:整体架构;
- 3.2 Scaled Dot-Product Attention;
- 3.2.2 Multi-Head Attention;
- 3.5 Positional Encoding;
- Section 4:Why Self-Attention;
- Section 5:Training;
- Table 2:翻译结果;
- Appendix 中的 Attention 可视化。
最值得精读的不是结果表,而是 Section 4。它清晰解释了作者为什么认为 Self-Attention 在复杂度、并行度和依赖路径上优于 RNN/CNN。
26. 最终评价
《Attention Is All You Need》的伟大之处,在于它把序列建模从“沿时间递归地更新状态”,改写成“通过内容寻址直接交换信息”。
这一变化带来了:
- 更短的依赖路径;
- 更强的训练并行性;
- 更规则的硬件计算图;
- 更容易扩展的模型结构;
- 跨文本、视觉、语音和多模态的统一表示方式。
它并没有解决现代大模型的全部问题。长上下文成本、KV Cache、训练稳定性、位置外推、推理延迟和事实可靠性,都是后续工作继续解决的。
但现代模型的大多数架构创新,依然是在回答同一个问题:
如何在保留 Transformer 全局信息路由能力的同时,降低它的计算、内存和训练成本?
从这个意义上说,Transformer 不是已经结束的历史,而仍是当前 AI 系统设计的主坐标系。
参考资料
- Vaswani, A. et al. Attention Is All You Need. NeurIPS 2017. arXiv:1706.03762.
- Bahdanau, D. et al. Neural Machine Translation by Jointly Learning to Align and Translate. 2014.
- Devlin, J. et al. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. 2018.
- Radford, A. et al. Improving Language Understanding by Generative Pre-Training. 2018.
- Dosovitskiy, A. et al. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. 2020.
- Dao, T. et al. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness. 2022.
- Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. 2021.
- Shazeer, N. Fast Transformer Decoding: One Write-Head is All You Need. 2019.
- Ainslie, J. et al. GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints. 2023.

Loading discussion…