论文 · 资源记录

Attention Is All You Need

提出以自注意力为核心、无需循环结构的 Transformer 架构。

作者:Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, Illia Polosukhin年份:2017出版信息:Advances in Neural Information Processing Systems 30元数据:完整链接核验于 2026-07-11

为什么重要

阅读注意力机制文章时用于核对原始模型定义和实验边界。

阅读前提

教材中的引用位置

  1. A04 · 第 1 章 感知机与多层感知器

    支持的主张:《Attention Is All You Need》在 Transformer 每层中使用位置前馈网络,为 MLP 在现代序列模型中的作用提供具体实例。该论文的核心贡献是注意力架构,不能替代感知机收敛定理或一般前馈网络理论教材。

  2. A04 · 第 2 章 激活函数与非线性表示

    支持的主张:《Attention Is All You Need》的位置前馈子层使用 ReLU,展示逐元素非线性如何嵌入注意力架构。它可支持该具体架构事实,但不构成 GELU、SiLU 或所有激活函数性能排序的证据。

  3. A04 · 第 4 章 反向传播与反向模式自动微分

    支持的主张:《Attention Is All You Need》给出由线性投影、softmax、残差与前馈层组成的 Transformer,为反向传播穿过真实复合模块提供应用背景。该论文不是自动微分原理教材,反向递推与梯度检查仍应以上述数学定义和专门教材为依据。

  4. A06 · 第 5 章 视觉 Transformer 与混合架构

    支持的主张:Stanford CS231n 2025 课程用于核对图像 patch、视觉分类、数据增强和视觉 Transformer 的评价流程;《Attention Is All You Need》用于核对多头注意力、位置表示与 Transformer 基础接口。本章的图像 token 化和二维位置处理来自视觉任务扩展,不能由原始文本翻译实验直接证明。

  5. A07 · 第 2 章 序列损失、教师强制与解码

    支持的主张:《Attention Is All You Need》原论文可用于核对因果掩码的并行自回归训练与 Transformer 序列条件化边界;本章不把其架构实验结论直接外推到所有序列任务。

  6. A07 · 第 3 章 缩放点积注意力与掩码

    支持的主张:《Attention Is All You Need》给出缩放点积、多头注意力和 Transformer 架构的原始定义,可用于核对公式、形状和模型组成。论文实验针对其数据与配置,不能直接转换成所有注意力模型的性能结论。

  7. A07 · 第 4 章 多头注意力与位置表示

    支持的主张:《Attention Is All You Need》用于核对多头投影、缩放点积注意力、正弦位置编码和原始 Transformer 的张量结构;《Deep Learning》用于核对表示学习、序列建模、参数共享和反向传播基础。本章的头数、维度和掩码公式以原论文为直接依据,不把位置编码形式写成所有 Transformer 的唯一选择。

  8. A07 · 第 5 章 编码器、解码器与 Transformer 架构

    支持的主张:《Attention Is All You Need》用于核对标准 Transformer 的多头注意力、残差、归一化、位置编码与编码器—解码器连接;《Deep Learning》用于核对序列概率、前馈网络、反向传播和优化基础。本章逐层标注张量形状与掩码轴,避免仅凭结构示意图推断实现正确。

  9. A07 · 第 6 章 长序列、效率与 Transformer 综合复习

    支持的主张:《Attention Is All You Need》用于核对编码器—解码器、多头注意力、前馈子层、掩码和原始翻译实验;《Deep Learning》用于核对序列条件建模、优化与泛化基础。本章把标准 Transformer 作为基线接口,长序列效率、缓存和外推结论均另行验证,不归入原论文保证。

官方入口