书籍 · 资源记录

Deep Learning

系统介绍深度网络的数学基础、优化与建模方法。

作者:Ian Goodfellow, Yoshua Bengio, Aaron Courville年份:2016出版信息:MIT Press元数据:完整链接核验于 2026-07-11

为什么重要

适合作为反向传播和优化章节的完整参考。

阅读前提

教材中的引用位置

  1. A00 · 第 1 章 监督学习任务、样本与标签

    支持的主张:《Deep Learning》官方在线教材第五章集中讨论机器学习基础、估计与泛化,可用于继续梳理总体风险和经验风险。

  2. A00 · 第 2 章 训练、验证、测试与数据泄漏

    支持的主张:《Deep Learning》关于经验风险、泛化误差和数据生成分布的区分,支撑本章的切分原则:测试数据必须代表尚未用于选择参数或表示的样本,验证集只能服务模型选择,预处理统计量也属于训练所得参数。由此可以严格说明,泄漏会让评估条件偏离未来部署条件,而不仅是让分数“略显乐观”。

  3. A00 · 第 3 章 损失函数、风险与评估

    支持的主张:《Deep Learning》官方在线教材第五至第八章讨论最大似然、输出分布、正则化和优化目标。

  4. A00 · 第 4 章 分类、回归指标与基线

    支持的主张:《Deep Learning》对训练误差、测试误差、容量与泛化的定义,支撑本章为何必须先建立朴素基线并在未见数据上计算指标。分类阈值、类别不平衡和损失函数改变时,准确率与优化目标可能指向不同决策;因此模型比较必须固定数据切分和指标口径,而不能只报告单个最高分。

  5. A00 · 第 5 章 分布偏移、置信区间与不确定性

    支持的主张:Stanford CS229 材料用于核对训练/测试误差、偏差—方差、概率预测和模型选择;《Deep Learning》用于核对数据分布、泛化、正则化及不确定预测的更广框架。本章据此区分抽样误差、模型不确定性和分布偏移,且不把源分布上的验证分数外推为目标分布保证。

  6. A00 · 第 6 章 机器学习问题与评估综合复习

    支持的主张:Stanford CS229 材料用于核对监督、无监督学习的任务形式、损失、基线及训练—验证—测试流程;《Deep Learning》用于核对表示学习、优化与生成建模的扩展框架。本章借此检查“数据、目标、评价和部署分布”是否共同定义清楚,而不按算法名称替问题分类。

  7. A01 · 第 1 章 线性回归、最小二乘与正规方程

    支持的主张:《Deep Learning》官方在线教材第五章讨论线性回归、最大似然与机器学习估计的基础联系。

  8. A01 · 第 2 章 Logistic 回归与概率分类

    支持的主张:《Deep Learning》官方在线教材第五章介绍最大似然、逻辑回归和监督学习估计,第六章连接神经网络输出层。

  9. A01 · 第 3 章 过拟合、泛化与模型选择

    支持的主张:《Deep Learning》官方在线教材第五章讨论容量、过拟合、欠拟合与估计,第七章讨论正则化。

  10. A01 · 第 4 章 正则化、偏差与方差

    支持的主张:《Deep Learning》官方在线教材第七章系统讨论参数范数惩罚、数据增强、早停与其他正则化方法。

  11. A01 · 第 5 章 经验风险、容量与一致收敛

    支持的主张:Stanford CS229 材料用于核对经验风险最小化、偏差—方差、模型容量和训练/验证划分的课程级推导;《Deep Learning》用于核对容量、正则化、泛化误差与优化误差的区分。本章据此说明训练损失很低只是经验拟合事实,不能单独推出总体风险很低。

  12. A01 · 第 6 章 线性模型与统计学习综合复习

    支持的主张:Stanford CS229 材料用于核对线性回归、logistic 回归、最大似然、正则化与支持向量机之间的公式关系;《Deep Learning》用于核对损失、梯度优化和容量控制的统一框架。本章的线性模型推导以前者为直接来源,后者用于比较这些结构如何进入更深模型而不改变统计假设。

  13. A02 · 第 1 章 特征映射、正定核与再生核空间

    支持的主张:《Deep Learning》的核方法与特征表示内容支撑本章的核心等价关系:正定核可以充当某个特征空间中的内积,使线性算法在不显式构造高维坐标时表达非线性决策边界。它同时说明核技巧只替换内积计算,样本规模、正则化选择和核参数仍决定泛化与求解成本。

  14. A02 · 第 2 章 最大间隔与支持向量机

    支持的主张:《Deep Learning》的线性分类与核机器内容支撑本章对间隔的解释:硬间隔问题在可分条件下最大化几何间隔,软间隔通过松弛变量和惩罚系数权衡违例与范数,核函数则把同一对偶形式迁移到隐式特征空间。该来源也说明 SVM 得分本身不是校准概率,若需要概率输出必须另设校准步骤。

  15. A02 · 第 3 章 决策树、划分准则与剪枝

    支持的主张:Stanford CS229 材料用于核对树模型的递归划分、纯度/误差准则、剪枝和集成学习的基本评价口径;《Deep Learning》用于核对经验风险、过拟合、正则化与验证集选择这些跨模型原则。本章的树结构算法以课程材料为直接依据,深度学习教材只支持泛化与模型选择边界,不被当作树算法原始来源。

  16. A02 · 第 4 章 随机森林与袋装集成

    支持的主张:Stanford CS229 材料用于核对 bootstrap 抽样、随机特征子集和树集成的偏差—方差作用;《Deep Learning》用于核对集成、正则化和独立验证的通用原则。本章关于随机森林构造的直接依据来自课程材料,深度学习教材仅支持为什么平均多个不完全相关模型可降低方差的比较框架。

  17. A02 · 第 5 章 AdaBoost、梯度提升与残差拟合

    支持的主张:《Deep Learning》关于损失函数、经验风险和梯度优化的统一表述,支撑本章把提升过程解释为函数空间中的逐步优化:每轮弱学习器拟合当前损失的一阶方向,而学习率控制新增函数的步长。这个框架也限定了“沿负梯度改进”的含义——它是对训练目标的局部更新,并不自动保证测试误差或概率校准同步改善。

  18. A02 · 第 6 章 核方法、树模型与集成学习综合复习

    支持的主张:《Deep Learning》的容量、正则化与泛化章节为本章跨模型比较提供共同尺度:无论使用核展开、树划分还是加法集成,都要区分训练拟合能力、有效复杂度和独立样本上的期望风险。因而本章不按模型名称预设优劣,而以数据规模、归纳偏置、验证误差和推理资源共同完成选择。

  19. A03 · 第 1 章 聚类目标、K 均值与密度方法

    支持的主张:《Deep Learning》在本章用于支撑无监督表示学习的边界:聚类结果取决于样本表示、距离和潜在生成假设,同一批对象换一种尺度或特征空间即可产生不同分组。这个观点解释了为何轮廓系数等内部指标只能检验既定几何下的紧致与分离,不能单独证明簇对应真实类别。

  20. A03 · 第 2 章 主成分分析与流形降维

    支持的主张:《Deep Learning》关于 PCA 与表示学习的论述支撑本章的线性降维推导:正交主方向最大化投影方差,等价地最小化给定维数下的平方重构误差。其流形观点还说明,局部低维结构不意味着全局可由一个线性子空间展开,因此邻域嵌入的距离保真结论不能外推到任意远点。

  21. A03 · 第 3 章 贝叶斯网络与 Markov 随机场

    支持的主张:Stanford CS229 材料用于核对 Bayesian network、Markov random field、条件独立与因子分解的基本形式;《Deep Learning》的结构化概率模型章节用于核对配分函数、潜变量和图模型推断与学习的统一记号。两者支持本章有向与无向分解的比较,但不把图的画法本身当作因果方向证据。

  22. A03 · 第 4 章 变量消元、消息传递与精确推断

    支持的主张:Stanford CS229 材料用于核对图模型中的条件独立、变量消元和消息传递计算;《Deep Learning》的结构化概率模型内容用于核对因子、配分函数、边缘化及潜变量表示。本章的复杂度分析以消元顺序和中间因子宽度为对象,不把“精确”误解为浮点实现没有舍入误差。

  23. A03 · 第 5 章 EM 算法与变分推断

    支持的主张:《Deep Learning》在本章用于支撑潜变量模型中的近似推断框架:对数证据可分解为证据下界与后验近似误差,EM 的 E、M 两步分别更新隐变量分布和模型参数,均值场假设则把联合近似限制为可计算因子。该来源也明确了 ELBO 上升不等于真实后验已被准确恢复。

  24. A03 · 第 6 章 无监督学习与概率图模型综合复习

    支持的主张:《Deep Learning》关于表示学习、结构化概率模型和近似推断的章节,支撑本章将聚类、降维与潜变量图模型放在同一生成假设下比较。图中的条件独立性决定可分解结构,推断算法只在该模型内计算后验或近似后验;因此可视化分组和潜变量轴都不能脱离可识别性与外部验证被解释为真实因果因素。

  25. A04 · 第 1 章 感知机与多层感知器

    支持的主张:《Deep Learning》系统讨论前馈网络、表示能力、损失、反向传播和正则化,可用于继续推导多层网络训练。阅读通用逼近内容时,应保留定理的激活函数、定义域和误差度量条件。

  26. A04 · 第 2 章 激活函数与非线性表示

    支持的主张:《Deep Learning》从前馈网络、反向传播和优化角度讨论 sigmoid、tanh、ReLU 等激活,可用于继续分析饱和、梯度传播与输出单元。具体实现仍应核对所用框架的零点导数和稳定损失接口。

  27. A04 · 第 3 章 计算图、链式法则与局部导数

    支持的主张:《Deep Learning》用于核对计算图、链式法则、反向模式和参数共享下的梯度累积;Stanford CS229 材料用于核对线性/逻辑模型中的向量化梯度与数值梯度检查。本章的节点级反传来自前者的通用框架,后者提供可手算的小模型交叉核验。

  28. A04 · 第 4 章 反向传播与反向模式自动微分

    支持的主张:《Deep Learning》系统讲解计算图、反向传播、自动微分和深度网络训练,可用于继续推导向量—Jacobian 乘积、共享参数与梯度流。

  29. A04 · 第 5 章 参数初始化与梯度传播

    支持的主张:《Deep Learning》用于核对权重初始化、前向方差、梯度消失/爆炸和深层计算图中的传播机制;Stanford CS229 材料用于核对随机优化、特征尺度与验证曲线的基础诊断。本章的方差递推是模型假设下的近似分析,实际初始化仍以激活统计和梯度范数实测复核。

  30. A04 · 第 6 章 神经网络与反向传播综合复习

    支持的主张:《Deep Learning》用于核对多层网络、计算图、反向传播、初始化与正则化的完整推导;Stanford CS229 材料用于核对梯度下降、线性/逻辑模型和数值梯度检查。复习中的链式法则以前者为主,后者提供可手算基线和训练—验证协议的独立检查。

  31. A05 · 第 1 章 随机梯度、动量与自适应方法

    支持的主张:《Deep Learning》作者在线教材可用于核对随机优化、动量和逐坐标自适应方法的基本动机。具体 Adam、RMSProp 与权重衰减公式仍应以所用实现的参数化和更新顺序为准。

  32. A05 · 第 2 章 学习率调度与二阶近似

    支持的主张:《Deep Learning》作者在线教材可用于核对学习率策略、曲率、Newton 与二阶近似的基本动机。拟 Newton、自然梯度和大规模曲率实现的具体保证仍取决于所用近似、阻尼和求解容差。

  33. A05 · 第 3 章 归一化方法与尺度控制

    支持的主张:《Deep Learning》用于核对特征尺度、内部激活分布、参数化和梯度优化的基础关系;Stanford CS229 材料用于核对输入标准化、训练/测试统计隔离和线性模型中的尺度效应。本章据此强调训练态与推理态统计必须分开,归一化带来的优化改善也不等同于概率校准。

  34. A05 · 第 4 章 正则化、数据增强与早停

    支持的主张:《Deep Learning》用于核对权重惩罚、dropout、早停和数据增强作为容量控制手段的机制;Stanford CS229 材料用于核对 L1/L2 正则、训练—验证选择和偏差—方差分析。本章据此区分目标函数中的显式惩罚与改变训练分布的增强操作,二者的超参数都只在验证数据上选择。

  35. A05 · 第 5 章 混合精度、分布式训练与检查点

    支持的主张:《Deep Learning》用于核对深度网络数值计算、优化和训练工程的基础口径。具体低精度算子、通信库和硬件能力会变化,本文不承诺固定加速倍数;任何收益都应连同数值误差、收敛质量和恢复能力实测。

  36. A05 · 第 6 章 调试、复现实验与工程方法综合复习

    支持的主张:《Deep Learning》用于核对深度网络优化、正则化和数值计算的基础口径。工程结论还依赖具体软件、数据和硬件,因而必须由版本化运行、分层监控、恢复演练和独立评估共同支撑。

  37. A06 · 第 1 章 离散卷积、感受野与参数共享

    支持的主张:《Deep Learning》在本章用于支撑离散卷积算子的三个核心性质:稀疏交互限制每个输出的局部依赖,参数共享让同一核作用于不同位置,等变性则说明输入平移如何传递到特征图。该来源也帮助区分数学卷积与框架常用互相关,防止在核翻转、填充和输出尺寸推导中混用约定。

  38. A06 · 第 2 章 卷积网络架构与残差连接

    支持的主张:《Deep Learning》的卷积网络章节支撑本章对局部连接、参数共享和层级表示的说明:卷积核在空间位置复用参数,堆叠卷积逐步扩大感受野,池化或步幅操作以降低分辨率换取一定平移稳定性。残差路径则需结合具体块结构分析,不能把“网络更深”本身当作精度必然提高的保证。

  39. A06 · 第 3 章 目标检测与多尺度特征

    支持的主张:Stanford CS231n 2025 课程用于核对目标检测中的框、类别、IoU、匹配、非极大值抑制以及两阶段/单阶段评价流程;《Deep Learning》用于核对卷积特征、损失优化和正则化基础。本章的检测指标必须与数据集匹配规则一起解释,不能由通用分类损失单独推出。

  40. A06 · 第 4 章 语义分割、实例分割与密集预测

    支持的主张:Stanford CS231n 2025 课程用于核对语义/实例分割的像素标签、密集预测结构、IoU 与类别不平衡评价;《Deep Learning》用于核对卷积特征、反向传播和正则化基础。本章要求同时报告类别级与聚合指标,避免大背景区域掩盖小目标失败。

  41. A06 · 第 6 章 几何、数据偏差与计算机视觉综合复习

    支持的主张:Stanford CS231n 2025 课程用于核对卷积网络、残差结构、检测、分割和视觉 Transformer 的任务接口与实验评价;《Deep Learning》用于核对卷积、优化、正则化和泛化的基础原理。本章的视觉任务细节以 CS231n 为直接依据,教材用于解释共同训练机制而不替代最新架构证据。

  42. A07 · 第 1 章 循环网络、门控单元与状态传播

    支持的主张:《Deep Learning》作者在线教材可用于核对循环网络、时间反向传播和门控单元的基本定义。具体门命名、状态布局和融合实现仍应以所用框架公式为准。

  43. A07 · 第 2 章 序列损失、教师强制与解码

    支持的主张:《Deep Learning》作者在线教材可用于核对序列建模、teacher forcing、BPTT 和生成训练基础。

  44. A07 · 第 3 章 缩放点积注意力与掩码

    支持的主张:《Deep Learning》提供表示学习、前馈网络、softmax 与优化的系统背景,适合补足注意力所依赖的线性代数和概率建模基础。该书出版早于 Transformer,不应被当作自注意力架构的原始来源。

  45. A07 · 第 4 章 多头注意力与位置表示

    支持的主张:《Attention Is All You Need》用于核对多头投影、缩放点积注意力、正弦位置编码和原始 Transformer 的张量结构;《Deep Learning》用于核对表示学习、序列建模、参数共享和反向传播基础。本章的头数、维度和掩码公式以原论文为直接依据,不把位置编码形式写成所有 Transformer 的唯一选择。

  46. A07 · 第 5 章 编码器、解码器与 Transformer 架构

    支持的主张:《Attention Is All You Need》用于核对标准 Transformer 的多头注意力、残差、归一化、位置编码与编码器—解码器连接;《Deep Learning》用于核对序列概率、前馈网络、反向传播和优化基础。本章逐层标注张量形状与掩码轴,避免仅凭结构示意图推断实现正确。

  47. A07 · 第 6 章 长序列、效率与 Transformer 综合复习

    支持的主张:《Attention Is All You Need》用于核对编码器—解码器、多头注意力、前馈子层、掩码和原始翻译实验;《Deep Learning》用于核对序列条件建模、优化与泛化基础。本章把标准 Transformer 作为基线接口,长序列效率、缓存和外推结论均另行验证,不归入原论文保证。

  48. A08 · 第 3 章 对比学习、负样本与信息瓶颈

    支持的主张:SimCLR 原论文用于核对两次数据增强、投影头、温度化对比损失和批内负样本的消融结论;《Deep Learning》用于核对表示学习、交叉熵式目标、正则化与下游评价的基础框架。本章关于具体增强和投影头的主张限定于 SimCLR 实验,而不把其配置写成所有模态的通用最优方案。

  49. A08 · 第 4 章 掩码预测与上下文建模

    支持的主张:BERT 论文用于核对随机掩码、双向 Transformer 编码、预训练—微调接口及原始任务实验;《Deep Learning》用于核对表示学习、条件建模、交叉熵和正则化基础。本章据此把掩码预测解释为特定条件目标,而不是完整联合分布的自动似然分解。

  50. A09 · 第 1 章 自回归生成与序列似然

    支持的主张:《Deep Learning》用于核对联合分布的链式分解、条件似然训练和序列生成中的 teacher forcing;VAE 原论文用于提供潜变量生成模型与重参数化变分下界的对照。本章借此说明自回归精确似然和潜变量近似似然回答不同建模问题,不从 VAE 结果推导自回归采样性质。

  51. A09 · 第 2 章 变分自编码器与证据下界

    支持的主张:《Deep Learning》用于核对潜变量模型、变分推断、KL 散度和生成建模背景;VAE 原论文用于核对 ELBO、Gaussian 重参数化估计器和原始生成实验。本章的闭式 KL 与重构项依赖所声明的分布族,不能把该推导直接套到任意离散或不可重参数化潜变量。

  52. A09 · 第 3 章 生成对抗网络与散度最小化

    支持的主张:GAN 原论文用于核对生成器—判别器极小极大目标、最优判别器分析和原始实验范围;《Deep Learning》用于核对概率建模、反向传播、优化与生成模型的统一背景。本章关于原始目标的数学结论以论文为依据,模式崩塌和训练稳定性则按后续工程现象陈述,不伪装成原论文定理。

  53. A09 · 第 4 章 正规化流与可逆变换

    支持的主张:GAN 原论文在本章只用于核对隐式生成模型的极小极大训练,作为可逆流显式密度和精确变量替换公式的对照;《Deep Learning》用于核对概率密度、可逆变换、Jacobian 与生成建模基础。因此本章的 flow 似然不归因于 GAN 论文,引用它支持的是两类生成目标的边界比较。

  54. A09 · 第 5 章 得分匹配、扩散过程与反向采样

    支持的主张:DDPM 原论文用于核对固定前向加噪链、参数化反向过程、变分界与噪声预测目标;《Deep Learning》用于核对潜变量模型、概率链和梯度优化基础。本章的离散扩散公式以原论文约定为准,连续时间 score 表达被标为后续推广,不由 2020 年论文的离散实验无条件推出。

  55. A09 · 第 6 章 生成质量、覆盖与生成模型综合复习

    支持的主张:《Deep Learning》用于核对显式/隐式密度、潜变量和生成训练的一般框架;VAE 论文用于核对 ELBO 与重参数化梯度,GAN 论文用于核对对抗极小极大目标,DDPM 论文用于核对前向加噪、反向链和噪声预测目标。本章的比较表逐列对应这些不同目标,不把某一模型的似然、样本质量或训练代价指标移用于另一模型。

  56. A11 · 第 1 章 图、图信号与节点表示

    支持的主张:《Geometric Deep Learning》用于核对图信号、置换作用、局部邻域和谱/空间图算子的统一定义;《Deep Learning》用于核对表示学习、参数共享和梯度优化的基础机制。本章的图几何结论来自前者,后者只支持训练接口,不把普通向量网络的结论直接当作图对称性证明。

  57. A12 · 第 1 章 语言建模、tokenization 与规模规律

    支持的主张:Kaplan 等的规模律论文用于核对损失随参数、数据和计算量变化的经验幂律、拟合区间及受控实验设置;《Deep Learning》用于核对语言建模似然、优化和泛化基础。本章将规模律限定为特定模型族、数据与损失上的经验关系,不由该回归外推能力、安全性或无限规模表现。

  58. A12 · 第 2 章 指令微调、偏好优化与上下文学习

    支持的主张:InstructGPT 论文用于核对监督指令微调、偏好数据、奖励模型与 PPO 阶段的真实数据流和评价;《Deep Learning》用于核对监督损失、序列建模、优化和过拟合基础。本章据此把 instruction tuning 与偏好强化学习分成不同阶段,也不把标注者偏好得分等同于事实正确性或安全性。

  59. A12 · 第 3 章 视觉语言对齐与多模态生成

    支持的主张:CLIP 论文用于核对图像—文本双塔、对称对比损失、提示模板和零样本分类实验;《Deep Learning》用于核对表示学习、交叉熵、优化与泛化基础。本章将“共享嵌入空间中的匹配”与“生成式视觉语言理解”分开,CLIP 的检索/分类结果不被扩写成开放式推理保证。

  60. A12 · 第 4 章 检索增强、引用与事实落地

    支持的主张:RAG 原论文用于核对检索器、文档潜变量与生成器联合建模,以及知识密集任务中的原始实验设置;《Deep Learning》用于核对条件序列模型、最大似然和潜变量学习基础。本章据此区分“检索到了文本”“生成使用了文本”和“回答中的主张被文本支持”三个独立检查。

  61. A13 · 第 1 章 特征归因、显著性与反事实

    支持的主张:SHAP 论文用于核对加性特征归因、Shapley 公理及不同解释方法的统一表示;《Deep Learning》用于核对模型计算图、梯度和表示学习背景。本章据此区分“给定模型与背景分布下的贡献分配”和“真实因果效应”,归因值不被解释为改变该特征必然造成同量结果变化。

  62. A13 · 第 2 章 表示探测与机制可解释性

    支持的主张:SHAP 论文用于核对基于 Shapley 值的输入归因及其加性公理,作为“行为归因”与“内部机制解释”之间的对照;《Deep Learning》用于核对神经网络计算图、隐藏表示和参数化结构。本章明确指出二者都不能单独证明某个内部单元是模型行为的唯一因果机制,机制主张还需干预与反事实复核。

  63. A13 · 第 3 章 校准、分布外检测与选择性预测

    支持的主张:Guo 等的校准论文用于核对可靠性图、ECE、温度缩放及现代神经网络过度置信的实验观察;《Deep Learning》用于核对概率输出、交叉熵、泛化和分布假设。本章据此把同分布后处理校准与分布外检测分开,温度缩放不被描述为 OOD 保证。

  64. A13 · 第 4 章 鲁棒性、对抗攻击与防御评估

    支持的主张:Goodfellow 等的对抗样本论文用于核对线性解释、FGSM 构造和原始鲁棒训练实验;《Deep Learning》用于核对损失梯度、优化、正则化和泛化基础。本章中的扰动预算、范数和威胁模型均显式给出,不把某一攻击失败当作模型已经鲁棒。

  65. M11 · 第 3 章 一阶优化与梯度下降

    支持的主张:《Deep Learning》作者维护的在线教材系统讨论深度模型的数值优化、随机梯度、动量和参数尺度;阅读时应把一般优化结论与特定网络经验区分开。

官方入口