论文 · 资源记录
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
以掩码语言建模和句间目标预训练双向 Transformer 表示。
作者:Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova年份:2019出版信息:Proceedings of NAACL-HLT 2019元数据:完整链接核验于 2026-07-14
为什么重要
用于核对掩码预测的条件建模方式、预训练—微调接口和原始实验范围。
阅读前提
教材中的引用位置
- A08 · 第 1 章 表示学习目标、相似度与不变性
支持的主张:SimCLR 论文用于核对增强视图间的实例对比目标,BERT 论文用于核对 token 掩码预测,CLIP 论文用于核对图文配对的双向对比目标。本章借三者说明“表示相近”由正样本构造和损失共同定义,不能把一个目标下的相似性直接解释成另一任务的语义等价。
- A08 · 第 4 章 掩码预测与上下文建模
支持的主张:BERT 论文用于核对随机掩码、双向 Transformer 编码、预训练—微调接口及原始任务实验;《Deep Learning》用于核对表示学习、条件建模、交叉熵和正则化基础。本章据此把掩码预测解释为特定条件目标,而不是完整联合分布的自动似然分解。
- A08 · 第 5 章 跨模态对齐与预训练迁移
支持的主张:CLIP 论文用于核对图文配对、双塔编码和跨模态对比目标;SimCLR 论文用于核对单模态增强视图的实例对比基线;BERT 论文用于核对离散 token 的掩码预测目标。本章借三者区分对齐式、对比式和重建式预训练,数据规模与迁移结论仍限于各论文实际任务。
- A08 · 第 6 章 表示质量、坍塌与自监督学习综合复习
支持的主张:SimCLR 的消融实验用于核对增强、投影头与线性评价,BERT 用于核对掩码预训练—微调接口,CLIP 用于核对跨模态对齐与零样本分类。本章的比较据此分别评价同模态不变性、上下文重建和跨模态匹配,不用单一线性探针分数概括全部表示质量。