论文 · 资源记录

Learning Transferable Visual Models From Natural Language Supervision

用大规模图像—文本配对数据和双塔对比目标学习可迁移视觉表示。

作者:Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, Ilya Sutskever年份:2021出版信息:Proceedings of the 38th International Conference on Machine Learning元数据:完整链接核验于 2026-07-14

为什么重要

用于核对跨模态对齐、零样本分类、数据构造和评价限制。

阅读前提

教材中的引用位置

  1. A08 · 第 1 章 表示学习目标、相似度与不变性

    支持的主张:SimCLR 论文用于核对增强视图间的实例对比目标,BERT 论文用于核对 token 掩码预测,CLIP 论文用于核对图文配对的双向对比目标。本章借三者说明“表示相近”由正样本构造和损失共同定义,不能把一个目标下的相似性直接解释成另一任务的语义等价。

  2. A08 · 第 2 章 度量学习、孪生网络与三元组损失

    支持的主张:SimCLR 论文用于核对同一样本增强视图之间的温度化对比损失、投影头和批内负样本;CLIP 论文用于核对图像—文本双塔、对称对比目标和零样本分类接口。本章据此比较同模态实例判别与跨模态对齐,二者的正负样本语义和评价协议不能互换。

  3. A08 · 第 5 章 跨模态对齐与预训练迁移

    支持的主张:CLIP 论文用于核对图文配对、双塔编码和跨模态对比目标;SimCLR 论文用于核对单模态增强视图的实例对比基线;BERT 论文用于核对离散 token 的掩码预测目标。本章借三者区分对齐式、对比式和重建式预训练,数据规模与迁移结论仍限于各论文实际任务。

  4. A08 · 第 6 章 表示质量、坍塌与自监督学习综合复习

    支持的主张:SimCLR 的消融实验用于核对增强、投影头与线性评价,BERT 用于核对掩码预训练—微调接口,CLIP 用于核对跨模态对齐与零样本分类。本章的比较据此分别评价同模态不变性、上下文重建和跨模态匹配,不用单一线性探针分数概括全部表示质量。

  5. A12 · 第 3 章 视觉语言对齐与多模态生成

    支持的主张:CLIP 论文用于核对图像—文本双塔、对称对比损失、提示模板和零样本分类实验;《Deep Learning》用于核对表示学习、交叉熵、优化与泛化基础。本章将“共享嵌入空间中的匹配”与“生成式视觉语言理解”分开,CLIP 的检索/分类结果不被扩写成开放式推理保证。

  6. A12 · 第 6 章 系统评估、故障模式与智能体综合复习

    支持的主张:ReAct 论文用于核对推理文本与工具动作交错的代理轨迹,RAG 论文用于核对检索器—生成器的联合建模,CLIP 论文用于核对图文对比预训练,InstructGPT 论文用于核对指令与偏好训练流程,规模律论文用于核对语言模型损失的经验缩放。本章分别引用这些接口,不把单篇实验扩张为自主性、事实性、多模态理解或安全性的统一保证。

官方入口