经典多模态arXiv:2103.00020
CLIP:用自然语言监督视觉
Learning Transferable Visual Models From Natural Language Supervision
Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, Ilya Sutskever
ICML · 2021
28k 引用 · 1.7k 阅读 · 0 收藏
摘要
在约四亿图文对上对比训练图像与文本编码器,使视觉分类可以通过自然语言零样本完成。
Contrastively trains image and text encoders on 400M image-text pairs, enabling zero-shot visual classification from natural language.
提要
CLIP 在约四亿图文对上对比训练图像与文本编码器,使二者落入同一向量空间。由此,自然语言提示词可以直接充当分类器,实现零样本视觉识别。
01背景与动机
传统视觉识别依赖固定类别标签与人工标注,模型一旦训练完成就难以扩展到新概念,部署成本高且覆盖面窄。研究者希望找到更灵活、可扩展的监督来源,让视觉系统不必被封闭词表锁死。
自然语言天然描述图像内容,且在互联网上与图片大量共现,是成本相对较低的监督信号。用语言监督视觉,可以把模型从固定类别集中解放出来,为开放词汇与零样本迁移提供路径。
02核心方法
CLIP 采用双向对比学习:在一个批次内,让匹配的图文对彼此靠近,不匹配的对彼此远离,同时优化“图找文”与“文找图”。图像塔可用 ResNet 或 ViT,文本塔为 Transformer,二者输出被映射到共享嵌入空间。
训练数据规模约为四亿图文对,目标不是预测离散类别,而是学习可对齐的多模态表征。推理时,把候选类别写成自然语言提示,经文本编码器得到权重,再与图像嵌入做相似度比较即可分类。

03结果与证据
对齐完成后,模型无需在目标数据集上微调分类头,即可通过提示词完成多种视觉分类任务,体现出跨任务的零样本迁移能力。同一套编码器也可用于图文检索等需要跨模态匹配的场景。
证据主要来自:在多种下游视觉基准上以自然语言构造分类器,并与需要任务专用标注的传统流程对照。整体表明,大规模图文对比学习能够把开放词汇识别能力转移到未见类别与任务上。

04影响与意义
CLIP 成为开源多模态技术栈的中枢组件:生成模型中的文本条件、跨模态检索系统,以及大量评测与基准构建,都依赖其共享表征与提示式接口。它把“用句子描述概念”变成了可复用的视觉接口。
更广泛地说,它证明语言可以作为视觉最便宜、覆盖面广的标签空间;一旦图文空间对齐,生成、检索与分类等应用可以被同一表征接通,降低了多模态系统的拼装成本。

05局限
CLIP 在细粒度计数、复杂空间关系与抽象推理等任务上仍然偏弱,提示词写法也会显著影响表现,零样本并不等于稳健的任务理解。对比目标优化的是匹配与区分,并不等价于真正的视觉常识或因果理解。
此外,网络图文对带来的噪声、偏见与覆盖盲区会进入表征;对需要精密结构或专业领域知识的场景,往往仍需额外适配或专用数据,而不能单靠通用提示一劳永逸。

06要点
- 01语言是视觉最便宜且可扩展的标签空间。
- 02零样本能力来自图文对齐,而不是来自任务专用分类头。
- 03表征空间一旦共享,分类、检索与生成等应用就能被接通。
为何入典
多模态对齐的基准方法。文生图、以文检索、视觉智能体,几乎都还在用这条对比学习绳。
标签
相关论文
ViT:图像也是一串 token
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
潜在扩散:在压缩空间里生成
High-Resolution Image Synthesis with Latent Diffusion Models
GPT-3:上下文里的少样本学习
Language Models are Few-Shot Learners
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。