探索/多模态

经典多模态arXiv:2103.00020

CLIP:用自然语言监督视觉

Learning Transferable Visual Models From Natural Language Supervision

Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, Ilya Sutskever

ICML · 2021

28k 引用 · 1.7k 阅读 · 0 收藏

摘要

在约四亿图文对上对比训练图像与文本编码器,使视觉分类可以通过自然语言零样本完成。

Contrastively trains image and text encoders on 400M image-text pairs, enabling zero-shot visual classification from natural language.

提要

CLIP 在约四亿图文对上对比训练图像与文本编码器,使二者落入同一向量空间。由此,自然语言提示词可以直接充当分类器,实现零样本视觉识别。

01背景与动机

传统视觉识别依赖固定类别标签与人工标注,模型一旦训练完成就难以扩展到新概念,部署成本高且覆盖面窄。研究者希望找到更灵活、可扩展的监督来源,让视觉系统不必被封闭词表锁死。

自然语言天然描述图像内容,且在互联网上与图片大量共现,是成本相对较低的监督信号。用语言监督视觉,可以把模型从固定类别集中解放出来,为开放词汇与零样本迁移提供路径。

02核心方法

CLIP 采用双向对比学习:在一个批次内,让匹配的图文对彼此靠近,不匹配的对彼此远离,同时优化“图找文”与“文找图”。图像塔可用 ResNet 或 ViT,文本塔为 Transformer,二者输出被映射到共享嵌入空间。

训练数据规模约为四亿图文对,目标不是预测离散类别,而是学习可对齐的多模态表征。推理时,把候选类别写成自然语言提示,经文本编码器得到权重,再与图像嵌入做相似度比较即可分类。

方法概要。标准图像模型联合训练特征提取器与线性分类器预测标签;CLIP联合训练图像与文本编码器,预测一批(图像,文本)的正确配对。测试时文本编码器通过对类别名称或描述嵌入,合成零样本线性分类器。
1. 方法概要。标准图像模型联合训练特征提取器与线性分类器预测标签;CLIP联合训练图像与文本编码器,预测一批(图像,文本)的正确配对。测试时文本编码器通过对类别名称或描述嵌入,合成零样本线性分类器。

03结果与证据

对齐完成后,模型无需在目标数据集上微调分类头,即可通过提示词完成多种视觉分类任务,体现出跨任务的零样本迁移能力。同一套编码器也可用于图文检索等需要跨模态匹配的场景。

证据主要来自:在多种下游视觉基准上以自然语言构造分类器,并与需要任务专用标注的传统流程对照。整体表明,大规模图文对比学习能够把开放词汇识别能力转移到未见类别与任务上。

零样本CLIP对分布偏移的鲁棒性远强于标准ImageNet模型。(左)理想鲁棒模型(虚线)在ImageNet与其他自然图像分布上表现相当;零样本CLIP可将“鲁棒性差距”缩小达75%。图为logit变换后的线性拟合及自助法95%置信区间。(右)香蕉类别在7个自然分布偏移数据集中5个共有,可视化其偏移;比较最佳零样本CLIP(ViT-L/14@336px)与ImageNet验证集性能相同的ResNet-101。
2. 零样本CLIP对分布偏移的鲁棒性远强于标准ImageNet模型。(左)理想鲁棒模型(虚线)在ImageNet与其他自然图像分布上表现相当;零样本CLIP可将“鲁棒性差距”缩小达75%。图为logit变换后的线性拟合及自助法95%置信区间。(右)香蕉类别在7个自然分布偏移数据集中5个共有,可视化其偏移;比较最佳零样本CLIP(ViT-L/14@336px)与ImageNet验证集性能相同的ResNet-101。

04影响与意义

CLIP 成为开源多模态技术栈的中枢组件:生成模型中的文本条件、跨模态检索系统,以及大量评测与基准构建,都依赖其共享表征与提示式接口。它把“用句子描述概念”变成了可复用的视觉接口。

更广泛地说,它证明语言可以作为视觉最便宜、覆盖面广的标签空间;一旦图文空间对齐,生成、检索与分类等应用可以被同一表征接通,降低了多模态系统的拼装成本。

对ImageNet有监督适配使准确率提高9.2%,但略降平均鲁棒性。(左)为各数据集定制零样本CLIP,优于单一静态零样本ImageNet分类器并按Taori等2020汇总相似类预测;适配后CLIP与先前最佳ImageNet模型有效鲁棒性相近。(右)两种干预在各数据集上的准确率变化:适配显著提升ImageNetV2,但在其他分布有所权衡;数据集特定零样本分类器可大幅提准,但仅适用于少数与ImageNet类别不完全对齐的数据集。
3. 对ImageNet有监督适配使准确率提高9.2%,但略降平均鲁棒性。(左)为各数据集定制零样本CLIP,优于单一静态零样本ImageNet分类器并按Taori等2020汇总相似类预测;适配后CLIP与先前最佳ImageNet模型有效鲁棒性相近。(右)两种干预在各数据集上的准确率变化:适配显著提升ImageNetV2,但在其他分布有所权衡;数据集特定零样本分类器可大幅提准,但仅适用于少数与ImageNet类别不完全对齐的数据集。

05局限

CLIP 在细粒度计数、复杂空间关系与抽象推理等任务上仍然偏弱,提示词写法也会显著影响表现,零样本并不等于稳健的任务理解。对比目标优化的是匹配与区分,并不等价于真正的视觉常识或因果理解。

此外,网络图文对带来的噪声、偏见与覆盖盲区会进入表征;对需要精密结构或专业领域知识的场景,往往仍需额外适配或专用数据,而不能单靠通用提示一劳永逸。

少样本CLIP较现有ImageNet模型提高有效鲁棒性,但弱于零样本CLIP。减少用于适配的ImageNet数据可提升有效鲁棒性,却降低相对鲁棒性。16样本逻辑回归CLIP在ImageNet上与零样本相当(见图7),但鲁棒性较差。
4. 少样本CLIP较现有ImageNet模型提高有效鲁棒性,但弱于零样本CLIP。减少用于适配的ImageNet数据可提升有效鲁棒性,却降低相对鲁棒性。16样本逻辑回归CLIP在ImageNet上与零样本相当(见图7),但鲁棒性较差。

06要点

  1. 01语言是视觉最便宜且可扩展的标签空间。
  2. 02零样本能力来自图文对齐,而不是来自任务专用分类头。
  3. 03表征空间一旦共享,分类、检索与生成等应用就能被接通。

为何入典

多模态对齐的基准方法。文生图、以文检索、视觉智能体,几乎都还在用这条对比学习绳。

标签

contrastivevision-language

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。