经典多模态2021
CLIP:用自然语言监督视觉
Learning Transferable Visual Models From Natural Language Supervision
CLIP 在约四亿图文对上对比训练图像与文本编码器,使二者落入同一向量空间。由此,自然语言提示词可以直接充当分类器,实现零样本视觉识别。
Alec Radford, Jong Wook Kim, Chris Hallacy et al.·ICML28k 引用1.7k 阅读
按时代、领域或关键词筛选。经典是骨架,新篇每天早上 6 点从 arXiv 自动收入。
Learning Transferable Visual Models From Natural Language Supervision
CLIP 在约四亿图文对上对比训练图像与文本编码器,使二者落入同一向量空间。由此,自然语言提示词可以直接充当分类器,实现零样本视觉识别。