CLIP
概述
CLIP(Contrastive Language-Image Pre-training)是一种多模态模型,通过对比学习联合训练图像和文本编码器,实现图文匹配和零样本视觉识别。
关键内容
-
对比学习架构:CLIP使用双塔架构,分别训练图像编码器和文本编码器,通过对比损失函数使匹配的图文对在嵌入空间中距离更近,不匹配的图文对距离更远。
-
应用影响:CLIP为多模态AI开辟了新的方向,影响了后续的DALL-E、GPT-4 Vision等多种多模态模型的设计思路。
-
对比学习:训练图像和文本编码器,使匹配的图文对在嵌入空间中靠近,不匹配的远离。
-
多模态对齐:建立了文本和视觉的统一表示空间,为 DALL-E 等文生图模型奠定基础。
来源
- ai_papers_timeline.md — 2021年CLIP提出
- Learning Transferable Visual Models from Natural Language Supervision (2021 论文) — Alec Radford等人在OpenAI的研究
相关
- Learning Transferable Visual Models from Natural Language Supervision (2021 论文) — described_in
- Alec Radford — created_by
- OpenAI — developed_at
- 零样本学习 — enables
- Multimodal Learning — exemplifies
- Contrastive Learning — uses
- DALL-E — relates_to