Type: concept
Confidence: 0.90
Created: 2026-04-20
Updated: 2026-04-25
Tags: multimodalcomputer visionnlpcontrastive learning机器学习

CLIP

概述

CLIP(Contrastive Language-Image Pre-training)是一种多模态模型,通过对比学习联合训练图像和文本编码器,实现图文匹配和零样本视觉识别。

关键内容

  1. 对比学习架构:CLIP使用双塔架构,分别训练图像编码器和文本编码器,通过对比损失函数使匹配的图文对在嵌入空间中距离更近,不匹配的图文对距离更远。

  2. 零样本能力:经过大规模图文对训练后,CLIP能够对未见过的图像分类任务实现零样本迁移,仅需提供类别名称而无需额外训练。

  3. 应用影响:CLIP为多模态AI开辟了新的方向,影响了后续的DALL-E、GPT-4 Vision等多种多模态模型的设计思路。

  4. 对比学习:训练图像和文本编码器,使匹配的图文对在嵌入空间中靠近,不匹配的远离。

  5. 零样本分类:CLIP 可以在未见过的类别上进行零样本分类,只需提供类别名称的文本描述。

  6. 多模态对齐:建立了文本和视觉的统一表示空间,为 DALL-E 等文生图模型奠定基础。

来源

相关