多模态检索
概述
多模态检索(Multimodal Retrieval)是将文本、图像、3D 模型等不同模态统一映射到共享向量空间后进行跨模态相似性搜索的技术,核心依赖 CLIP 类模型实现跨模态语义对齐,但受 Modality Gap 制约。
关键内容
- 核心技术路线:
- 双编码器(Bi-encoder):图像编码器 + 文本编码器分别生成向量,离线预计算图像向量,查询时只需计算文本向量再做 ANN 检索,速度极快但受 Modality Gap 影响
-
跨编码器(Cross-encoder):图文拼接后联合编码,更精确但无法离线预计算,适合精排
-
三种检索范式:
- 文本搜图(Text-to-Image):用自然语言描述检索图像,最常见
- 图搜图(Image-to-Image):相似图像检索
-
图搜文本(Image-to-Text):图像检索相关文档
-
游戏美术资产检索(实际场景):CLIP 解决的核心问题:美术资产海量、多模态(图像/贴图/渲染图/草图)、需要自然语言检索。优势:零样本分类(无需标注)、模糊语义/风格检索("帅/暗黑/二次元")、3D 模型通过渲染多视角图间接检索。腾讯/网易/Unity/Epic 等游戏厂商均采用 CLIP 或其变体。
-
实验对比(Modality Gap 的影响):
- 文本 Embedding 检索 VLM 生成的图片描述:判别力是直接图像通道的 33.6 倍
- Pipeline A(图→文字描述→文本检索)是生产验证的最优解
-
qwen3-vl-embedding(MMEB-V2 第一名)在专业领域(3D 渲染图)的 modality gap 甚至比 CLIP 更大
-
3D 模型检索的工程方案:3D 模型难以直接编码 → 渲染成 8 个视角图 → CLIP 编码每个视角 → 聚合(最大池化)→ 3D 检索。MetaFind 采用更复杂的 ESSGNN(场景感知等变图编码)+ ULIP-2 三模态对齐。
-
混合架构(生产最优解):图像通道(CLIP 向量)+ 文本通道(VLM 生成描述→文本 Embedding)→ RRF(倒数排名融合)。
来源
raw/articles/ai-engineering/search-retrieval/CLIP:跨模态语义对齐.mdraw/articles/ai-engineering/search-retrieval/Qwen-VL vs Multimodal Embedding:深度分析.mdraw/articles/ai-engineering/search-retrieval/MetaFind.md
相关
- CLIP — uses(核心跨模态对齐模型)
- Modality Gap — extends(核心挑战)
- 检索增强生成 — extends(多模态 RAG)
- 近似最近邻检索 — uses(向量相似度搜索)
- MetaFind — uses(3D 资产多模态检索实体)