Type: concept
Confidence: 0.88
Created: 2026-04-16
Updated: 2026-04-16
Tags: AI工程

向量空间模型

概述

向量空间模型(Vector Space Model, VSM)将文档和查询表示为高维词条权重向量,用余弦相似度(而非欧氏距离)计算相关性,是稀疏检索的经典框架,TF-IDF 是其最主流实现。

关键内容

  1. 核心思想:词典大小为 n,每篇文档 d 表示为 n 维向量 d⃗ = [tfidf(t₁,d), ..., tfidf(tₙ,d)],查询同样表示为向量,高维空间中距离近的文档更相关。

  2. 为什么用余弦不用欧氏距离:欧氏距离受文档长度影响("cat cat cat" 和 "cat" 意义相同但距离不同)。余弦相似度 cos(q,d) = q⃗·d⃗/(‖q‖‖d‖) 只看向量方向,消除长度偏置。实践中对文档向量预先 L2 归一化,查询时退化为纯点积。

  3. 稀疏向量 vs 稠密向量:VSM 向量维度等于词典大小(10万+),大多数维度为 0,属于稀疏表示Embedding 模型(BERT、BGE 等)生成 768/1024 维稠密向量,需要近似最近邻检索FAISS/Milvus)。

  4. VSM 局限:词袋假设(忽略词序);语义盲区(car ≠ automobile,无法跨语言);高维空间计算相似度效率低(稠密向量需要 ANN)。

  5. 演进:VSM(TF-IDF) → BM25(概率框架,显式长度归一化)→ Dense Retrieval(稠密向量,语义理解)→ 混合检索(BM25 + Dense,两者互补)。

来源

相关