词向量
概述
词向量是一种将词汇映射到连续向量空间的技术,使得语义相似的词在向量空间中有相近的表示,解决了传统 One-Hot 编码的语义盲区问题。
关键内容
- 发展背景:
- 传统 One-Hot 编码存在维度灾难和语义盲区问题
- 词向量通过稠密向量表示解决这些问题
-
让"语义距离"变得可以计算
-
核心特性:
- 稠密表示:相比 One-Hot 的稀疏高维向量,词向量是低维稠密向量
- 语义捕捉:语义相似的词在向量空间中距离相近
-
几何性质:支持线性类比运算(如"国王 - 男人 + 女人 ≈ 女王")
-
代表性方法:
- Word2Vec(2013):提出 CBOW 和 Skip-gram 模型
- GloVe(2014):结合全局共现矩阵的方法
- FastText(2016):引入子词信息处理未登录词
来源
- paper_09_word2vec — 词向量的重要实现
相关
- Word2Vec — 实现方法
- One-Hot 编码 — 比较对象
- 分布式假说 — 理论基础
- NLP — 应用领域
- GloVe — 替代方法
- FastText — 替代方法