Word2Vec
概述
Word2Vec 是由 Google 在 2013 年提出的神经网络模型,用于高效地将词汇映射到稠密向量空间中,使语言中的语义关系可以通过几何关系来捕获,是现代 NLP 的词向量基础。
关键内容
- 核心贡献:
- 提出了两种训练模型:CBOW(连续词袋)和 Skip-gram(跳字模型)
- 解决了传统 One-Hot 编码的维度灾难和语义盲区问题
-
证明了语言中的语义关系可以被几何关系捕获(如"国王 - 男人 + 女人 ≈ 女王")
-
两种模型架构:
- CBOW(Continuous Bag of Words):用周围词预测中心词
-
关键技术优化:
- 层次 Softmax(Hierarchical Softmax):将词表构建成哈夫曼树,减少计算复杂度
- 负采样(Negative Sampling):每次只随机抽取少量"负样本",将多分类转为二分类问题,极大提升训练速度
来源
- paper_09_word2vec — 论文精读
- Google — 作者单位
相关
- Tomas Mikolov — 作者
- GloVe — 继承发展
- FastText — 继承发展
- BERT — 受其影响
- GPT — 受其影响
- One-Hot 编码 — 比较对象
- 词向量 — 核心概念
- 分布式假说 — 理论基础
- CBOW — 模型组件
- Skip-gram — 模型组件
- 负采样 — 关键技术
- 层次 Softmax — 关键技术