Type: concept
Confidence: 0.95
Created: 2026-04-18
Updated: 2026-04-18
Tags: 机器学习深度学习NLP词嵌入

Word2Vec

概述

Word2Vec 是 Google 于2013年提出的词向量模型,通过上下文预测任务将词语映射为稠密低维向量,实现语义推理的向量化。

关键内容

核心思想

基于 Firth(1957)的语言学直觉:"A word is characterized by the company it keeps."(词的意义由其上下文决定)。Word2Vec 将这一语言学直觉转化为可学习的神经网络。

两种架构

  1. Skip-gram:用中心词预测上下文窗口内的词。对低频词和生僻词效果更好,是论文重点推荐的模型
  2. CBOW(连续词袋模型):用上下文词的平均向量预测中心词。训练速度更快,但对低频词效果较差

训练优化

语义向量算术

训练后的 300 维向量空间展现惊人的线性语义关系: - king - man + woman ≈ queen(性别类比) - Paris - France + Italy ≈ Rome(国家-首都关系) - walked - walk + swim ≈ swam(动词时态变化) - China - Chinese + Japanese ≈ Japan(语言-国家关系)

几何解释:向量空间中存在语义方向(Semantic Direction),某个维度方向编码"皇室"、"国家→首都"、"动词时态"等语义概念。

工程实现

演化谱系

Word2Vec(2013)→ GloVe(2014,Stanford)→ FastText(2016,Facebook)→ ELMo(2018,AllenNLP)→ BERT(2018,Google)→ 当今大模型内置词嵌入层

来源

相关