分布式假说
概述
分布式假说(或分布假说)是一个语言学理论,认为一个词的意义可以从其上下文环境推断出来,即"一个词由它的公司决定"(You shall know a word by the company it keeps)。
关键内容
- 理论起源:
- 由语言学家 John Rupert Firth 在 1957 年提出
- 体现了分布语义学的核心思想
-
为词向量表示提供了理论基础
-
核心观点:
- 在相似上下文中出现的词,应该有相似的含义
- 词汇的语义可以通过其周围的词汇模式来确定
-
相似的语境意味着相似的意义
-
在 NLP 中的应用:
- Word2Vec 算法将此语言学洞察转化为可计算的算法
- "在相似上下文中出现的词,应该有相似的向量表示"
- 为现代词向量表示和语义嵌入奠定理论基础
来源
- paper_09_word2vec — 论文中提及此理论