探索/基础

经典基础arXiv:1301.3781

词向量:把语义放进几何里

Efficient Estimation of Word Representations in Vector Space

Tomas Mikolov, Kai Chen, Greg Corrado, Jeffrey Dean

ICLR Workshop · 2013

42k 引用 · 1.5k 阅读 · 0 收藏

摘要

提出 Skip-gram 与 CBOW,用大规模语料高效学习词向量,并发现向量空间中稳定的线性语义关系。

Introduces continuous skip-gram and CBOW models that learn high-quality word vectors from large corpora at low computational cost, capturing linear semantic regularities.

提要

Word2Vec 证明,在足够大的无监督语料上可以学出支持算术运算的语义空间。词与词之间的几何关系能够稳定地反映类比等语义规律。

01背景与动机

在深度学习广泛进入自然语言处理之前,词多被表示为稀疏离散符号或手工特征,语义相似性难以直接度量,类比推理更几乎无从谈起。研究者希望把词语嵌入低维连续空间,使相近含义彼此靠近,并让关系体现为可计算的向量结构。

若语义关系能表现为稳定的几何偏移,模型便有望在无标注文本上自动获得可迁移的词汇知识。这一动机推动了以大规模语料驱动、以预测上下文为目标的分布式表示学习路线。

02核心方法

Word2Vec 提供两种互补目标:CBOW 依据周围上下文预测中心词,适合快速估计常见词表示;Skip-gram 则由中心词预测上下文,对低频词往往更敏感。二者都把共现统计压缩进共享的低维向量表中。

为在数十亿词规模上可行,负采样用少量噪声词近似整表归一化,把学习改写为区分真共现与随机词对的二分类问题。由此,训练成本显著下降,语义几何仍能从局部预测任务中涌现。

03结果与证据

论文用词类比与词相似度等定性定量任务表明,学得向量支持 king − man + woman ≈ queen 一类运算,说明关系可近似为方向稳定的向量差。相近语义的词在空间中聚集,验证了分布假说在神经网络目标下仍然成立。

与仅统计共现的经典方法相比,该框架在保持可扩展训练的同时,给出了可直接参与下游计算的稠密特征。证据主要来自内在评价与类比求解,而非某一特定有监督基准上的单一分数。

04影响与意义

Word2Vec 把“先在大规模无标注文本上预训练通用词表示”变成可行默认路径,深刻影响了随后的迁移学习习惯。许多系统不再从随机词表冷启动,而是复用已对齐语义空间的向量作为输入层。

BERT、GPT 等模型的 token embedding,在思想谱系上仍可视为这条预训练表示线的后代:先有可运算的几何,再有上下文编码与注意力机制叠加上去。它也为对比学习式负采样提供了早期范本。

05局限

每个词只对应一个静态向量,无法区分银行作为金融机构或河岸等不同义项,多义词与上下文依赖意义被平均进同一点。句子级与文档级组合语义也超出词袋式局部窗口的建模范围。

真正随上下文变化的表示,要等到 ELMo、BERT 一类上下文编码器出现后才系统解决。此外,窗口共现偏重局部搭配,对需要长程话语结构的任务帮助有限。

06要点

  1. 01词被表示为空间中的点,而语义关系常常体现为可平移的向量差。
  2. 02负采样把大规模词表上的归一化难题改写成可训练的对比式分类目标。
  3. 03先建立可运算的语义几何,后来的上下文表示与注意力机制才有稳固底座。

为何入典

分布式表示的大众入口。后来几乎所有语言模型都站在「词/token 是向量」这一步上。

标签

embeddingsNLP

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。