笔记:Relation Classification via Convolutional Deep Neural Network


Relation Classification via Convolutional Deep Neural Network

作者:Zeng D et al.

目录

  • Introduction
  • Model
  • Experiment
  • Conclusion
  • 参考

1 Introduction

”在深度学习兴起之前,关系抽取的传统方法依赖于特征工程,而这些特征通常由预先准备的NLP系统得到,这容易在构造特征的过程中造成误差累积,阻碍系统性能。该论文属于早期使用深度卷积网络模型解决关系抽取任务的经典论文\(^{[2]}\)。“

2 Model

输入:两个标注名词+含有这两个名词的语句,输出:提取此语句中两个名词(三元组中的两个实体)的关系relation。

其中relation是预先定义好的N类关系,即在已有关系前提下,根据输入获取这个语句所蕴含的关系,即可以看作多分类问题--有监督。

流程:大致分为三步,如下Figure1所示。首先embedding处理。之后进行特征提取:词级别以及句子级别特征提取,得到一个特征向量\(\mathbf{f = [l,g]}\)。最后 f 做一次线性变换后(\(o = W_3\mathbf{f}\))喂给全连接分类器softmax输出--最后输出的是一个向量,维度为relation类型数,输出向量的每一维相当于每个relation的得分。

2.1 Lexical Level Features

词汇级别的特征:\(\mathcal{l}\) 为多个word embedding的拼接,如下表Table1,分别为两个实体--名词对、两个实体的左右两边的词、WordNet上位词向量--五个level的embedding,其中“ WordNet 上位词特征指的是 e1e1 和 e2e2 同属于哪一个上位名次,如“狗”和“猫”的上位词可以是“动物”或者“宠物”\(^{[2]}\)。”

2.2 Sentence Level Features

句子级别特征的抽取大致流程如下Figure2。
首先输入为WF和PF--分别为词特征和位置特征--的拼接,之后先做了个线性变化(\(Z = W_1X\),X为窗口处理后的最终的词表示)再交给卷积以及最大池化处理得到m (\(m_i = maxZ(i,\cdot), Z(i,\cdot)\)代表矩阵Z的第i行),最后为了能够学到更加复杂的特征,对m进行非线性变换得到最终的句子级别的特征:\(\mathcal{g}\)

2.2.1 Word Feature

如下图所示,此时窗口大小为w=3,每个词的WF表示为当前词以及左右两个词的embedding组合,其中\(X_s\)\(X_e\)为起始特殊embedding。

2.2.2 Position Feature

“额外增加了时序特征来弥补卷积网络对时序特征抽取能力不足的缺陷。论文中的做法是为每个词拼接两个固定维度的位置向量,分别表示词距离两个关键实体的相对位置信息。如“中国 的 首都 是 北京”,“的”与“中国”的距离大小为 1,与“北京”的距离大小为 -3,再将 1 和 -3 在 Position Embedding 层中查表得到,Position Embedding 层是随机初始化的,并且参与到模型训练当中\(^{[2]}\)。”

3 Experiments

做了两组实验;调超参、于传统方法对比。

4 Conclusion

“该模型将关系抽取任务利用神经网络进行建模,利用无监督的词向量以及位置向量作为模型的主要输入特征,一定程度上避免了传统方法中的误差累积。但仍然有 lexical level feature 这个人工构造的特征,且 CNN 中的卷积核大小是固定的,抽取到的特征十分单一\(^{[2]}\)。”

参考

[1] Daojian Zeng, Kang Liu, Siwei Lai, Guangyou Zhou and Jun Zhao.Relation Classification via Convolutional Deep Neural Network.COLING 2014.

[2] 西多士NLP.信息抽取-关系抽取.博客园 2019..