笔记:CIL: Contrastive Instance Learning Framework for Distantly Supervised Relation Extraction
CIL: Contrastive Instance Learning Framework for Distantly Supervised Relation Extraction
-
来源:Chen et al., ACL 2021.
-
任务:DSRE
-
动机:采用bag-level的MIL(多实例学习)是处理DSRE噪声问题的一种比较有效的方法,但这类方法主要依赖encoder得到的bag表示做关系分类而忽略了细粒度的构成bag的丰富的instance信息。
-
方法:主要通过对比学习使模型能够考虑到bag中丰富的instance信息,具体来说就是使(事实上而不是DS标注的因为可能有噪声嘛)真正包含相同三元组的句子在hidden语义空间应该尽可能接近,反之包含不同三元组的句子在隐语义空间应该尽可能的远离。
-
Sentence Encoder. 使用预训练语言模型BERT编码句子,拼接两实体的特征向量作为句子表示,但这里没说明这两个实体特征向量\(h_{e1},h_{e2}\)是指什么?一个实体可能有多个token啊。
-
Bag Encoder. 仍然遵循(Lin et al., 2016)的selective-attention计算bag表示。
-
Contrastive Instance Learning. 对比学习本身并不是一种算法或是某种模型,而是一种训练方式,利用数据之间的相关性(也就包括正相关和负相关)进而更好的学习数据特征等相关信息。所以我们要为batch中所有bag中的每个instance(具体如图5、8、9)构建征服样本对比学习,训练目标函数使模型能够更好的学到细粒度的instance信息,文中对于正负样本的构建有多种对比方式,这里只说明最终实验采用的方法,详见原文。
- Positive Pair Construction. 利用整个训练语料训练得到的\(TF-IDF\)针对当前batch中某个bag中的某个句子\(x_s\),将得分较低的token替换为其他的词,得到增强的句子表示\(x_x^*\),如图5、6。
- Negative Pair Construction. 选取与当前bag(\(Bag_s\))不同的bag(\(Bag_t\))的表示作为负样本特征向量,选取bag表示为了能够减少噪声的影响,详见原文。
-
Training Objective. 三个loss结合,分别为Bag关系分类、CIL损失以及为了能够继承BERT这类语言模型语言理解的能力加入的MLM(掩蔽语言建模)目标函数。
-
-
实验:数据集为NYT-10、GDS、KBP,评估指标AUC、P@N、P@M。
-
消融实验
- 表4分别\(MIL_{bag}\)为去掉CIL以及\(MIL_{sent}\)使用由相同的句子构成的bag利用传统MIL来证明MIL并未充分利用bag中的句子,证明加入CIL确实充分利用了相比bag表示更细粒度的句子信息。
- 表5探究本文构造正负样本的合理性,对比不同构造方式对最终模型性能的影响。
-