1.1.1 基于Word2Vec的文本语义特征训练提取
(1)科研成果论文中文文本词语分词。将科研成果论文中文文本转换为ASCLL字符串,并以空格为词语划分标准[9],把论文中文文本词语设成wj,k,代表第j个文本中第k类词语的分词,其中j={1, 2, ..., ||J}, J代表科研成果论文中文文本集合数目。 k={1, 2, ..., m}, m表示词语类别数目。全部文本中词语wj,k的数目设成M,多个文本中同一ASCLL字符串,看做相同词语。
(2)使用Word2Vec工具抽取语义特征。科研成果论文中文文本词向量初始化赋值过程中,第j个、第i个文本中相同词语,其词向量vj, k、 v i, k一致,则vj, k =v i, k。
将wj, k使用Word2Vec工具,结合科研成果论文中文文本词语上下文关系,抽取语义特征后转换为词向量模式[10]。图1是Word2Vec工具抽取语义特征的技术原理。
图1 Word2Vec工具抽取语义特征Fig.1 Semantic features extracted by Word2Vec tool
Word2Vec工具需要使用CBOW模型训练,此模型的基本原理是:词的前后N个词,直接影响词汇出现概率。为此,可以通过科研成果论文中文文本上下文信息,预测目前科研成果论文中文文本词语的出现概率。
如图1所示,由Word2Vec工具运算设置某个上下文中词语wj,k概率是q,词向量是此工具的训练副产物,q数值越高的词语,其代表性越差,作为候选关键词的概率便越低。将论文中文文本集合转换为词汇表U,U中各个词语均对应一个wj,k。词语上下文样本的设计方法是:针对论文中文文本集合中随机一个词语wj, k,其上下文信息设成b ( wj, k ),提取b ( wj, k ),构建为元组[ b ( wj, k ), wj, k ]。将此元组输入神经网络训练,输入的各个节点单元均属于一个论文中文文本词语向量,向量的各个分量都是词向量,训练时,此量可变[11-12]。
在图1中,将各个论文中文文本词语wj,k,使用Word2Vec工具均把它映射为词向量vj, k。映射后词向量vj,k代表第j个文本中第k类词语的语义特征。
因科研成果论文中文文本词向量维数为指定值,所以使用文本的词平均值,描述文本词向量。假如科研成果论文中文文本集合中,某文本中词语的集合是υ={wj,1, wj,2, ..., wj, k},词语wj, k映射的词向量是vj, k,则此文本的向量化处理结果是:
1.1.2 基于卷积神经网络的候选关键词集合生成模型
将Vj,k作为科研成果论文中文文本候选关键词的分类特征,输入卷积神经网络,以分类的方式,提取中文文本候选关键词集合。
将论文中文文本词向量Vj,k输入输入层后,再传递到卷积层,卷积层使用卷积核提取Vj,k的深层属性,输出论文中文文本词向量Vj,k特征图至最大池化层,此层筛选提取代表性最显著的文本语义特征信息,在输出层使用softmax函数进行分类,生成候选关键词集合[13]。
(1)卷积层
卷积运算方法是:
式(2)中, Yi 、 zji 、 bi分别是卷积层输出的论文中文文本词向量深层属性、卷积核、偏置项;V ′j 、f分别代表输入的语义特征矩阵子集(词向量矩阵子集)、激活函数。
(2)池化层
使用最大池化方法,使用1个卷积核,便可提取Yi的最具代表性的特征属性(平均信息熵、词性、位置三种属性),此类语义特征属性是y=
。
(3)输出层
输出层中,
输入后,使用分类函数对y进行分类,便可判断y是否属于候选关键词的语义特征属性。如果是。便将其所属文本词语,作为候选关键词。此分类函数的输出结构,是y属于候选关键词的概率分布[14-15]。y的分类输出结果o,属于科研成果论文中文文本候选关键词s的概率是:
损失函数是:
上式中,卷积神经网络模型的训练目标是保证ε最小化。ϖTk (y) 为候选关键词权重; b为偏置向量。
输出单元输出的候选关键词是:
s=Argmax (ϖy + b )(5)
式(5)中,ϖ代表权重矩阵。