深度学习--biLSTM_CRF 命名实体识别

前文

中文分词、词性标注、命名实体识别是自然语言理解中，基础性的工作，同时也是非常重要的工作。在很多NLP的项目中，工作开始之前都要经过这三者中的一到多项工作的处理。在深度学习中，有一种模型可以同时胜任这三种工作，而且效果还很不错--那就是biLSTM_CRF。

biLSTM，指的是双向LSTM；CRF指的是条件随机场。

biLSTM词性标注

本文是以字为单位进行处理。从下往上看，w0,w1...表示句子里面的字，经过biLSTM处理，输出每个字对应每个标签的分数，我们将最大数值表示对该字预测的标签。既然，biLSTM已经能够进行满足词性标注，那为什么还要再最后加上CRF层呢？

biLSTM词性标注

从这幅图中，可以看出，预测结果明显是错的，那为什么会出现这种错误呢，因为biLSTM只能够预测文本序列与标签的关系，而不能预测标签与标签之间的关系，标签之间的相互关系就是CRF中的转移矩阵。

biLSTM_CRF词性标注

这就是完整的biLSTM_CRF的模型图，文本序列经过biLSTM模型处理，输出结果传入CRF层，最后输出预测结果。
下面，进入正题，biLSTM_CRF模型在tensorflow中的实现。

运行环境

python 3.6
tensorflow 1.2
本文GITHUB 欢迎Star和Fork。
使用同样方法，构造的中文分词。中文分词GITHUB

正文

1.数据预处理
2.模型构建
3.模型训练与测试
4.模型验证
5.总结

1.数据预处理

首先是将预测数据进行处理，转成模型能够识别的数字。

数据原格式

数据是以列形式存储，截图翻转了一下。

我从训练文本中，抽取频数在前5000的字，实际只抽取到了4830左右个字。加入'<PAD>','<UNK>','<NUM>'，分别表示填充字符，未知字符，数字字符。一起存入字典。

字典

标签同样也有对应的字典。

# 将tag转换成数字
tag2label = {"O": 0, "B-PER": 1, "I-PER": 2, "B-LOC": 3, "I-LOC": 4, "B-ORG": 5, "I-ORG": 6}

依据字典与标签字典，将文字与标签分别转成数字。第一行是文本，第二行是标签。

文本与标签

下一步是生成batch的操作。
生成batch后，需要对batch内句子padding到统一的长度，并计算每句的真实长度。

2.模型构建

采用双向LSTM对序列进行处理，将输出结果进行拼接。输入shape[batch,seq_Length,hidden_dim]，输出shape[batch,seq_length,2*hidden_dim]。

        with tf.name_scope('biLSTM'):
            cell_fw = tf.nn.rnn_cell.LSTMCell(pm.hidden_dim)
            cell_bw = tf.nn.rnn_cell.LSTMCell(pm.hidden_dim)
            outputs, outstates = tf.nn.bidirectional_dynamic_rnn(cell_fw=cell_fw, cell_bw=cell_bw,inputs=self.embedding,
                                                                 sequence_length=self.seq_length, dtype=tf.float32)
            outputs = tf.concat(outputs, 2)#将双向RNN的结果进行拼接
            #outputs三维张量，[batchsize,seq_length,2*hidden_dim]

我们从本文的第一幅图中，可以看出，整个biLSTM完整的输出格式是[batch,seq_length,num_tag]。num_tag是标签的数量，本实验中是标签数量是7。所以我们需要一个全连接层，将输出格式处理一下。

        with tf.name_scope('output'):
            s = tf.shape(outputs)
            output = tf.reshape(outputs, [-1, 2*pm.hidden_dim])
            output = tf.layers.dense(output, pm.num_tags)
            output = tf.contrib.layers.dropout(output, pm.keep_pro)
            self.logits = tf.reshape(output, [-1, s[1], pm.num_tags])

self.logits就是需要输入CRF层中的数据。代码的第三行，对output的变形，表示将[batch,seq_length,2hidden_dim]变成[batchseq_length,2*hidden_dim]，最后处理时再变形为[batch,seq_length,num_tag]。
下面就是CRF层的处理：

        with tf.name_scope('crf'):
            log_likelihood, self.transition_params = crf_log_likelihood(inputs=self.logits, tag_indices=self.input_y, sequence_lengths=self.seq_length)
            # log_likelihood是对数似然函数，transition_params是转移概率矩阵
            #crf_log_likelihood{inputs:[batch_size,max_seq_length,num_tags],
                                #tag_indices:[batchsize,max_seq_length],
                                #sequence_lengths:[real_seq_length]
            #transition_params: A [num_tags, num_tags] transition matrix
            #log_likelihood: A scalar containing the log-likelihood of the given sequence of tag indices.

这一步，是调用from tensorflow.contrib.crf import crf_log_likelihood函数，求最大似然函数，以及求转移矩阵。最大似然函数前加上"-"，可以用梯度下降法求最小值；

        with tf.name_scope('loss'):
            self.loss = tf.reduce_mean(-log_likelihood) #最大似然取负，使用梯度下降

转移矩阵可以帮助维特比算法来求解最优标注序列。

    def predict(self, sess, seqs):
        seq_pad, seq_length = process_seq(seqs)
        logits, transition_params = sess.run([self.logits, self.transition_params], feed_dict={self.input_x: seq_pad,
                                                                                               self.seq_length: seq_length,
                                                                                               self.keep_pro: 1.0})
        label_ = []
        for logit, length in zip(logits, seq_length):
            #logit 每个子句的输出值，length子句的真实长度，logit[:length]的真实输出值
            # 调用维特比算法求最优标注序列
            viterbi_seq, _ = viterbi_decode(logit[:length], transition_params)
            label_.append(viterbi_seq)
        return label_

3.模型训练与测试

训练时，共进行12次迭代，每迭代4次，将训练得到的结果，保存到checkpoints；loss的情况，保留到tensorboard中；每100个batch,输出此时的训练结果与测试结果。

模型训练

模型的loss由最初在训练集54.93降到2.29，在测试集上由47.45降到1.73。我们看下，保存的模型在验证集上的效果。

4.模型验证

我从1998年的人民网的新闻素材中，随机抽取了几条语句。

模型验证

ORG表示组织名词，LOC表示地理名词,PER表示人名。从验证结果上看，模型在命名实体识别上，效果还可以。

5.总结

模型训练数据从github上获取的，在训练时使用未训练的字向量，不知道使用预训练字向量是否可以提高准确率。受限于电脑的性能，训练数据仅使用50000条；提高机器性能，加大训练数据的量，准确性应该可以进一步提高。写这篇博客，主要是介绍实验过程，希望能够给需要的人带来帮助。

参考

https://zhuanlan.zhihu.com/p/44042528

最后编辑于：2019.02.11 19:56:28

人面猴
序言：七十年代末，一起剥皮案震惊了整个滨河市，随后出现的几起案子，更是在滨河造成了极大的恐慌，老刑警刘岩，带你破解...
沈念sama阅读 159,835评论 4赞 364
死咒
序言：滨河连续发生了三起死亡事件，死亡现场离奇诡异，居然都是意外死亡，警方通过查阅死者的电脑和手机，发现死者居然都...
沈念sama阅读 67,598评论 1赞 295
救了他两次的神仙让他今天三更去死
文/潘晓璐我一进店门，熙熙楼的掌柜王于贵愁眉苦脸地迎上来，“玉大人，你说我怎么就摊上这事。” “怎么了？”我有些...
开封第一讲书人阅读 109,569评论 0赞 244
道士缉凶录：失踪的卖姜人
文/不坏的土叔我叫张陵，是天一观的道长。经常有香客问我，道长，这世上最难降的妖魔是什么？我笑而不...
开封第一讲书人阅读 44,159评论 0赞 213
港岛之恋（遗憾婚礼）
正文为了忘掉前任，我火速办了婚礼，结果婚礼上，老公的妹妹穿的比我还像新娘。我一直安慰自己，他们只是感情好，可当我...
茶点故事阅读 52,533评论 3赞 287
恶毒庶女顶嫁案：这布局不是一般人想出来的
文/花漫我一把揭开白布。她就那样静静地躺着，像睡着了一般。火红的嫁衣衬着肌肤如雪。梳的纹丝不乱的头发上，一...
开封第一讲书人阅读 40,710评论 1赞 222
城市分裂传说
那天，我揣着相机与录音，去河边找鬼。笑死，一个胖子当着我的面吹牛，可吹牛的内容都是我干的。我是一名探鬼主播，决...
沈念sama阅读 31,923评论 2赞 313
双鸳鸯连环套：你想象不到人心有多黑
文/苍兰香墨我猛地睁开眼，长吁一口气：“原来是场噩梦啊……” “哼！你这毒妇竟也来了？” 一声冷哼从身侧响起，我...
开封第一讲书人阅读 30,674评论 0赞 203
万荣杀人案实录
序言：老挝万荣一对情侣失踪，失踪者是张志新（化名）和其女友刘颖，没想到半个月后，有当地人在树林里发现了一具尸体，经...
沈念sama阅读 34,421评论 1赞 246
护林员之死
正文独居荒郊野岭守林人离奇死亡，尸身上长有42处带血的脓包…… 初始之章·张勋以下内容为张勋视角年9月15日...
茶点故事阅读 30,622评论 2赞 245
白月光启示录
正文我和宋清朗相恋三年，在试婚纱的时候发现自己被绿了。大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
茶点故事阅读 32,115评论 1赞 260
活死人
序言：一个原本活蹦乱跳的男人离奇死亡，死状恐怖，灵堂内的尸体忽然破棺而出，到底是诈尸还是另有隐情，我是刑警宁泽，带...
沈念sama阅读 28,428评论 2赞 254
日本核电站爆炸内幕
正文年R本政府宣布，位于F岛的核电站，受9级特大地震影响，放射性物质发生泄漏。R本人自食恶果不足惜，却给世界环境...
茶点故事阅读 33,114评论 3赞 238
男人毒药：我在死后第九天来索命
文/蒙蒙一、第九天我趴在偏房一处隐蔽的房顶上张望。院中可真热闹，春花似锦、人声如沸。这庄子的主人今日做“春日...
开封第一讲书人阅读 26,097评论 0赞 8
一桩弑父案，背后竟有这般阴谋
文/苍兰香墨我抬头看了看天上的太阳。三九已至，却和暖如春，着一层夹袄步出监牢的瞬间，已是汗流浃背。一阵脚步声响...
开封第一讲书人阅读 26,875评论 0赞 197
情欲美人皮
我被黑心中介骗来泰国打工，没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留，地道东北人。一个月前我还...
沈念sama阅读 35,753评论 2赞 276
代替公主和亲
正文我出身青楼，却偏偏与公主长得像，于是被迫代替她去往敌国和亲。传闻我的和亲对象是个残疾皇子，可洞房花烛夜当晚...
茶点故事阅读 35,649评论 2赞 271