中文命名实体识别及关系提取

[.*.*] [讯.*.*] [] [.*.*] [报道.*.*] [] [.*.*] [电.*.*] []
例子
关系
方法和关系抽取中上下文匹配的方式相同。
实际情况中,关系一定是要有关键词提示的。 比如: 创办了微软公司 【中文中有关键词】
是微软之父【后文中有关键词】
关系
大多数关系的关键词不是动词而是变化多端的职位 :中共中央总书记胡锦涛 微软鲍尔默
原因:中文偏正关系 *为什么将词缀放到机器学习的标记中而不是用于结 果修正? 后缀容易识别,但是向前匹配的位置难于确定 ,比如“上海研究院”。
训练模板
字的特征识别: []:前一个字 [] [] [][]:前面一个字和当前字的组合 [][] , [][]
词缀特征识别: []:前一个字的词缀 [][][][][]
其它问题
为什么没有引入词性信息? )一般的词性标注的准确率在左右,而且人民日报语
料的标注词性比较多,有种,准确率要比低一些。 )命名实体的准确率在以上,已经比词性标注要高了
。 )对于命名实体的提升的话,词性标注没有明显的帮
助办法,换句话说词性对于判错还有些用,但是对于只 会降低。
???
关系识别
关系: 穷举任意两个在一篇文章中出现的命名实体,然后判
Thanks
匹配的上下文形式化: 作用方向:是在前,在后,还是反之。 作用域::一个句子,不可有其他实体打断 :之后全文 (新华社北京讯) :之前全文 (记者北京报道) 上文,中间,下文:正则表达式,上下文只用一个窗
口,中间的文字去掉无用词,只保留名词和动词。
[] [.*地处.*] [] [] [.*位于.*] [] [] [.*坐落.*] [] [] [.*在] [] [] [.*地址是] [] [] [] [.*报道.*] [] [] [.*讯.*] [] [] [.*电.*]
受的时间内,增大训练语料比多增加分词信息有效得多 。
)分词和命名实体标注可以映射为一列,没必要增加 一个维度。比如"主 "。实验数据显示,性能没有任何变 化。
如何获得词缀信息
)从训练语料中抽取所有的命名实体,然后计算频率, 然后抽取所有词的后缀,然后计算频率,取频率高的。
)手动检查是否添加了无用的后缀,比如“上海市”在 训练语料出现很多次,提取后缀会出现“海市”为一个 高频率后缀,这些需要特殊处理。
测试结果
测试方法: 将训练集拆分,用于训练
,用于测试(篇左右)
测试结果:
校正
考虑到没有充分利用分词结果 :"{张牙舞}爪" 》利用分词结 果可以校正 校正方法:如果命名实体不是 由完整的几个词组成的,判错 校正结果:
一些问题
为什么没有在标记集中加入分词信息的一列 :江 泽 民 主 席 ) 训练时间过长,内存消耗过大。 如果训练在可接
“上海市”》“上海” 如果一个地点实体由多个词组成,那么提取它的词性, 然后取最后一个,然后判断后缀是否可忽略,如果可忽 略返回最后的,否则返回最后的后缀
“上海浦东机场”》“浦东机场” “香港特别行政区”》“香港”
如何匹配上下文
在没有标注语料的情况下,采用了自定义规则,因为从 训练语料来看,新闻题材中需要上下文匹配的情况较少 ,而且特点比较一致。
识别方法:)提取和之间的关键名词,作用域是一个 句子中不可打断,除了并列举例的人名。
有职位
)采用一个字典匹配,检查之间是否
存在的问题
命名实体识别:命名实体有很多都识别了,但是无法准 确定位一个完整的命名实体,比如“三峡坝区”
命名实体识别:外国人名
关系提取:上下文匹配的办法还比较幼稚,个人认为如 果有一个标注的训练语料的话,如果可以统计词频,确 定关键词。
中文命名实体识别及关系提取
*** *** ***
中文命名实体识别 语料:人民日报年版 主要方法:根据训练预料,由字构词 将{ }三种实体类型,和分词中的词位信息{}
做组合,其它字标记为 :
中文命名实体识别
词缀标记 :人名的姓,比如“王” :人名的后缀,比如“先生” : 地名的后缀,比如“省”,“特区”,“地区” : 组织名的后缀,比如“委员会”,“公司”
断他们是否是关系。
判断标准: )如果一个地点实体()是一个组织()的模糊前缀
。比如“上海市” “上海大白兔有限公司” )一个地点后紧接着一个组织,“上海市” 的"大白
兔有限公司" ) 在上下文中有关键词匹配成功 )中内含,“上海市闵行区派出所”
关于提取地点的核心词
如果一个地点只有一个词,那么去掉它的可以忽略的后 缀,所有可以忽略的后缀以字典形式存在一个文件中。
合集下载

基于BERT的中文简历命名实体识别

基于BERT的中文简历命名实体识别
当前中文命名实体识别的主要方法分为:基于规则模板 方法、基于机器学习的方法和基于神经网络的方法。基于规 则的方法多通过手工构造规则模板,以模板和字符串相匹配 为主要手段,选用包括关键字、统计信息、中心词、标点符号、 指示词、位置词(如尾字)等特征。这类系统依赖于知识库的 建立,缺点是系统的可移植性不好,对不同的领域需要构建不
Key words: Conditional Random Field (CRF); Chinese entity recognition; personal resume; BERT (Bidirectional Encoder Representation from Transformers)
0 引言
然而,Word2Vec 等预训练模型仍然存在无法表征一词多 义问题,因为它们主要关注的是词或者字符之间的特征,而忽 略 了 词 的 上 下 文 语 境 ,导 致 其 实 体 识 别 能 力 有 限 。 因 此 , Google 的 Devlin 等[8]提 出 了 一 种 BERT(Bidirectional Encoder Representations from Transformers)预训练语言模型,该模型使 用了 Transformers 作为算法的主要框架,使得模型能够更彻底 地捕捉语句中的双向关系,更好地表征不同语境中的句法和 语义信息。在传统命名实体数据集上,杨飘等[9]将 BERT 嵌入 到 BiGRU-CRF(Bidirectional Gated Recurrent Unit-CRF)模 型 中,在 MASA 数据集上取得 95. 43% 的平均 F1 值;李妮等[10]将 BERT 嵌 入 IDCNN-CRF(Iterated Dilated Convolutional Neural Network-CRF)模 型 中 ,在 MASA 数 据 集 上 的 F1 值 达 到 了 94. 41%;谢腾等[11]将 BERT 嵌入到 BiLSTM-CRF 中,在 MASA 数 据 集 中 的 F1 值 为 94. 65%。 在 各 领 域 数 据 集 上 ,李 灵 芳 等[12]通过使用 BERT-BiLSTM-CRF 模型,在中文电子病历数集 上的实体识别效果得到了明显的提升;吴俊等[13]将 BERT 用 在中文专业术语数据集的词向量预训练中,识别效果较浅层 机器学习模型有较为显著的提升;王月等[14]在警情文本中使 用了 BERT 来预训练词向量,使得在训练集的准确率达到了 91%。由于 BERT 具有较强的语义表达能力,因此本文通过将 该模型嵌入 BiLSTM-CRF 网络中,以提高中文简历数据集的 命名实体识别准确率。

面向命名实体抽取的大规模中医临床病历语料库构建方法研究

面向命名实体抽取的大规模中医临床病历语料库构建方法研究

1、中医临床病历文本特点
1、中医临床病历文本特点
中医临床病历文本主要包括患者的基本信息、主诉、现病史、既往史、家族 史、舌象和脉象等方面。其中,患者的基本信息包括姓名、性别、年龄等;主诉 是指患者的主要症状和体征;现病史是指患者发病后的主要症状和体征;既往史 是指患者过去患病情况;家族史是指患者家族中是否有遗传疾病;舌象是指患者 的舌质和舌苔情况;脉象是指患者的脉搏情况。
2、命名实体抽取技术研究
目前,命名实体识别技术主要分为基于规则、基于模板和基于机器学习等方 法。其中,基于规则的方法主要依靠人工编写规则进行实体识别,该方法需要大 量的人力资源和经验,而且规则的适用范围比较有限;基于模板的方法则是将模 板中的实体用待识别的实体替换掉,该方法自动化程度较高,但是需要预先准备 模板;
引言
引言
电子病历是指医疗机构或医生在诊断和治疗过程中产生的数字化医疗记录。 包含患者基本信息、症状描述、诊断结果、治疗方案等关键信息。命名实体识别 (NER)是指从文本中自动识别出具有特定意义的实体,如人名、地名、组织名 等。实体关系抽取则是从文本中提取出两个或多个实体之间的关系。在电子病历 分析中,命名实体识别和实体关系抽取技术有助于快速、准确地获取患者信息, 提高医疗质量和效率。
2、命名实体抽取技术研究
基于机器学习的方法则是利用机器学习算法对大量标注数据进行训练,从而 得到实体识别的结果,该方法具有较高的准确率和召回率。
2、命名实体抽取技术研究
针对中医临床病历文本的特点,可以结合基于规则和基于机器学习的方法进 行命名实体识别。具体来说,可以利用已有的中医临床病历文本数据集进行训练, 得到基于机器学习的命名实体识别模型;同时,针对不同的实体类型,可以编写 相应的规则进行实体识别。例如,针对患者基本信息中的姓名、性别、年龄等实 体,可以编写相应的规则进行识别;针对症状和体征中的舌象和脉象等实体,可 以利用基于机器学习的方法进行识别。

法律文档关键信息抽取技术

法律文档关键信息抽取技术

法律文档关键信息抽取技术法律文档关键信息抽取技术法律文档关键信息抽取技术简介人们在日常生活和工作中常常需要处理大量的法律文档,例如合同、法律文件和诉讼文件等。

然而,这些文档通常都是大篇幅的文字材料,其中包含了大量的信息。

为了能够高效地处理和利用这些文档,研究人员开发了一种称为法律文档关键信息抽取技术的方法。

法律文档关键信息抽取技术是一种自然语言处理技术,旨在从法律文档中提取出其中的关键信息。

这些关键信息可以是法律文件的标题、案件的相关方和背景、法律条款和条文等。

通过这种技术,用户可以快速地了解文档的主要内容和要点,从而提高处理文档的效率。

在实际应用中,法律文档关键信息抽取技术通常涉及以下几个方面的任务:命名实体识别、关系抽取、事件抽取和法律条款抽取。

命名实体识别是指从文本中识别出具有特定意义的词或短语,例如人名、地名、组织机构名等。

在法律文档中,识别出相关方的名称是非常重要的,因为这些名称通常与案件的背景和进展密切相关。

关系抽取是指从文本中抽取出实体之间的关系,例如合同的签署方、案件的原告和被告之间的关系等。

通过关系抽取,用户可以了解文档中不同实体之间的联系,从而更好地理解文档的内容。

事件抽取是指从文本中抽取出具有时间、地点和行为等要素的事件描述。

在法律文档中,案件的经过和详情通常以事件的形式呈现,通过事件抽取,可以更加直观地了解案件的发展过程。

法律条款抽取是指从文本中抽取出法律文件中的具体条款和条文。

法律条款往往是法律文件的核心内容,通过抽取这些信息,可以更好地理解法律文件的要求和规定。

为了实现上述任务,研究人员通常采用一些机器学习和自然语言处理的方法。

他们首先构建一个训练集,其中包含了大量已标注的法律文档,然后使用这些数据训练一个模型。

这个模型可以自动学习到从文本中提取关键信息的规律和模式,从而实现自动化的信息抽取。

总之,法律文档关键信息抽取技术是一种非常实用的技术,可以帮助用户快速地理解和处理大量的法律文档。

嵌入知识图谱信息的命名实体识别方法

嵌入知识图谱信息的命名实体识别方法

第50卷第3期2021年5月内蒙古师范大学学报(自然科学版)Journal of Inner Mongolia Normal University(Natural Science Edition)Vol.50No.3May2021嵌入知识图谱信息的命名实体识别方法阎志刚,李成城,林民(内蒙古师范大学计算机科学技术学院,内蒙古呼和浩特010022)摘要:在大规模文本语料库上预先训练的BERT(bidirectional encoder representation from transformers, BERT)等神经语言表示模型可以较好地从纯文本中捕获丰富的语义信息。

但在进行中文命名实体识别任务时,由于命名实体存在结构复杂、形式多样、一词多义等问题,识别效果不佳。

基于知识图谱可以提供丰富的结构化知识,从而更好地进行语言理解,提出了一种融合知识图谱信息的中文命名实体识别方法,通过知识图谱中的信息实体增强语言的外部知识表示能力。

实验结果表明,与BERT、OpenAI GPT.ALBERT-BiLSTM-CRF等方法相比,所提出的方法有效提升了中文命名实体的识别效果,在MSRACMicrosott Research Asia,MSRA)与搜狐新闻网标注数据集上F i值分别达到了95.4%与93)%。

关键词:自然语言处理;命名实体识别;知识图谱;深度学习;知识嵌入中图分类号:TP391.1文献标志码:A文章编号:1001—8735(2021)03—0275—08doi:10.3969/j.issn.1001—8735.2021.03.014命名实体识别(named entity recognition,NER)是将文本中的命名实体定位并分类为预定义实体类别的过程[]。

近年来,基于深度学习的NER模型成为主导,深度学习是机器学习的一个领域,它由多个处理层组成,可以学习具有多个抽象级别的数据表示[2]。

神经网络模型RNN[](recurrent neural network, RNN)有长期记忆的性能并能解决可变长度输入,在各个领域都表现出良好的性能,但会伴有梯度消失的问题。

实体抽取(命名实体识别)调研报告

实体抽取(命名实体识别)调研报告

实体抽取(命名实体识别)调研报告⼀.介绍实体抽取也就是命名实体识别(Named Entity Recognition ) ,简称为NER,命名实体识别是是⾃然语⾔处理(NLP)中⼀项最基础的⼯作,它的任务就是识别出⽂本当中特定意义的实体,MCU将其分为三⼤类:时间类(TIMEX),实体类(EMAMEX)和数字类(NUMEX),三⼤类⼜被分为七⼩类(Location, Person, Organization, Money, Percent, Date, Time),⽐如实践类包含⼈名,地名,机构名三类,时间类包含⽇期和时间两类,数字类包含货币和百分⽐两类。

当然我们也可以⾃⼰定义⼀个新的实体类别⼆.命名实体识别发展的历史在命名实体识别⽅⾯的研究,国外开始的⽐较早,⽽国内起步则⽐较晚。

在1991年的IEEE⼈⼯智能应⽤会议上,RAU⾸次发表了有关抽取和识别的⽂章,其主要采⽤基于⼿⼯编写规则的⽅法2。

在MCU-6正式将命名实体识别引⼊,作为⼀项基本的任务之后,随后⼀系列的国际重要会议都将命名实体识别作为⼀项指定的任务,在最早的⼀批会议中,如MCU-7会议评测的系统,⼤多数都是基于⼿⼯编写规则的⽅法。

随着慢慢地发展,在CoNNLL-2003会议上,所有的参赛者都是使⽤的基于统计的机器学习⽅法。

近年来,深度学习发展⼗分迅速。

深度学习的⽅法在NER任务中野得到了运⽤,⽐如RNN-CRF,CNN-CRF以及最近⽐较流⾏的BiLSTM-CRF。

命名实体识别在各个领域发挥着重要的作⽤。

三.NER的实现⽅法及其优劣从NER的发展历史来看,我们⼤致可以将其⽅法做出以下分类:(1)基于规则和字典的⽅法基于规则与字典的⽅法是命名实体识别任务中最古⽼的⽅法。

利⽤⼿⼯编写的规则,提取特征,⽐如关键词,指⽰词,位置词等,收集特征词,并且给每⼀个规则都赋予⼀个权值,当规则冲突的时候,选择权值最⾼的规则进⾏命名实体类型。

由于是最早的命名实体⽅法,所以它的限制也很⼤,当提取规则⽐较适合的时候,它的优越性是很⼤的。

基于知识图谱的关系提取方法

基于知识图谱的关系提取方法

基于知识图谱的关系提取方法知识图谱作为一种用于表示和储存知识的结构化数据模型,近年来在自然语言处理和信息提取领域得到了广泛应用。

关系提取是一项重要的任务,其目的是从未标注的文本中发现实体之间的语义关系。

本文将介绍基于知识图谱的关系提取方法,以帮助读者更好地理解和应用该技术。

一、知识图谱简介知识图谱是一种由实体(节点)和它们之间的关系(边)构成的图结构,旨在表示真实世界中的实体和其语义关系。

知识图谱可以通过自动化的方式从大规模文本数据中提取出来,成为一种重要的知识表示和推理工具。

二、关系提取的挑战关系提取的主要挑战之一是语义的多样性和复杂性。

同一个实体对可能存在多种不同类型的关系,而且这些关系可能在不同的文本上下文中表达。

此外,语言的表达方式也可能因人而异,导致同一关系的表达方式多种多样。

三、基于知识图谱的关系提取方法基于知识图谱的关系提取方法主要包括以下几个步骤:1. 实体识别:首先,需要从文本中识别出实体,并将它们映射到知识图谱中对应的节点。

实体识别可以通过命名实体识别技术(NER)来实现。

2. 关系抽取:在确定实体之后,需要从文本中抽取出它们之间的关系。

这一步可以采用基于规则的方法,如基于模式匹配或关键词匹配的方法,来发现特定关系的出现。

另外,也可以利用机器学习方法,如支持向量机、条件随机场等来进行关系分类和抽取。

3. 关系分类:在抽取出关系后,需要对其进行分类,并将其归类到预定义的关系类型中。

关系分类可以通过基于知识图谱的方法,如基于路径特征的方法和基于图表示学习的方法来实现。

4. 知识图谱构建:最后,将从文本中提取出的关系信息加入到现有的知识图谱中,以不断完善和更新知识图谱的结构。

这一步可以通过自动化的方式,如基于规则的方法和基于统计的方法来实现。

四、实例分析为了更好地理解基于知识图谱的关系提取方法,我们以人物关系提取为例进行实例分析。

假设我们有一段文本:“乔布斯创立了苹果公司,并和沃兹尼亚克共同开发了第一台苹果电脑。

中文命名实体识别任务的评估方法

中文命名实体识别任务的评估方法中文命名实体识别(Named Entity Recognition,简称NER)是自然语言处理领域中的一项重要任务,旨在从文本中识别出具有特定意义的实体,如人名、地名、组织机构名等。

对于NER任务的评估方法,是评估模型性能和效果的重要依据。

本文将介绍几种常见的中文NER评估方法。

一、数据集划分在进行NER任务的评估时,首先需要将数据集划分为训练集、验证集和测试集。

训练集用于训练模型,验证集用于调整模型的超参数,测试集用于评估模型的性能。

划分数据集时应保持数据的随机性和平衡性,以确保评估结果的准确性和可靠性。

二、评估指标1. 准确率(Precision)准确率是指模型预测为正样本的实体中,真正为正样本的比例。

计算公式为:准确率 = 正确预测的实体数量 / 预测的实体数量。

2. 召回率(Recall)召回率是指模型正确预测为正样本的实体数量占所有真实正样本实体数量的比例。

计算公式为:召回率 = 正确预测的实体数量 / 真实的实体数量。

3. F1值F1值是准确率和召回率的调和平均值,综合考虑了模型的精确性和全面性。

计算公式为:F1值 = 2 * (准确率 * 召回率) / (准确率 + 召回率)。

三、评估方法1. 精确匹配评估精确匹配评估方法是将模型预测的实体与真实实体进行精确匹配,只有完全匹配的实体才被认为是正确的。

该方法简单直观,但对于模型预测的实体边界稍有偏差的情况,将被视为错误。

因此,在使用精确匹配评估方法时,需要对实体边界进行严格限制。

2. 宽松匹配评估宽松匹配评估方法是允许模型预测的实体与真实实体存在一定的边界偏差,只要两者存在重叠部分即视为正确。

该方法相对于精确匹配评估方法更加宽容,能够更好地适应实际应用场景中实体边界模糊的情况。

3. 基于BIO标注的评估BIO标注是一种常用的实体标注方式,将每个字分为三类:B(Begin),表示实体的开头;I(Inside),表示实体的中间部分;O(Outside),表示非实体。

HMM与自动规则提取相结合的中文命名实体识别

修正。这种方法可 以有效的发挥二者的优势,充分利用 N E的内部结构特征和上下文信息, 克服了二者简单结合所带来的识别结果不易融合的缺点,提高了系统对中文 N E的整体识别
效果。
1 系统概述
我们的系统包括两个部分,一是基于 HM的 N 识别部分,二是规则修正部分。系统的 M E 结构图如图 1 所示。基于 HM的 N 识别部分的输入是己分词且标注了词性的句子,它的识 M E 别结果又作为规则修正部分的输入,整个系统的输出是标注了 N 标记的句子。下面我们就 E 将对系统做详细介绍。
・2 4 。 3
其中 PS是指复合 N O E的词性串序列。Po是该词性串序列出现的概率,由 PS出现的 r O 次数除以词性串序列总数得到。 h{ s N N 为 PS N N I i{ z O 或特征词对应的 N 类别。 E 为了满足使用规则的前提条件,我们规定只有 N E的内部词性序列和特征词对应同一种 N E类别才表示规则匹配,此时才能修改 HM的识别结果。这与传统的规则匹配方法不同。 M 首先, 传统的规则方法是独立运行的, 它与 HM M 一样直接对原始语料进行处理, 只要规则匹 配就表示识别成功。 但是, 这种做法存在一个明显的不足,即当同一个序列经 tM和规则处 B 1
两大任务之一,可见其重要程度。 N E的识别方法主要有两种,一种是基于规则的方法,它的识别系统比较简单,但是必 须人工制定规则,费时费力,且系统的健壮性和移植性不好。现在的N 识别更倾向于基于 E 统计的机器学习方法, 它的健壮性和灵活性都比规则的方法好, 且代价小. 但是需要大规模
的语料进行A练。具有代表性的机器学习 算法有HM1Mxmm rpl Mmr-ae MI ai Etoy1 eoy s 2 , u n 3 , b d

基于文献的中文命名实体识别算法适用性分析研究


( a ) 时 问 ( ie 、 Dt 、 a Tm ) 百分 数 ( e et e 、 币 ( o Pr na ) 货 c g M— nt y vl ) 身 份 、 er ae ¨ 及 a u 领域 专 业 特有 的命 名 实体 ,
如 : 质 或 蛋 白质 名称 、 学 分子 式 、 物 化 学 反 应 、 物 化 生 检
构 名 、 有 名 词 等 。 首 先 对我 国 关 于命 名 实 体识 别研 究 的 文 献 进 行 了 总 结 , 出命 名 实体 识 别 的 主要 方 法及 模 型 。 专 给
并针 对 文献 中对 这 些命 名 实体 识 别 方 法 的 效果 进 行 统计 分析 , 讨 各 种 识 别 对 象 、 别模 型 的 效 果 及 适 用性 。经 过 探 识
第2 9卷 第 9期 21 0 0年 9月




Vo. 9 No 9 12 . S p 2 1 e. 00
J OURNAL OF I ELL GENCE NT I
基于文献的中文命名实体识别算法适用性分析研究
Ap l a i t ay i o i ee Na d En i c g i o eh d B s d o tr t r s pi bl y An lss f Ch n s me tt Re o n t n M t o a e n Li au e c i y i e
研究命名实体识别的核心 中文文献中设计 的算法 效率
进行统计分析 , 以期 对 命 名 实 体 等 特 殊 文 本 的 识 别 提 供 一 些 参 考 性 的 意 见 , 进 特 殊 文 本 特 征 提 取 研 究 的 促
收稿 日期 :0 0 0 — 6 2 1 — 4 1 修回 日期 :0 0 0 — 4 2 1 — 6 2

部首感知的中文医疗命名实体识别

第34卷第12期2020年]2月Vol.34,No.12Dec.,2020中文信息学报JOURNAL OF CHINESE INFORMATION PROCESSING文章编号:1003-0077(2020)12-0054-11部首感知的中文医疗命名实体识别李丹徐童「2,郑毅3,王詰锋?,陈恩红「2(1.大数据分析与应用安徽省重点实验室(中国科学技术大学),安徽合肥230027;2.中国科学技术大学计算机科学与技术学院•安徽合肥230027;3.华为技术有限公司,浙江杭州310052)摘要:人工智能技术的发展推动了医疗领域的智能化,为提升医疗效率、改善医疗水平提供了新的助力。

同时,这一新的趋势也催生了海量的电子病历文本,其所蕴含的丰富信息具有巨大的潜在挖掘与应用价值。

然而,当前中文电子病历的命名实体识别研究工作并没有全面考虑中文及中文医疗领域的特殊性,而是将面向通用数据集的模型迁移到医疗领域的实体类型中,分析效果较为有限。

针对这一问题,该文设计了长短期记忆网络与条件随机场的联合模型并引入BERT模型;在此基础之上,考虑到医疗领域命名实体鲜明的部首特征,通过将部首信息编码到字向量中•并且结合部首信息修改条件随机场层得分函数的计算方式.有效地提升了医疗领域命名实体的抽取能力。

通过两项电子病历数据集的实验结果表明•该文提出的模型整体效果略高于通用的实体识别模型,并对疾病诊断等特定类型的实体词的识别效果具有较为明显的提升。

关键词:命名实体识别;长短期记忆网络;条件随机场;BERT中图分类号:TP391文献标识码:ARadical-Aware Named Entity Recognition for Chinese Medical RecordsLI Dan12,XU Tong112,ZHENG Yi3,WANG Zhefeng3,CHEN Enhong1'2(1.Anhui Province Key Laboratory of Big Data Analysis and Application*University of Science and Technology of China,Hefei,Anhui230027,China;2.School of Computer Science and Technology*University ofScience and Technology of China・Hefei,Anhui230027»China;3.Huawei Technologies Co.Ltd»Hangzhou,Zhejiang310052»China)Abstract:The general named entity recognition fails to capture the features in Chinese characters as well as Chinese medical records.In this paper,we integrate the BERT into a joint model of bi-directional long short-term memory and conditional random fields for better performance.Considering the unique feature of radicals for medical entities* we encode the radical information into the word vector,and then modify the scoring function of the CRF layer.Ex­periments on two real-world electronic medical record datasets validate that the proposed method outperforms the state-of-the-art baseline methods,especially for the disease-related named entities.Keywords:named entity recognition;long short-term memory;conditional random field;BERT()引言问答网站也随之涌现,使得海量的医疗诊断信息以电子文档的形式呈现在人们面前。

  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
相关文档
最新文档