0409_82_李保利_信息抽取研究综述

信息抽取研究综述ж

李保利 陈玉忠 俞士汶

(北京大学计算机科学与技术系 计算语言学研究所 北京 100871)

摘要:信息抽取研究旨在为人们提供更有力的信息获取工具,以应对信息爆炸带来的严重挑战。与信息检索不同,

信息抽取直接从自然语言文本中抽取事实信息。过去十多年来,信息抽取逐步发展成为自然语言处理领域的一个重要分

支,其独特的发展轨迹——通过系统化、大规模地定量评测推动研究向前发展,以及某些成功启示,如部分分析技术的

有效性、快速NLP系统开发的必要性,都极大地推动了自然语言处理研究的发展,促进了NLP研究与应用的紧密结合。

回顾信息抽取研究的历史,总结信息抽取研究的现状,将有助于这方面研究工作向前发展。

关键词:自然语言处理;信息抽取;信息检索;命名实体识别

中图法分类号:TP391

RESEARCH ON INFORMATION EXTRACTION: A SURVEY

LI Bao-Li, CHEN Yu-Zhong, YU Shi-Wen

Department of Computer Science and Technology, Peking University, Beijing 100871

Abstract: The research on Information Extraction aims at providing more powerful information access tools to help people

overcome the problem of information overloading. Unlike Information Retrieval, Information Extraction Systems extract factual

information directly from natural language texts. In the last decade, Information Extraction has become an important sub-field of

Natural Language Processing. Its unique development track, i.e. accelerating research via systematical and large scale evaluation,

and some successful experience, such as the effectiveness of partial-parsing techniques and the importance of fast development

cycles, have made it a great and most important impetus to the research of NLP in the last decade. Moreover, Information

Extraction has built a more effective connection between NLP researchers and NLP system developers. It will be helpful to review

the history and investigate the state of the art of Information Extraction.

Key words: Natural Language Processing; Information Extraction; Information Retrieval; Named Entity Recognization

1. 引言

随着计算机的普及以及互联网(WWW)的迅猛发展,大量的信息以电子文档的形式出现在人们面

前。为了应对信息爆炸带来的严重挑战,迫切需要一些自动化的工具帮助人们在海量信息源中迅速找到

真正需要的信息。信息抽取(Information Extraction)研究正是在这种背景下产生的。

信息抽取系统的主要功能是从文本中抽取出特定的事实信息(factual information)。比如,从新闻报

道中抽取出恐怖事件的详细情况:时间、地点、作案者、受害者、袭击目标、使用的武器等;从经济新

闻中抽取出公司发布新产品的情况:公司名、产品名、发布时间、产品性能等;从病人的医疗记录中抽

取出症状、诊断记录、检验结果、处方等等。通常,被抽取出来的信息以结构化的形式描述,可以直接

存入数据库中,供用户查询以及进一步分析利用。

与信息抽取密切相关的一项研究是信息检索,但信息抽取与信息检索存在差异,主要表现在三个方 ж本文得到国家自然科学基金项目(69973005)、国家973项目(G1998030507-4)和北大985项目支持。 作者李保利,男,1971年生,博士研究生,主要研究方向:中文信息处理。陈玉忠,男,1963年生,副教授,博士研究

生,主要研究方向:中文信息处理、机器翻译等。俞士汶,男,1938年生,教授,博士生导师,主要研究方向:中文信

息处理、计算语言学等。 面:

① 功能不同。信息检索系统主要是从大量的文档集合中找到与用户需求相关的文档列表;而信息

抽取系统则旨在从文本中直接获得用户感兴趣的事实信息。

② 处理技术不同。信息检索系统通常利用统计及关键词匹配等技术,把文本看成词的集合(bags

of words),不需要对文本进行深入分析理解;而信息抽取往往要借助自然语言处理技术,通过

对文本中的句子以及篇章进行分析处理后才能完成。

③ 适用领域不同。由于采用的技术不同,信息检索系统通常是领域无关的,而信息抽取系统则是

领域相关的,只能抽取系统预先设定好的有限种类的事实信息。

另一方面,信息检索与信息抽取又是互补的。为了处理海量文本,信息抽取系统通常以信息检索系

统(如文本过滤)的输出作为输入;而信息抽取技术又可以用来提高信息检索系统的性能。二者的结合

能够更好地服务于用户的信息处理需求。

信息抽取虽然需要对文本进行一定程度的理解,但与真正的文本理解(Text Understanding)还是不

同的。在信息抽取中,用户一般只关心有限的感兴趣的事实信息,而不关心文本意义的细微差别以及作

者的写作意图等深层理解问题[1]。因此,信息抽取只能算是一种浅层的或者说简化的文本理解技术。

一般来说,信息抽取系统的处理对象是自然语言文本尤其是非结构化文本。但广义上讲,除了电子

文本以外,信息抽取系统的处理对象还可以是语音、图像、视频等其他媒体类型的数据。在这里,我们

只讨论狭义上的信息抽取研究,即针对自然语言文本的信息抽取。

下面首先回顾了信息抽取研究发展的历史,然后介绍信息抽取系统的体系结构以及一些关键技术,

最后对信息抽取研究未来的方向做了展望。

2. 信息抽取研究的发展历史

从自然语言文本中获取结构化信息的研究最早开始于20世纪60年代中期,这被看作是信息抽取技

术的初始研究,它以两个长期的、研究性的自然语言处理项目为代表[2]。

美国纽约大学开展的Linguistic String项目[3]开始于60年代中期并一直延续到80年代。该项目的主

要研究内容是建立一个大规模的英语计算语法,与之相关的应用是从医疗领域的X光报告和医院出院记

录中抽取信息格式(Information Formats),这种信息格式实际上就是现在我们所说的模板1(Templates)。

另一个相关的长期项目是由耶鲁大学Roger Schank及其同事在20世纪70年代开展的有关故事理解

的研究。由他的学生Gerald De Jong设计实现的FRUMP系统[4]是根据故事脚本理论建立的一个信息抽

取系统。该系统从新闻报道中抽取信息,内容涉及地震、工人罢工等很多领域或场景。该系统采用了期

望驱动(top-down,脚本)与数据驱动(bottom-up,输入文本)相结合的处理方法。这种方法被后来的

许多信息抽取系统采用。

从20世纪80年代末开始,信息抽取研究蓬勃开展起来,这主要得益于消息理解系列会议(MUC,

Message Understanding Conference)的召开。正是MUC系列会议使信息抽取发展成为自然语言处理领域

一个重要分支,并一直推动这一领域的研究向前发展。

从1987年开始到1998年,MUC会议共举行了七届,它由美国国防高级研究计划委员会(DARPA,

the Defense Advanced Research Projects Agency)资助。MUC的显著特点并不是会议本身,而在于对信息

抽取系统的评测[5]。只有参加信息抽取系统评测的单位才被允许参加MUC会议。在每次MUC会议前,

组织者首先向各参加者提供样例消息文本和有关抽取任务的说明,然后各参加者开发能够处理这种消息

文本的信息抽取系统。在正式会议前,各参加者运行各自的系统处理给定的测试消息文本集合。由各个

系统的输出结果与手工标注的标准结果相对照得到最终的评测结果。最后才是所谓的会议,由参与者交 1遵循MUC(Message Understanding Conference)系列会议建立的术语,我们把信息抽取最终的输出结果称为模板(Template),模板中的域称为槽(Slot),而把信息抽取过程中使用的匹配规则称为模式(Pattern)。另外,我们把要提取的特定事件或关系称为一个场景(Scenario),而领域(Domain)的概念要宽泛一些,通常一个领域可以包含多个场景。比如,在金融领域的新闻中,可能包含有建立合资公司、股票转让等很多个场景。 流思想和感受。后来,这种评测驱动的会议模式得到广泛推广,如1992年开始举行的文本检索会议TREC2

等。

从历次MUC会议,可以清楚地看到信息抽取技术发展的历程。

1987年5月举行的首届MUC会议基本上是探索性的,没有明确的任务定义,也没有制定评测标准,

总共有6个系统参加,所处理的文本是海军军事情报,每个系统的输出格式都不一样。

MUC-2于1989年5月举行,共有8个系统参加,处理的文本类型与MUC-1一样。MUC-2开始有

了明确的任务定义,规定了模板以及槽的填充规则,抽取任务被明确为一个模板填充的过程。

MUC-3于1991年5月举行,共有15个系统参加,抽取任务是从新闻报告中抽取拉丁美洲恐怖事

件的信息,定义的抽取模板由18个槽组成。从MUC-3开始引入正式的评测标准,其中借用了信息检索

领域采用的一些概念,如召回率和准确率等。

MUC-4于1992年6月举行,共有17个系统参加,任务与MUC-3一样,仍然是从新闻报告中抽取

恐怖事件信息。但抽取模板变得更复杂了,总共由24个槽组成。从这次会议开始MUC被纳入TIPSTER

文本项目3。

MUC-5于1993年8月举行,共有17个系统参加:美国14个,英国、加拿大、日本各一个。此次

会议设计了两个目标场景:金融领域中的公司合资情况、微电子技术领域中四种芯片制造处理技术的进

展情况。除英语外,MUC-5还对日语信息抽取系统进行了测试。在本次会议上,组织者尝试采用平均

合集下载

基于BERT嵌入BiLSTMCRF模型的中文专业术语抽取研究

基于BERT嵌入BiLSTMCRF模型的中文专业术语抽取研究

基于BERT嵌入BiLSTMCRF模型的中文专业术语抽取研究

一、概要

随着自然语言处理技术的不断发展,中文专业术语抽取已经成为了研究的热点。本文提出了一种基于BERT嵌入BiLSTMCRF模型的中文专业术语抽取方法。该方法首先使用BERT模型对文本进行特征提取,然后将提取到的特征输入到BiLSTMCRF模型中进行序列标注。通过对比实验,我们发现该方法在中文专业术语抽取任务上取得了显著的性能提升。同时我们还对模型进行了调优和改进,以进一步提高其性能和鲁棒性。本文的研究为中文专业术语抽取提供了一种有效的解决方案,具有一定的理论和实际应用价值。

1. 研究背景和意义

随着自然语言处理技术的不断发展,文本挖掘和信息抽取已经成为了学术界和工业界的热点问题。在众多的自然语言处理任务中,专业术语抽取是一项具有重要意义的任务。专业术语是指在特定领域内具有特殊含义和用途的词汇,它们在文本中的出现频率较低,但对于理解文本内容和进行知识推理具有重要价值。因此研究如何从大量的非结构化文本数据中自动抽取专业术语,对于提高文本分析的效率和准确性具有重要的理论和实际意义。

然而现有的专业术语抽取方法仍然存在一些局限性,首先这些方法主要针对单个领域的专业术语抽取,对于跨领域的专业术语抽取仍存在困难。其次现有的方法往往需要人工提取特征或设计复杂的模型结构,这增加了算法的复杂性和计算成本。此外现有方法在处理长文本和多义词等问题时也存在一定的局限性。

2. 相关工作概述

在自然语言处理领域,文本挖掘和信息抽取一直是一个重要的研究方向。针对中文专业术语抽取问题,研究者们提出了许多方法,如基于规则的方法、基于统计的方法和基于机器学习的方法等。这些方法在一定程度上提高了专业术语抽取的准确性和效率,但仍然存在一些局限性,如对未登录词的处理不足、对长文本的处理能力有限以及对于歧义词汇的处理不够准确等。近年来随着深度学习技术的快速发展,基于BERT等预训练模型的中文专业术语抽取方法逐渐成为研究热点。这些方法利用预训练模型在大规模语料库中学习到的知识,为专业术语抽取任务提供了有力的支持。

自然语言处理文献综述

自然语言处理文献综述

自然语言处理文献综述

自然语言处理(Natural Language Processing,NLP)是一种利用计算机技术处理人类自然语言的学科。随着计算机技术的不断发展,NLP正在成为人工智能领域的热门研究方向。本文将对近年来NLP领域的一些研究综述,并将这些研究按照以下列表分类:

1. 语言模型

语言模型一直是NLP领域的核心研究方向。语言模型可以用来评估语句的概率,识别语音,机器翻译等。2003年,Bengio等人提出了基于神经网络的语言模型,使语言模型性能得到了显著提高。2013年,Google提出了谷歌神经机器翻译系统(Google Neural Machine

Translation,GNMT),将神经网络应用于机器翻译,取得了较好的效果。

2. 文本分类

文本分类是NLP领域的另一个重要研究方向。它可以应用于垃圾邮件过滤、新闻分类等。2013年,Kim提出了卷积神经网络(CNN)在文本分类中的应用,极大地提高了文本分类的性能。2014年,Deng等人提出了一种基于深度学习的文本分类模型,获得了AlexNet大赛亚军,引起了广泛的关注。

3. 信息提取

信息提取是NLP领域的另外一个研究方向。其任务是从文本中抽取出特定的信息。2011年,Yao等人提出了一种跨语言信息抽取模型,可以将不同语言的信息进行对齐处理。2015年,Shu等人提出了一种基于远程监督的关系抽取方法,可以从未标注的文本中抽取出关系。

4. 语音识别

语音识别是NLP领域中的一个重要应用方向。随着智能家居市场的兴起,语音识别受到了越来越多的关注。2016年,Amodei等人提出了一种基于深度学习的语音识别模型DeepSpeech,取得了较好的效果。同年,Baidu提出了具有端到端学习的Deep Speech 2语音识别模型,并在多个数据集上取得了最佳成绩。

总体来说,神经网络与深度学习等技术的发展给NLP领域带来了新的机遇与挑战。未来,随着研究的深入,NLP领域将会得到更多的发展与应用。

有关国内自主研发的作文自动评分系统的研究综述——基于CNKI期刊论文数据的分析(2010-2021)

有关国内自主研发的作文自动评分系统的研究综述——基于CNKI期刊论文数据的分析(2010-2021)

007

文化纵横

有关国内自主研发的作文自动评分系统的研究综述

——基于CNKI期刊论文数据的分析(2010-2021)

信息时代背景下,网络写作自动评分系统的应用给

语言学习者和测试者提供了极大便利。自20世纪60年代

以来,国外先后出现了PEG(Project Essay Grade)、

Intelligent Essay Assessor E-rater、Writing

Roadmap和Peerceptive等影响较大的智能写作平台。

然而,这些平台主要是为英语为母语的学习者设计的,

对于英语作为外语的中国学习者来说使用并不太方便。

针对这一需求,国内研发团队借鉴国外智能平台的开发

经验,研发了适合国内外语教学人员的一些作文智能评

分系统。其中,影响较大的有2010年北京词网科技有限

公司推出的——句酷批改网和梁茂成团队2015年研发的

iWrite2.0。此外,还有浙江大学推出冰果英语智能作文

评阅系统[1]。迄今为止,句酷批改网在全国广泛应用已10

年有余,较新的iWrite2.0也有5年多。毋容置疑,有关国

内自主研发的这些智能写作平台的研究也引起了国内学

者较大的热情。经检索,截止2021年(检索日期为2021

年9月9日),国内CNKI数据库收录的主题为“句酷网”

的期刊论文193篇,其中CSSCI核心论文是13篇;主题为

“iWrite”的文献有43篇,CSSCI核心论文2篇。基于此,

本文采用CNKI自带的文献分析功能,较全面、直观地对

比出国内外有关句酷批改网和iWrite2.0两个平台的研究

热点和发展过程。殷小娟

(闽江学院外国语学院 福建福州 350108)

摘 要:应用CNKI自带的文献可视化分析软件,以2010-2021年期间CNKI数据库收录的193篇主题为“句酷网”的

期刊文献和43篇主题为“iWrite”的期刊文献作为数据来源,对10余年来有关国内自主研发的作文自动评分系统的研究领

域知识点进行了分析。研究发现,国内有关批改网的期刊发文数量大大超过iWrite的发文数量,但有关二者的研究核心期

【计算机科学】_信息抽取_期刊发文热词逐年推荐_20140722

【计算机科学】_信息抽取_期刊发文热词逐年推荐_20140722

序号科研热词推荐指数序号科研热词1频繁子树挖掘11人脸识别2过程神经网络12特征抽取3语义角色标注13连通性4词典码14语法特征5评论抽取15语义序列核6评标16语义对应7规则库17表理解8自动学习18结构特征9自动分词19离群样本10网络贸易110知识获取11网络结构构造算法111特征选取12网络结构112流程挖掘13特征抽取113模糊线性鉴别分析14混沌114核数15泛化能力115核foley-sammon鉴别分析16正则表达式116机器学习17查询分析117术语抽取18条件随机场118本体映射19本体筛选119本体抽取20本体120普适计算21文档格式121无线射频识别技术22文本特征词122无尺度23文本挖掘123支持向量机24并行遗传算法124推理25工程项目125异质数据集成26密码分析126工作流模型27多智能体127小样本问题28垂直搜索128小世界29句法分析129实体关系抽取30半结构化130复杂网络31分组加密131复杂事件处理32关系抽取132增量挖掘33元数据抽取133图像水印34信息精化134启发式规则35信息检索135可适应性36信息提取136可能世界模型37信息抽取137分布方差38信息安全138分布式描述逻辑39事件要素139几何攻击40事件信息抽取140信息隐藏41中文信息处理141信息抽取42三元组结构142依存分析43xml143二维线性鉴别分析44web挖掘144二维主成分分析45k-means聚类145事件识别46主曲线47不确定数据48zernike矩49unithood50termhood51sufferage52dom树2008年2009年

基于CiteSpace_的专利组合研究综述

基于CiteSpace_的专利组合研究综述

170 / CHINA MANAGEMENT INFORMATIONIZATION2023年11月第26卷第22期中国管理信息化China Management InformationizationNov.,2023Vol.26,No.22

基于CiteSpace的专利组合研究综述

张贞林,张丽玮(首都经济贸易大学 管理工程学院,北京 100070)[摘 要]在全球科技浪潮中,专利已成为参与市场竞争的重要武器,在促进科技创新和推动技术开发方面具有重要作用。文章运用可视化软件CiteSpace对国内专利组合研究成果进行发文量和关键词分析,从专利组合分析模型、专利组合管理策略和专利组合价值评估3个方面梳理总结国内专利组合的研究现状和存在的问题,并指出可能的研究方向,以期为未来研究提供参考。[关键词]专利组合;可视化分析;CiteSpace;研究综述doi:10.3969/j.issn.1673 - 0194.2023.22.055[中图分类号]F204;F273.1 [文献标识码]A [文章编号]1673-0194(2023)22-0170-03

0 引 言近年来,在全球范围内的科技创新浪潮中,专利已经成为一个企业参与竞争的重要武器。而单一专利难以应对日渐激烈和复杂的市场竞争,以专利组合为基本研究单元的技术战略分析逐渐成为学界和业界的关注焦点[1]。所谓专利组合,是指利用专利之间相似相异、补充互斥等关系形成的,具有防御、竞争等功能的专利集合[2],其相较于单一专利能创造更多直接和间接价值。一方面,专利组合内包含各种不同技术领域的专利,可以促进专利权人的技术开发;另一方面,专利组合可以实现对各类型、各层次创新的支持,实现创新价值,既可以有效提高企业的技术水平和产品竞争力,提高其在市场中的地位,也能有效实现对竞争对手的技术防御。通过近年来国内专利组合文献的可视化分析和整理,本文从专利组合分析模型、专利组合管理策略和专利组合价值评估3个方面对现有专利组合研究成果进行分析总结,系统地对相关研究进行解析。1 研究方法为了对专利组合的相关文献作出系统的分析,本文选用CiteSpace软件进行文献计量分析。笔者将文献名“专利组合”作为检索条件,并不限制领域和持续时间,最终检索到165篇文献。笔者观察发现国内专利组合发文量呈现不断上升的趋势,这说明专利组合的相关研究仍是我国学界关注的焦点。本文使用CiteSpace软件生成专利组合领域的关键词共现图谱,如图1所示,由此得到国内专利组合领域的研究热点。图谱中节点越大,所代表的关键词共现频次越高;颜色越浅,关键词越新;节点间连线粗细,则表示二者间的联系密切度。由图1可知,除专利组合外,国内包括“专利战略”“专利策略”“专利管理”“组合分析”等高频关键词,反映了国内的专利组合管理策略、专利组合分析等研究热点。同时,国内高频关键词中还包括“专利价值”“价值评估”“价值”,由此可看出国内对专利组合价值评估这一研究方向也比较 关注。

关系抽取研究综述

关系抽取研究综述

文章编号:1007—1423(2015)O3—0018—04 DOI:10.3969/j.issn.1007-1423.2015.03.005 

关系抽取研究综述 

母克东.万琪 

(四川大学计算机学院,成都610065) 

摘要: 

信息抽取、自然语言理解、信息检索等应用需要更好地理解两个实体之间的语义关系,对关系抽取进行概况总结。将 

关系抽取划分为两个阶段研究:特定领域的传统关系抽取和开放领域的关系抽取。并对关系抽取从抽取算法、评估指 标和未来发展趋势三个部分对关系抽取系统进行系统的分析总结。 

关键词: 

关系抽取;机器学习;信息抽取;开放关系抽取 

0 引言 

随着大数据的不断发展.海量信息以半结构或者 

纯原始文本的形式展现给信息使用者.如何采用自然 

语言处理和数据挖掘相关技术从中帮助用户获取有价 值的信息.是当代计算机研究技术迫切的需求。因此, 

信息抽取技术应运而生.信息抽取的主要目的是从自 

然语言文本中抽取指定的实体(Entity)、关系(Rela. 

ti。 )、事件(Event)等事实信息。信息抽取技术可以经 过一些列处理把文本中蕴含的无规律化信息转化成结 

构化的信息存储到数据库中.方便用户快速获取急需 

的信息 而关系抽取(Relation Extraction)是信息抽取的 

一个重要子任务.首次于1998年在MUC E1J会议正式提 

出.主要任务是确定两个实体之间的语义关系。实体关 

系抽取技术已经被广泛应用到信息检索(information extraction)、基因疾病关系挖掘(gene—disease)、蛋白质 

交互作用(protein-protein)等众多应用领域。 

1 关系抽取 

实体间的关系可被形式化描述为关系_一元组<E1. 

R,E2>,其中E1和E2是实体类型,R是关系描述类 

型。实体关系抽取的主要目的是把无结构的自然语言 

文本中所蕴含的实体语义关系挖掘出来,整理成j三元 

组<El,R,E2>存储在数据库中,供进一步分析利用或查 

知识抽取技术综述

第27卷第9期 2010年9月 计算机应用研究 Application Research of Computers V01.27 No.9 Sep.2010 

知识抽取技术综述 

刘鹏博 ,车海燕升,陈伟 

(1.上海市特种设备监督检验技术研究院,上海200062;2.吉林大学计算机科学与技术学院,长春130012) 

摘要:知识抽取主要研究如何从无语义信息的文档内容中抽取与本体匹配的事实知识,进而实现对web数 据充分、有效的利用,已经成为国内外语义Web领域的研究热点之一。介绍了知识抽取相关技术知识,系统地 分析比较了面向英文和中文的知识抽取方法,着重探讨了对中文自然语言文档内容的自动知识抽取方法,指出 了目前该类方法的不足,并展望了知识抽取发展的方向。 . 

关键词:知识抽取;语义Web;综述 中图分类号:TP31;TP18 文献标志码:A 文章编号:1001—3695(2010)09-3222-05 

doi:10.3969/j.issn.1001-3695.2010.09.005 

Survey of knowledge extraction technologies 

LIU Peng—bo .CHE Hai.yan”.CHEN Wei (1.Shanghai Institute ofSpecial Equipment Inspection&Technical Research,Shanghai 200062,China;2.College of Computer Science& Technology,Jilin University,Changchun 130012,China) 

Abstract:Knowledge extraction,whose main task is to extract the factual knowledge from the no—semantics-embedded docu— ments and to realize the full and effective use of Web data,has become a hot topic in the semantic Web field.Firstly,this pa- per gave a brief introduction of knowledge extraction related technologies.Secondly,analyzed and compared the EnIglish-orien— ted and Chinese—oriented knowledge extraction methods systematically,especially the methods towards Chinese natural lan- guage documents.Lastly,pointed out the main drawbacks of the current methods and discussed the future development direc— tion of knowledge extraction. Key words:knowledge extraction;semantic Web;survey 

基于远程监督的关系抽取研究综述

第33

卷第10

2019

年10

月中文信息学报

JOURNAL

OF

CHINESE

INFORMATION

PROCESSINGVol. 33, No. 10

Oct.,2019

文章编号

:1003-0077(2019)10-0010-08

基于远程监督的关系抽取研究综述

白龙,靳小龙,席鹏弼,程学旗

(1.

中国科学院计算技术研究所中国科学院网络数据科学与技术重点实验室,北京100190;

2.

中国科学院大学计算机与控制学院,北京100190)

摘要:关系抽取作为信息抽取的一项关键技术,在知识库自动构建、问答系统等领域有着极为重要的意义,一直

以来受到人们的关注。远程监督关系抽取技术通过外部知识库作为监督源,自动对语料库进行标注,能够大量节

省人工标注成本,因而受到了研究者们的重视。该文针对远程监督关系抽取技术做了较为系统性的梳理,将已有

方法分为基于概率图的、基于矩阵补全的和基于嵌入的三大类,并且对其当前面临的挑战进行了探讨,最后总结并

展望了远程监督关系抽取技术未来的发展。

关键词:远程监督;关系抽取;信息抽取

中图分类号:TP391

文献标识码:A

A Survey on Distant Supervision Based Relation Extraction

BAI Long, JIN Xiaolong, XI Pengbi, CHENG Xueqi

(1. CAS Key Lab of Network Data Science and Technology, Institute of Computing

Technology, Chinese Academy of Sciences, Beijing 100190, China

2. School of Computer and Control Engineering, University of Chinese

Academy of Sciences* Beijing 100190, China)

浅析信息抽取技术及前景(doc 9页)

信息抽取技术及前景浅析

李荣国 072529

关键词:信息抽取 信息处理技术 分词 句法及语义分析

摘要: 面向实际应用和潜在需求,建立自适应的、可移植的系统是未来信息抽取的发展方向,立足于目前已有的研究成果,建立受测试集驱动、通过机器学习构建有监督机制的规则库并在此基础上实现知识获取将成为一条发展的思路。

一、信息抽取概述

随着计算机在各个领域的广泛普及和Internet的迅猛发展,社会的信息总量呈爆炸式的指数增长。信息总量的量级,从20世纪90年代初的MB(106)过渡到GB(109)再到现在的TB(1012)。进入21世纪后,全世界信息总量更是以每三年增加一倍的速度递增。据统计,在这些海量信息中,有60%~70%是以电子文档的形式存在。为了应对信息爆炸带来的挑战,迫切需要一些自动化的技术帮助人们在海量信息中迅速找到自己真正需要的信息。信息抽取(Information Extraction,IE)正是解决这个问题的一种方法。

信息抽取技术是指从一段自然语言文本中抽取指定的事件、事实信息,并以结构化形式描述信息,供信息查询、文本深层挖掘、自动回答问题等应用,为人们提供有力的信息获取工具。也就是从文本中抽取用户感兴趣的事件、实体和关系,被抽取出来的信息以结构化的形式描述,然后存储在数据库中,为情报分析和检测、比价购物、自动文摘、文本分类等各种应用提供服务。广义上信息抽取技术的抽取对象并不局限于文本,其他形式存在的信息也可以作为信息抽取的对象,而抽取的结果则变为相应的结构化数据。后文如无说明只涉及中文文本信息抽取。

信息抽取技术的最终目的就是开发实用的信息抽取系统,从自由文本中抽取、分析信息,从而得到有用的、用户感兴趣的信息。信息抽取技术在军事、经济、医学、科学研究等领域有着极大的应用空间。

与信息抽取密切相关的一项研究是信息检索(Information Retrieval,IR)技术。信息抽取并不同与信息检索,两种的功能、处理技术、适用领域均不相同,但它们俩是可以互补的。为了处理海量文本,信息抽取系统通常以信息检索系统(如文本过滤)的输出作为输入;而信息抽取技术又可以用来提高信息检索系统的性能。二者的结合能够更好地服务与用户的信息处理需求。另外,和信息抽取相关的技术还有自动文摘、文本理解、自然语言生成、机器翻译和数据挖掘等。

{信息技术}_李荣国_信息抽取技术及前景浅析报告

(信息技术)_李荣国_信息抽取技术及前景浅析报告

信息抽取技术及前景浅析

李荣国072529

关键词:信息抽取信息处理技术分词句法及语义分析

摘要:面向实际应用和潜于需求,建立自适应的、可移植的系统是未来信息抽取的发展方向,立足于目前已有的研究成果,建立受测试集驱动、通过机器学习构建有监督机制的规则库且于此基础上实现知识获取将成为壹条发展的思路。

壹、信息抽取概述

随着计算机于各个领域的广泛普及和Internet的迅猛发展,社会的信息总量呈爆炸式的指数增长。信息总量的量级,从20世纪90年代初的MB(106)过渡到GB(109)再到当下的TB(1012)。进入21世纪后,全世界信息总量更是以每三年增加壹倍的速度递增。据统计,于这些海量信息中,有60%~70%是以电子文档的形式存于。为了应对信息爆炸带来的挑战,迫切需要壹些自动化的技术帮助人们于海量信息中迅速找到自己真正需要的信息。信息抽取(InformationExtraction,IE)正是解决这个问题的壹种方法。

信息抽取技术是指从壹段自然语言文本中抽取指定的事件、事实信息,且以结构化形式描述信息,供信息查询、文本深层挖掘、自动回答问题等应用,为人们提供有力的信息获取工具。也就是从文本中抽取用户感兴趣的事件、实体和关系,被抽取出来的信息以结构化的形式描述,然后存储于数据库中,为情报分析和检测、比价购物、自动文摘、文本分类等各种应用提供服务。广义上信息抽取技术的抽取对象且不局限于文本,其他形式存于的信息也能够作为信息抽取的对象,而抽取的结果则变为相应的结构化数据。后文如无说明只涉及中文文本信息抽取。

信息抽取技术的最终目的就是开发实用的信息抽取系统,从自由文本中抽取、分析信息,从而得到有用的、用户感兴趣的信息。信息抽取技术于军事、经济、医学、科学研究等领域有着极大的应用空间。

和信息抽取密切关联的壹项研究是信息检索(InformationRetrieval,IR)技术。信息抽取且不同和信息检索,俩种的功能、处理技术、适用领域均不相同,但它们俩是能够互补的。为了处理海量文本,信息抽取系统通常以信息检索系统(如文本过滤)的输出作为输入;而信息抽取技术又能够用来提高信息检索系统的性能。二者的结合能够更好地服务和用户的信息处理需求。另外,和信息抽取关联的技术仍有自动文摘、文本理解、自然语言生成、机器翻译和数据挖掘等。

  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
相关文档
最新文档