中文指代消解名词短语的识别

合集下载

如何“破译”指代词语的指代义- -

如何“破译”指代词语的指代义- -

如何“破译”指代词语的指代义- -【注】:本文在2001年3月于浙江温州召开的全国中语会教改中心第三届年会上获得第四届"语通杯"好文章大赛全国二等奖(由中国教育学会中学语文教学专业委员会教学改革研究中心与中国教育学会中学语文教学专业委员会会刊《语文教学通讯》联合主办)如何"破译"指代词语的指代义福建省福鼎市第五中学林承雄"理解词语在文中的含义"是高考现代文阅读的一项重要技能,而"理解指代词语在文中的指代义"又是文章词语阅读的一种常见的题型。

1990、1994、1996高考全国卷等先后多次考查过对指代词语的理解。

本文试图结合具体题例谈谈指代词语理解题的解答技巧。

指代词语包括指代词与指代短语两类。

指代词是指具有指示、代替作用的代词等。

主要起替代作用的有人称代词"我、你、他","我们、你们、他们","自己、人家、别人"等,"它"不指人,但习惯上也归入人称代词,既有代替作用,又有指称作用的有指示代词,包括近指代词"这"、"此"和远指代词"那"。

此外,现代书面语中经常使用两个文言代词"之"与"其"来指代一定内容,"之"相当于"他(它)"、"他(它)们",在句中作宾语(或兼语),不能作主语;"其"相当于"他(它)的"、"他(它)们的"在句中作领属性定语。

指代语是由代词与其他词类(如:名词、数量词、连词、动词等)复合生成的某些特殊的短语。

如"这些、那些","某些","这样、那样","如此","之所以如此","既然这样"等等。

基于多注意力机制的维吾尔语人称代词指代消解

基于多注意力机制的维吾尔语人称代词指代消解

的先行语, 因为文本中 “
(布葛热汗)” 与
“ (他)” 距离更近. 但是, 候选先行语 “
(吾
斯英)” 才是照应语 “ (他)” 正确的先行语. 所以,
人称代词指代消解应该充分考虑候选先行语距离特
征和更深层次的语境信息.
针对以上问题, 本文提出基于多注意力机制的
深度学习模型应用于维吾尔语人称代词指代消解任
2. Key Laboratory of software engineering technology, Xinjiang University, Urumqi 830046 3. Key Laboratory of Signal and Information Processing, Xinjiang University, Urumqi 830046 4. Network Center, Xinjiang University, Urumqi 830046 5. College of formation Science and Technology, Xinjiang University, Urumqi 830046
指代消解作为自然语言处理一个重要子任务, 深度学习模型在指代消解中得到广泛的研究. 这些 研究关注照应语和候选先行语的语义信息, 应用大 量的神经网络模型进行候选先行语预测[6−8]. 目前 的研究主要针对中文和英文等具有充足语料库的语 种, 对维吾尔语等小语种的研究不够深入, 针对小语 种的研究无论是语料标注还是实体识别都需要掌握 多级语法知识、语义知识, 甚至相应语言领域知识, 在当前自然语言处理的研究阶段, 要获取和学习研 究中所需知识仍比较困难. 人称代词指代消解作为 指代消解任务更细粒度的一个分支, 不仅依赖照应 语和候选先行语特征信息, 还要关注距离特征和上 下文语境信息. 例如句子:

中英文论文参考文献范例

中英文论文参考文献范例

中英文论文参考文献一、中英文论文期刊参考文献[1].面向中英文混合环境的多模式匹配算法.《软件学报》.被中信所《中国科技期刊引证报告》收录ISTIC.被EI收录EI.被北京大学《中文核心期刊要目总览》收录PKU.2008年3期.孙钦东.黄新波.王倩.[2].基于自适应特征与多级反馈模型的中英文混排文档分割.《自动化学报》.被中信所《中国科技期刊引证报告》收录ISTIC.被EI收录EI.被北京大学《中文核心期刊要目总览》收录PKU.2006年3期.夏勇.王春恒.戴汝为.[3].基于最大熵方法的中英文基本名词短语识别.《计算机研究与发展》.被中信所《中国科技期刊引证报告》收录ISTIC.被EI 收录EI.被北京大学《中文核心期刊要目总览》收录PKU.2003年3期.周雅倩.郭以昆.黄萱菁.吴立德.[4].中英文指代消解中待消解项识别的研究.《计算机研究与发展》.被中信所《中国科技期刊引证报告》收录ISTIC.被EI 收录EI.被北京大学《中文核心期刊要目总览》收录PKU.2012年5期.孔芳.朱巧明.周国栋.[5].基于树核函数的中英文代词消解?.《软件学报》.被中信所《中国科技期刊引证报告》收录ISTIC.被EI收录EI.被北京大学《中文核心期刊要目总览》收录PKU.2013年5期.孔芳.周国栋.[6].基于树核函数的中英文代词消解.《软件学报》.被中信所《中国科技期刊引证报告》收录ISTIC.被EI收录EI.被北京大学《中文核心期刊要目总览》收录PKU.2012年5期.孔芳.周国栋.[7].一种并行中英文混合多模式匹配算法.《计算机工程》.被中信所《中国科技期刊引证报告》收录ISTIC.被北京大学《中文核心期刊要目总览》收录PKU.2014年4期.王震.李仁发.李彦彪.田峥.[8].中英文混合文章识别问题.《软件学报》.被中信所《中国科技期刊引证报告》收录ISTIC.被EI收录EI.被北京大学《中文核心期刊要目总览》收录PKU.2005年5期.王恺.王庆人.[10].中英文混排扭曲文本图像快速校正方法.《图学学报》.被中信所《中国科技期刊引证报告》收录ISTIC.被北京大学《中文核心期刊要目总览》收录PKU.2015年6期.王景中.孙婷.童立靖.二、中英文论文参考文献学位论文类[1].中英文足球新闻标题中隐喻的对比研究.作者:郭浩.英语语言文学安徽大学2013(学位年度)[2].中英文汽车广告的人际意义比较研究.被引次数:2作者:王洁璁.外国语言学与应用语言学山东师范大学2012(学位年度)[3].中英文字体匹配初探.被引次数:1作者:姚文凭.艺术设计学湖南师范大学2011(学位年度)[4].多模态理论视角下中英文环保广告的对比研究.作者:张楠.外国语言学及应用语言学山西师范大学2013(学位年度)[5].基于字符串匹配的中英文混合分词技术研究.被引次数:4作者:王茜.计算机软件与理论四川师范大学2011(学位年度)[6].基于ROI原则的中英文公益广告修辞劝说及其诉求分析.作者:马欣宇.商务英语对外经济贸易大学2013(学位年度)[7].跨文化视角下中英文简历的语类分析.作者:高琳.外国语言学及应用语言学天津商业大学2015(学位年度)[8].中英文商务信函比较研究.作者:王卓.汉语言文字学长春理工大学2013(学位年度)[9].中英文混排名片识别系统研究.被引次数:4作者:金鑫.计算机应用技术南京航空航天大学2011(学位年度)[10].网上中英文招聘广告信息流动模式对比研究.作者:韩蕊.外国语言学及应用语言学天津理工大学2012(学位年度)三、中英文论文专著参考文献[1]VisualEPlus—EnergyPlus的中英文图形化界面工具.潘毅群.李歧强.周辉.黄治钟.何宗键,2010全国暖通空调制冷2010年学术年会[2]一种适合中英文混排的字符分割技术.刘娟.郭钧天.范依林,20082008中国计算机大会[3]医学期刊中英文姓名的著录及中英文转换.王冰,2003第三届中国科技期刊青年编辑学术研讨会[4]清管技术与设备中英文术语探析.杨路,2006第三届全国管道技术学术会议[5]科研论文写作中的汉英杂糅现象及编辑策略.石春让,2010第八届全国核心期刊与期刊国际化、网络化研讨会[6]高影响力医学期刊中英文参考文献著录差错分析.朱红梅.张大志.任红,2011第九届全国医药卫生期刊编辑出版学术会议[7]基于聚合关系的中英文词表概念映射方法及实证.邓盼盼.常春.李晓瑛,20142014年第五届全国知识组织与知识链接学术交流会[8]合理运用语言比例,提高经济学科双语教学质量.王时芬,2010第五届中国经济学教育年会暨院长(系主任)联席会议[9]VisualEPlus——EnergyPlus的中英文图形化界面工具.潘毅群.李歧强.周辉.黄治钟.何宗键,20092009年全国暖通空调专业委员会空调模拟分析学组学术交流会[10]‘大峡谷与谷地’名称问题讨论.凌小惠.钱方,2009中国地质学会旅游地学与地质公园研究分会第24届年会暨白水洋国家地质公园建设与旅游发展研讨会。

指代消解的主要方法及其机制

指代消解的主要方法及其机制

静态变元约束机制 ,意义被看作是模型中的状态变元之间的关系 ,语句的意义看作是语境更新的潜
力。


处理 照 应现象 的主 要方 法
据笔者所知 ,到 目 前为止 ,处理指代现象 的方法在逻辑学界就多达十多种 ,比如 :话语表现理
收 稿 日期 :0 2 0 — 0 21—62
基金项 目: 国家社科 基金重大招标项 目“ 自然语言信 息处理 的逻辑语义学研究 ” 阶段 性成果之一 , 目编号 :0 D0 3 项 1&Z 7 作者简介 : 张晓君(9 O )女 , 17一 , 四川南充人 , 厦门大学哲学 系博士后 。研究方 向 : 自然语 言逻辑 、 动态认知行动逻辑 。
指代 (np oa是 自然 语言 中非 常普 遍 的语 言现 象 ,对 于简 化表 述 ,衔接 上下 文 和意 义 的连贯 起 aah r ) 着重 要 的作用 。在 语言 学 中 ,指代 词(npo 所 指 的对象 和 内容 叫做 先行 词 ,为指代 词确 定先 行词 的 ห้องสมุดไป่ตู้aahO
过程 叫做指代消解( ahr r o tn。指代消解在信息抽取 、自 a poae l i ) n s uo 然语言接 口、机器翻译 、文本摘要 和问答系统等人工智能的应用领域中起着重要的作用 。n 在 自然语言中,具有指代现象 的典型语句
合性话语表现理论(P o p si a D T等,而仅使用范畴对指代现象进行处理的方法就有六种。 S C m oiol R ) tn 笔者通过对 比研究发现 :话语表现理论虽然具有动态地处理指代现象 的能力 ,但它却不满足组 合性原则 ;动态谓词逻辑虽然满足组合性且能够进行指代消解 ,但其语境增量具有破坏性 ;动态蒙 太格语 法在其动态内涵逻辑的翻译 中 ,选择一个 特别 的话语标 记对 成分 间可 能的指代关系进行标 示 ,能 够很 好 地 处理 指 代 现 象 ;带 有 内在 动态 广 义 量词 的动 态谓 词 逻辑 允 许 在其 第 一个 论 元 的动 态 存在量词与其第二个论元相应变元之 间具有间接约束关系 ,能够进行指代消解 ;增量动态逻辑规定 量词可 以约束 下一 个可 以达 到的变元寄存器 (g t ) ,并定义 了能够为代词找到先行 词的语境 ; r ie ① esr kD T - R 是通过向话语表现理论中添加入 演算从而得到语句的组合性处理 ;【 组合性话语表现理论是 一 8 ] m

nlp面试题目及答案

nlp面试题目及答案

nlp面试题目及答案NLP(自然语言处理)是人工智能领域中的一个重要分支,涉及到理解、处理和生成人类语言的能力。

对于从事NLP相关工作的人员来说,准备好面试题目及其答案是至关重要的。

本文将为大家提供一些常见的NLP面试题目及其答案,希望对大家的面试准备有所帮助。

一、基础理论题1. 请解释自然语言处理(NLP)的概念。

自然语言处理(NLP)是指计算机通过对自然语言进行分析和理解,并利用这些分析结果进行相关任务的一种技术。

它包括了文本理解、机器翻译、文本生成、信息抽取等一系列技术和应用。

2. 请介绍NLP的主要挑战是什么?NLP的主要挑战包括语义理解、语义生成、指代消解、语音识别、机器翻译等。

其中,语义理解是指理解句子的具体意义和上下文关联;语义生成是指根据一定的输出规则和输入生成句子;指代消解是解决代词、名词短语等的指代问题;语音识别是将语音转化为文字的过程;机器翻译是将一种语言的内容转化为另一种语言的过程。

3. 请解释什么是词嵌入(Word Embedding)?词嵌入是将单词转化为连续向量表示的技术。

它通过将单词映射到高维向量空间中的点来表示单词的语义。

通常使用的方法是通过训练语言模型或者神经网络自动学习词嵌入。

4. 请解释什么是词袋模型(Bag of Words Model)?词袋模型是一种简化的文本表示方法,将文本中的每个词都看做一个独立的特征,并将其转化为一个向量。

在词袋模型中,每个词的出现与否是一个二进制的特征,向量的每一维表示对应词的出现次数。

5. 请解释什么是TF-IDF值?TF-IDF(Term Frequency-Inverse Document Frequency)是一种用于衡量词语在文本中的重要性的方法。

TF指的是词语在文本中的频率,IDF指的是逆文档频率,即该词语在整个文本集合中的重要程度。

TF-IDF值越大,表示该词在文本中的重要性越高。

二、应用题1. 请解释一下词性标注是什么?词性标注是指为文本中的每个词语标注词性或者词类的过程。

自然语言处理领域存在哪些亟待解决的问题?

自然语言处理领域存在哪些亟待解决的问题?

自然语言处理领域存在哪些亟待解决的问题?自然语言处理(Natural Language Processing, NLP)是计算机科学与人工智能领域中探索和处理人与机器之间的自然语言交互的研究领域。

随着人工智能的迅速发展,NLP也取得了长足的进步和成就。

然而,尽管取得了重要的突破,但NLP领域仍然面临许多亟待解决的问题。

本文将重点介绍一些当前NLP领域中存在的亟待解决的问题。

一、语义理解与推理语义理解是指计算机对语句进行深入的理解和解释,使其能够捕捉到言外之意、常识性知识和上下文的相互关系。

目前,NLP系统的语义理解仍然相对较浅,无法涵盖复杂的语义推理和逻辑推理。

在真正地理解人类语言的同时,将语言转化为计算机可处理的结构将是一个重要的问题。

此外,许多基于统计的方法在处理复杂的语义关系上也存在局限性。

二、语言生成语言生成是指计算机根据一定的输入信息生成自然语言。

虽然自动生成某些文本内容的技术已经取得了进展,但生成的文本在语义和流畅性方面仍然存在问题。

生成文本往往不自然,缺乏结构和条理性,特别是当涉及到长篇文章或复杂议题时。

为了解决这个问题,需要进一步改进生成模型,提高生成文本的自然程度和准确性。

三、语言理解的上下文语言理解的上下文理解是NLP中一个重要的挑战。

人类往往依靠上下文信息来理解含糊或模棱两可的语句,但对于计算机而言,理解语句时上下文信息往往是不可见的。

因此,在NLP中引入上下文信息变得非常重要。

解决这个问题的方法包括引入语义角色标注、指代消解和共指消解等技术,以更好地利用语境信息来理解和解释自然语言。

四、多语言处理随着全球化的发展,多语言处理成为NLP领域的一个重要问题。

许多NLP技术在处理英语之外的其他语言时效果不佳。

在处理多语言数据时仍存在着语言差异和结构差异的挑战。

如何在各种不同的语言和语境中进行高效准确的处理,仍然是一个亟待解决的问题。

五、数据稀缺和数据偏见大规模的高质量数据是许多NLP任务的基础。

中文指代消解方法研究讲义brmq


搭配

饰限定 饰数量
类型
类型
I、J的距 I、J的全 I、J的子 I、J的抽

匹配信 串缩略 取缩略

信息
信息
Outline
研究背景及意义 国内外研究现状 论文研究方法及内容 名词短语识别及特征向量选定 基于决策树的中文指代消解 结合规则的决策树中文指代消解 结论 下一步工作
基于决策树的中文指代消解
{19980101-01-001-002/m}Q {中共中央 /nt}O {总书记/n 、/w 国家/n 主席/n}G {江 /nr 泽民/nr}H
特征向量选定
参考国内外相关研究选定16个特征
I
搭配

饰限定 饰数量
类型
类型
J的句法 J的单复 J的性别 J的类型 J的被修 J的被修
名词短语识别(识别步骤)
第一步:识别出基本名词成分。各种名词成分 分为六组,如上页所示。
第二步:同组短语局部最大化,亦即如果两个 相邻的标出的短语的组别相同,那么就将二者 合并为一个短语。
第三步:并列名词性短语合并。如果出现在 “和”、“与”或“、”两侧的短语组别相同, 则将两侧短语连带“和”、“与”或“、”一 起合并为一个短语(这里排除代词组的情况)。
决策树学习概况:ID3、C4.5、C5.0 实验数据准备情况
正反例类型 指代类型
正例(有指代 名词短语 关系) 代词
反例(无指代 名词短语 关系) 代词
数 百分 量比
44 29.3%
35 23.3%
58 38.7%
13 8.7%
样例的不同类型分布情况
C5.0生成的决策树
IJ全匹配
T
F
+

指代消解中代词待消解项识别研究

指代消解中代词待消解项识别研究陈九昌;孔芳;朱巧明;周国栋【摘要】This paper studies the identification of pronouns to be resolved on the basis of a machine learning based coreference resolution platform.A filter of pronouns to be resolved is generated with machine learning method by combining these two: to mine sets of features which are able to discriminate whether the pronouns are the items to be resolved or not, and to summarise and educe syntactic structure of pronouns to be resolved with rules, and they are add onto the pronouns coreference resolution platform. The performance of the filter and the contribution to pronouns coreference resolution are tested with ACE2003 benchmark corpus. Experiment shows that the filter achieves higher precision rate and the performance of pronouns coreference resolution system can be improved outstandingly.%以基于机器学习的指代(Anaphora)消解平台为基础,研究代词待消解项识别问题.挖掘能区分代词是否为待消解项的特征集,总结归纳具有规律的代词待消解项的句法结构,使用机器学习的方法将二者结合生成代词待消解项过滤器并将其加入到代词指代消解平台.在ACE2003基准语料上测试过滤器自身性能及对代词指代消解的贡献.实验表明过滤器具有较高的准确率,能明显地提高代词指代消解系统的性能.【期刊名称】《计算机应用与软件》【年(卷),期】2011(028)003【总页数】4页(P217-219,249)【关键词】指代消解;待消解项识别;机器学习【作者】陈九昌;孔芳;朱巧明;周国栋【作者单位】【正文语种】中文0 引言指代是自然语言中常见的语言现象,它是指在语篇中用一个指代词回指某个以前说到过的语言单位,这对保持文章的连贯性上起着重要的作用。

中文词义消歧的方法研究

中文词义消歧的方法研究摘要:词义消歧一直是自然语言处理领域的难题之一,它的研究对包括机器翻译、信息检索、文本分类等众多研究领域都会有一个积极的推动作用。

本文阐述了词义消歧的方法,以及各种消歧方法的优缺点,分析了影响词义消歧效果的因素,并给出了自己在词义消歧方面的想法。

关键词:词义消歧;自然语言处理;规则;统计词义消歧是自然语言处理领域一个重要的研究课题.也是近年来该领域研究的热点问题之一。

歧义的存在使计算机在“理解”自然语言时发生了困难,并很可能出现了错误。

词义消歧要解决的问题是如何让计算机理解多义词在特定的上下文环境中具体代表的语义。

汉语的词义消歧研究起步比较晚,整体水平不容乐观.尚局限在几个歧义词,譬如说选择5~10个有歧义的名词或动词作为消歧研究对象,个别正确率很高,但难以推广至全文(即所有的歧义词)。

目前的词义消歧研究还停留在实验室阶段,离实际应用还有很长的一段距离。

一、词义消歧方法语言学知识描述了词汇间的关系,歧义的产生源于词汇所涉及的领域、所处的结构等因素。

消解歧义的前提是为歧义词选择恰当上下文。

所有歧义的消解都依赖于多义词上下文提供的信息。

所以通过特定的上下文环境判断歧义词的特定词义是解决词义消歧问题的唯一出发点,是所有词义消歧技术、方法的源头。

1、基于规则的词义消歧方法早期的词义消歧研究重点在于基于规则的方法。

该方法依赖语言学家的语言知识来描述词义之间的关系,并建立规则库。

通过对歧义词及其上下文词语的分析,选择满足规则、条件的词义作为正确答案。

该方法符合人类的认知习惯,像专家系统那样很容易理解并被接受。

但由于规则通常由语言专家制定,具有很大的主观性,难免存在一些错误。

此外,如何保证规则库的一致性、可扩充性和完备性是该方法面临的难题。

2、统计词义消歧方法统计词义消歧方法借助统计学的思想和方法来处理词义歧义问题,统计学的方法不需要制定规则,自动在语料库、知识库中获取所需信息,来指导词义消歧。

统计与规则相结合的中文指代消解

析和测试 入规则来进行分
距离特征定义如下: [ 3 】 王厚峰. 汉语篇章的指代 消解浅论[ J ] . 语 言文 字应 用, 2 0 0 4 ( 4 ) : 1 1 3 — 1 9 . 规则 三: 如果 出现 了第 三人称代 词 “ 他” , 那 么后 面出现 的代词 1 “ 他” 是全匹配, 即指代的是相 同的先行词 。 『 4 】 孔芳, 周 国栋等. 指代 消解综述『 J ] 计 算机 工程, 2 0 1 0 , 3 6 ( 8 ) : 3 3 — 3 6 . 规则 四: 第三人称在指代消解是 比较好判断, 由于第一人称 “ 我”
科 技论 坛
・ 1 1 5 ・
统 计与规则相结合 的中文指代消解
韦丽红 王继 钢
( 呼伦 贝尔学院 计算机科学与技 术学院, 内蒙古 海拉 尔 0 2 1 0 0 8 ) 摘 要: 研 究选定了 6 种特征 向量 , 在1 2 0个手工标注的指代样本的基础上采用 C5 . 0 决策树 方法训练得到一棵 用于 中文名词短语 指代 消解 的决策树 , 并对其进行 实验测试 。采用决策树 的 i f - t h e n规 则之前加入 四奈针对代词指代 消解 的规则的方法来改进 系统。 关键词 : 指代消解 ; 特征 ; 规 则; 决策树 采用统计和规则 相结合 的方式来进行指代消解。 解决召 回率较 或者 “ 我们” 这样 的指代 词在判 断起来有一 定的难度, 所 以本 文不加 低的方法是通过大量 的手工标记 得出更好 的决策树 和向量特征, 但 以考 虑 。 以上 四条规则从上到下依次判断执行。 2加入 了规则的消解流程图 指代消解在 国外多采用规则 的方式 , 多在句法层 面上进行研究, 本文实 验人 民 E t 报 1 9 9 8年 1 月份 和 2 0 0 0年 4月 份新 闻版 的 如R A P算法等。国外的规则 多是在句法和语法层面上进行的, 国内 文章作为语料 , 首先 确定语料 的特征属性 , 通过 C 5 . 0算法构建形 成 的基 于规则 的制定, 比较有代表性 的是 王厚斌 提出的排斥 规则, 此外 个新的决策树算法, 再结合上 面提 出的四个规则进行指代消解, 将 参 考文献中可 以查看汉语 的消解特点。 这次消解后 的语料作为 自动文摘生成的源语料 。 1规则 的选 定 使用 5 0个样本进行 实际文档 的指代消解 问题, 通过 实验加入 了 在语 言学 中, 我们总结 了以下一些常识原则 : 上面的四个规则过滤之后, 进行指代消解, 实验 得到的实验测试结果 1 . 1 J 陛别 统一原则 。指示语 和相应 的先行 语的性别必须是一致 显示 召回率有 了明显的提高。 的。如果 指示语 和相应的先行语 的性别得性别 不一致, 基本 上可 以 利用统计 中的决 策树 与规则相结合 的方法来 改进方法之 后, 使 排除指代关系 。例如: “ 母亲 / n a p 王/ n r f 玲/ n r g ” ( 根据 “ 母亲” , 性别 为 该 方法能更加细致 的区分在消解范 围内的代词在具体 的语 境 中是 “ 女性” ) , 但是这时候要考虑识别优先 问题 , “ 王/ n r f 玲/ n r g ” 性 别为不 否需 要消解, 并且能够进行正确 的消解 。在统计 方法中加人 了规则 确定 。这里需要考虑 “ 人名 ” 的优先级 比“ 普通指人名词 ” 的高, 但 是 方法之后, 代词 的消解范 围扩大了。 在具体 的应用时还需要考虑层 次捆绑的问题, 较为复杂, 在本 文中不 将 利用统计 与规则相结合 的方法生成 的语料用 于基 于事件 的 加 以考虑。 自动文摘 中之后, 对于文摘的性能也有所提高, 利用统计与规则相结 1 . 2 单复数一致原则 。指示语和相应 的先行语 的单 复数 必须是 合 的方法进行消解要 比单 纯利用统计 的方 法进 行消解所生 成的 自 致的 。分析情 况规定如下 : 动文摘的性能有所提高。 ( 1 ) 若主语为表示人 、 机构 、 地点的单一名词 时, 对应 的代词用 表 “ 在, p老工人 , n闫戌麟 , n r 家, n , , w当 , p李鹏 / n r 了解 , v 到/ v 示单数的代 词; 老闰/ n r 退休 , v 前, f 一直 , d都 / d 是/ v 厂, n里 , f 的, u先进 , a工作 ( 2 ) 若 主语为表示距 离 、 时间、 长度 、 价值 、 金额 、 重量 的名 词时, 者 , n 、 , w曾经 , d被 / p评 为 , v 北 京市 , n s 五/ m好 , a 职工 , n , , w退 休 对应代 词应 为单数代词; / v 后, f 仍然 , d 为, v 改善 , v 职工 , n的 / u住房 / n而 , c c 奔波 , v 时 , ( 3 ) 集合 名词做 主语 时, 若 表示 整体概念 时, 对应代 词用单 数形 , w十分 , d高兴 , a , , w对 , p他 / r 为, p工 厂 , n建设 , v n作 出 , v的 , u 式; 若表示 集合 中的每个成员对应代词用复数形式。 贡献 / n / / n表示 , v 感谢 , v 。, w ” 1 . 3人称一致性。当指示语是人称代词, 相应的先行语也是人称 消解后 的语料为:在 , p 老 工人 / n闫戌麟 , n r 家, n , / w当 , p 李 鹏 代 词时, 他们必 须是一致 ( 相同的) 的。人称代词也可以作 为指代 的对 / n r 了解 , v 到, v 老闫 / n r 退休 , v 前/ f 一直 , d都 , d 是, v 厂, n 里, f 的 象, 但原则上人称代词 只能指代相 同的人称 代词, 不 同的人称代词应 , u 先进 , a 工作 者 , n 、 , w曾经 , d被 , p评为 , v 北 京市 , n s 五, m好 , a 当排斥掉 。 职工 , n , , w退休 , v 后, f 仍然 , d为 / v改善 , v 职工 , n的 , u 住房 , n而 1 . 4 距 离近优先原则 。 距离指示语近 的先行语优先指代 。 例: 张 , c c奔波 , v时 / g , / w十分 / d高兴 / a , / w对 / p闫戌 麟 , n r 为, D工厂 / n 三的哥哥气走 了他的朋友( 这里, 他优先选择: 哥哥) 。 建设 , v n作出 , v的 , u 贡献 / n / / n表示 , v 感谢 , v 。, w 1 . 5 重 复出现优先原 则。上下文 中重复 出现的先行语 优先指 尽管加入规则后 我们 的消解后 的语料增加 了可读性 和连 贯性, 代。 但是相对 于英文而言, 中文指代消解 的研究相对较少, 人工添加 的规 1 . 6“ 这/ 那等代词 ” 。指代消解系统中对 于代词短语 中出现的 则有很 多不足, 规则 的数量有 限, 选用 的规则也很难覆盖全部 的 自然 “ 这/ 这些 ” 、 “ 那/ 那个那些 ” 、 “ 哪/ 哪些 / 哪个”等情形还没有深入 语 言现象。本论 文讨论的规则相对还是 比较简单, 针对较复杂的文 在做测试 时, 可能会有很多 的未消解内容, 还需要进一步改进。 研究 , 为 了使指代消解系统对 于指代关 系识别的精确率提 高而不强 章, 调 召回率,这种情形留待以后 深入研 究, 现在不对这 种情况进行消 3结 论 解。 本 文在基于决策树 的中文指代消解 的基础上 加入 了四条规则 , 根据上 面常识原则 和对语 料的分析总结 , 本文提 出以下 四个规 绘 制出了消解 流程图, 主要针对的是指代消解 中的人 称代词 。通过 则: 实验对 比, 可 以看 出加 入规则 的识别结果 , 代词 的指代消解, 召 回率 规则一 : 指 代词 的一 致性, 即如果句子 中出现 了人 名, 那么后 面 有 了一定 的提高, 但是 由于本 文加 入的规则 相对 简单 , 好多的 中文指 出现 的指代 词如“ 他” 、 “ 她” 等有 指代关 系; 如果前方 出现的是机构 、 代 的内容没有考虑全面, 比较复杂 的指代消解还存在一些 问题 。 参 考 文 献 地点或者是物品名, 则指代词“ 它” 或者“ 它们” 等存在指代关系。 规则二:指代 消解 中的名词 短语 在进 行指代时,如果指代 词如 【 1 】 汤姆逊, 马丁 内特 . 牛津使 用英语语 法【 M】 锑 四版. 北京: 外语教 学与 2 0 1 I . “ 他” 、 “ 他们 ” 等, 与照应 词的位 置应 控制在代 词所在 的当前句子 和 研 究 出版 社 。 前几句, 即距离应该 3句范围 内, 指代 的可能性很 大。句子距 离大于 【 2 】 史树敏, 黄河燕, 刘 东升. 自然语 言文本指代 消解技 术研 究『 J 1 . 计算 3的可以不加 考虑 。 机科 学, 2 0 0 7 , 3 4 ( 1 2 ) : 2 1 4 — 2 1 5 , 2 3 7 .
  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
相关文档
最新文档