句法与词义相结合的中文代词消解
句法与词义相结合的中文代词消解1宋巍 秦兵 郎君 刘挺(哈尔滨工业大学信息检索研究室,哈尔滨 150001)E-mail: {wsong, bqin, bill_lang, tliu}@摘要: 句法知识对代词消解有着很大的支持。
近年来依存句法由于其利于描述语言中词与词之间的关系、突出核心词的特点日益得到重视。
本文提出了一种中文第三人称代词消解方法,直接利用依存句法分析器的结果,构建有效的句法角色特征和名词短语的支配词之间的词义相似相关性特征,采用支持向量机作为分类器,在ACE2005语料上的取得了满意的效果。
关键词:代词消解;依存句法;句法角色; 词义相似;支持向量机Combining Syntax and Word Sense for Chinese PronounResolutionWei Song Bing Qin Jun Lang Ting Liu(Information Retrieval Laboratory, Harbin Institute of Technology, Harbin 150001)E-mail: { wsong, bqin, bill_lang, tliu}@Abstract: Syntactic knowledge is important for pronoun resolution. In recent years, research on dependency parsing becomes active, because dependency grammar benefits to represent the relation between terms. We propose a dependency parsing based method for Chinese pronoun resolution, design effective syntactic role features and word sense similarity and word relevance features in related to the dependent words. Support V ector Machine is used as the classifier. The experimental result on the ACE 2005 training data shows that our approach gives a good performance and is effective for Chinese pronoun resolution.Key words:pronoun resolution; dependency parsing; syntactic role; word sense similarity; Support V ector Machine1引言指代是指当前的指示语与上文出现的短语(先行语)存在语义关联,指代消解的过程即是对当前指示语确定先行语的过程。
指代消解是自然语言理解与处理领域的核心问题之一,在信息抽取、机器翻译等应用中,都发挥重要作用[1]。
早期的指代消解算法基于语言学知识,以Hobbs算法[2]和中心理论[3]为代表。
近年来,研究者们尝试使用机器学习方法来解决。
基于机器学习的指代消解方法一般可以分为两类:有指导方法和无指导方法。
前者的主要思想是将指代消解问题视为二元分类问题,首先利用标注有指代关1本文受到国家自然科学基金(60675034)、863项目(2008AA01Z144)和微软基金(共指消解技术研究)资助系的训练数据训练一个分类器,而后利用这个分类器判断两个名词短语是否具有指代关系。
应用于指代消解的有指导的机器学习方法有贝叶斯[4]、决策树[5]、最大熵[6]等。
基于无指导方法的指代消解算法研究相对较少。
Cardie等提出一种基于聚类的名词短语共指消解方法[7] ,采用特征向量来表示各个名词短语,然后用聚类算法来实现名词短语的共指消解。
在中文上指代消解的研究相对较少[ 8,9]。
与英文相比,中文浅层词汇处理难度更大,体现在句子需要分词,名词短语没有明确的性别、单复数特征,代词没有明确的主、宾格特征等。
这些难点都给指代消解的特征提取带来了很大困难。
2相关工作句法分析一直是研究者依靠的“武器”之一。
Hobbs提出了两种指代消解的算法:一种是简单Hobbs算法,通过自左向右先广搜索,层次遍历句法树来消解代词,另外一种在句法知识基础上加入了语义约束。
1994年,Lappin和Leass提出了句法与约束规则相结合的方法[10],首先使用槽文法分析器分析句子结构,继而通过约束规则过滤掉不满足条件的候选先行语,最后计算候选先行语权值来评判其作为先行语的可能程度。
Xiaofeng Y ang提出基于Tree-Kernel的方法[11],将句法分析树结构作为特征,利用Convolution Tree Kernel[12]计算两棵句法树之间的相似程度,取得了很好的效果。
近年来,依存语法和依存句法分析[13]越来越受到关注。
依存语法建立起句子中词和词的“依存”关系,每一个关系将上下两项联系起来,上项称为支配词,下项称为所属词,其主要目的在于描述与揭示构成语言的元素与元素之间的关系,因此可能更适于语言结构的描述与更深层次的分析。
本文利用自动生成的依存句法分析器的结果,构建句法角色特征,利用Hownet[14]计算指代词与候选先行语的支配词的词义相似度和词汇相关性作为特征,采用支持向量机作为学习算法在ACE2005的中文训练语料上,针对第三人称代词进行了实验。
后续内容组织如下,第二章将详细介绍我们的指代消解系统框架和基于依存句法分析的特征构建。
第三章介绍实验的设计与结果的分析。
最后对全文内容做出总结与展望。
3依存句法与词义结合的代词消解方法3.1系统框架我们的方法采用支持向量机作为分类器,利用自动获得的依存句法分析器的结果构建特征。
系统的框架如图1所示。
对训练语料中每一个待消解的代词首先确定候选先行语的范围,而后进行一致性约束过滤淘汰掉不符合一致性约束的候选得到最终的候选集合,继而构建训练实例训练得到一个分类模型。
测试时对每一个待消解的代词确定其候选先行语的集合,每个候选先行语与代词构成一个分类实例,利用训练得到的模型进行分类,确定最终的先行词。
3.2一致性约束过滤和训练、测试实例构建不符合性别、单复数和名词短语的类别一致性约束的名词短语之间是不能互指的。
例如:图1系统框架“她”不能指向布什先生,因为不符合性别一致性;“他”不能指向“同学们”,因为不符合单复数一致性;同样,“他”不能指向“摩天大楼”,因为前者指人,后者指建筑,两者不符合类别一致性。
在一致性约束过滤阶段,将过滤掉不符合一致性约束的候选。
这需要对名词短语的性别、单复数和类别进行识别。
单复数和类别的识别依靠标注语料提供的信息,将在实验设计部分阐述。
性别识别将名词短语的性别表示为Male,Female,Unknown之一。
对人名和非人名名词短语采取不同策略。
对于人名,利用尾字作为性别指示词,按照它们在男名和女名中出现的比例作为判断标准。
对出现在男名或者女名中的比例大于一定标准(实验中设为0.75)的尾字对应的人名标注为相应的性别,其余标注为Unknown。
对于非人名名词短语,借助Hownet提供的语义信息识别。
Hownet中有词语的性别指示信息,“male|男”表示男性指示词,“female|女”表示女性指示词,“#male|男”表示男性相关指示词,“#female|女”表示女性相关指示词。
在Hownet中查询名词短语的核心词(Head),如果核心词的知识元定义中含有包含性别指示的义项则将其置为相对应的性别。
若Hownet不包含核心词或对应的义项中不包含性别指示信息则置为Unknown。
最终对于两个名词短语M1和M2,如果具有明确(Male或Female)但不相同的性别信息,如:M1为Male,M2为Female,则认为二者不具有性别一致性。
构建训练实例时,对于每一个代词将在其之前出现的三句(包括代词所在句)以内的,与该代词属于同一实体的名词短语与该代词作为一个训练正例,对于不属于同一实体的名词短语进行一致性约束过滤,余下的候选名词短语分别与该代词构成一个训练反例。
构建测试实例时,将代词前三句内的符合一致性约束的名词短语作为候选,与代词构成一个分类实例。
3.3特征选择通常的指代消解算法构造特征时,只考虑代词和候选先行语两者本身的属性或者两者之间的联系,如:词汇距离、词语类别、是否具有同位或并列关系等,即使语义特征,也仅仅考虑两个名词短语之间的语义相关性,而没有利用上下文中其他词语的语义特征。
这种策略下有一些指代现象难以区分,例如:1.李老师病倒了,小明说他要去看一看。
2.李老师病倒了,小明说他的病是累出来的。
对句中的“他”进行消解。
显然,句1中的“他”应当指代“小明”,句2中的“他”指代李老师。
然而,传统的指代消解系统对这两句的处理一般是没有区别的,很可能给出相同的结果。
观察句2中的代词“他”和候选先行语“李老师”的支配词都为“病”,给予我们很大的指示性:“他”指向“李老师”的可能性将更大一些。
又例如:“我行使权力加重他的刑罚,判他坐牢7年和鞭打12下。
”其中两个“他”分别依存于“刑罚”和“坐牢”,这两个词具有很大的相关性。
这给我们一个启示:代词与候选先行语所在的上下文内,与它们关系密切的词语之间的语义关联性可以帮助我们确定复杂情形下的指代关系。
依存句法不仅本身可以提供丰富的句法信息而且这种词和词之间的依存关系了提供一种途径来确定与代词和候选先行语具有密切关系的词语。
这即是我们将句法与支配词词义结合的初衷。
以下,令P为待消解的代词,A为候选的先行语,D P为P依存的支配词,D A为A依存的支配词,根据依存分析的特点设计了以下特征。
3.3.1支配词的词义特征(1) DependWordsSimilarity:我们寄希望于支配词的词义相似性可以帮助代词消解,利用Hownet提供的API:HowNet_Get_Concept_Similarity,计算两个词语词义相似度。
HowNet_Get_Concept_Similarity可以给出两个概念(即义项)之间的相似度,计算方法综合考虑了概念的类的相似度,框架的相似度,定义的相似度等。
一个词在Hownet中往往具有多个义项,令WordSence_Similarity(X, Y)表示词语间的词义相似度并定义如下。
定义1:设词X具有义项(x0, …, x i),Y具有义项(y0, …, y j),i >= 0, j >= 0, 则X与Y的词义相似度WordSence_Similarity为:i j (1)i, jW ordSence_Similarity(X, Y)=max(HowNet_Get_Concept_Similarity(x, y))如果WordSence_Similarity(D A, D P)大于指定阈值(设为0.8),将此特征置为True;(2) DependWordRelevant:Hownet提供的API:HowNet_Get_Concept_Relevance可以得到与一个概念的相关概念场的词语,利用该API把一个词所有义项对应的相关词语合并作为该词的相关概念词集。
语境对歧义的消解
语境对歧义的消解4.1文化因素的影响文化是一个民族在自己的社会历史中形成的独特风格与传统。
从文化的构成来看,语言既是文化的一部分,又是文化的载体。
反过来,文化的各个方面在某种程度上又影响语言的表达。
由于任何一种语言都承载着一定的文化内涵,所以,同一个词在不同的文化环境中所容纳的文化内涵也常不同。
英语文学作品中,大量的习语、成语、引语和典故等词语都含有其独特文化成分,这些词语有的可追到古希腊、罗马神话,有的跟基督教《圣经》有关,有的来自英美电影、广告、电视、畅销书和报刊杂志。
不了解产生这些词语的文化语境,就很难把握词义的内涵。
确定词汇意义可凭借词典,领会词语的文化意义却只能依赖对文化环境的了解。
从文化氛围着手,充分了解词的文化内涵,才能透彻地理解言语交际中的每一个词。
4.2词的搭配意义词项搭配(collocation),指词项在长期使用过程中逐步形成的习惯搭配,例如:“茶”可以与“浓”或“淡”搭配,而不与“稀”或“稠”搭配;“酒”可以是“淡”的,但却不能说“浓酒”。
不同的语言中词语搭配的习惯不相同。
汉语中的“淡酒”和“淡茶”译成英语后分别为light wine和weak tea。
再如:fat 是一个多义词,与不同的词项连用时意义不同:a fat pjg(肥胖的)、fat pork(多脂肪的)、fat lands(肥沃的)、fat income(优厚的)、fat kitchen(贮足食物的)等。
在人们的认识领域中,对外部世界的观察,必然要客观地反映在我们的头脑中,再用语言表达出来。
因此客观世界,即情景,决定词汇的某些搭配原则。
搭配意义可以限制人们理解词义的主观随意性。
词项的搭配关系既相对稳定,又不断变动,正确理解这一辨证关系很有必要。
我们掌握词项习惯搭配的目的,不仅仅是为了遵守搭配习惯,正确用词,而也是为了判断搭配幅度的扩展趋势,推测非惯常搭配的意义,找出创造胜用词的依据。
4.3语面意义之外的词的含义在具体的语境中说出的言语常常具有超出话面意义的特殊含义,这种含义不同于语句的概念和命题意义,后者直接来自词语和句子,前者则间接地来自语用推断。
基于组合特征的汉语名词词义消歧
Computational Linguistics and Chinese Language ProcessingVol., No., , pp. 1The Association for Computational Linguistics and Chinese Language Proces sing 基于组合特征的汉语名词词义消歧1A Study on Noun Sense Disambiguation Based onSyntagmatic Features王惠WANG HuiEmail: chswh@i.sgAbstractWord sense disambiguation (W SD) plays an important role in many areas of natural language processing, such as machine translation, information retrieval, sentence analysis, and speech recognition. Research on WSD has great theoretical and practical significance. The main purposes of this study were to study the kind of knowledge that is useful for WSD, and to establish a new WSD model based on syntagmatic features, which can be used to disambiguate noun sense in Mandarin Chinese effectively.Close correlation has been found between lexical meaning and its distribution.According to a study in the field of cognitive science [Choueka, 1983], people often disambiguate word sense using only a few other words in a given context (frequently only one additional word). Thus, the relationships between one word and others can be effectively used to resolve ambiguity. Based on a descriptive study of more than 4,000 Chinese noun senses, a multi-level framework of syntagmatic analysis was designed to describe the syntactic and semantic constraints of Chinese nouns. A ll of these polyseme nouns we re surveyed, and it was found that different senses have different and complementary distributions at the syntax and/or collocation levels.1本研究得到中国973重点基础研究项目“面向新闻领域的汉英机器翻译系统”(G1998030507-4)的支持。
_语句_与_代词_的设定对指代消解的影响_一项向心理论参数化汇总
2008年5月第31卷第2期现代外语(季刊)ModernForeignLanguages(Quarterly)May2008Vol.31No.2“语句”与“代词”的设定对指代消解的影响———一项向心理论参数化实证研究*上海外国语大学许余龙段嫚娟华东理工大学付相君提要:本文采用向心理论的参数化研究方法,设计了六种指代消解算法,通过对标注语料的分析,初步探讨了“语句”与“代词”这两个参数的设定对汉语指代消解的影响。
结果表明,总体来说,无论采用基于哪种确定Cf显著度排序的算法,1)语句的设定对代词指代消解的影响要比零形代词小;2)将语句设定为小句所得到的零形代词消解结果,要普遍优于将语句设定为自然句;3)汉语代词的指代消解准确率要远低于零形代词的消解准确率。
向心理论、参数化研究关键词:指代消解、[中图分类号]H030[文献标识码]A[文章编号]1003-6105(2008)02-0111-10理论时,致力于使其具有跨语言有效性,并且1.引言向心理论(Joshi&Weinstein1981;Groszetal.1995;Walkeretal.1998)是一个关于语篇局部连贯性和代词化的理论,着重研究在一个语篇片段中,注意焦点、指称形式的选择和连贯性这三者之间的联系。
该理论简单明了、易操作、易验证,因而被广泛应用于语篇回指的理解和生成研究(如见Lappin&Leass1994;是将其作为一个抽象的、语言学的语篇理论而非一个具体的语篇生成或理解的算法规则系统提出的,所以故意对其中的一些基本核心概念不作明确的厘定。
同时,不同的研究者在应用向心理论时,对其中的一些基本概念和主要论断又有不同的定义和理解,因而得出的结论难以比较。
因此,Poesioetal.(2004)提出了向心理论的参数化研究方法,将这些基本核心概念视为该理论中的参数,并探讨了这些参数的不同设定对该理论有效性的影响。
本文将参照该研究方法,初步探讨“语句”与“代词”这两个参数的设定对汉语指代消解的影响。
句子语境中汉语同形异音词的歧义消解
句子语境中汉语同形异音词的歧义消解汉语中的同形异音词简单来说就是指同样的形状或字形但是却有不同的音节和含义的字词。
这类词语,因为音节的不同而造成了很多语言学上的歧义,造成了很多不必要的误解或者误会。
因此,对于这类词的消解问题是经常被讨论的一个问题。
本文将介绍汉语中的同形异音词的歧义消解及其相关案例。
一、歧义消解的概念和重要性歧义消解是指在一个句子中,根据上下文的含义,消解语句中句子成分存在的歧义。
在汉语这个相当特别的语言中,因为存在同形异音的词语,在造句时经常会出现歧义。
而歧义的存在,则会让人们产生误解和其他不必要的问题。
歧义的消解,就是避免和纠正这类问题,确保交流无障碍,避免出现不必要的误解和误会。
歧义消解的重要性在于,在正常的人际交流中如果存在歧义,会产生不必要的误解和问题,并对交流造成困扰,影响交流的质量和效果,降低沟通的效率,而在商业活动中甚至可能对业务产生损失或者错失商机。
因此,对于同形异音词的消解问题,应引起足够的重视。
二、同形异音词的例子及其歧义消解方法1. 会会是一个同形异音词,可以表示会议、会员、能力等。
当“会”字在语境中出现时,应该结合上下文具体含义来理解。
比如:我今天有个会。
- 会指的是会议我是一个书法会的会员。
- 会指的是组织他数学很好,只要学一遍就会了。
- 会指的是能力2. 行行,可以表示走,可行性、行业等。
同样的,行在语境中的具体含义要根据上下文情况而定。
比如:我明天不行,有事情要处理。
- 行指的是能否做某件事情这份合同还可以行吗?- 行指的是可行性评估他是从事IT行业的。
- 行指的是职业方向3. 坐坐是一个很容易产生歧义的同形异音词,可以表示做、坐在上面等。
比如:我坐在沙发上看电视。
- 表示坐在上面今天有事,去公司坐了一天。
- 表示在公司工作别坐着不动,出去散散步。
- 表示停留在某个地方4. 挂挂可以表示衣服、电话或者情绪等,这也是一个同形异音词的例子。
比如:他挂了电话之后就立刻进入了工作状态。
指代消解中代词待消解项识别研究
指代消解中代词待消解项识别研究陈九昌;孔芳;朱巧明;周国栋【摘要】This paper studies the identification of pronouns to be resolved on the basis of a machine learning based coreference resolution platform.A filter of pronouns to be resolved is generated with machine learning method by combining these two: to mine sets of features which are able to discriminate whether the pronouns are the items to be resolved or not, and to summarise and educe syntactic structure of pronouns to be resolved with rules, and they are add onto the pronouns coreference resolution platform. The performance of the filter and the contribution to pronouns coreference resolution are tested with ACE2003 benchmark corpus. Experiment shows that the filter achieves higher precision rate and the performance of pronouns coreference resolution system can be improved outstandingly.%以基于机器学习的指代(Anaphora)消解平台为基础,研究代词待消解项识别问题.挖掘能区分代词是否为待消解项的特征集,总结归纳具有规律的代词待消解项的句法结构,使用机器学习的方法将二者结合生成代词待消解项过滤器并将其加入到代词指代消解平台.在ACE2003基准语料上测试过滤器自身性能及对代词指代消解的贡献.实验表明过滤器具有较高的准确率,能明显地提高代词指代消解系统的性能.【期刊名称】《计算机应用与软件》【年(卷),期】2011(028)003【总页数】4页(P217-219,249)【关键词】指代消解;待消解项识别;机器学习【作者】陈九昌;孔芳;朱巧明;周国栋【作者单位】【正文语种】中文0 引言指代是自然语言中常见的语言现象,它是指在语篇中用一个指代词回指某个以前说到过的语言单位,这对保持文章的连贯性上起着重要的作用。
中文词义消歧的方法研究
中文词义消歧的方法研究摘要:词义消歧一直是自然语言处理领域的难题之一,它的研究对包括机器翻译、信息检索、文本分类等众多研究领域都会有一个积极的推动作用。
本文阐述了词义消歧的方法,以及各种消歧方法的优缺点,分析了影响词义消歧效果的因素,并给出了自己在词义消歧方面的想法。
关键词:词义消歧;自然语言处理;规则;统计词义消歧是自然语言处理领域一个重要的研究课题.也是近年来该领域研究的热点问题之一。
歧义的存在使计算机在“理解”自然语言时发生了困难,并很可能出现了错误。
词义消歧要解决的问题是如何让计算机理解多义词在特定的上下文环境中具体代表的语义。
汉语的词义消歧研究起步比较晚,整体水平不容乐观.尚局限在几个歧义词,譬如说选择5~10个有歧义的名词或动词作为消歧研究对象,个别正确率很高,但难以推广至全文(即所有的歧义词)。
目前的词义消歧研究还停留在实验室阶段,离实际应用还有很长的一段距离。
一、词义消歧方法语言学知识描述了词汇间的关系,歧义的产生源于词汇所涉及的领域、所处的结构等因素。
消解歧义的前提是为歧义词选择恰当上下文。
所有歧义的消解都依赖于多义词上下文提供的信息。
所以通过特定的上下文环境判断歧义词的特定词义是解决词义消歧问题的唯一出发点,是所有词义消歧技术、方法的源头。
1、基于规则的词义消歧方法早期的词义消歧研究重点在于基于规则的方法。
该方法依赖语言学家的语言知识来描述词义之间的关系,并建立规则库。
通过对歧义词及其上下文词语的分析,选择满足规则、条件的词义作为正确答案。
该方法符合人类的认知习惯,像专家系统那样很容易理解并被接受。
但由于规则通常由语言专家制定,具有很大的主观性,难免存在一些错误。
此外,如何保证规则库的一致性、可扩充性和完备性是该方法面临的难题。
2、统计词义消歧方法统计词义消歧方法借助统计学的思想和方法来处理词义歧义问题,统计学的方法不需要制定规则,自动在语料库、知识库中获取所需信息,来指导词义消歧。
统计与规则相结合的中文指代消解
距离特征定义如下: [ 3 】 王厚峰. 汉语篇章的指代 消解浅论[ J ] . 语 言文 字应 用, 2 0 0 4 ( 4 ) : 1 1 3 — 1 9 . 规则 三: 如果 出现 了第 三人称代 词 “ 他” , 那 么后 面出现 的代词 1 “ 他” 是全匹配, 即指代的是相 同的先行词 。 『 4 】 孔芳, 周 国栋等. 指代 消解综述『 J ] 计 算机 工程, 2 0 1 0 , 3 6 ( 8 ) : 3 3 — 3 6 . 规则 四: 第三人称在指代消解是 比较好判断, 由于第一人称 “ 我”
科 技论 坛
・ 1 1 5 ・
统 计与规则相结合 的中文指代消解
韦丽红 王继 钢
( 呼伦 贝尔学院 计算机科学与技 术学院, 内蒙古 海拉 尔 0 2 1 0 0 8 ) 摘 要: 研 究选定了 6 种特征 向量 , 在1 2 0个手工标注的指代样本的基础上采用 C5 . 0 决策树 方法训练得到一棵 用于 中文名词短语 指代 消解 的决策树 , 并对其进行 实验测试 。采用决策树 的 i f - t h e n规 则之前加入 四奈针对代词指代 消解 的规则的方法来改进 系统。 关键词 : 指代消解 ; 特征 ; 规 则; 决策树 采用统计和规则 相结合 的方式来进行指代消解。 解决召 回率较 或者 “ 我们” 这样 的指代 词在判 断起来有一 定的难度, 所 以本 文不加 低的方法是通过大量 的手工标记 得出更好 的决策树 和向量特征, 但 以考 虑 。 以上 四条规则从上到下依次判断执行。 2加入 了规则的消解流程图 指代消解在 国外多采用规则 的方式 , 多在句法层 面上进行研究, 本文实 验人 民 E t 报 1 9 9 8年 1 月份 和 2 0 0 0年 4月 份新 闻版 的 如R A P算法等。国外的规则 多是在句法和语法层面上进行的, 国内 文章作为语料 , 首先 确定语料 的特征属性 , 通过 C 5 . 0算法构建形 成 的基 于规则 的制定, 比较有代表性 的是 王厚斌 提出的排斥 规则, 此外 个新的决策树算法, 再结合上 面提 出的四个规则进行指代消解, 将 参 考文献中可 以查看汉语 的消解特点。 这次消解后 的语料作为 自动文摘生成的源语料 。 1规则 的选 定 使用 5 0个样本进行 实际文档 的指代消解 问题, 通过 实验加入 了 在语 言学 中, 我们总结 了以下一些常识原则 : 上面的四个规则过滤之后, 进行指代消解, 实验 得到的实验测试结果 1 . 1 J 陛别 统一原则 。指示语 和相应 的先行 语的性别必须是一致 显示 召回率有 了明显的提高。 的。如果 指示语 和相应的先行语 的性别得性别 不一致, 基本 上可 以 利用统计 中的决 策树 与规则相结合 的方法来 改进方法之 后, 使 排除指代关系 。例如: “ 母亲 / n a p 王/ n r f 玲/ n r g ” ( 根据 “ 母亲” , 性别 为 该 方法能更加细致 的区分在消解范 围内的代词在具体 的语 境 中是 “ 女性” ) , 但是这时候要考虑识别优先 问题 , “ 王/ n r f 玲/ n r g ” 性 别为不 否需 要消解, 并且能够进行正确 的消解 。在统计 方法中加人 了规则 确定 。这里需要考虑 “ 人名 ” 的优先级 比“ 普通指人名词 ” 的高, 但 是 方法之后, 代词 的消解范 围扩大了。 在具体 的应用时还需要考虑层 次捆绑的问题, 较为复杂, 在本 文中不 将 利用统计 与规则相结合 的方法生成 的语料用 于基 于事件 的 加 以考虑。 自动文摘 中之后, 对于文摘的性能也有所提高, 利用统计与规则相结 1 . 2 单复数一致原则 。指示语和相应 的先行语 的单 复数 必须是 合 的方法进行消解要 比单 纯利用统计 的方 法进 行消解所生 成的 自 致的 。分析情 况规定如下 : 动文摘的性能有所提高。 ( 1 ) 若主语为表示人 、 机构 、 地点的单一名词 时, 对应 的代词用 表 “ 在, p老工人 , n闫戌麟 , n r 家, n , , w当 , p李鹏 / n r 了解 , v 到/ v 示单数的代 词; 老闰/ n r 退休 , v 前, f 一直 , d都 / d 是/ v 厂, n里 , f 的, u先进 , a工作 ( 2 ) 若 主语为表示距 离 、 时间、 长度 、 价值 、 金额 、 重量 的名 词时, 者 , n 、 , w曾经 , d被 / p评 为 , v 北 京市 , n s 五/ m好 , a 职工 , n , , w退 休 对应代 词应 为单数代词; / v 后, f 仍然 , d 为, v 改善 , v 职工 , n的 / u住房 / n而 , c c 奔波 , v 时 , ( 3 ) 集合 名词做 主语 时, 若 表示 整体概念 时, 对应代 词用单 数形 , w十分 , d高兴 , a , , w对 , p他 / r 为, p工 厂 , n建设 , v n作 出 , v的 , u 式; 若表示 集合 中的每个成员对应代词用复数形式。 贡献 / n / / n表示 , v 感谢 , v 。, w ” 1 . 3人称一致性。当指示语是人称代词, 相应的先行语也是人称 消解后 的语料为:在 , p 老 工人 / n闫戌麟 , n r 家, n , / w当 , p 李 鹏 代 词时, 他们必 须是一致 ( 相同的) 的。人称代词也可以作 为指代 的对 / n r 了解 , v 到, v 老闫 / n r 退休 , v 前/ f 一直 , d都 , d 是, v 厂, n 里, f 的 象, 但原则上人称代词 只能指代相 同的人称 代词, 不 同的人称代词应 , u 先进 , a 工作 者 , n 、 , w曾经 , d被 , p评为 , v 北 京市 , n s 五, m好 , a 当排斥掉 。 职工 , n , , w退休 , v 后, f 仍然 , d为 / v改善 , v 职工 , n的 , u 住房 , n而 1 . 4 距 离近优先原则 。 距离指示语近 的先行语优先指代 。 例: 张 , c c奔波 , v时 / g , / w十分 / d高兴 / a , / w对 / p闫戌 麟 , n r 为, D工厂 / n 三的哥哥气走 了他的朋友( 这里, 他优先选择: 哥哥) 。 建设 , v n作出 , v的 , u 贡献 / n / / n表示 , v 感谢 , v 。, w 1 . 5 重 复出现优先原 则。上下文 中重复 出现的先行语 优先指 尽管加入规则后 我们 的消解后 的语料增加 了可读性 和连 贯性, 代。 但是相对 于英文而言, 中文指代消解 的研究相对较少, 人工添加 的规 1 . 6“ 这/ 那等代词 ” 。指代消解系统中对 于代词短语 中出现的 则有很 多不足, 规则 的数量有 限, 选用 的规则也很难覆盖全部 的 自然 “ 这/ 这些 ” 、 “ 那/ 那个那些 ” 、 “ 哪/ 哪些 / 哪个”等情形还没有深入 语 言现象。本论 文讨论的规则相对还是 比较简单, 针对较复杂的文 在做测试 时, 可能会有很多 的未消解内容, 还需要进一步改进。 研究 , 为 了使指代消解系统对 于指代关 系识别的精确率提 高而不强 章, 调 召回率,这种情形留待以后 深入研 究, 现在不对这 种情况进行消 3结 论 解。 本 文在基于决策树 的中文指代消解 的基础上 加入 了四条规则 , 根据上 面常识原则 和对语 料的分析总结 , 本文提 出以下 四个规 绘 制出了消解 流程图, 主要针对的是指代消解 中的人 称代词 。通过 则: 实验对 比, 可 以看 出加 入规则 的识别结果 , 代词 的指代消解, 召 回率 规则一 : 指 代词 的一 致性, 即如果句子 中出现 了人 名, 那么后 面 有 了一定 的提高, 但是 由于本 文加 入的规则 相对 简单 , 好多的 中文指 出现 的指代 词如“ 他” 、 “ 她” 等有 指代关 系; 如果前方 出现的是机构 、 代 的内容没有考虑全面, 比较复杂 的指代消解还存在一些 问题 。 参 考 文 献 地点或者是物品名, 则指代词“ 它” 或者“ 它们” 等存在指代关系。 规则二:指代 消解 中的名词 短语 在进 行指代时,如果指代 词如 【 1 】 汤姆逊, 马丁 内特 . 牛津使 用英语语 法【 M】 锑 四版. 北京: 外语教 学与 2 0 1 I . “ 他” 、 “ 他们 ” 等, 与照应 词的位 置应 控制在代 词所在 的当前句子 和 研 究 出版 社 。 前几句, 即距离应该 3句范围 内, 指代 的可能性很 大。句子距 离大于 【 2 】 史树敏, 黄河燕, 刘 东升. 自然语 言文本指代 消解技 术研 究『 J 1 . 计算 3的可以不加 考虑 。 机科 学, 2 0 0 7 , 3 4 ( 1 2 ) : 2 1 4 — 2 1 5 , 2 3 7 .
基于句法分析的汉语词义消歧
中图分类号 :T P 3 9 1 . 2 文献标 志码 :A 文章编 号 :1 0 0 1 . 3 6 9 5 ( 2 0 1 4 ) 0 1 — 0 0 4 0 — 0 3
d o i : 1 0 . 3 9 6 9 / j . i s s n . 1 0 0 1 . 3 6 9 5 . 2 0 1 4 . 0 1 . 0 0 8
C o l l e g e o f l n J b r t mz t i o n& C o mm u n i c a t i o n E n g i n e e r i n g , H a r b i n E n g i n e e r i n g U n i v e r s i t y , Ha r b i n 1 5 0 0 0 1 ,C h i n a )
d i n g a n a mb i g u o u s w o r d a n d p r o p o s e d a n e w me t h o d o f wo r d s e n s e d i s a mb i g u a t i o n b a s e d o n p a r s i n g k n o wl e d g e .I t e x t r a c t e d p a r s i n g i n f o r ma t i o n a n d p a r t o f s p e e c h a s d i s a mb i g u a t i o n f e a t u r e s .T h i s p a p e r u s e d n a i v e B a y e s i a n mo d e l a s wo r d s e n s e d i s a m—
基于组合范畴语法的汉语指代歧义消解
收稿日期:2020-11-28基金项目:国家社科基金重大招标项目“面向计算机人工智能的组合范畴语法研究”,项目编号:17&ZDA027。
作者简介:周正(1997-)男,重庆巴南人,四川师范大学哲学所硕士研究生。
研究方向:自然语言逻辑。
2021年第2期第39卷(总第211期)NO.2,2021Vol.39General No.211贵州工程应用技术学院学报JOURNAL OF GUIZHOU UNIVERSITY OF ENGINEERING SCIENCE 摘要:组合范畴语法通过把不同的范畴指派给同一词条,以及改变证明树里词条的毗连顺序,能够从范畴推演和λ-演算两个方面消解汉语的指代歧义。
带有指代算子的组合范畴语法是通过在组合范畴语法中增加指代算子“│”和若干指代规则而得到的,能够有针对性地处理涉及语义资源重复使用的汉语指代歧义现象。
通过给代词指定不同的先行词,可以得到不同语义理解的证明树,从而完成指代歧义的消解。
关键词:反身代词;指代歧义;歧义消解;范畴中图分类号:B81文献标识码:A 文章编号:2096-0239(2021)02-0043-07基于组合范畴语法的汉语指代歧义消解周正(四川师范大学哲学研究所,四川成都610066)一、引言在自然语言中经常会出现非连续现象,这类语言现象的特点是“在语义上结合但在句法上却分离”,其中就包括指代现象。
在语言学中,先行词就是指代词所指的对象,指代消解(anaphora resolu ⁃tion )就是为某个指代词确定先行词。
例如:(a )小兰上班去了,但她忘了带伞。
(a )句中指代先行词“小兰”的就是指代词“她”。
这里的“小兰”不仅要作为主语与其他语言成分进行运算,还要作为“她”这个代词的先行词,所以就多次使用了词条“小兰”。
根据子结构逻辑的相关结论,传统命题逻辑包含了三条结构规则:单调规则、缩并规则、交换规则。
因为兰贝克演算处于子结构逻辑序列的底层,所以三条规则都不具备。
中文信息处理跨文本指代消解研究
浅谈中文信息处理跨文本指代消解研究摘要:中文信息处理是nlp(自然语言处理)的一个组成部分,它是研究自然语言的学科,它和其他学科如计算机学,文学,理工学等有着一定的综合联系。
中文跨文本指代消解是中文信息处理的核心技术,是提高信息抽取和信息检索正确率的基础,主要任务是解决重名消歧和多名聚合两大问题。
该文从基本概念入手,描述在语言处理中典型的指代现象和指代消解所需的基本语言知识;同时简单介绍指代消解中商用的算法和技术。
关键词:中文信息处理技术;切词;指代消解;语料库创建中图分类号:tp311 文献标识码:a 文章编号:1009-3044(2013)15-3447-02中文信息处理是利用计算机对存储在计算机内的中文的音、形、义等信息进行加工和处理。
中文信息处理一般可以继续分为汉字信息处理和汉语信息处理,具体内容包括对字词句、段落的处理,加工步骤首先为为输入—存储—传输—输出,其次是识别—转换压缩—检索—分析理解和生成等方面的处理技术。
中文信息处理的应用主要是信息抽取和信息检索,在信息抽取和信息检索过程中,难免会遇到多个指代词指向同一个实体,或者多个实体同一个名称的现象,如何解决这两大问题是当今研究的主要方向,单一文本指代消解技术目前已相对成熟,而跨文本指代消解技术更加复杂。
下面先介绍相关基本概念。
1 相关基本技术1)中文信息处理技术在语言处理阶段分为基础技术和应用技术,基础技术涉及到词处理,句处理,篇章处理。
应用技术主要应用在信息检索,信息抽取方面。
统计方法阶段的技术主要有语料库的建立,统计模型建立,利用语料库训练模型参数,编写算法解决问题等技术。
2)指代分为两种情况,指代主要有回指和共指消解主要有两项任务,即:重名消歧和多名聚合。
重名消歧义主要指同一个名称指代的物体不同,在信息检索中常出现,而多名聚合主要指多个名称指向同一个物体,一般应用在信息抽取中。
指代主要有回指和共指,如:“小明放学了,妈妈去接他”,句中的“他”一般就是回指“小明”,再如:“中国国家主席和毛泽东”就是共指。
