书面汉语自动分词及歧义分析
第25卷 第4期河南师范大学学报(自然科学版)Vol.25 No.4 1997年11月JournalofHenanNormalUniversity(NaturalScience)Nov.1997
书面汉语自动分词及歧义分析
郑延斌
(河南师范大学计算机系,453002,新乡;33岁,男,讲师)
摘 要 歧义现象是自动分词过程中不可避免的现象,本文通过对自动分词过程的分析,总结出书面汉语自动分词中歧义产生的根源,提出处理这些歧义字段的方法.关键词 分词;切分;歧义字段;知识;词典;规则分类号 TP391α
书面汉语自动分词是把汉语材料中汉字字符的序列用计算机切分成词的序列的过程.汉字是方块字,每一个方块汉字都自为一个独立的、完整的书写单元,相互之间有明显的界
限,书写时字与字逐一连续等矩离排列,词与词之间没有空格隔开,没有任何区分标志,因此
在进行词处理之前,首先要对待处理的汉语语料进行分词处理.这一问题解决的好坏,将直
接影响到词处理阶段的后期工作.因此称自动分词是汉语词处理阶段的“瓶颈”,自动分词是
汉语信息处理中关键的一环.
1 常用的分词方法介绍
自动分词中使用的分词方法,也称为机械分词方法.最基本的分词有以下3种:
1.1 最大匹配法——MM方法
MM(TheMaximunMatchingMethod)的基本思想是:假设自动分词词典中的最长词条中汉字个数为i,则取被处理材料当前字符串序列中的前i个字作为匹配字段,查找分词
词典,若词典中有这样一个i字词,则匹配成功,匹配字段作为一个词被切分出来;如果词典
中找不到这样一个i字词,则匹配失败.匹配字段去掉最后一个汉字,剩下的字符作为新的
匹配字段,进行新的匹配,如此进行下去,直到匹配成功为止.即完成一轮匹配,匹配出一个
词,然后再按上面的步骤进行下去,直到切分出所有词为止.
1.2 逆向的最大匹配法——RMM方法或OMM方法与MM方法相对应的方法是RMM方法(TheReverseDirectionalMaximunMatching
Method),也称OMM方法.它的分词过程与MM方法相同,不同的是每次是从待处理语料的末尾开始处理,每次匹配不成功时去掉的是前面一个汉字.
1.3 逐词遍历法该方法是把词典中的词按由长到短的顺序逐个搜索整个待处理材料,直到把所有的词
都切分出来为止.
α文稿收到日期:1997-06-23.除了上述3种基本方法外,在分词过程中可以采用其它的一些技巧,这些技巧有时也被
称为分词方法,但它们不是纯粹意义的机械分词方法.
[1]中把汉语自动分词方法归纳为以下11种:最大匹配法(MM方法);OMM方法;逐词遍历法;设立切分标志法;OM方法;有穷多层次列举法;二次扫描法;基于词频统计的分词方法;基于期望的分词方法;联想——回溯
法;双向扫描法.在实际的自动分词系统中,往往是几种方法结合起来使用,以求达到最佳的效果.
2 歧义分析
在分词过程中具有两种或两种以上切分形式的字段称为歧义字段,只有歧义字段才能
产生错误切分,衡量一个自动分词系统的指标主要有3个:切分速度,切分精度,系统的可维
护性.切分精度则直接反映系统的正确性与科学性,是3个指标中最重要的一个.所以,要提
高自动分词的精度,必须有效地处理歧义字段.
2.1 歧义产生的根源分词过程中歧义产生的根源可以归结为以下3个方面:
A)由自然语言中的二义性所引起的歧义,称为第一类歧义;如:“乒乓球拍卖完了”可以
切分成“乒乓球拍卖完了”又可以切分成“乒乓球拍卖完了”.这两种切分形式无论在语
法上、语义上都是正确的,只有结合上下文才能给出正确的切分.
B)由计算机自动分词产生的特有歧义,称为第二类歧义;如:“在这种环境下工作是太可怕了”,用计算机切分,可以切分成“在这种环境下工作是太可怕了”,也可以切分
成“在这种环境下工作是太可怕了”,而对本句来说,只有第二种切分都正确的.这
用人工分词是不可能产生歧义的.
C)由于分词词典的大小而引起的歧义,称为第三类歧义;如:“王小二是一个农民”,用
计算机切分被分为“王小二是一个农民”,这里“王小二”是一个人名,在汉语中应是一
个词,所以这个切分是错误的.“发展社会主义的新乡村”,“新乡”是一个地名,若词典中有该
词,则“新乡村”是一个歧义字段.因此,不论词典的大与小都可以产生歧义.
2.2 歧义字段的分类
[2]中把自动分词中的歧义现象分为两类:交集型歧义切分字段,多义组合型歧义切分
字段.如:“下工作”可以分为“下工作”或“下工作”,它是一个交集字段.“手指”可以切分成
“手指”或“手指”,它是一个多义组合字段.
[2]中给出了词尾字检验技术,利用此方法,可以找出所有的交集字段.但对于多义组合
字段,目前还没有比较好的检验技术,只能通过人工收集,在分词词典中加以歧义标记,然后
再利用某些知识来解决.
3 歧义的解决方法
3.1 第一类歧义
这类歧义,由于他们本身就是汉语言中的歧义问题,解决这类歧义需要依靠上、下文语
义信息,即增加语义、语用知识的处理.这无异对自动分词的效率有很大的影响(时间上和空
间上),而且实现起来比较困难.若是在词处理的相应阶段,结合对分词阶段未解决的歧义字19第4期 郑延斌:书面汉语自动分词及歧义分析段进行处理,则会起到事半功倍的效果.统计表明,第一类歧义字段只占整个歧义字段总数
的130以下,因此不必在分词阶段花费巨大的开销来处理它们.
3.2 第二类歧义
目前对它们的处理方法有以下几种:
A)分词知识处理法 这类方法是通过对大量歧义切分字段的研究,发现其中的一些普遍规律,获得知识,并反过来利用所获得的知识来处理歧义字段.
B)联想—回溯法[3] 该方法主要依据规则库处理歧义字段,规则库中包括有语法知识,使用联想机制构造新词汇,利用回溯机制处理歧义.
C)基于词频统计的方法 该方法的基本思想是在分词过程中,依据词频统计的结果,对歧义字段进行处理.频度高的词优先分出.若ABC是交集字段,AB的频度比BC的频度
高,则应切分为ABC.若A的频度比C的频度大,则应切分为ABC.
D)邻接约束法[4] 由于句法、语义或习惯用法的限制,或人们为了避免造成阅读上的
困难,相邻词之间有一种约束关系,称为邻接约束.如“那里”不能切分成“那里”.
E)基于数学期望的方法 在一个句子中,由于人们说话的习惯和汉语语法及语用规则,一个词的出现对于它后面的紧相随的词有一种期望.根据语法知识和语义知识可把该期
望分为结构期望和语义期望.
3.3 第三类歧义
计算机分词中使用的分词词典只能包括一定数量的词,而汉语中词的数量非常多,解决
这类歧义目前有两种方法:
A)增加构词知识 如:“他快快乐乐地走了”中的“快快乐乐”词典中可能没有这个词,故该句被错误切分成“他快快乐乐地走了”.“快快乐乐”一词属于AABB构词形式,若系统中有AABB这一条知识,就可以正确切分这一句子.
B)增加临时词典 对于人名、地名等专用名词,词典中只能收集少量,对没有收集的人名、地名可以采用临时词典的形式来解决.有了临时词典后,匹配过程中若分词词典匹配不
成功,需要从临时词典中来匹配.
4 分词知识处理法
能够正确切分某一类歧义字段的知识称为分词知识,所有分词知识的集合称为知识库
或规则库.虽然对第二类歧义的处理可以采用多种方法,但全面衡量,分词知识处理具有好
的效率.此方法的明显优点是:解决歧义问题的方法,独立于自动分词方法(机械分词方法),它的适用性比较强.对分词词典只要求能提供必要的词项信息,故对自动分词的空间复杂度
影响不大.再者采用这种方法便于在使用的过程中,采用知识学习的手段,以丰富系统的知
识,提高分词的精度.目前所用的分词知识可以分为如下几种:
4.1 构词知识
构词知识用于构造词典中没有的词.如:“花花绿绿的世界”,按照汉语的构词法“花花绿
绿”是一个词,但分词词典中不可能包括所有形如AABB的词,故词被错误地切分.构词知识能够构成如AA、AABB、AAB(AB为词)、ABB(AB为词)、前缀词构成的词、
后缀词构成的词等等,有了构词知识后,这类词就可以正确切分.
4.2 规则知识29河南师范大学学报(自然科学版) 1997年从歧义字段形成的词与词之间的结构关系和词性关系出发,总结出一些规则来解决它
们,这类知识[5]中作了详细说明.
4.3 专用知识用于正确地解决一个字所形成歧义字段的知识称为专用知识.如:“把”字知识的描述如
下:式中的W为分词词典中词的集合,WD为动词的集合.
r=把ΑΒ∩把Α∈W](Β∈WD]r1=把ΑΒ)∪(Β|WD∩ΑΒ∈W]r1=把ΑΒ)∪(Β|WD∩ΑΒ|W]r1=把ΑΒ).
利用此知识可以把“把头抬起来”正确切分为“把头抬起来”,“把儿子给你”正确切分
为“把儿子给你”,“请拉好把手”正确切分为“请拉好把手”等等.并不是分词知识越多越好,由于知识之间的相互影响和顺序不同,就可以有不同的切分
效果.因此知识库(或规则库)应是开放的系统,用户可以根据实际需要来进行调整、修改、添
加等操作.总之,只要进行研究,完全可在系统中彻底解决第二类、第三类歧义字段.
5 第一类歧义字段的处理
对于第一类歧义字段,目前还没有更好的处理方法,可以从下面几个方面入手:①高级
的分词知识处理 即在分词过程中使用语义知识、语用知识来解诀.②人工干预分词 在遇
到计算机解决不了的歧义时,借助于人工干预来完成,可以大大提高分词的精度,但对分词
的速度有影响.③人工分词与计算机自动分词结合 随着词输入技术的发展与运用,汉字输
入阶段的输入对象由单个字转变成词,用户在输入的过程中首先对所输入语言文本进行人
工分词,然后再把所分的词输入计算机,但由于词输入系统中不可能包括更多的词,加上输
入者的知识水平限制,这一阶段的分词不可能完全正确,进入分词阶段后,只需对有歧义的
字段来参考输入过程的分词就可以了.这一方法在利用计算进行自动分词的同时,又充利用
了用户在文本输入过程中的人工分词工作,对分词系统没有什么影响,但系统的分词精度可
以大大提高.
参 考 文 献
1 梁南元,郑延斌.书面汉语自动分词方法和分词模型.微型计算机,1991(3):182 梁南元.书面汉字自动分词与一个自动分词系统CDWS.北航学报,1984(4):443 李国臣.汉语自动分词及歧义组合结构的处理.中文信息学报,1988(3):324 张潮生.邻搠约束事汉语自动分词.ICCIP’87,19875 梁南元.汉语自动分词知识.中文信息学报,1990(2):29
PrintedChineseWordAutoSegmentationandAmbiguousPhrasesAnalysingZhengYanbin(DepartmentofComputerScience,HenanNormalUniversity,453002,Xinxiang)Abstract Ambiguousistheproductofautosegmentationwhichcannotbeprohibited,throughanalysingofautosegmentation,thispaperproposedtheoriginalofambiguousphrasesinautosegmenta2tionandgavethemethodstodealwiththeseAmbiguousPhrases.Keyword segmentation;ambiguousphrases;knowledge;dictionary;rule39第4期 郑延斌:书面汉语自动分词及歧义分析
汉语自动分词算法综述
2006年第4期 福建 电脑
汉语自动分词算法综述
瞿锋,陈纪元
r冀 士=母计车机 牛与矬长学 江苏苏州21f^ )
【摘要】:本文对目前已有的各种中文自动分词的算法、采用的模型、数据结构等方面进行了分析、比较,探讨了它们的
优缺点,并指出了今后的研究方向。
【关键词】:自动分词,算法模型.查全率,壶准率
1.引言
汉语与英语不同,英文文本是小字符集上的词串,而汉语是 大字符集上的字串。汉语的句子不同于英文句子.英文单词之间
有间隔.汉语文本中词与词之间没有明确的分隔标记.而是连续
的汉字串.词是构成句子的基本单位。若要计算机智能地理解汉
语中的每一句话。则必须让计算机明白该句子的各个词的含义.
也就是说需要计算机智能地把每一句话.都把词正确地切分出 来。才不会造成理解上的偏差。因而可以说汉语自动分词技术.
是所有的中文信息处理应用系统中共同的、基础性的工作.对象
语音识别、语音合成、文本校对、信息检索和机器翻译等等后续
的高级应用.都有根本性的指导意义。
显而易见。自动识别词边界.将汉字串切分为正确的词串的
汉语分词问题无疑是实现中文信息处理的各项任务的首要问 题。
基于以上的一些情况.本文主要探讨了计算机智能地对汉
语文本自动切分词的种种算法、模型。分析了其中的优缺点.并 对今后的工作提出指导
2.问题描述
2.1系统任务 汉语的语素和单字词.合成词和短语之问没有清晰的界限。
汉语分词是由计算机自动识别文本中的词边界的过程 从计算
机处理过程上看,分词系统的输入是连续的字符串(C。C:C ….
C )。输出是汉语的词串(w。W w,……w ),这里.w;可以是单 字词也可以是多字词。在这个过程中.我们所要解决的一个主要
问题就是.建立一个标准的分词系统词表。有一个权威的分词词
表作为分词依据。很可惜,到目前为止,我们还没有。另外一个主 要问题就是切分规范和消歧。这方面。虽然还没有出现一个百分
一种自组织的汉语组合型歧义消歧方法
第28卷第3期
VO1.28 NO.3 计算机工程与设计
Computer Engineering and Design 2007年2月
Feb.2007
一种自组织的汉语组合型歧义消歧方法
冯素琴, 陈惠明
(忻州师范学院计算机科学与技术系,山西忻州034000)
摘要:组合型歧义切分字段一直是汉语自动分词的难点。用人工校验后的分词语料提供的搭配实例作为组合歧义字段的
初始搭配知识,提出使用搭配统计表的多元最大对数似然比进行消歧;继而根据实验确定了歧义字段的上下丈窗口、窗口
位置区分、权值估计等要素;在此基础上采用自组织方法自动扩充搭配集,使消歧信息趋于稳定;最后,对提出的方法进行
了实验,实验表明,该算法能有效提高消歧准确率。 关键词:自然语言处理;汉语自动分词;组合型切分歧义;自组织方法;消歧 中图法分类号:TP391.1 文献标识码:A 文章编号:1000・7024(2007)03-0737・03
Adaptive Chinese combinatorial ambiguities disambiguate method
FENG Su.qin, CHEN Hui-ming
(Department of Computer Science and Technology,Xinzhou Teachers’University,Xinzhou 034000,China)
Abstract:Combinatorial ambiguity is a vital issue in Chinese word segmentation.A multi maximal log disambiguation algorithm by
collocations provided by using the checked word segmentation is presented;Then the key factors regarding combinatorial ambiguities is determined by experiments(the size of the context windows,the sensitivity of locations in the windows aS well aS weighting of feature
分词中的歧义处理
分词中的歧义处理
谭琼;史忠植
【期刊名称】《计算机工程与应用》
【年(卷),期】2002(038)011
【摘 要】歧义处理是影响分词系统切分精度的重要因素,是自动分词系统设计中的一个最困难也是最核心的问题.该文利用一种统计的方法来解决交集型歧义字段的切分.
【总页数】4页(P125-127,236)
【作 者】谭琼;史忠植
【作者单位】中国科学技术大学管理学院,北京,100080;中国科学院计算技术研究所,北京,100080;中国科学院计算技术研究所,北京,100080
【正文语种】中 文
【中图分类】TP30
【相关文献】
1.全文检索中的汉语自动分词及其歧义处理 [J], 熊回香
2.中文分词中的歧义识别处理策略 [J], 魏莎莎;熊海灵
3.汉语自动分词中的歧义处理 [J], 张辉丽;孟昭鹏;王慧芝
4.中文分词中歧义切分处理策略 [J], 郑家恒;张剑锋;谭红叶
5.谓词逻辑视角下HanLP中文分词中对歧义的处理 [J], 邱德钧; 冯霞
因版权原因,仅展示原文概要,查看原文内容请购买
中文分词相关技术简介
中文分词相关技术简介
目前对汉语分词方法的研究主要有三个方面:基于规则的分词方法、基于
统计的分词方法和基于理解的分词方法。
基于规则的分词方法
基于规则的分词方法,这种方法又叫做机械分词方法,它是按照一定的策略
将待分析的汉字串与一个"充分大的"机器词典中的词条进行匹配,若在词典中找到某个字符串,则匹配成功(识别出一个词)。常用的方法:最小匹配算法
(Minimum Matching),正向(逆向)最大匹配法(Maximum Matching),逐字匹配
算法,神经网络法、联想一回溯法,基于N-最短路径分词算法,以及可以相互组
合,例如,可以将正向最大匹配方法和逆向最大匹配方法结合起来构成双向匹配
法等。目前机械式分词占主流地位的是正向最大匹配法和逆向最大匹配法。
◆最小匹配算法
在所有的分词算法中,最早研究的是最小匹配算法(Minimum Matching),该算法从待比较字符串左边开始比较,先取前两个字符组成的字段与词典中的
词进行比较,如果词典中有该词,则分出此词,继续从第三个字符开始取两个
字符组成的字段进行比较,如果没有匹配到,则取前3个字符串组成的字段进
行比较,依次类推,直到取的字符串的长度等于预先设定的阈值,如果还没有匹配成功,则从待处理字串的第二个字符开始比较,如此循环。
例如,"如果还没有匹配成功",取出左边两个字组成的字段与词典进行比
较,分出"如果";再从"还"开始,取"还没",字典中没有此词,继续取"还没有
",依次取到字段"还没有匹配"(假设阈值为5),然后从"没"开始,取"没有",如此循环直到字符串末尾为止。这种方法的优点是速度快,但是准确率却不是
很高,比如待处理字符串为"中华人民共和国",此匹配算法分出的结果为:中
华、人民、共和国,因此该方法基本上已经不被采用。
◆最大匹配算法
基于字符串的最大匹配,这种方法现在仍比较常用。最大匹配(Maximum
Matching)分为正向和逆向两种最大匹配,正向匹配的基本思想是:假设词典中
语言歧义
句子歧义指的是一个句子含有两种或两种以上的意义和解释。由于造成歧义的原因纷繁复杂,本文只对几种主要原因作深入分析。
(一)一词多义和同形异义词引起的歧义
词汇层面引起的歧义的主要因素是一词多义,但同形异义现象——尤其绝对同形异义词(读音、词形和词性都相同的词)引起的歧义也为数不少。例如:
(1)He is looking for the glasses,
(2)I found the table fascinating,
例(1)的歧义是由于名词“glasses”在句中可解释为“眼镜”和“几个玻璃杯”,属一词多义引起的歧义。而例(2)的歧义是“table”既可作“桌子”也可作“项目表”解释,属同形异义词引起的歧义。
一词多义和同形异义的区别在于:一词多义指一个相同的形式具有若干个相关联的意义:同形异义的意义并不相互关联。这两种歧义一般都可借助语境来消除。
(二)短语层面引起的歧义
英语句子结构中的短语主要有名词短语、动词短语、形容词短语、介词短语等。现对这几种短语因内部结构和句法功能而造成的歧义进行了一些探讨。
名词短语由于本身结构产生了大量歧义,笔者总结了三种,举例如下:
(3)The old man and woman went there together,
这里的歧义是由于短语中的修饰语和中心词的关系不明确。名词短语“the
old nan and woman”中“old”所修饰的范围可解释为同时包括“man”和“woman”,也可解释为仅包括“man”而不包括“woman”。
(4)The girl’s story deeply moved us.,
此处的歧义是由于“属格’s”与中心词的关系既可表示“主谓、动宾、同位”,又可表示“所属、来源、性质、类别”等多种复杂关系。名词短语“the
girl’s story”既可指the story told by thegirl,又可指the story about
《系统功能语言学视角下英汉偏正结构歧义对比分析》范文
《系统功能语言学视角下英汉偏正结构歧义对比分析》篇一
一、引言
在语言交际中,语言结构的歧义是一个常见的现象。系统功能语言学作为语言学的一个分支,着重研究语言的三大元功能:概念功能、交际功能和语篇功能。其中,偏正结构是句子中常见的结构之一,其在英汉两种语言中都有出现,但由于两种语言的语法、文化、历史背景等方面的差异,偏正结构的歧义现象存在较大差异。本文将从系统功能语言学的视角出发,对英汉偏正结构的歧义进行对比分析。
二、英汉偏正结构的概述
偏正结构是指句子中修饰语与被修饰语之间的关系结构。在英语中,偏正结构通常由定语从句或分词短语等修饰语构成,而在汉语中,偏正结构则主要由定语或状语等修饰成分构成。由于两种语言的语法规则和文化背景等方面的差异,导致偏正结构的表达方式和歧义现象存在较大差异。
三、英汉偏正结构歧义的对比分析
1. 英语偏正结构的歧义
在英语中,定语从句或分词短语等修饰语的复杂性和多义性容易导致偏正结构的歧义。例如,The man with a long face.(那个有着长脸的男子。)这句话中,“a long face”既可以是用来描述“人”的外貌特征,也可以是用来形容“面孔”本身。因此,这个偏正结构的歧义可能使得读者对句子的理解产生不同的解释。
2. 汉语偏正结构的歧义
与英语相比,汉语的偏正结构更容易出现歧义现象。在汉语中,定语和状语等修饰成分往往较为复杂,其与被修饰成分之间的关系往往需要依赖上下文和语境才能确定。例如,“大红苹果”这个短语中,“大”和“红”的修饰关系可以有两种理解:一是苹果很大,颜色为红色;二是苹果是红色的,并且大小可变。这种歧义现象在汉语中非常常见。
四、系统功能语言学的解释
从系统功能语言学的角度来看,英汉偏正结构的歧义现象可以归因于语言的三大元功能的相互作用。在语言交际中,人们需要根据不同的语境和目的选择不同的语言结构和表达方式。因此,同一种偏正结构在不同的语境和目的下可能产生不同的理解和解释。此外,由于英汉两种语言的语法规则和文化背景等方面的差异,也导致了偏正结构的表达方式和歧义现象存在差异。
文心一言对汉语歧义的翻译研究
091
[摘 要] 语言歧义一直都是自然语言处理系统面临的最大挑战之一,最近百度推出的人工智能模型文心一言引起了大众的关注。通过实证研究,分析文心一言在汉语歧义句方面的翻译现状,探讨其在汉语歧义句翻译方面的特点和不足,得出文心一言可以通过人为反馈对结果进行优化,而且关注语言的使用习惯,让表达更地道,但是翻译比较单一,且没有一致性。这让人们更好地了解自然语言处理机制,优化人工智能的性能,让其更好地为人类所用,达到“人机合作”的理想局面。[关 键 词] 汉语歧义;人机互动;文心一言;翻译文心一言对汉语歧义的翻译研究
唐红芳 李婧怡
一、引言
我国著名语言学家朱德熙先生认为:“一种语言语
法系统里的错综复杂和精细微妙之处往往在歧义现象里
得到反映。”随着时代的发展,人工智能逐渐出现在生
活中,比如机器翻译、人机对话、智慧教学等,而语言
是人机交流最基础的媒介,自然语言的处理就变得十分
关键。机器无法像人类一样可以通过生活常识和对汉语
的精准掌握来排除歧义,它只有掌握人类制定出来的一
套消除歧义的规则才能破解这个难题。而机器翻译就是
一个不断去除句子分析歧义的过程。因此,研究自然语
言的歧义现象,并制定系统的消解歧义的规则,让机器
去掌握,是新时代语言学发展的一个关键方向。
二、文献综述
对于汉语的歧义研究最早可追溯到赵元任先生用英
语发表的《汉语歧义问题》。此后,汉语研究者从多个
方面对歧义进行了探讨,主要有歧义定义、歧义类型、
歧义格式、歧义比较和歧义消解方法等。刘悦怡等(2020)
对歧义的分类文献进行了详细的梳理,将现代汉语的歧
义类型划分为语音歧义、词汇歧义、句法歧义、语义歧
义和语用歧义五大类,本文将按照此分类标准进行实验。
目前的歧义研究以书面语歧义为主,语用歧义的相关研
究还不够深入,且多注重口头交际,书面交际中的语用
歧义研究比较匮乏(尤天来,2022)。因此,这里主要
探讨两个基本歧义层次,即词汇歧义和句法歧义,这也
是自然语言处理模型要面对的最基本的挑战。
中文分词技术
一、 为什么要进行中文分词?
词是最小的能够独立活动的有意义的语言成分,英文单词之间是以空格作为自然分界符的,而汉语是以字为基本的书写单位,词语之间没有明显的区分标记,因此,中文词语分析是中文信息处理的基础与关键。
Lucene中对中文的处理是基于自动切分的单字切分,或者二元切分。除此之外,还有最大切分(包括向前、向后、以及前后相结合)、最少切分、全切分等等。
二、 中文分词技术的分类
我们讨论的分词算法可分为三大类:基于字典、词库匹配的分词方法;基于词频度统计的分词方法和基于知识理解的分词方法。
第一类方法应用词典匹配、汉语词法或其它汉语语言知识进行分词,如:最大匹配法、最小分词方法等。这类方法简单、分词效率较高,但汉语语言现象复杂丰富,词典的完备性、规则的一致性等问题使其难以适应开放的大规模文本的分词处理。第二类基于统计的分词方法则基于字和词的统计信息,如把相邻字间的信息、词频及相应的共现信息等应用于分词,由于这些信息是通过调查真实语料而取得的,因而基于统计的分词方法具有较好的实用性。
下面简要介绍几种常用方法:
1).逐词遍历法。
逐词遍历法将词典中的所有词按由长到短的顺序在文章中逐字搜索,直至文章结束。也就是说,不管文章有多短,词典有多大,都要将词典遍历一遍。这种方法效率比较低,大一点的系统一般都不使用。
2).基于字典、词库匹配的分词方法(机械分词法)
这种方法按照一定策略将待分析的汉字串与一个“充分大的”机器词典中的词条进行匹配,若在词典中找到某个字符串,则匹配成功。识别出一个词,根据扫描方向的不同分为正向匹配和逆向匹配。根据不同长度优先匹配的情况,分为最大(最长)匹配和最小(最短)匹配。根据与词性标注过程是否相结合,又可以分为单纯分词方法和分词与标注相结合的一体化方法。常用的方法如下:
(一)最大正向匹配法 (MaximumMatchingMethod)通常简称为MM法。其基本思想为:假定分词词典中的最长词有i个汉字字符,则用被处理文档的当前字串中的前i个字作为匹配字段,查找字典。若字典中存在这样的一个i字词,则匹配成功,匹配字段被作为一个词切分出来。如果词典中找不到这样的一个i字词,则匹配失败,将匹配字段中的最后一个字去掉,对剩下的字串重新进行匹配处理…… 如此进行下去,直到匹配成功,即切分出一个词或剩余字串的长度为零为止。这样就完成了一轮匹配,然后取下一个i字字串进行匹配处理,直到文档被扫描完为止。 其算法描述如下:
一种改进的上下文相关的歧义字段切分算法
计算机系统应用 2oo6年第5l_期
一种改进的上下文:相关的歧义字段切分算法
A new Context..Sensitive ambiguous phrase segmentation Algorithm
张培颖 李村合 (中国石油大学(华东)计算机与通信工程学院东营257061):
摘要:无论在自然语言处理还是在机器翻译中,中文自动分词都是一个重要的环节。歧义字段切分是中文自动分 囱研尧中的一个“拦路虎”。在分析基于规则和基于上下文的歧义字段切分策略基础上,提出了一种改进的上下
文相关歧义字段切分算法。并根据汉语中特殊的语法现象,给出了切分算法的辅助策略来对待切分字符串进行预
处理。不仅提高了分词的精度。还加快了分词的速度。
关键词:自动分词歧义字段交集型歧义组合型歧义
1 引言
词是最小的能够独立活动的有意义的语言成分。
但中文是以宇为基本的书写单位,词语之间没有类似
英文空格之类的明显的区分标记。随着中文信息处理
工作的推进,对中文自动分词的要求越来越高。无论
在自然语言处理还是在机器翻译中,中文自动分词都
是一个重要的环节。 歧义字段切分是中文自动分词研究中的一个“拦
路虎”。歧义字段分为两种基本类型:交集型歧义和组
合型歧义。交集型歧义字段,占歧义字段总数的85%
一90%。本文在分析基于规则和基于上下文的歧义字
段切分策略基础上,提出了一种改进的上下文相关歧
义宇段切分算法,并根据汉语中特殊的语法现象。给出
了切分算法的辅助策略来对待切分字符串进行预处
理,不仅提高了分词的精度,还加快了分词的速度。
2歧义分析
2.1歧义产生的根源
分词过程中歧义产生的根源可以归结为以下3个
方面:
(1)由自然语言中的二义性所引起的歧义,称为 第一类歧义;例如:“美国会采取措施制裁伊拉克”,既
可以切分为:“美国/会/采取/措施/制裁/伊拉克/”, 也可以切分为:“美国会/采取/措施/制裁/伊拉克/”,
ES-自然语言处理之中文分词器
ES-⾃然语⾔处理之中⽂分词器
前⾔
中⽂分词是中⽂⽂本处理的⼀个基础步骤,也是中⽂⼈机⾃然语⾔交互的基础模块。不同于英⽂的是,中⽂句⼦中没有词的界限,因此在进⾏中⽂⾃然语⾔处理时,通常需
要先进⾏分词,分词效果将直接影响词性、句法树等模块的效果。当然分词只是⼀个⼯具,场景不同,要求也不同。
在⼈机⾃然语⾔交互中,成熟的中⽂分词算法能够达到更好的⾃然语⾔处理效果,帮助计算机理解复杂的中⽂语⾔。根据中⽂分词实现的原理和特点,可以分为:基于词典分词算法基于理解的分词⽅法
基于统计的机器学习算法
基于词典分词算法
基于词典分词算法,也称为字符串匹配分词算法。该算法是按照⼀定的策略将待匹配的字符串和⼀个已经建⽴好的"充分⼤的"词典中的词进⾏匹配,若找到某个词条,则说明匹配成功,识别了该词。常见的基于词典的分词算法为⼀下⼏种:正向最⼤匹配算法。逆向最⼤匹配法。最少切分法。
双向匹配分词法。
基于词典的分词算法是应⽤最⼴泛,分词速度最快的,很长⼀段时间内研究者在对对基于字符串匹配⽅法进⾏优化,⽐如最⼤长度设定,字符串存储和查找⽅法以及对于词
表的组织结构,⽐如采⽤TRIE索引树,哈希索引等。
这类算法的优点:速度快,都是O(n)的时间复杂度,实现简单,效果尚可。
算法的缺点:对歧义和未登录的词处理不好。
基于理解的分词⽅法
这种分词⽅法是通过让计算机模拟⼈对句⼦的理解,达到识别词的效果,其基本思想就是在分词的同时进⾏句法、语义分析,利⽤句法信息和语义信息来处理歧义现象,它
通常包含三个部分:分词系统,句法语义⼦系统,总控部分,在总控部分的协调下,分词系统可以获得有关词,句⼦等的句法和语义信息来对分词歧义进⾏判断,它模拟来
⼈对句⼦的理解过程,这种分词⽅法需要⼤量的语⾔知识和信息,由于汉语⾔知识的笼统、复杂性,难以将各种语⾔信息组成及其可以直接读取的形式,因此⽬前基于理解
的分词系统还在试验阶段。
基于统计的机器学习算法
这类⽬前常⽤的算法是HMM,CRF,SVM,深度学习等算法,⽐如stanford,Hanlp分词⼯具是基于CRF算法。以CRF为例,基本思路是对汉字进⾏标注训练,不仅考虑了
