藏文自动分词系统中虚词识别算法研究
藏文自动分词系统中虚词识别算法研究拉巴顿珠;欧珠;赵栋材【摘要】在分析现有藏文自动分词方法的基础上,针对藏文分词系统中虚词识别的难点进行深入研究.根据传统藏文文法,描述了藏文虚词在文本中不同的表现形式,用规则和统计相结合的方法,建立了较为全面的虚词知识库和规则库,并给出切分用虚词分块算法,该方法在不同领域的3 200个较典型的藏文句子进行了测试,结果表明,该方法的虚词识别率高达98%以上.%By analyzing a literature review of present Tibetan Auto-Segmentation solutions,we study on the difficult points of Tibetan function words recognition.According to the traditional Tibetan grammar,we described the forms of Tibetan function words in different texts.A holistic function word dictionary and rules set had been created by a rulesstatistics-combined method,and the function words segmentation algorithm had been implemented.We tested the algorithm on a sample corpus which contains 3 200 typical Tibetan sentences from different fields.The results show that the correct recognition rate of our system reaches up to 98%.【期刊名称】《计算机应用与软件》【年(卷),期】2017(034)009【总页数】4页(P299-301,333)【关键词】藏文自动分词;藏文信息处理;虚词识别;藏文虚词【作者】拉巴顿珠;欧珠;赵栋材【作者单位】西藏大学藏文信息技术研究中心西藏拉萨850000;西藏民族大学陕西咸阳712082;西藏大学藏文信息技术研究中心西藏拉萨850000【正文语种】中文【中图分类】TP391藏文自动分词研究是藏文自然语言处理的前提,是藏文信息处理的一项不可缺少的基础性工作,具有广泛的应用前景。
藏文自动分词为词性标注、藏文语料库的建设、藏文文本校对、藏文字词频统计、搜索引擎的设计与实现、机器翻译系统的开发、藏文拼写检查以及语句理解等方面的研究奠定良好的研究基础。
目前,国内有关学者提出了很多不同的分词方案和算法理论,但这些方法还是没能解决自动分词过程中的一些关键问题。
如何准确地把句子切分成块,这是自动分词的关键任务和难点之一。
该问题需要运用规则和统计相结合的方法,准确地识别藏文句子中的虚词,才能把句子切分成块,但藏文虚词数量较多,出现的频率也很高。
据统计,没有虚词的一个句子也可以能够表达句子的含义,例如:但这种情况在文本中实际出现的概率很低,一般一个完整的句子中至少会出现一个虚词,特别是对一些长句而言,虚词能够更好地表达句子的实际意义。
本文根据虚词本身的特点,结合目前藏文自动分词过程中的难点和所存在的问题,对虚词的识别、紧缩词的识别及还原等问题提出具体的解决方法并予以实现。
1.1 虚词的概述在语言学中,词分为实词和虚词两大类,实词指的是具有实际意义的词,是藏文自动分词中独立运用而能够表达一定意义的最小分词单位。
虚词是与实词相对而言的,在文本或者句子中不能表达任何意义,也不能独立承担句子的主要成分。
虚词本身没有实在意义,也没有词性变化,但一个文本或句子中没有虚词就不能形成完整的语句,也不能表达出完整的含义。
在自然语言处理中,藏语虚词对词法和句法结构起着至关重要的桥梁纽带作用,虚词的用途广,在句子结构中用法和意义十分复杂,出现的频率相当高。
在实现藏文自动分词系统中的主要难点之一,因此,信息处理用藏文虚词识别研究很重要。
目前,很多语言学家和有关学者对藏文虚词的定义不尽相同,根据传统的藏文文法“三十颂”()描述,藏语虚词共有85个,分为65个不自由虚词和20个自由虚词,不自由虚词与自由虚词的主要不同在于有无受到前一个后加字或再后加字的限制,不自由虚词具有严格的接续规则,而自由虚词不受前一个音节后置字的限制,可以自由使用[1]。
1.2 计算机识别藏文虚词的难点(1) 同一个虚词,在不同的语境中充当不同的角色,所表达的意义也不同,从而出现虚词的歧义问题,我们称之为虚词的兼类性。
通过整理发现,共有以下25个既是虚词又是实词,(谁)(山羊)(队)(年龄、生病)(坡)(烟、多少)(天)(路)(懂)(脸)(女)(一双、二)(尸体)(年)(吻)(田地)(木)(青稞) (职业、从,)(奶牛) (母亲、不)(人、不)(牙齿)(再,又、轻)(虱子)。
(2) 很多虚词与其他的字或词组合成新词,该新词一般都不作为虚词,例如:等,称之为虚词的组合性。
此类词很多诞生在自由虚词中,自由虚词本身没有严格的接续规则,其中大部分虚词与其他字、词组合成新的词后表达具体的意义,从而导致文本中出现较多的歧义现象。
(3) 指人名词缀词。
中嵌否定词结合它的前后字、词,例如:等。
9个指人名词后缀是它的前一个字、词结合成新词,例如:等,其中“”也受前一个音节后置字的限制,属于不自由虚词。
(4) 虚词变体性。
当虚词前面音节字的后加字是或者词尾没有后加字时,省略后该虚词黏着在前一个词尾,这样无法判断该词尾的字符为虚词还是后加字(再后加字)[2],例如:该句子中的虚词黏着在词末,词尾出现的两个不是虚词,中的是再后加字,中的是的后加字。
例如:句子中的虚词黏着在词尾,他的原形为已还原的结果。
计算机识别藏文虚词根据虚词本身的特点和难点分析出发,按照一定的先后顺序进行判断,首先通过虚词兼类词典、单字词典、规则的不自由虚词词典库等进行划分,再识别紧缩词并还原,最后结合中嵌否定词、指人后缀来判断藏文虚词,如图1所示。
2.1 藏文虚词的识别过程计算机识别虚词的首要工作就是建立一个相对全面的词典库,为了提高词典库的质量,需要采用规则和统计相结合的方法,并进行大量的人工训练和测试。
另一方面,经实验和研究发现,藏文虚词在文本中表现形式相对复杂,单一形式的词典不能满足需求,因此要按照虚词在文本中的不同表现形式,建立几种不同的虚词词典(词典命名为xcself)。
(1) 虚词兼类词典(xcself1)。
通过对大量的语料进行训练,根据词频等特征,再结合虚词兼类性和组合性特点,收录比较固定,较常见的词,这样可以能够排除藏文分词中虚词兼类而导致分词不准确的问题。
例如,等。
另外不自由虚词中“”等虚词中间存在分隔符“·”的虚词也收录到该词典中。
(2) 单字词典(xcself2):除了已收录到虚词兼类词典中的词外,藏文虚词“”在藏文文本中均以单字词的形式出现,这些虚词在分词过程中作为分割点。
(3) 不自由虚词词典(xcself3):收录需要根据不自由虚词的接续规则识别的藏文虚词,该词典格式为:<虚词—前导字符—后接字符>。
2.2 紧缩词识别及还原根据紧缩词的变体性及特殊性,分两种情况进行识别,分别是一般紧缩词的识别和特殊紧缩词的识别。
(1) 一般紧缩词的识别方法:当一个音节符后面出现“”这四个字时,判断该紧缩词前导符的编码在0F40~0F68之间[3],并且切分紧缩词后的音节字长度为大于1,该音节字后面添加一个,否则,直接分离紧缩词。
(2) 特殊紧缩词(和)的识别方法:当出现“”这10个音节时,紧缩词和进行分离,分离后的还原成,还原成。
其中,以“”结尾的音节字,可能以“后加字”、“再后加字”、“紧缩词”3中不同形式出现,识别时还要先执行“再后加字”的识别算法,避免将“再后加字”和“紧缩词”混淆。
(3) “再后加字”的识别算法:首先计算机找出“”结尾的音节字,该音节字的长度大于等于4,并且从右起第二个字符在“”中,第三个字符编码不在0F40~0F68之间,或者,“”结尾的音节字长度大于等于3,并且从右起第二个字符在“”中,第三个字符的编码在0F40~0F68之间时,该音节字的最后一个字符“”为再后加字,这样可以排除大量“”结尾的音节字。
通过以上方法仍未能识别的紧缩词和,取出词末的和,去除紧缩词后的字符串与词典匹配,匹配成功,则和分离出来,并进行还原,若匹配不成功,紧缩词和分离后,前导字符的编码在0F40~0F68之间时,前导字符后面添加一个“”,与词典进行匹配,若成功,则紧缩词和进行还原。
2.3 自由虚词的识别方法在藏文传统文法中自由虚词没有变体性,而且不受前一个音节后置字的限制,可以自由使用,但自由虚词也并不是不受任何限制而随意使用,在文本中使用自由虚词时也具有一定的接续特点。
文中根据自由虚词本身的接续特点和出现歧义的问题,提出了较简单的自由虚词识别方法。
(1) 除了虚词兼类和虚词组合性的词外,例如:等词条均收录到虚词兼类词典库中[4],连词“”、指示代词“”、疑问代词“”、否定词“”、位格助词“和”、从格助词“和”均以单词的形式出现,即作为分词单位,当文本中出现以上虚词时直接识别为虚词。
(2) 中嵌否定词“”结合前后字、词,指人名词后缀“”与前一个字、词结合的词与词典进行匹配,作为分词单位,即与前一个词结合的词不作为虚词。
3.1 测试结果本文采用的测试语料包含了法律、新闻类、教育类、医学类、诗歌类、文学类等各个领域。
从中选择了较典型的3 200句进行测试,同时还考虑了文献的年代、地域等问题。
对测试语料进行分词,统计语料中虚词出现的次数并计算准确率(准确率=正确识别的总次数/测试语料中出现的总次数×100%),同时对虚词的兼类性、组合性、结合性、识别紧缩词及还原。
实验结果表明,文中提出的方法使虚词的识别率达到98.013 8%。
3.2 结果分析采用本虚词识别方法的结果分析发现,① 如:该句子中的,根据紧缩词的识别方法,去除紧缩词后的词在词典中,与词典匹配成功后紧缩词还原,错误地识别和还原成,导致成交集型歧义。
② 如:该句子中的词,既可以切分为“”,又可以切分为“”,但词在词典中,错误切分成“”,正确的切分结果为“”。
此类问题目前还未找到合适的处理方法,下一步将针对此类问题进行深入研究。
藏文虚词在文本中出现的频率极高,其应用广泛,表现形式复杂多变。
本文基于不同的语境中虚词的识别率和分词的准确度,根据传统的藏文文法,采用统计和规则相结合的方法,对较典型的3 200个语料句子进行了测试。
藏文自动分词系统的设计
藏文自动分词系统的设计才智杰;才让卓玛【期刊名称】《计算机工程与科学》【年(卷),期】2011(33)5【摘要】语料库作为基本的语言数据库和知识库,是各种自然语言处理方法实现的基础.随着统计方法在自然语言处理中的广泛应用,语料库建设已成为重要的研究课题.自动分词是句法分析的一项不可或缺的基础性工作,其性能直接影响句法分析.本文通过对85万字节藏语语料的统计分析和藏语词的分布特点、语法功能研究,介绍基于词典库的藏文自动分词系统的模型,给出了切分用词典库的结构、格分决算法和还原算法.系统的研制为藏文输入法研究、藏文电子词典建设、藏文字词频统计、搜索引擎的设计和实现、机器翻译系统的开发、网络信息安全、藏文语料库建设以及藏语语义分析研究奠定了基础.%As the fundamental linguistic knowledge base, human-annotated corpora are the basis of many statistical natural language processing tasks. Along with the wide use of statistical methodsin natural language processing, corpus construction becomes an important research area. Word segmentation is necessary prerequisite of syntax parsing; its performance determines the parsing accuracy in a large degree. By the statistical analysis on a Tibetan corpus with 850,000 bytes, we first investigate the distribution and the syntactic function of Tibetan words, introduce a dictionary-based Tibetan word segmentation model, and then present the dictionary structure, case-auxiliary blocking and restoring algorithms which are necessary to Tibetan word segmentation. Thedevelopment of the Tibetan word segmentation system also facilitates the research of the Tibetan word input methods, the Tibetan electronic dictionary construction, the Tibetan word frequency statistics, the design and realization of the search engine, the development of the machine translation system, the security of the network information, the construction of the Tibetan corpus, and the Tibetan semantic analysis.【总页数】4页(P151-154)【作者】才智杰;才让卓玛【作者单位】青海师范大学藏文信息处理省部共建教育部重点实验室,青海西宁,810008;青海师范大学藏文信息处理省部共建教育部重点实验室,青海西宁,810008【正文语种】中文【中图分类】TP391【相关文献】1.班智达藏文自动分词系统的设计与实现 [J], 才智杰2.藏文自动分词系统中虚词识别算法研究 [J], 拉巴顿珠;欧珠;赵栋材3.基于词频学习和动态词频更新的藏文自动分词系统设计 [J], 项炜;金澎4.藏文自动分词系统中紧缩词的识别 [J], 才智杰5.藏文自动分词系统的设计与实现 [J], 陈玉忠;李保利;俞士汶因版权原因,仅展示原文概要,查看原文内容请购买。
藏文不自由虚词的自动识别研究
2 ) “ ” 栩 5 ” 是拉格助词
,
在虚词识别过程 中出现 以下规则 可
跳过。
≈
s 3 譬
(
)等・ 例如: 酶鬟 霉 s
( 能濠聃动词) 礴 等。 例如 :
3 ) “ ”葺 Q “ ”建离食诵 , 在盎调{ } l j 5 I l 进程串出现以下规则也霹瑞过 ・ ・
藏 文 不 自 由虚 词 的 自动 识 别 研 究
卓玛吉 安见 才让
摘 要 :本 文将通过传统藏文文法的语法规则 ,主要研 究藏文文本 中大量藏文不 自由虚 词的识别算 法,同时建立 了藏文 不 自由虚词 的 消岐规 则库 。使计算机快速地识别并消除藏文句子 中不 自由虚词的歧 义问题 。提 高藏 文 自动分词的准确 率。使 句子的 生产 、句法分析 、八 格 识 别 和机 器 翻译 等研 究 的基 础 更 扎 实 。 关 键 词 : 藏 文 不 自由虚 词 ; 自动 识 别 ;歧 艾 ;规 则 库
钢
等 四个虚词 外 ,其余 的 5 8 个
不 自由虚词在分词过程中都以单字词的形式 出现。 建立藏文虚词库 X C ;在 X C 库 中分别建立 b z y x c 和b z y x c 2 两 个表。在
表b z y x c 是不 自由虚词 中 “ 单 字词 ”类 虚词表 ( 如:
虚词表。
想:
c I 擎
等
倒如 : 争弹 l 峄 s 鞠
伪如: 争∞每
n
钠
倒如 : ㈣
’
1 )本课题 的研究根据传 统藏文文 法 ,结合最 大匹配 藏文分 词法 和 藏文树型分词法 ,在藏文 自动 分词过程 中与 自动 分词 同时 进行虚 词识
藏文自动分词技术研究综述
1藏文自动分词的主要意义分词其实就是按照一定的标准或规范将一系列连续的字序列重新划分成词序列的过程。
在英文中,单词之间是以空格作为自然分界符的,因此在词的理解上较为直观,它直接跨越了分词这一处理过程。
而藏文的词与词之间是不具备任何形式的分界符的,这便给藏文的信息处理增加了一定的难度。
而一段藏文在经过分词后,如果让计算机来处理这样一段由词组成的藏文句子,它首先需要对句子的词法进行分析,然后才能够进一步去理解整个句子的具体含义。
因此,藏文词的正确切分在藏文信息处理工作中显得尤为重要。
在保障词的正确切分过程中,如果仅仅通过人工的方式进行分词处理,显然是一个庞大而复杂的过程,并且会存在许多的弊端。
而在飞速发展的信息技术社会背景下,如果用计算机按照一定的规则和程序来代替人工进行藏文文本的自动分词,将具有很大的研究意义。
目前,藏文信息处理技术的应用已经在文字处理的基础上逐渐面向语言信息处理,但是作为语言的基本组成单元,分词处理仍然是藏文信息处理中一项不可或缺的基础工作。
因为分词结果的质量将直接影响到藏文检索主题排序、藏文机器翻译、藏文语音识别等藏文信息处理技术的应用和发展。
进而,藏文自动分词技术的研究与发展也即将对藏族人民的生活、学习和工作等具有积极的作用和重要的意义。
2国内藏文自动分词的研究现状迄今为止,随着藏文信息处理技术的不断研究与深入,藏文自动分词技术也取得了很多令人瞩目的成果。
比如,目前在国内公开发表的关于藏文分词方面的研究和系统有很多:1999年,中国藏学研究中心的扎西次仁所发表的“一个人机互助的藏文分词和词登录系统的设计”可以看作是藏语分词研究开始的标志[1];2001年,陈玉忠设计实现了《一个基于格助词和接续特征的藏文分词系统》[2]。
此外,祁坤钰提出了切分与格框架、标注一体化的藏语三级切分体系的藏文分词方法[3];才智杰实现了一种藏文分词方法,并首次提出了基于规则的方法“还原法”来处理藏语分词中紧缩词识别问题等[3]。
藏语动词形态的自动识别系统研究
藏语动词形态的自动识别系统研究作者:俄果措安见才让来源:《电子技术与软件工程》2016年第06期摘要藏语自动分词和藏语动词形态自动识别过程中的一个重要部分,使藏语分词过程中字串的匹配对象。
电子词库中每一个词条的准确性直接影响着藏语自动分词结果和藏语动词形态自动识别结果。
因此,电子词典中主要收录了所选藏语语料库中的18本藏语(翻译版)教材的5000个词条。
【关键词】自动分词动词形态自动识别电子词典藏语动词的研究历来是藏语语法研究的核心。
藏语书面语约有1500 个单音节动词,其中大多数动词具有词形数目不等的时式形态变化。
在藏语的发展过程中,由于语言内部结构的语音变化及语言的外部影响,藏语动词的词形出现了不同的简化模式。
1 藏语动词形态自动识别模块藏语动词形态的自动识别是藏语句法分析和藏语八格的识别等过程中的一个重要环节。
藏语动词形态自动识别的目的是识别出藏语文本中的大量的藏语动词形态,并消除识别过程中动词形态的变化问题。
藏语动词形态自动识别模块采用了以藏语传统语法为依据,格桑居冕(1982)在《藏语文法教程》(简称教程)中对藏语书面动词进行了详细讲并收集其中所讲的藏语动词形态和动词形态的接续规则来实现。
最终建立了藏语动词形态的规则库,按规则库中相应的规则来识别句子中的动词形态的变化。
具体如图1所示。
2 藏语动词形态的自动识别算法如图2所示。
在藏语动词形态识别过程中动词形态处变化处理算法描述如下:S=“”在S中消除具有一个以上音节的词。
S=“”在S中消除虚词。
S=“”逐一取每一个词在词典中data中查找,如果查找到,就将结果存储在SS中,最后显示SS 中的内容,如下:3 藏语动词形态识别的运行结果如图3所示。
4 结束语通过探索藏文传统文法理论,建立藏语动词形态的接续规则,按照规则及相关的算法和模块实现藏语动词形态自动识别系统。
参考文献[1]格桑居冕,格桑央金.藏文文法教程[M].四川民族出版社,2004.11(391-513).[2]金鹏.藏语动词屈折形态向粘着形态的转变[J].中国藏学,1988(01)(131-139).[3]金鹏.《西藏现代口语动词的时态和体及其表达方法》.西藏研究1984(03)-1985(02).作者简介俄果措(1987-),女,青海省人。
藏文自动分词技术研究综述
1 藏 文 自动分词的主要意义
目前 的藏文分词处 理通 常都是首先 由计算机 对藏文文本进行 自
动分词 .然后再对分词结果 附以人工校对。但无论是计算机 自动分词
分词其实就是按照一 定的标 准或规范将一 系列 连续的字序列重 还是人工校对 .前提是都需要符合一定的分词标准或规范 以保证分词 新划分成词序 列的过程 。在英文中,单词之间是 以空格作为 自然分界 结果 的正确性 .从而也 为藏文信息处理的后续 工作提供统一 的输入 。 符的,因此在词的理解上较为直观 ,它直接跨越 了分词这一处理过程 。 但 即使 如此 .也并 不能完全保证分词结果 的正 确性 ,因为藏文 自动分
的应用和发展 。进而 .藏文 自动分词技术 的研究与发展也即将对藏族 采用最大概率方法来 消解交集型歧义 .主要 利用词频信息来找 出最佳
人民的生 活 、学 习和工作等具有积极 的作用和重要的意义。
的切分结果 但是由于高频单音节对切分结 果的影 响,有 时也往往无
2 国内藏文 自动分词的研 究现状
而藏文的词与词之间是不具备任何形式的分界符的 .这便 给藏文 的信 词还面临着两个 最大的困难 :一是歧义切分 问题 ,二是未登 录词识 别
息处理增加了一定的难 度。而一段藏文在经过分词后 。如果让计算机 问题 。
来处理这样一段 由词组 成的藏 文句子 .它首先需要对句 子的词法进行 4.1 歧义切分 问题
分析 .然后才能够进一步去理解整个句子的具体含义。因此 ,藏文词的
在藏文信息处理_ T作 中显得尤为重要
式的字段 .称为分词歧义字段 。针对分词 中的歧义现象 ,人们从不同
在保障词的正确切分过程 中.如果仅仅通过人l丁的方式进 行分词 的角度提 出了不 同的分类方式 。从歧义字段的主要 构成形 式来分 ,藏 处理 .显然是一个庞大而复杂 的过程 .并且会存在许 多的弊端 。而在飞 文分词 中歧义分为两种:一种是交集型歧义字段 .另一种是组合型歧
藏文自动分词技术研究综述
藏文自动分词技术研究综述作者:于诗画赵小兵来源:《科技视界》2016年第06期【摘要】藏文分词是藏文信息处理中最为基础却又十分重要的工作,而藏文的自动分词是提高藏文信息处理工作效率的重要技术。
本文主要从藏文自动分词的意义、国内研究现状、分词方法以及目前所面临的主要问题等方面来简单阐述藏文自动分词技术的相关内容。
【关键词】分词;藏文分词;分词方法1 藏文自动分词的主要意义分词其实就是按照一定的标准或规范将一系列连续的字序列重新划分成词序列的过程。
在英文中,单词之间是以空格作为自然分界符的,因此在词的理解上较为直观,它直接跨越了分词这一处理过程。
而藏文的词与词之间是不具备任何形式的分界符的,这便给藏文的信息处理增加了一定的难度。
而一段藏文在经过分词后,如果让计算机来处理这样一段由词组成的藏文句子,它首先需要对句子的词法进行分析,然后才能够进一步去理解整个句子的具体含义。
因此,藏文词的正确切分在藏文信息处理工作中显得尤为重要。
在保障词的正确切分过程中,如果仅仅通过人工的方式进行分词处理,显然是一个庞大而复杂的过程,并且会存在许多的弊端。
而在飞速发展的信息技术社会背景下,如果用计算机按照一定的规则和程序来代替人工进行藏文文本的自动分词,将具有很大的研究意义。
目前,藏文信息处理技术的应用已经在文字处理的基础上逐渐面向语言信息处理,但是作为语言的基本组成单元,分词处理仍然是藏文信息处理中一项不可或缺的基础工作。
因为分词结果的质量将直接影响到藏文检索主题排序、藏文机器翻译、藏文语音识别等藏文信息处理技术的应用和发展。
进而,藏文自动分词技术的研究与发展也即将对藏族人民的生活、学习和工作等具有积极的作用和重要的意义。
2 国内藏文自动分词的研究现状迄今为止,随着藏文信息处理技术的不断研究与深入,藏文自动分词技术也取得了很多令人瞩目的成果。
比如,目前在国内公开发表的关于藏文分词方面的研究和系统有很多:1999年,中国藏学研究中心的扎西次仁所发表的“一个人机互助的藏文分词和词登录系统的设计”可以看作是藏语分词研究开始的标志[1]; 2001年,陈玉忠设计实现了《一个基于格助词和接续特征的藏文分词系统》[2]。
信息处理中藏语虚词“na”和“la”的标注研究
E ma f @e c . t n - i k j c e e. h y n e
ht : ww d z .e .n t / w.n sn t p/ e T 1 8 — 51 5 9 9 3 5 9 9 4 e: 6 5 - 6 0 6 6 0 6 +
K e o ds n o ai n p oc sig;t tn f nci n or s a g n y w r :i f r to r esn m i a u to w d ;tg i g be
1概 述
在 藏 语 中词 都 代 表 着 一 定 的意 义 。与 汉 语词 的分 类 一 样 , 语 的 词也 可 以包 括 实 词 和 虚 词 。实 词是 可 以表 示 任 何 词 汇 的 意 义 , 藏
Abs r :Ti tn i f m ai oc si a r he orgna o d pr c si o aurlln a e pr c si ,no a y rdu l o he tct bea nor ton pr esng h sfom t i i lw r o esng t n t a a gu g o e s ng w da s g a al t t y s t c c a ay i,sntnc nayss u o aial bsrc ,a t m ai lsi c to nd m a hi r ns to yn a t n lss e e e a l i,a t m tc l a ta t u o tc casf ai n a c ne ta li n.Bu hee a e b sd n t e l i y i a tt s r a e o he lve
而 虚 词 则 是 用 来 表 示 语 法 意 义 , 表 示 实 词 与 虚词 之 间 的组 合 关 系 。藏 文 句子 中 , 成 语 句 时 虚 词 的作 用 和实 词 一 样 重 要 。在 传 统 即 构
基于虚词切分的藏文分词系统的设计与实现
摘要 : 藏文分词是藏文 自然语言处理的基础 。根据藏文虚词在藏文文本 中的特殊作 用以及虚词的兼
类性 、 结合性 、 着 变体 性和 还 原特 性 , 黏 设计 实现 了一 个基 于藏语 虚 词切吩 的正 向最 大 匹配的藏 文 分词 系
向最大匹配算法。设虚词兼类词典中音节最多的词条的音节数为 S 一, C 则每次从文本 中截取的参与比较 的藏文字 符 串 w 的音节数 S <S m。 W 在 兼类 词典 中查找相 同项 , 果找 到说 明是兼类 虚词 , C_ C 将 如 进行 切 分 , 则去掉 w 最后 一个音 节 继续 查找 , 否 如此 反 复循环 , 到 W 中只剩 下 一个 音 节 为止 , 后继 续取 S 直 此 C
第 2 卷 第 2期 7
21 0 2年 1 O月
西藏大 学学报c 自然科 学版 )
J RNAL OFT B T NI RSTY OU I E U VE I
、0.7 No2 r1 . 2 0c . 0 2 t2 l
基 于虚词切分 的藏文分词 系统 的设 计 与实现
赵 栋材
收 稿 日期 :0 2 0— 1 2 1 — 6 2
基金项 目:0 1年度 国家 自然科学基金 资助 项 目 “ 21 藏语语 音合 成关键技术研 究” 项 目号 :1 6 0 0 ;0 0年度 国家 自然 ( 6 1 5 1 )2 1
科 学基金资助项 目 “ 基于虚词 的藏语基本句 型的形 式化研 究” 项 目号 :1 6 0 5 ;0 ( 6 031 )21 1年度 国家 自然科学基金资助项 目 “ 藏语依存树 库的构建” 项 目号 :1 6 0 3 ;09年度教 育部长江学者与创新团队发展计划 资助项 目 “ ( 6 1 3 4 )2 0 藏文信息技术创新
计算机识别藏语虚词的方法研究
( 1 . Ti b e t a n I n f o r ma t i o n Te c h n o l o g y En g i n e e r i n g Re s e a r c h C e n t e r ; Ti b e t Un i v e r s i t y , L h a s a ,Ti b e t 8 5 0 0 0 0,Ch i n a;
t i f i c at i o n o f Ti be t a n f u nc t i on wo r d. The e xp e r i me nt on 2 5 2 5 s e n t e nc e s a c hi e v e s a n a c c ur a c y o f 97. 07 6 8 me t ho d. f o r t hi s
计 算 机 识 别 藏 语 虚 词 的 方 法 研 究
高 定 国 , 扎 西 加 , 赵 栋 材
( 1 .西 藏 大学 藏 文 信 息 技 术 研 究 中心 , 西藏 拉萨 8 5 0 0 0 0 ;
2 .西 藏 大学 工 学 院 计 算 机 科 学 系 , 西 藏 拉萨 8 5 0 0 0 0 ) 摘 要: 藏 文 虚 词 的 研 究是 藏 文信 息 处理 技 术 中词 、 句及 语 义研 究 的 基 础 , 而计 算机 自动 识 别 藏 文 虚 词 又 是 藏 语 虚
词识 别的正确率高达 9 7 . 0 7 6 8 。 关 键 词 :识 别 ; 藏语 ; 虚 词
中 图分 类 号 : T P 3 9 1
文献标识码 t o ma t i c I n d e n t f i c a t i o n o f Ti b e t a n Fu n c t i o n Wo r d
藏文信息处理中自动分词方法的研究
【 关键词 】 藏文分词 ; 义字段切分 ; 歧 未登录词识 别
1 藏文 自动分词 的意义
中最基本 、 最重要的环节 。 不经过藏文分词上述工作很难进行 , 藏文分 词是所有藏文信息处理 的基础工作 。
分 词就是将连续 的字序列 按照一定的规范重新组 合成词序列的 32 歧义字段切分 . 过程 英文是单词之间以空格 分开 , 的界 限是 比较清楚 的, 词 因此 , 在 藏文分词歧义最常见的有 : 词 的理 解上 比较直观 . 比如 : a s d n ( I m a t e t 英文 ) u . 一句中的单词 间以 () 1交集型歧义 如果 A B和 B c都是词典 中的词 , 么如果待切 那 空格分开 . 英文 已经跨越 了分词这一步 。而藏文是词与词之 间没有 明 分 字串 中包含 “ B ” A C 这个子 串 , 就必然会造成两 种可能 的切分 :A / “ B 显 的分 隔符 , :g i l i y 如 n o mz g i n s b h n一句中的单词间没有分隔符。 藏 c ” “ B / 。这种类型的歧义就是交集型歧义 。比如 “ yg n / 和 C” r g r 文以字f 音节字沩 单位涟 字成句才能描述一个 完整的意思 。 而对由词 t h” s te 就可能造成交集型歧3 ( y r s ce r / t / e 。 h  ̄ r d h h/ g g n s e / g t/ 或 y r hh ) 组成的藏文句子. 计算机必须通过藏文分词技术才得以理解 。因此 , 如 f) 2 组合型歧义 如果 A B和 A B都是词典 中的词 , 、 那么如果待 何 运用计算机进行文本分词成了许 多人 的研究热点 切分 字串中包含 “ B 这个子串 . A ” 就必然会造成两种可能的切分 :A / “ B 用藏 文记载 的经典文献 、古籍著述 和译作 就如一个浩瀚 的海洋 , ” MB” 和“ / 这种类型的歧义就是组合型歧义 。比 “ g a n i 就可 如 n g y ” n d 要用人 工对如 此繁多 的文本进行分词 . 就是 通过读 取所 有文章后 一般 能造成组合 型歧义 (g n / i § n/ g y / n g n d 诘 g n i ) r y /i r n d 再对它们进行分词标注 .显然这种人工分类 的做法存 在着许 多弊端 : 33 未登录词识别 . 是耗费大量 的人力和物力 。 二是存在分词结果不一致 性的问题 。 即 未登录词指 的是词典 中没有收录的词 。 一个计算机分词系统要处 使分词人员都是具有很高学识的专业人士 . 于不 同的人来 分词 . 对 其 理真实世 界中的藏语语料 . 碰到未登录词几乎是不可避免 的。 比如 : 分词结果 仍不相同 甚至 同一人在不同时间内做 分词也可能会有不同 a. 中外 的人名 , 地名 Camer k ” “r n ” “k ii o g克林 i h . g b g , h ndn ( n l 的结果 因此 . 用计算机代替人工进行藏文文本 的 自 动分词 , 尽可能地 顿) ; ”) 满足人们所期望 的各 类藏文文本分词应用 需求具有很大研究 意义和 b 中外组织机构单位名称和商 品品牌 名 (c n t n y m . “i l g c i r nirs g 重要的实现意义 l”, n im tsc y y lg “g lsi p is y d k n ”“ lb go o “ y rg n g in igo ”. ry rd sy p o h g ,so s 藏文 自动分词是 目 前藏文信息处理领域中公认 的难题 , 因为藏文 pa” ; uu ) 自 动分词 是 自然语言 理解 、 机器 翻译 、 息检索 、 信 语言 文字研 究 、 藏文 c. 专业领域的大量术语(d yntid y ,agygAS I” ; “ bi r r g ”“n i CI) h r 文本 自 动标注 、 信息提取 、 文本校对 、 文本生成 、 文本分类 、 自动摘要 以 d新词语 。 . 缩略语 ( O ” “ 9” ; ‘ K .Q ) ‘ 及藏文文字识别 等领 域中最重要 、 最基 本的环节 . 具有广泛 的应用前 3 藏文分词的方法 - 4 景和很重要的现实意义 可以说直接影响到使用藏文 的每一个人的方 目前在汉英文方面分词方法较多 . 由于藏文的语法结构与汉英语 方面面 。 法结构不 同. 已有 的分词方法不能直接使 用到藏文分词 中 . 需要修改 藏文分词 的研究要 从语音 、 语义 、 语法 、 语用 、 语境 五个方 面进行 原有的这些汉英 分类算法或研制一种符合藏文特性 的分词算法 。 本文 彻底、 细致 、 细 、 精 规则 化的研究 , 要以词 为基 本单位 , 步 向词一 短 逐 重点介绍用最大匹配分词法和最大概率分词法进行藏 文分词过程 。 语一句字一句群一 篇章等多层 面藏文信息处理技术发展 。 341 最大匹配分词法 .. 另外 . 藏文分词技术 对推动社会的发展 . 方便人们的学 习与生活 . 最大 匹配法 分词的过程很简单 . 先准备一个分词 表 . 首 顺序扫描 促进人们 的工作效率和生活质量 的提高也有重要的意义 待分词 的句子 , 将句中候选 词按照词长从大到小 的顺序依次跟词表 中 的词进行 匹配 , 匹配成功即作为一个词输 出。如果一个句 中的多字候 2 藏 文 自动 分 词 技 术 的研 究 现 状 选词跟词表 中所有的词匹配不上 .只能把单字词 当作分词结果输 出 随着藏文信息处理研究 的深入 . 藏文文本 自动分词 问题 已经引起 最 大匹配法分词 由句 中的候选词从 待切分 的分子 串左 边开始扫描 的 高度重视 。 成为藏文信息处理的一个前沿课题 。 经过十几年的研究 。 藏 顺 向最大 匹配法和从右 向左扫描来 选取候选词 的逆 向最大匹配法两 文文本 自动分词技术也取得 了令人瞩 目的成果 目前国内的有关学者 种 。如 s= dernd gs bm ”老师 和学生 ) 1 “ g g n l ( o 在分词词表中最大 词长 已经提 出了藏文分词的算法及规范方案 : 扎西次仁曾设计过一个采用 MaLn 2 对 S 进行分词处理: x e= . 1 最 大匹配算法的人机互助藏文分词和登录新词的演示系统 :罗秉芬 、 aS= ;1不为空 , .2 …’s 从左边取 出候选字串 w= dern : “ g g ” 江狄曾提出过一个藏文计算机 自动分词的基本规则 :陈玉忠 于 2 0 01 b 词表 ,der ” . 查 “g g 在此表 中 , w 加入到 s n 将 2中,2 “ g r /。 s=de g ” n 年设计实现 了一个基于格助词和接续特征 的藏文分词系统等 并 将 w 从 s 中去掉 . l 此时 S : d g l ” 1 “n o m sb 十几 年来 . 藏文信息处理在 各个 方面得到 了长 足的发展 . 取得 了 c 1 . 不为空 . S 于是从 s 左边取出候选字串= d g l ” 1 “ n o sb 不少成绩 , 产生 了积极的社会效益 。但具有全面性 、 系统性 、 科学性 的 d 查词 表 . 不在此表 中 , w 最右边一个 字去掉 ,得 到 W: . w 将 藏文分词规范仍然未 曾提出。因此 , 藏文分词的首要任务是研究并提 “ n ” d g 出符合藏文特性 的最佳分词方 案 . 以提高分词系统 的切分精度 和通用 e . 词 表.d g 在此表 中, w 加入 到 s “n ” 将 2中 ,2 “g r d g ” S = der d n / g 。 性. 尽可能地满足人们所期望的各类分词应用需求 并将 w 从 s 中去掉 . 1 此时 S = s bm” 1 “l o
