基于信息处理的藏文框架语义关系研究

第31卷总第77期 2 0 1 0年3月 西北民族大学学报(自然科学版) Journal of Northwest University for Nationalities(Natural Science) Vo1.31,No.1 Sep,2010 

基于信息处理的藏文框架语义关系研究 

多杰卓玛 

(西北民族大学中国民族信息技术研究院,甘肃兰州730030) 

[摘要]藏文框架语义知识语义关系分析的关键就是建立句子中各词语之间的语义关联关系。实现各框架间知识 的共享,获取更多的信息.文章引出了藏文框架语义知识、框架及框架元素并结合实例分析了以藏语句子为主,组成该 句子的词语或短语间的语义关系及框架形式表示该句子的语义为结构化. 【关键词】藏文;框榘;知识;分析 【中图分类号]TP391.1iH017 [文献标识码]A [文章编号]1009—2102(2010)01—0016一O4 

O引言 

语言信息处理的研究中,在国外,早在20世纪70年代末美国语言学家Fillmore从计算机科学中引 

入“框架”的概念,并把它应用到1997年在美国加州大学的伯克利分院由Fillmore主持的项目“基于语 料库的计算词典编篡工程”…中,到2009年5月为止,共收录了英语的11 600个词元,共构建了英语的 960个框架,其中6 800个词完成了例举标注,共标注了15万的框架语义信息【2】.这个语义框架 

(Semantic Frame)的构建,为人们提供了研究英语词汇语义及句法结构意义的方法.在国内,2006年由 山西大学的刘开瑛、由丽萍等人创建了一个以有限词语集合为描述对象的汉语框架语义知识库,共对汉 语1 760个词元(一个义下的一个词)构建了130个框架,涉及动词词元142个、形容词词元140个、事 

件名词词元192个,标注8 200条句子 J.到目前位置,藏语在这个领域的研究可以称得上是一块未开 发和挖掘的处女地.为了加快藏文信息处理的进程,藏文框架语义知识的研究和建设也是迫在眉睫. 

因此,本文是对藏文框架语义知识的语义关系这一角度出发,逐一分析并揭示组成语义的词语及短语内 部成分间的关系. 

1藏文框架语义知识 

在藏语言研究中,组成藏语句子的词语及短语在句子中占有重要的地位.比如:例句“商’ 

< ‘气 ’r.q。习’ ‘磊气。司旨’ 。 司1 ’ 日1 。 列 。 < 日 目r’中,“ 气 q吾。司1 ”、“ ai’ ‘ ”、“商‘ 闽’ 

、“ ’ 。 5{ 日 日1”是组成这个句子的一些词语和短语.其中,句子中的“ 日1’叩i 。1 5l ’ 

司 qf’并含有学习各种文化知识的意思.并且,词语“日 司”’为目标词,我们从这个目标词出发,通过对 该短语进行分析,得到了以日标词为中心的词语或短浯的语义关系形式化结构. 

短语: 司1 剖 ’司 司1 短语语义形式: ’ ‘司 ql—— ’目1 +司 一——哥 q旨’ +司 司‘ +舌气+司吾+ 

—— +目 

【收稿日期]2010—02—12 [基金项目】国家语委科研基金项目(项目号:MZll5—69) [作者简介】多杰卓玛(1970一),女(藏族),青海贵德人,讲师,硕士,主要从事藏文信息处理方面的研究 

一16

— 短语语义结构: ’ 。 ’q 司卜_一 日1 叩i ’1 ’占j +q 司.司 这个词语可以激活一个语境, 

该语境包括:蓠司 琶 。萝气。5I『日 ‘ 。 ‘气‘<1萄司’暂 ’萝 ’ 茂‘ ’气 。q ‘每 ’l琶 寻 ‘哥。舌气‘日旨’ 1 司茂‘ 

翻日1 ‘i 。 。日1 ’蓠日 1 日 琶 ‘ ’甏 ‘ 5I’ ’1 昌’ ’ ’司’ ‘司旨。 日1 琶 。日1、 R写 I 

等信息.语境是由萄q。5I『日 l主体耄 。 l地点 琶 。昌1对象 罄ciI时间等多个方面来定义的.前面 

的四个因素或四个成分设定了一个简单的语境:进修(深造)者在某个时间某个地点作了某事.其中语 境中的蓠司 5l I主体琶 ’ 1地点 。寻1 誉 耐间等内容又组成了这个语境的主要成分及知识. 

我们把词语“司 日”相对应的整体概念结构称之为框架语义知识. 框架语义是一钟图示化的表示方法,涉及各种参与者、外部条件和其他概念角色,称为框架元 素[引.框架元素是框架的主要组成部分.而框架元素又是颗粒度更小的词元组成的.比如例句“蔺 日1 

‘ 茂’ ’q’ ‘ ‘ 磊气‘目旨 ’ ’ 1。 ’ 荨I 司 司1”中,蓠司 5I 1主体、琶< 5 1地点、 誉气1时 

间等每一项都是一个框架元素.一个个的框架元素的集合形成了一个框架.如例句中的“司 日”’其实 

就是一个框架. 

2藏文框架语义知识的语义关系分析 

在自然语言处理中,对语义的研究文献[5】中,林杏光引用了陈望道先生提出的“六何”,即何人、何 

物、何时、何地、何故以及如何,以此来概括任一事件结构都可用7S视图,即事件由目的(Purpose)、主体 

(Actor)、动作(Action)、对象(Object)、辅助设施(Facility)、地点(Location)和时间(Time)7s个概念域构 成.然而对藏文词语的框架语义分析时,我们不仅要考虑到词语在句子中的7s这些概念域,还要考虑 

到各个词语框架与这些概念域之间的关系,从而确立以藏语词语为主的框架、框架元素、词元等.下面 分析句子的语义构成情况: 例1 藏文: 。 ‘ ’ ’两茂。司 。 ‘自’ 萄日’ ’马司‘琶<。寻 l 

汉文:从去年到现在,我在北大进修. 

从句子的横向看:“写司’琶 为该句子的日标词,由于“蜀司。蓉 与组成该句子的其他词语或短语间的 语义关系分析(见图1)后。得到了如下信息: 1)“ 。 司’ ”是目标词“司目鼋 的处所地.反之,“司q‘琶 是指深造(进修)人的在所处的位置 

里学习时的一种表现行为. 2)词语“ ”与目标词“昌司曾 ”问的关系是:“司司 蓉 的主体是“ ”,而“ 这个主体要实施的行为是 “司马 暂 .所以,它们两者之间可以用施为关系.即指主体实施某种行为. 3)词语“气 ’ 。 镯a 司 ”是目标词“司马鼋 的时间.因此,两者之间具有存在关系. 

图l词语或短语间的平面语义关系分析图 从句子的纵向看: 

目标词“葺司’琶<”中隐藏着更多的信息量.我们可以挖掘,如“蜀q鼋 ”的内容是什么,为什么要“青q’ 

暂 ,“葛q鼋 后达到的程度以及“葛≈鼋<”后的结果会如何等这些信息.从而将“暑目鼋 与隐藏的知识 点“琶<’昌茂 面 ‘可 ”、“琶<‘司茂’气 ”、“ 马 ”等之间建立关联关系.总之,将一个句子的纵向和 

横向语义综合起来要考虑它的整体语义,从而构成该目标为中心的框架语义网络. 

一】7

一 例2 藏文:昌气 。 。 ‘ q 目 ‘司宥 ’酉ql 

汉文:学习科学技术取得了良好成果. 例2的语义关系分析后,得到如下: 1)“晶 。 ’ ’ 司”与“ 司 司司<’ ’酉q1”两个事件之间有明显的因果次序,良好的成绩是 

因为之前学习过科技技术的原因.因此,两者之间具有因果关系. 

2)“贳 ’ 司1‘ ”是“ ’司”的内容,而“ ‘司”是对内容“ ‘ ’ ”的实施的行为.它们 之间是利用关系.即:某一动作利用某种资源. 。. 一’.. 

“ .嫡’ 怠 {季 l暑 

曩2 璃罨语.爻墓蒙;建车巨 匿 .‘ 袁翥 擎遍吴. 

窿,,,—、表豢i≮擎鸯誊. 

臣 … 袁 ≮擎誊豹・ 

3藏文框架语义知识的语义关系表示 图2词语语义关系分析图 写 ” 

根据例1、例2的语义分析结果,用框架网络形式表示以上两个句子的语义(见图2). 

首先,确定句子中的日标词,并以目标词为中心如例1中的“司司。琶<”和例2中的“碧< ”两个词语为 

中心进行框架网络. 

图3藏文框架语义知识的语义关系表示图 从图2看:“司 鼋 框架是由多个框架元素组成,或者是由激活“蜀q 琶 语境的多个场所构成的. 

其中“毫 ’ ”、“毫 ”、“ ”、“ 磊 ”、“弩<’昌f’、“导’ ”、“ 写 ”等都是框架元素.这些 框架元素是由更小的词元组成的.一个框架是以它相关的概忠结构组成的,这个结构具有一定的层级 

性.因此,在框架的描述中,词元是最小的框架构成单位,也是构成框架的层级中最低层的一级. 

4结束语 

本文是从藏文框架语义知识的语义关系这一角度出发,并结合实例逐一分析揭示组成语义的内部 成分闻的关系.为藏文信息科学领域的深人研究提供了参考作用,同时也为今后在藏文信息处理领域 

内的信息检索、自动语义标注、问答系统、信息捕取等的应用研究提供了参考依据. 

一j8

一 参考文献: 

【1]Theory and Practice.[2007一O3—12].http://framenet.icsi.berkeley.edu/ [2]Welcome tO FrameNet.[2010—03—123.ht印 ̄//framenet.icsi.berkeley.edu/ [3]由丽萍等.信息处理用中文框架语义知识描述方法研究.民族语言文字信息技术研究.第十一届全国民族语言文字 信息学术研讨会论文集[c],2007. [4]贾君枝、陈幼华.汉语框架网络知识本体构建研究[J].中国图书馆学报.2007(2).56. f5]林杏光.诃汇语义和计算语言学[M].北京:语文出版社,1999. 

Analyses of Semantic Relations between 

Tibetan Framework of Semantic Knowledge 

Duo Jie Zhuo Ma 

(China Minorities Information Technology Institute,Northwest University for Nationalities,Lanzhou Gansu 730030,China) [Abstract]The Tibetan framework of semantic knowledge mainly focuses on building a sentence associated with the various semantic relations between words and realizing the sharing of knowledge between the various frameworks for more information.This leads to the Tibetan framework for semantic knowledge, 

framework and framework elements.The semantic relation of the sentences,word and phrase in the sentence were also analyzed in the present.By using the framework of the semantics to indicate how the sentence is 

structured. [Key words]Tibetan;framework;knowledge;analysis 

合集下载

藏文语义本体中的上下位关系模式匹配算法

藏文语义本体中的上下位关系模式匹配算法

第25卷第4期 2011年7月 中文信息学报 JOURNAL 0F CHINESE INFoRMATIoN PROCESSING Vo1.25,No.4 Ju1.,201I 

文章编号:1003—0077(2011)04—0045—05 

藏文语义本体中的上下位关系模式匹配算法 

邱莉榕 ,翁或 。,赵小兵 

(1.中央民族大学信息工程学院,北京100081; 2.国家语言资源监测与研究中心少数民族分中心,北京100081) 

摘 要:语义本体是共享概念模型显示的形式化规范说明,其目标是将杂乱无章的信息源转变为有序易用的知识 源。目前语义本体还主要依赖于手工创建模式。上下位关系是一种基本的语义关系,常用于语义本体中概念的自 动获取和验证。该文首先描述了藏文语义本体的创建方法,进而给出了藏文中的上下位关系模式以及模式匹配算 法。上下位关系的模式可以辅助进行概念扩充,也可以作为建立和维护本体的辅助工具,这在一定程度上降低了 创建和维护本体的成本。 关键词:知识获取;语义本体;概念获取;上下位关系 中图分类号:TP391 文献标识码:A 

Acquisition Method of Hyponymy Concepts Based on Patterns in Tibetan Semantic Ontology 

QIU Lirong 。WENG Yu 。ZHAO Xiaobing ’ (1l Department of Information Technology,Minzu University of China,Beiiing 100081,China; 2.Minority Languages Branch,National Language Resource Monitoring and Research Center,Beijing 100081,China) 

Abstract:Semantic ontology is a formal,explicit specification of a shared conceptualization,which provides a shared vocabulary used to model a domain--that is,the type of objects and/or concepts that exist,and their properties and relations.Hyponymy pattern is a basic semantic relationship between concepts,which is used tO concepts acquisition in an ontology automatically.In this paper,hyponymy pattern is represented as a pair of a meaning frame defining the necessary information extraction in Tibetan language.Then the concept acquisition algorithm and the method of how tO get pattern—match sentences are presented.The research of hyponymy relationship pattern can assist concept enrichment in ontology,which can reduce the cost during the ontology engineering process. Key words:knowledge acquisition;semantic ontology;concepts acquisition;hyponymic relation 

初中藏文信息处理中自动分词方法研究

初中藏文信息处理中自动分词方法研究

龙源期刊网

初中藏文信息处理中自动分词方法研究

作者:格桑

来源:《杂文月刊·教育世界》2016年第08期

西藏自治区昌都市洛隆县初级中学

【摘 要】藏文分词是藏文信息处理领域的一项不可缺少的基础性工作,也是智能化藏文信息处理的关键所在。在藏文分词的研究过程中藏文分词的准确性,直接制约着藏文输入法研究、藏文电子词典建设、藏文词频统计、搜索引擎的设计和实现、机器翻译系统的开发、藏文语料库建设以及藏语语义分析研究等高层藏文信息处理技术的进一步发展。本文借鉴汉语的分词理论和方法,提出符合藏文特性的分词方法,以及歧义字段切分和未登录词识别等相关问题,并举例说明。

【关键词】信息处理 藏文分词 分词方法

藏文分词是藏文信息处理中一项不可缺少的基础性工作。从文本的输入系统(如智能语句输入法、语音输入、手写输入),到文字处理(如文本校对)以及语音合成、文本检索、文本分类、自然语言接口、自动文摘等,无处不渗透着分词系统的应用,它是藏文信息处理重要基础之一。众所周知,英文以词为单位,以空格隔开。计算机可以容易地理解英文单词。而藏文句子中,词与词之间没有明显的分隔符(如空格)。藏文以字(音节字)为单位,连字成句才能描述一个完整的意思。而对由词组成的藏文句子,必须通过藏文分词技术才得以理解。把藏文的音节字序列切分成有意义的词,是藏文分词的研究工作。通过研究和分析藏文分词的概念以及国内外相关成果,本文系统地提出了分词系统中藏文分词切分单位的划定原则以及藏文分词技术方法,结合藏文自然标记断句、以格助词来为分块、块内匹配与统计相结合的分词方法,提出了藏文自动分词方法、格助词的识别方法、交集型和组合型歧义的识别方法及未登录词识别方法。进而提出了藏文自动分词的基础理论知识及分词技术方法。

一、制定藏语词性标记集规范

为了使藏文与汉文信息处理同步,建立统一的中文多文种信息处理平台,本项研究借鉴北京大学现代汉语词类及词性标记集规范、语料库词性标记集,制定了藏语词性标记集规范。

论元角色的藏语语义角色标注研究

论元角色的藏语语义角色标注研究

论元角色的藏语语义角色标注研究

珠杰; 仁青诺布; 春燕; 拉巴顿珠; 索朗次仁

【期刊名称】《《高原科学研究》》

【年(卷),期】2018(002)003

【摘 要】针对面向信息处理用藏语语义角色标注尚不成熟的问题,文章借鉴PropBank标注规范和语义角色分析理论,探讨了藏语语义角色标注问题。一是按照PropBank标注规范对藏语简单句进行了语义角色标注;二是依据藏语动词的语义类别,研究了藏文语义角色框架文件建设的可行性;三是结合藏语动词分析理论和格语法理论,在PropBank标记基础上研究了藏语特殊语义角色标记规范和标记方式。

【总页数】12页(P85-96)

【作 者】珠杰; 仁青诺布; 春燕; 拉巴顿珠; 索朗次仁

【作者单位】西藏大学信息科学技术学院 西藏拉萨850000; 藏文信息技术国家地方联合中心 西藏拉萨850000

【正文语种】中 文

【中图分类】TP391

【相关文献】

1.语义角色标注中有效的识别论元算法研究 [J], 丁金涛;周国栋;王红玲;朱巧明

2.基于多策略的藏语语义角色标注研究 [J], 龙从军;康才畯;李琳;江荻

3.基于依存树距离识别论元的语义角色标注系统 [J], 王鑫;穗志方 4.基于模糊机制和语义密度聚类的汉语自动语义角色标注研究 [J], 王旭阳; 朱鹏飞

5.基于BILSTM-CRF的高校政策语义角色标注研究 [J], 徐建国;刘泳慧;刘梦凡

因版权原因,仅展示原文概要,查看原文内容请购买

藏文信息处理的原理与应用电子版

藏文信息处理的原理与应用电子版

藏文信息处理的原理与应用电子版

1. 藏文字符编码:将藏文字符映射为计算机能够处理的二进制编码,通常采用Unicode编码或其他自定义编码方案。

2.藏文文本分词:将藏文文本进行分词,将文本按照词语单位进行切分,方便后续处理。

3.藏文词性标注:对分词后的词语进行标注,判断其词性和语法功能。

4.藏文语言模型:建立基于藏文语料库的语言模型,用于进行自动语言识别、句子生成等自然语言处理任务。

5.藏文文本分类与情感分析:利用机器学习技术对藏文文本进行分类和情感分析,可以应用于舆情监测、情感分析等领域。

1.藏文机器翻译:将中文或其他语言的文本翻译成藏文,或者将藏文翻译成其他语言。

2.藏文信息检索:实现对藏文文本的检索和索引,方便用户查找相关信息。

3.藏文语音识别:将藏文声音转化为文字,实现对藏文语音的识别和转录。

5.藏文文本挖掘与知识发现:通过对大规模藏文文本数据的分析和挖掘,发现其中的规律和知识,用于文本分析、情报分析等领域。

总之,藏文信息处理的原理和应用的电子化,可以帮助加速处理藏文信息的效率和精确度,推动藏文信息化的发展。

汉文和藏文在信息处理中的比较研究

汉文和藏文在信息处理中的比较研究

《西藏科技》2013年10期(总第247期) 信息技术 

汉文和藏文在信息处理中的比较研究 

普顿 群诺尼玛扎西 

(西藏大学教务处;西藏大学现代教育技术中心,西藏 拉萨850000) 

摘 要:汉文和藏文是中文信息处理的重要组成部分,文章利用比较法对两者的信息处理方法和技术手 

段进行了研究,从而为今后进一步开展藏文信息处理深层次研究工作提供借鉴。 

关键词:汉文 藏文 信息处理 比较法 

1 引言 

中文信息处理已经从20世纪50年代开始研究, 

经过50多年的发展,已经取得了丰硕的研究成果,相 

应的研发产品已经广泛应用于社会、经济、生活中的方 

方面面。汉文作为中文信息处理的核心内容,不论在 

字、词、句为主的基础研究,还是在输入输出、存储转换 

以及信息检索、自然语言理解、机器翻译等信息处理方 

面都有很好的研究成果。藏文在中文信息处理领域虽 

然起步较晚,但近几年借助国家强有力的支持,已经取 

得了前所未有的发展和进步,成为国内少数民族语言 

文字中信息处理能力走在前列的文种之一。在藏文信 

息处理技术的研究过程中离不开与汉语、汉字信息处 

理方法的借鉴与吸收,期间由于语言、文字本身的自身 

特性也存在许多不同的处理方法和技术手段。文章利 

用比较法对汉文和藏文在文字特点、技术处理方法及 

手段方面的不同之处进行深入研究,从而为今后开展 

更深层次的藏文信息处理研究工作提供借鉴。 

2 汉文和藏文的文字特点不同 

在现代汉语中,音节是语音中最自然的单位。每 

个音节都有它的相对独立性,一个音节表示一个汉字 

(部分儿化韵除外)。而汉字是与汉语中语素义直接相 

联系的,是一种表意性很强的文字。除少数联绵词、音 

译外来词中的字不具有意义,大多数汉字都具有一定 

的意义。汉字是书面形式中最小的表意单位,一个汉 

字基本上相当于汉语中一个语素,因此有人把汉字称 为语素文字。作为表意性文字,汉字虽然与汉语的语 

音没有直接联系,但一旦成为记录语言的符号,它就不 

基于组块的藏文依存句法分析及自动标注方法

基于组块的藏文依存句法分析及自动标注方法

基于组块的藏文依存句法分析及自动标注方法

达瓦追玛;曹玺;尼玛扎西;群诺;道吉扎西

【期刊名称】《高原科学研究》

【年(卷),期】2024(8)1

【摘 要】依存句法分析是自然语言处理领域核心技术之一,旨在通过分析句子中词语之间的依存关系来确定句法结构。目前,藏文依存句法分析研究面临着长句解析困难和粗粒度依存转化映射不全面等问题。为此,文章提出一种基于组块和细粒度词性匹配规则的藏文依存句法分析及自动标注方法。该方法首先完善了藏文依存句法标注体系,并基于该标注体系人工标注数据集,提取词性匹配规则,进而通过藏文句子组块识别,提高了长句解析的准确性,最后实现了一个藏文依存句法自动标注原型系统TDParser,并构建了含7335条依存句法的藏文依存句法树库。通过实验证明了TDParser的性能及自动标注数据的有效性。

【总页数】10页(P102-111)

【作 者】达瓦追玛;曹玺;尼玛扎西;群诺;道吉扎西

【作者单位】西藏大学信息科学技术学院;西藏大学西藏自治区藏文信息技术人工智能重点实验室;西藏大学藏文信息技术教育部工程研究中心;西藏大学西藏信息化省部共建协同创新中心

【正文语种】中 文

【中图分类】TP391.1

【相关文献】 1.基于序列标注的中文依存句法分析方法2.基于序列标注模型的分层式依存句法分析方法3.一种融合依存句法分析和语义角色标注的领域新闻热点话题识别方法4.基于组块分割的无监督藏文句法分析方法研究5.基于Bi-LSTM的藏文依存句法分析研究

因版权原因,仅展示原文概要,查看原文内容请购买

信息处理用藏语语法模型知识库研究

第32卷总第83期 2 0 1 1年9月 西北民族大学学报(自然科学版) Journal of Northwest University for Nationalities(Natural Science) Vo1.32.No.3 Sep,2011 

信息处理用藏语语法模型知识库研究 

多 拉 ,才让三智2 

(西北民族大学中国民族信,息技术研究院,甘肃兰州730030) 

[摘要]语言模型是对自然语言的一种描述,构造语言模型是研究计算语言学、自然语言理解的核心内容之一,好 的语言模型将有助于自然语言处理的准确性.由于藏文是属于有形态的语言,既有曲折的特点,也有黏着的特征,并有 丰富的格标记.深入研究其格语法体系,使之规范化,建立和完善语言模型知识库.这对于进一步开展机器识别的句法 研究以及文本理解、汉藏智能翻译、自动分词、文本自动校对、句法树库建设、信息检索等方面将会起到基础支撑作用. [关键词]语言模型;藏语语法;藏语虚词;知识库 [中图分类号】TP391;H214 【文献标识码]A [文章编号]1009—2102(2011}03—0013—06 

O弓l言 

语言模型是对自然语言的一种描述,构造语言模型是研究计算语言学、自然语言理解的核心内容之 

一,好的语言模型将有助于自然语言处理的准确性.语言信息处理的高新科技已成为一个国家、一个 

民族发展进步的重要标志.语言及其所负载的信息是信息处理的主要对象,而面向信息处理的语言面 

临着新的挑战,从适应人的语法深入或转变为方便计算机理解或习得的语法是必然趋势. 

1藏语自然语言处理研究现状 

目前,国内外对于藏语语法的研究是基于《三十颂》和《音势论》.相对而言,对这两部典籍进行注疏 的较多,用现代语言学的方法研究的较少,大部分都是基于《三十颂》和《音势论》的思路对其进行进一步 

的阐释和说明,而用费尔摩的格语法等现代语言学理论方法分析的相对较少.然而在信息处理领域,特 

信息处理中藏语虚词“na”和“la”的标注研究

ISSN 1009-3044 Computer Knowledge and Technology电脑知识与技术 Vo1.7,No.10,April 201 1,pp.2441—2445 E-maih kfyj@ecce.net.en http://www.dnzs.net.en Te1:+86—551-5690963 5690964 

信息处理中藏语虚词“nll"和“la"的标注研究 

才让三智,多拉 

(西北民族大学中围民族信息技术研究院,甘肃兰州730030) 

摘要:藏文信息处理已经从最初字处理转向了自然语言处理的阶段。现如今正逐步向句法分析、语句分析、自动文摘、自动分类和机 器翻译迈进 但是这些都基于词的层面上研究处理,而词则受许多格标记和虚词的制约。因此,在藏文信息处理q-对格标记的分词 标注更是一件棘手和复杂的事。该文通过研究藏文信息中的兼类虚词“na”和“la”,提出了如何在不同的语境q-,处理和解决这类词 

性的标注问题。 

关键词:信息处理:藏文虚词;标注 

中图分类号:TP391 文献标识码:A 文章编号:1009—3044(2Ol1)1O一2441—05 

The study of the Tibetan Function Words”na”and”la”Tagging for Information Processing 

Testing Sam ZhU,Dloha 

(China Minorties Information Technology Institute,Northwest Umve ̄iw for Nationalities,Lanzhou 730030,China) 

Abstrct:Tibetan information processing has from the original word processing to natural language processing,nowadays gradually to the syntactic analysis,sentence analysis,automatically abstract,automatic classification and machine translation.But these are based on the level of word processing,and the words are limited by many case inarkers and function words.Therefore,in the Tibetan information processing the particimple mark on the case markers is a tough and complex thing.Through the study of the Tibetan information function words”na” and”la”.put forward how to in diferent contexts handle and solve this problem of part—of-speech tagging. 

融合La格虚词语义信息的藏文La格分类模型

第62卷 第4期厦门大学学报(自然科学版)Vol.62 No.4 2023年7月JournalofXiamenUniversity(NaturalScience)Jul.2023

http:∥doi:10.6043/j.issn.0438-0479.202209022

融合La格虚词语义信息的藏文La格分类模型

班玛宝1,2,慈祯嘉措1,2,3,4,5,张 瑞1,2,才让加1,2,3,4,5*

(1.青海师范大学计算机学院,青海西宁810016;2.省部共建藏语智能信息处理及应用国家重点实验室,青海西宁810008;

3.青海省藏文信息处理与机器翻译重点实验室,青海西宁810008;4.藏文信息处理教育部重点实验室,青海

西宁810008;5.青海省藏文信息处理工程技术研究中心,青海西宁810008)

摘要:采用深度学习方法实现藏文La格()分类是一项具有挑战性和重要研究意义的藏语自然语言处理任务.藏

文La格的自动分类更加依赖于上下文语义信息和特征的时序性,该文通过分析La格虚词的用法及语义特征,在设计La格虚词语义信息标记算法的基础上,提出一种融合La格虚词语义信息的藏文La格分类模型.该模型首先以每个音

节及对应La格虚词或其它音节的语义特征嵌入作为输入,丰富嵌入向量的语义信息,增加输入特征的多样性;然后采

用一维卷积融合并学习每个音节及对应La格虚词或其它音节语义信息的局部特征向量,提高卷积层的空间特征学习

能力;其次使用双向长短时记忆网络(longshort-termmemory)(LSTM)学习时序特征,提高时序特征的学习能力;最后

使用注意力机制对双向LSTM层每一时刻的输出特征进行加权融合,充分利用每一时刻的输出特征,以提高最终文本

表示的特征质量.在TLD藏文La格数据集上的实验结果显示,该模型的分类效果优于基线模型及仅用藏文音节嵌入

的模型,在测试集上的分类准确率为93.10%.

信息处理用藏文自动分词研究

西北民族大学学报(哲学社会科学版) 中国民族学类核心期刊 J.NOR'I'HWI ̄T I】NI、 围圆rr F0R N^.I10N^I rI卫ES(Pl1 6ophy and s∞i.1 Sclm,:e) 2006年第4期 No.4.2I’06 

信息处理用藏文自动分词研究 

祁坤钰 

(西北民族大学中国民族信息技术研究院,甘肃兰州730030) 

[摘要]藏文自动分词研究是藏文信息处理领域的一项基础性_r_-- ̄,在研究藏语形式逻辑格、语义逻辑格、音势论 等语法理论的基础上。借鉴汉语的分词理论和方法,充分利用藏语上下文语境,在不同藏语句子层面采用不同的处理方 法。格切分用于句子结构层面,边界符判定用于短语切分,模式匹配用于词块切分,由此,提出了切分与格框架、标注一 体化的藏语三级切分体系。 [关键词]信息处理;藏语语法;自动分词 【中图分类号]H214 【文献标识码]A 【文章编号]1001—5140(2006)04—0092—06 藏文信息处理涵盖了字、词、短语、句子、篇章等多层面的信息加工处理任务。当前藏文信息处理处 于字、词处理阶段。藏文是属于逻辑格语法体系的拼音文字,虽然与汉语差别很大,但在词汇边界处理 方面与汉语相同,词间没有间隙,因而语言处理首先遇到的问题是词的切分问题。这里的分词不是指人 脑思维机制对语言在理性意义上的词汇界限的区分,而是指机器自动分词。 藏语自动分词研究是藏语自然语言处理的关键技术之一,也是语言智能化处理的基础工程。只有 对藏语句子正确无误的分词,才有可能实现对藏语自然语言的理解。目前,在我国中文信息处理领域, 许多专家、学者对汉语分词做了近二十多年的研究,提出了不少算法和策略,但这些算法都是基于汉字 的。由于汉字是像形文字,属于开放语言体系的非受限语言,语法结构约束性很弱。而藏语是拼音文 字,具有相对严格的格语法理论,因此,现有的基于统计的汉语分词方法无法直接移植到藏语分词中。 藏文分词必须从藏语词法、句法、音势论等为基础的格语法理论研究开始,同时借鉴国内外分词技术及 算法研究的优势,提出藏语分词方案,为藏语大型语料库建设藏、汉、英机器翻译,提供技术基础。 

  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
相关文档
最新文档