汉语自动分词词典机制的实验研究

中 文 信 息 学 报

14卷第

1期

JOURNALOFCHINESEINFORMATIONPROCESSINGVol.14No.1

汉语自动分词词典机制的实验研究Ξ

孙茂松 左正平 黄昌宁

清华大学计算机科学与技术系 北京 

100084

摘要 分词词典是汉语自动分词系统的一个基本组成部分。其查询速度直接影响到分词

系统的处理速度。本文设计并通过实验考察了三种典型的分词词典机制

:整词二分、

TRIE索

引树及逐字二分

,着重比较了它们的时间、空间效率。实验显示

:基于逐字二分的分词词典机

制简洁、高效

,较好地满足了实用型汉语自动分词系统的需要。

关键词 中文信息处理 汉语自动分词 汉语自动分词词典机制

AnExperimentalStudyonDictionaryMechanism

forChineseWordSegmentation

SunMaosong 

ZuoZhengping 

HuangChangning

TheStateKeyLaboratoryofIntelligentTechnologyandSystems,

DepartmentofComputerScienceandTechnology,TsinghuaUniversity 

Beijing 

100084

Abstract 

ThedictionarymechanismservesasoneofthebasiccomponentsinChinesewordseg2

mentationsystems.Itsperformanceinfluencesthesegmentationspeedsignificantly.Inthispaper,

wedesignandimplementthreetypicaldictionarymechanisms,i.e.binary2

seek2

by2

word,TRIEin2

dexingtreeandbinary2

seek2

by2

characters,fromwordsegmentationpointofview,andcompare

theirspaceandtimecomplexityexperimentally.Itcanbeseenthatthebinary2

seek2

by2

characters

modelisthemostappropriateonebeingcapableoffulfillingtheneedforspeedofpracticalChinese

wordsegmenterstothemaximumextent.

Keywords 

Chineseinformationprocessing 

Chinesewordsegmentation 

Dictionarymechanism

forChinesewordsegmentation

一、引言

分词词典是汉语自动分词系统的一个基本组成部分[1]

。自动分词系统所需要的各类信

息(知识)都要从分词词典中获取

,分词词典的查询速度直接影响到分词系统的速度。而现实

1Ξ本研究得到国家自然科学基金资助(合同号

:69433010)

本文于

1999年

4月

6日收到

© 1995-2005 Tsinghua Tongfang Optical Disc Co., Ltd. All rights reserved.应用(如因特网上的中文文本检索、汉字与汉语语音识别系统的后处理以及中文文语转换系统

的前处理等)均对分词速度提出了迫切要求

,因此建立高效快速的分词词典机制势在必行。

针对分词系统的特点

,可以将分词词典的查询操作大致分为三种基本方式

:

查询方式

1

:在分词词典中查找指定词

w

0(词在分词词典中的定位)

这是一种最基本的查询方式。给定词

w

0,返回

w

0在分词词典中的位置

,以便得到

w

0

的各类附属信息。此时

w

0是确定的

,所以可以简单地通过二分查找给出结果。

查询方式

2

:根据分词词典

,在汉字串

S中查找从某一指定位置

i开始的最长词

w

i,max(对

应最大匹配分词法)

有别于查询方式

1

,这里最长词

w

i,max无法预知

,需要在查询过程中动态地确定。通常的

做法是尝试始于位置

i的所有可能长度的词

,多次运用查询方式

1来完成查询。

查询方式

3

:根据分词词典

,在汉字串

S中查找从某一指定位置

i开始的所有的词

w

i,1,

w

i,2,…

,w

i,max(对应全切分分词法)

类似查询方式

2,但返回结果通常不唯一。

本文设计并通过实验考察了三种典型的分词词典机制

:(

1)基于整词二分(

2)基于

TRIE

索引树及(

3)基于逐字二分

,着重比较了它们的时间、空间效率。

二、三种典型的分词词典机制

实验利用了一个包含

112967个不同词的分词词典

THDic。

THDic中最短词只有一个汉

字(单字词)

,最长词则达到

17个汉字(长词多为成语、惯用语、习用语等)

,平均词长度约

2.5

个汉字。

2.1 基于整词二分的分词词典机制

这是一种广为使用的分词词典机制。其结构通常分为三级

,前两级为索引(见图

1)。

1 基于整词二分的分词词典机制

1.首字散列表

词首字散列函数根据汉字的国标区位码给出。通过一次哈希运算即可直接定位汉字在首

字散列表中的序号。

首字散列表的一个单元包括两项内容

:

入口项个数(

4字节)

:以该字为首字的词的个数

;

第一入口项指针(

4字节)

:指向第一入口项在词索引表中的位置。

2.词索引表

因词的长度可变(实际系统中还包括附属于该词的各类信息)

,故以选择不定长存储为宜

;2

© 1995-2005 Tsinghua Tongfang Optical Disc Co., Ltd. All rights reserved.此外必须实现对词的随机访问。这两条决定了必须建立词索引表。

词索引表的一个单元仅含一项内容

:

词典正文指针(

4字节)

:指向词在词典正文中的位置。

3.词典正文

以词为单位的有序表。通过词索引表和词典正文的配合

,很容易实现指定词在词典正文

中的整词二分快速查找。

此种分词词典机制比较适合于查询方式

1。而在查询方式

2、

3中

,对任一位置

i,通常我

们不得不预先主观设定一个词的可能最长长度

l(一般

l取词典中最长词的长度。

THDic为

17个字

)

,然后截取子汉字串

S[i,i+

l-1

]作为假想词

,在词典中进行整词二分查找。不成

功则词长

l递次减一并循环

,直至匹配成功。由于一、二、三、四字词分别占

THDic的

3

.6

%、

64

.0

%、

16

.0

%、

14

.0

%,它们更动态覆盖了真实文本绝大部分

,因此这种由长词及短词的盲目

尝试方法效率很低。

[例

] 查询

S“水怪大白天现形一个多小时这个令人惊异的消息不径而走。”中从“大”字

开始的最长的词。

(1) 取从“大”字开头最长可能的汉字串

:w

i,max=“大白天现形一个多小时这个令人惊

异的”(词典中最长词为

17个汉字)

;

(

2) 用整词二分法在词典中查找候选词

w

i,max,失败

;

(3) 去掉

w

i,max最后一个字

,重复步骤(

2)

,失败

;

(

4) ……

(

5) 经过

14次的错误尝试

,

w

i,max最终消减到“大白天”

,查找成功

,于是返回

w

i,max=

“大白天”。

2.2 基于

TRIE索引树的分词词典机制

TRIE索引树是一种以树的多重链表形式表示的键树[2]

。面向英文的

TRIE索引树一般

26个字母作为关键字

,树结点包含个数相同的指针。汉字接近

7000个

,如果采用同样的

策略构造中文词典

,显然将造成指针的大量浪费。面向中文的

TRIE索引树的结点应允许指

针个数变化。

基于

TRIE树的分词词典由两部分组成(见图

2)。

1.首字散列表

同基于整词二分的分词词典机制。首字散列表的一个单元是所对应汉字的

TRIE索引树

的根结点。

2.TRIE索引树结点

TRIE索引树结点是以下述结构为单元的、按关键字排序的数组

:

关键字(

2字节)

:单一汉字

;

子树大小(

2字节)

:以从根结点到当前单元的关键字组成的子串为前缀的词的个数

;

子树指针(

4字节)

:子树大小非

0时

,指针指向子树

;否则指向叶子。

TRIE索引树上查询任意一个词

W[1,n]的过程为

:

(

1) 根据首字散列表得到

W[1]的

TRIE索引树

,沿相应指针移动至目标结点

NODEx;

i=2;

(

2) 在

NODEx的关键字域中对汉字

W[i]进行二分查找。

如果与

NODEx的第

j个单元的关键字匹配成功

,3

© 1995-2005 Tsinghua Tongfang Optical Disc Co., Ltd. All rights reserved.

合集下载

面向中文自动分词的可扩展式电子词典研究

面向中文自动分词的可扩展式电子词典研究

co 妣r Engineering and Applications计算机工程与应用 !,44 1 1)一 

面向中文自动分词的可扩展式电子词典研究 

贺 胜 ,曲维光z,许超 

HE Sheng ,QU Wei—guang2,XU Chao 

1.南京师范大学文学院,南京210097 

2.南京师范大学计算机科学系,南京210097 1.Sch(】(】l of Chinese Language and Literature,Nanjing Normal University,Nanjing 210097,China 

2.Deptartment of Computer Science,Nanjing Normal University,Nanjing 210097,China 

E~mail:heshe“g99@sina.com 

HE Sheng,Qu Wei—guang,XU Chao.Extendable digital dictionary for automatic Chinese word segmentation・Computer 

Engineering and Applications,2008,44(21):199—201. 

Abstract:Digita1 dictionary is an important part in automatic Chinese word segmentation and part of speech tagging,which is 

a1so a vita1 tactor affecting system performance.This thesis introduces the necessary searching functions aud comlnoll components for a digita1 dictionary and proposes an extendable mechanism which consists of system dictionary and user dictionary.The system 

自扩充中文分词词典的研究与实现

自扩充中文分词词典的研究与实现

第38卷(2007)第6期 计算机与数字工程 143 

自扩充中文分词词典的研究与实现 

马志强周长胜丁维杨娜 (北京机械工业学院计算机及自动化系北京100085) 摘要中文分词词典是中文自动分词的一个核心技术,词条的完备率和词典的结构,在一定程度上决定着分词的正 确率和查询速度。为了提高以上两方面的性能,从计算机技术层面上讨论,给出两种改进的词典组织结构和一种自动扩充 词条的方法。 关键词词典整词二分TRIE索引树 自扩充算法 中图分类号TP31 

1 引言 从20世纪50年代开始,计算机界和语言学界 对中文信息处理进行了大量的研究,主要有:北航 1983年设计实现的CDWS分词系统,它是我国第 一个实用的自动分词系统;山西大学计算机系研制 的自动分词系统ABWS;清华大学研制的SEGTAG 系统;国家语委文字所应用句法分析技术的汉语自 动分词;复旦的分词系统;哈工大的统计分词系统; 杭州大学改进的MM分词系统;北大计算语言所的 分词系统等。 分词算法主要有三种类型:机械分词算法。 准确率直接与词典相关(即歧义性问题),并 且不能识别各种未登录词。但是该算法实现简单, 是一种较好的粗分算法。 基于统计的分词算法 这、它与语料库的规模有关,并且要进行大规 模的计算,因此实现较复杂。 基于语义理解的分词算法,由于在分词的过程 中要考虑中文的语法和语义,因此实现复杂。 2 中文分词的一般过程 中文分词包括以下部分:词典初始化、输入分词文 本、文本的结构化处理、分词(粗分)、消歧与识别 未登录词、更新词典和保存结果如图1。 词典是整个分词过程的基础,它会对分词结果 的准确率和速度产生重要影响,所以,本文的目的 就是给出一种实用的词典组织结构,提高查询速 度;同时给出一种词典自学习的方法,扩充词条,提 高分词的准确率。 

图2中文分词流程图 3 词典结构的研究与实现 3。1词典的组织结构 目前,词典的组织结构主要有整词二分和 TRIE索引树两种词典机制的组织结构 J。其它词 典的组织都是以这两种结构为基础进行改进的。 根据这两个基本结构,设计了下面的两种结构,并 进行了对比。 (1)基于整词二分的两层索引结构 该结构分为首字结构散列表和词典正文两级, 如图2所示。 

基于双字哈希的PAT树词典机制的研究

基于双字哈希的PAT树词典机制的研究

2011年1月 第24卷第1期 黑龙江生态工程职业学院学报 Journal of Heilongjiang Vocational Institute of Ecological Engineering Jan.2011 V01.24 NO.1 

基于双字哈希的PAT树词典机制的研究 

赵 丽 郭宏文 

(黑龙江生态工程职业学院计算机技术系,哈尔滨150025) 

摘要:分词词典是汉语自动切分系统的重要组成部分,词典机制的优劣影响到分词的精度及切分速度。针对 汉语中双字词占较大比例的特点及哈希算法的查询高效性,设计了基于双字哈希的PAT树词典机制,并从理论上 

分析了其性能。通过实验在分词的准确率上与逐字二分法进行了比较,同时,与双字哈希机制及改进的PAT树机 

制在时间效率上也进行了比较。结果证明,基于双字哈希的PAT树词典机制在分词的准确率及分词的时间效率上 

均有提高,能够满足大规模文本的分词切分工作要求。 

关键词:分词词典;哈希函数;PAT树 

中图分类号:TP391.1 文献标志码:A 文章编号:1674—6341(2011)O1—0037—03 

中文信息处理技术是重要的计算机应用技术,它已渗透 

到计算机应用的各个领域。中文自动分词是中文信息处理 

的一项重要的基础性工作,许多中文信息处理项目中都涉及 到分词问题。分词的算法可分为有词典及无词典两大类。 

有词典分词算法是以分词词典作为分词的基础,其中正向最 

收稿日期:2010—11—26 

作者简介:赵丽(1979一),女,黑龙江哈尔滨人,讲师,硕 

士研究生。研究方向:中文信息系统与网络操作系统。 大匹配算法、逆向最大匹配算法及全切分算法是基本且有效 

的分词算法 J。 

目前,分词词典机制种类较多,但典型的主要有整词二 

分的词典机制、基于TRIE树的词典机制及逐字二分的词典 机制。随着研究的深入,还有其他学者提出的双字哈希词典 

机制、基于改进的PAT树词典机制及四字哈希词典机制。这 

基于二字词位图表的汉语自动分词词典机制

基于二字词位图表的汉语自动分词词典机制

第33卷第1期 2 0 0 6年2月 湖南大学学报(自然科学版) Journal of Hunan University(Natural Sciences) v01.33.No.1 Feb.2 0 0 6 

文章编号:1000—2472{2006}01—0121 03 

基于二字词位图表的汉语自动分词词典机制 

蒋斌,杨超,赵欢 

(湖南大学计算机科学与通信学院,湖南长沙410082) 

摘 要:根据汉语中二字词较多的特点,提出了一种新的分词词典机制.该机制在词典 

数据结构中添加二字词检测位图表,在分词时,利用位图表可快速判断二字词优化分词速 

度.选取人民日报语料片断进行了实验测试.实验结果表明,基于二字词检测位图表的分词 

词典机制有效地提高了汉语自动分词的速度和效率. 

关键词:汉语自动分词;分词词典机制;二字词检测位图表 

中图分类号:TP391 文献标识码:A 

A Kind of Dictionary Mechanism Based on 

the Two--Word,.Bitmap for Chinese Word Segmentation 

JIANG Bin。YANG Chao,ZHA0 Huan 

(College of Computer and Communication,Hunan Univ,Changsha-Hunan 410082-China) 

Abstract:According to the characteristics that twO-word words are abundant in Chinese,this paper put for— 

ward a new dictionary mechanism.which added two—word—bitnmp into the data structure.The speed of word 

 ̄gmentation can be improved by using this two-word—bitmap to j udge whether two single words could be a two- 

分词技术研究报告

分词技术研究报告

分词技术研究报告 (1)

2008-9-13 7:28:22

技术报告 报告人:杨超一、 研究内容 目前,国内的每个行业、领域都在飞速发展,这中间产生了大量的中文 信息资源,为了能够及时准确的获取最新的信息, 中文搜索引擎是必然 的产物。中文搜索引擎与西文搜索引擎在实现的机制和原理上大致雷同, 但由于汉语本身的特点, 必须引入对于中文语言的处理技术, 而汉语自 动分词技术就是其中很关键的部分。 汉语自动分词到底对搜索引擎有多 大影响?对于搜索引擎来说, 最重要的并不是找到所有结果, 最重要的 是把最相关的结果排在最前面,这也称为相关度排序。 中文分词的准确 与否,常常直接影响到对搜索结果的相关度排序。 分词准确性对搜索引 擎来说十分重要,但如果分词速度太慢,即使准确性再高,对于搜索引 擎来说也是不可用的,因为搜索引擎需要处理数以亿计的网页,如果分 词耗用的时间过长, 会严重影响搜索引擎内容更新的速度。 因此对于搜 索引擎来说,分词的准确性和速度,二者都需要达到很高的要求。 研究汉语自动分词算法,对中文搜索引擎的发展具有至关重要的意义。 快速准确的汉语自动分词是高效中文搜索引擎的必要前提。 本课题研究 中文搜索引擎中汉语自动分词系统的设计与实现, 从目前中文搜索引擎 的发展现状出发, 引出中文搜索引擎的关键技术 汉语自动分词系统

的设计。首先研究和比较了几种典型的汉语自动分词词典机制,指出各 词典机制的优缺点,然后分析和比较了几种主要的汉语自动分词方法, 阐述了各种分词方法的技术特点。 针对课题的具体应用领域, 提出改进 词典的数据结构, 根据汉语中二字词较多的特点, 通过快速判断二字词 来优化速度; 分析中文搜索引擎下歧义处理和未登陆词处理的技术,提 出了适合本课题的自动分词算法, 并给出该系统的具体实

现。 最后对系 统从分词速度和分词准确性方面进行了性能评价。 本课题的研究将促进 中文搜索引擎和汉语自动分词新的发展。

开放式汉语自动分词的学习机制

开放式汉语自动分词的学习机制

开放式汉语自动分词的学习机制

黄德根;岳函;李丽双

【期刊名称】《小型微型计算机系统》

【年(卷),期】2005(026)008

【摘 要】针对统计模型词典动态适应性不高及大规模语料库建设中人工代价昂贵的问题,在基于统计的汉语自动分词基础上,引入了以错误驱动为基础的开放学习机制,通过有监督和无监督相结合的学习方法,建立了包含可信度修正和部分三元语法信息的多元分词模型,讨论了切分算法和人机交互中的具体问题,并通过实验确定模型系数和阈值 .实验结果表明,该分词模型经三次学习后,闭式分词中的切分错误有78.44%得到纠正,切分正确率达到99.43%,开式分词中的切分错误有63.56%得到纠正,切分正确率达到98.46%.系统具有较高的实用价值.

【总页数】5页(P1406-1410)

【作 者】黄德根;岳函;李丽双

【作者单位】大连理工大学,计算机系,辽宁,大连,116024;大连理工大学,计算机系,辽宁,大连,116024;大连理工大学,计算机系,辽宁,大连,116024

【正文语种】中 文

【中图分类】TP391.1

【相关文献】

1.基于自学习机制汉语自动分词系统研究 [J], 邓曙光;刘金铸;曾朝晖

2.广州市终身学习型社会开放学习机制构建策略——基于国内外开放学习机制构建实践的启示 [J], 黄安心

3.基于统计的开放式汉语自动分词 [J], 吴东峥

4.汉语自动分词词典新机制-词值哈希机制 [J], 韩莹;王茂发;陈新房;潘志安;张艳霞

5.基于BERT预训练模型的古汉语自动分词方法研究 [J], 高毅

因版权原因,仅展示原文概要,查看原文内容请购买

中文分词算法的研究与比较

中文分词算法的研究与比较

中文分词是自然语言处理中的重要任务,它将连续的中文文本序列分割成词语的序列。中文分词的结果对于解决其他自然语言处理问题(如文本分类、信息检索、机器翻译等)具有重要的影响。因此,中文分词算法的研究具有重要意义。本文将介绍中文分词算法并比较它们的性能。

1. 常见的中文分词算法

1.1 基于词典匹配的算法

基于词典匹配的算法,也称为基于规则的算法,是最早被提出的中文分词算法。它使用一个词典来储存一些已有的中文单词和词组。然后在对文本进行分词时,根据词典中的单词和词组,将文本中的连续子串与之匹配。由于这种算法采用了大量人工规则,因此其准确性有一定保障,但是其对未登录词的处理能力相对较弱。

1.2 基于统计学的算法

基于统计学的算法,又称为基于概率的算法,是基于大规模语料库的统计分析来实现词语划分的。在基于统计学的算法中,首先需要通过分析建立一个中文分词语料库,然后根据该语料库建立统计模型,通过对分词候选列表的比较和选择,得出最终的分词结果。

1.3 基于机器学习的算法

基于机器学习的算法,是使用机器学习的方法来对中文分词进行自动化学习的过程。这种算法通过训练模型来学习中文分词的规律,然后利用所学规律对文本进行自动分词。基于机器学习的算法不需要人工干预,具有自适应、高效等特点。但是,其对训练语料的要求相对较高。

2. 中文分词算法的比较 2.1 分词准确性

分词准确性是衡量一种分词算法性能的重要指标。在评估分词准确性时,应该考虑其对于未登录词的识别能力。实验结果表明,基于统计学和机器学习的算法在对未登录词的处理能力上具有一定的优势,而基于词典匹配的算法的处理能力相对较弱。

2.2 分词速度

分词速度是衡量中文分词算法性能的另一个重要指标。实验结果表明,基于词典匹配的算法具有较快的速度,而基于统计学的算法和基于机器学习的算法需要较长的计算时间。

2.3 适用范围

分词算法的适用范围也是需要考虑的因素。实验结果表明,基于词典匹配的算法和基于统计学的算法对于固定范围内的语言模式有良好的适应性,但对于复杂的语言环境和文本结构有一定的局限性;而基于机器学习的算法可以适应更复杂的语言环境和文本结构。

中文分词程序实验报告

汉语分词程序实验报告

一、程序功能描述:

本程序每次处理时都用缓冲区的数据从头开始去存储语料库的链表中匹配一个最长的词语来输出,如若没有匹配到的词语则单独输出该首字。

为了简化程序所以语料库和预备分词文章都统一采用ASCII码的编码方式,并且不允许文中出现英语单字节编码。别且本程序没有对未登录词和未声明数据结构格式进行处理,都按照普通汉字进行了分词,因此在最后的性能比较中这部分的准确率很差,但是在语料库有存储的部分中都是用最长匹配原则进行了分词,准确率还是达到了很高的水平。

分词符采用//+空格的方式来标记分词。

语料库的名字默认为:语料库.txt,打开方式为只读

读取的文件名字默认为:resource.txt,打开方式为只读

输出的文件名字默认为:result.txt,打开方式默认为追加的方式

二、算法思路:

(1)、从文件中读取语料库存储在内存中,组织成单链表的存储方式

(2)、组织以首字的ASCII码为下标的哈希表指向语料库链表

(3)、从文件中读满输入缓冲区,以缓冲区的首字的ASCII码做为下标从哈希表中查找首字相同的内存地址。

(4)、从该地址开始逐条匹配,记录其中匹配最长的词语的长度和地址。写入文件中并写入分词符。

(5)、读满缓冲区,若文件已经读取完毕则查看缓冲区是否用尽,若已经用完则执行第(6)步,否则重复(4)过程。

(6)、释放申请的内存空间,程序结束。

三、数据结构:

typedef struct coredict{//使用链表来存储语料库

char data[9];

struct coredict*nextPtr;

}CoreDict,*CoreDictPtr;

CoreDictPtr tablePtr=NULL,tailPtr=NULL,newPtr;//指向语料库链表的头和尾

CoreDictPtr Hash[65536]={NULL};//一个以匹配词语的第一个字的ASCII码为下标的指向链表的哈希表

古汉语自动句读与分词研究

古汉语自动句读与分词研究

古汉语是汉字的古代形式,其构词、语法与现代汉语存在较大差异。在古代文献研究中,古汉语的自动句读与分词一直是一个重要的课题。本文将探讨古汉语自动句读与分词的研究现状及其挑战。

古汉语的自动句读是指通过计算机程序自动将古汉语文本分割成句子的过程。由于古汉语中没有明确的标点符号,句子之间常常没有明显的分界线,因此自动句读是一个具有挑战性的任务。目前,研究者们通过分析古汉语中词汇的用法、语序和语义等特点,采用统计学和机器学习的方法,已经取得了一定的进展。然而,由于古汉语本身的复杂性,自动句读仍然存在一定的误差,并且对于古代文献中存在的特殊情况(如句子中嵌套句的情况)处理不够准确。

古汉语的分词是指将古汉语文本中的连续字序列按照词的边界进行划分的过程。与现代汉语不同,古汉语中的词没有明确的边界,一个词可以由多个字组成,也可以是一个字。因此,古汉语的分词是一个复杂且具有挑战性的任务。研究者们通过分析古汉语中的语法规则、用词习惯和上下文信息等特征,采用统计学和规则匹配的方法,已经取得了一些进展。然而,古汉语的语法规则复杂多样,且存在较多的特例,因此仍然存在分词错误的情况。 古汉语自动句读与分词的研究对于古代文献的数字化处理和文本分析具有重要意义。通过自动句读与分词,可以实现对古汉语文本的有效搜索、信息提取和语义分析等功能,进一步促进古代文献研究的发展。然而,古汉语的复杂性和特殊性给自动句读与分词带来了很大的挑战,需要进一步深入研究和探索。

未来的研究方向可以包括采用深度学习等新兴方法,结合古汉语的语法规则和语义特点,提高自动句读与分词的准确性和效率。同时,还可以建立古汉语自动句读与分词的标准数据集,为算法评估和比较提供基础。此外,还可以通过与其他相关领域的交叉研究,如自然语言处理和古代文献学等,借鉴其他语言和领域的研究成果,进一步推动古汉语自动句读与分词的发展。

总之,古汉语自动句读与分词是一个具有挑战性的研究课题,其研究对于古代文献。

基于自学习机制汉语自动分词系统研究

第23卷 第l期 VO1.23 No.1 平原 大 学 学报 JOuRNAL OF PINGYUAN UNIVERSITY 2006年2月 Feb.2006 

基于自学习机制汉语自动分词系统研究 

邓曙光 ,刘金铸 ,曾朝晖 

(1.湖南城市学院,湖南益阳413000;2.南京信息工程大学,江苏南京210044) 

摘 要:为扩展分词知识库,提高自动分词能力,本文提出了一种基于自学习机制的汉语自动 

分词系统。该系统通过对逐词匹配法进行改进,结合分词规则来实现自动分词,并采用统计提取等 

自学习机制来完善和丰富分词知识库。模拟结果表明该系统能有效荻取知识,获得较高的字段切 

分正确率。 

关键词:自动分词;自学习;分词规则;逐词匹配算法;分词知识库 

中图分类号:TP391 文献标识码:A 文章编号:1008—3944(2006)01--0087一O3 

要利用计算机实现汉语信息的自动处理,必须实 

现歧义字段的切分。本文提出了一种基于自学习机 制的汉语自动分词系统。该系统通过改进逐词匹配 

算法,结合分词规则来实现自动分词,并采用统计提 

取等自学习机制来完善和丰富分词知识库,有效提高 了分词的准确性,为分词系统提供了新的知识支持。 

一、汉语自动分词模型及方法 

(一)自动分词模型Ll 设W是分词过程中依据的分词词典,W ,W。, 

w --'wn是w中的元素(词条),n为自然数。T 是要进行分词的中文文本,它包括非汉字字符集合 A和汉字字符集合C。其中非汉字字符集合是由外 

文字母、阿拉伯数字、标点符号和空格等组成。设D 

是T中短句的集合,则T是D和A的元素组成的 序列。对于任意的歧义字段P,在确定的语言环境 

中都存在惟一的一种正确切分。即对任意的一个歧 

义字段P=C ,C ,…,Ci都有惟一的映射K:W , W2,…,Ws,其中、 ∈W,j=1,2,…,s,使得P在K 

的作用下得到正确切分。分词模型可表示为:M(F, 

W,T,K)。 其中F是基本分词方法,w是分词词典,T是 

  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
相关文档
最新文档