中文分词和词性标注模型
(3)
W
W
P(C)
基金项目:国家“863”计划基金资助项目“智能感知与先进计算技 术”(2007AA01Z160);北京市自然科学基金资助重点项目“基于情 绪认知模型的个性化数字教育关键技术研究”(KZ200810028016) 作者简介:刘遥峰(1982-),男,博士研究生,主研方向:自然语言 处理,个人机器人技术;王志良,教授、博士生导师;王传经,硕 士研究生 收稿日期:2009-09-30 E-mail:yaofeng-liu@
了词性的词串 < W ,T >=< w1,t1 >< w2,t2 > " < wn ,tn > 。其中,
< wi ,ti > 表 示 具 有 词 性 ti 的 词 wi , 输 出 端 输 出 序 列 C = c1c2 "cn ,通过找出跟 C 对应的 < W ,T > ,比较得出具有最大 概率的结果 < W ,T >o 。
< W ,T >o = arg max P(< W ,T >| C)
(1)
W .T
2.2 中文分词和词性标注统计模型
式 (1) 从 概 率 统 计 角 度 描 述 了 分 词 及 词 性 标 注 的 一 般 模
型。为将中文自动分词和词性自动标注模型化处理,实现将
词语信息和词性信息融合在一起作为最终结果的评价依据, 引入 N-最短路径法,用以产生包含 N 个最大结果的候选集[2]。
—17—
其中, P(C) 是汉字串的概率,它是一个常数,不必考虑;
P(C | W ) 是词串到汉字串的条件概率。在已知词串的条件下,
出现相应的汉字串的概率是 1,也不必考虑。仅仅需要考虑
的是 P(W ) ,即词的概率。
上述公式可简化为
W ' = arg max P(W )
(4)
W
词串概率采用一元语法进行求解,则
| tk )],1≤
j
≤T
(13)
词 i +1 处于状态 j (标注为 j )时,词 i 所处的最有可能的
状态(标记)为
Ψi+1(t j ) = arg max[δi (tk ) × P(wi+1 | t j ) × P(t j | tk )], 1≤ j ≤ T (14)
1≤k≤T
(3)终止和路径读出
T'
=
n
arg max ∏ P(ti
|
ti−1 ) P ( wi
|
ti )
(11)
i=1
用隐马尔科夫模型来描述词性标注问题:以词串 W =
w1w2 "wn 作为观察到的输出序列,以对应的词性标注串 T = t1t2 "tn 作为隐藏的状态转移序列,将词语以某词性出现的概
率变相作为状态转移的发射概率。在求解过程中,应用维特
比算法,算法有 3 步:初始化,推导,终止和路径读出[3]。
(1)初始化
第 1 个词处于状态 j (标注为 j )的概率:
δ1(t' ) = P(t' | w1)
(12)
(2)推导
词 i +1 处于状态 j (标注为 j )的概率:
δi+1(t' )
=
max[δ
1≤k≤T
i
(t
k
)
×
P(
wi+1
| tk ) × P(t j
(9)
假定一个标记的概率取决于出现在它前面的那个标记,
那就可以用 T 中每个标记的概率的乘积来表示:
P(T) ≈ P(t1 | t0)P(t2 | t1)"P(tn | tn−1)
(10)
因为 t0 是虚设的标记,所以 P(t1 | t0 ) 实际上是 P(t1) ,综
合起来,词性标记的统计模型可以表示为
n
P(W ) = ∏ p(wi )
(5)
i=1
这就是说,概率最大的词串便是最佳的词串。
2.4 词的自动标注模型
在词性自动标注过程中,在已知词串 W,寻求最大概率
的词性标注列 T ' 。
T ' = arg max P(T | W )
(6)
根据贝叶斯公式:
P(T | W ) = P(T )P(W | T )
正向最大匹配分词和逆向最大匹配分词相结合的分词方法。
正向最大匹配算法的核心是,对于待切分的一段字符串,
用户首先以该段语句的首字母起点进行搜索,直到找到以该
首字母为起点,在字符串中出现的最长的词,并以此为标志
切出第一个词,并将剩余字符串作为另一待切分字符串进行 相同处理[4]。
逆向最大匹配算法的基本思想与正向最大匹配算法相
P(< W ,T >| C) = ∏ P(ti | ti−1)P(wi | wt )
(20)
P0 (W ,T ) = ln P(W ,T ) = ∑ ln P(ti | ti−1) + ∑ ln P(wt | ti )
(21)
评估函数如下:
R# = arg max[∑ ln P(ti | ti−1) + ∑ ln P(wt | ti )]
一个词串对应的汉字串是唯一的,即
—18—
P(C | W ) = 1− P(CW ) = P(W )
(18)
P(W ,T | C) = P(T | CW )P(W | C) = P(T | W )P(W | C) =
P(T )P(W | T )
(19)
利用隐马尔科夫展开 P(T )P(W | T ) ,并引入共现概率
t1,t2 ,",tn 是词语序列 w1, w2,", wn 选择的标记,有
tn = arg maxδn (t j )
(15)
1≤ j≤T
ti =Ψi+1(ti+1),1 ≤ i ≤ n −1
(16)
P(t1,t2,",tn ) = maxδn+1(t j ),1≤ j ≤ T
(17)
2.5 目标评估函数
(北京科技大学信息工程学院,北京 100083)
摘 要:构造一种中文分词和词性标注的模型,在分词阶段确定 N 个最佳结果作为候选集,通过未登录词识别和词性标注,从候选结果集 中选优得到最终结果,并基于该模型实现一个中文自动分词和词性自动标注的中文词法分析器。经不同大小训练集下的测试证明,该分析 器的分词准确率和词性标注准确率分别达到 98.34%和 96.07%,证明了该方法的有效性。 关键词:分词;词性标注;最短路径
同,唯一的区别是最大匹配的顺序不是从首字母开始而是从
末尾开始。正向最大匹配算法流程如图 2 所示。
切分字符串s1, 输出字符串s2=””,
最大词长MaxLen=4
s1是否空 是
否
选取字符串w,w长 度为MaxLen
输出结果s2
去w首字符拼音的 首字母
获取字符串在词典 中的范围
S2=s2+w+“/”, 是 S1=s1-w
【Abstract】This paper proposes a model of Chinese words segmentation and part-of-word tagging. In the words segmentation stage, the top N segmentation results are confirmed as the candidate. The final result among these candidates is gotten after unknown words recognition and part-ofword tagging. A Chinese lexical analyzer is developed. This model with different size of training set is tested. The lexical analyzer’s accuracy of words segmentation and part-of-word is 98.34% and 96.07%. This proves the effectiveness of the method. 【Key words】words segmentation; part-of-word tagging; shortest path
使用 2 种分词方法相结合的方式。通过统计方法消除部分歧 义。描述如下: C = c1c2 "cm 表示输入的由 m 个汉字组成的歧 义切分字段。 W = w1w2 "wn 表示把 C 切分后得到的由 n 个词 组成的词串。V = v1v2 "vk 是另一种切分结果。用 frq(w) 表示
目标评估
输出词串序列和词性标注序列 <W,T >o
图 1 分词和词性标注处理过程
2.3 一元粗分模型
自动分词就是已知一个汉字串,求跟它对应的、有最大
概率的词串。即
W ' = arg max P(W | C)
(2)
W
由贝叶斯公式
W ' = arg max P(W | C) = arg max P(W )P(C | W )
看w是否 在词典中
否
去掉w最右一个字 否
是
w是否
为单字
图 2 分词算法流程
采用 2 种分词算法相结合的方式,主要是为了消除组合 歧义,比如如下的 2 个句子:
他的确切地址在这里。 这块肉的确切得不错。 这种歧义称为组合歧义。单一使用正向最大匹配算法和 逆向最大匹配算法都会产生错误,为了减少这种歧义的影响,
中文nlp模型
中文nlp模型
中文NLP模型是指专门用于处理中文自然语言的各类任务的模型。
中文NLP模型主要有以下几种:
1. 分词模型:用于将中文句子进行分词,将句子拆分成独立的词语单位。
2. 词性标注模型:用于为中文句子中的每个词语标注其词性,如动词、名词、形容词等。
3. 命名实体识别模型:用于识别中文句子中的命名实体,如人名、地名、机构名等。
4. 语义角色标注模型:用于对中文句子中的动词进行语义角色标注,将动词与其所表示的语义角色进行对应。
5. 情感分析模型:用于分析中文句子中的情感倾向,判断句子是否表达了积极、消极或中性的情感。
6. 机器翻译模型:用于将中文句子翻译为其他语言的句子,或将其他语言的句子翻译成中文。
7. 文本生成模型:用于生成中文文本,如填充式文本生成、生成式对话系统等。
以上只是中文NLP模型的一部分,随着研究的深入和技术的进步,还会出现更多新的模型和任务。
中文分词与词性标注技术研究与应用
中文分词与词性标注技术研究与应用中文分词和词性标注是自然语言处理中常用的技术方法,它们对于理解和处理中文文本具有重要的作用。
本文将对中文分词和词性标注的技术原理、研究进展以及在实际应用中的应用场景进行综述。
一、中文分词技术研究与应用中文分词是将连续的中文文本切割成具有一定语义的词语序列的过程。
中文具有词汇没有明确的边界,因此分词是中文自然语言处理的基础工作。
中文分词技术主要有基于规则的方法、基于词典的方法和基于机器学习的方法。
1.基于规则的方法基于规则的中文分词方法是根据语法规则和语言学知识设计规则,进行分词操作。
例如,按照《现代汉语词典》等标准词典进行分词,但这种方法无法处理新词、歧义和未登录词的问题,因此应用受到一定的限制。
2.基于词典的方法基于词典的中文分词方法是利用已有的大规模词典进行切分,通过查找词典中的词语来确定分词的边界。
这种方法可以处理新词的问题,但对未登录词的处理能力有所限制。
3.基于机器学习的方法基于机器学习的中文分词方法是利用机器学习算法来自动学习分词模型,将分词任务转化为一个分类问题。
常用的机器学习算法有最大熵模型、条件随机场和神经网络等。
这种方法具有较好的泛化能力,能够处理未登录词和歧义问题。
中文分词技术在很多自然语言处理任务中都起到了重要的作用。
例如,在机器翻译中,分词可以提高对齐和翻译的质量;在文本挖掘中,分词可以提取关键词和构建文本特征;在信息检索中,分词可以改善检索效果。
二、词性标注技术研究与应用词性标注是给分好词的文本中的每个词语确定一个词性的过程。
中文的词性标注涉及到名词、动词、形容词、副词等多个词性类别。
词性标注的目标是为后续的自然语言处理任务提供更精确的上下文信息。
1.基于规则的方法基于规则的词性标注方法是根据语法规则和语境信息,确定每个词语的词性。
例如,根据词语周围的上下文信息和词语的词义来判断词性。
这种方法需要大量的人工制定规则,并且对于新词的处理能力较差。
汉语自动分词与词性标注
– :主词位 – 对于任意一个字,如果它在某个词位上的能产度高于0.5,称这个词 位是它的主词位。
– MSRA2005语料中具有主词位的字量分布:
33
由字构词方法的构词法基础(2)
• 自由字
– 并不是每个字都有主词位,没有主词位的字叫做自由字。
– 除去76.16%拥有主词位的字,仅有大约23.84%的字是自 由的。这是基于词位分类的分词操作得以有效进行的基 础之一。
• 随着n和N的增加,计算复杂度增加太快, 张华平给出了一种基于统计信息的粗分模 型。 • 粗分的目标就是确定P(W)最大的N种切分结 果
P(W ) = P (w )
i i =1 m
7.2.3 基于HMM的分词方法
• 我们可以将汉语自动分词与词性标注统一 考虑,建立基于HMM的分词与词性标注一 体化处理系统。 • 详见第六章举例。 • 有了HMM参数以后,对于任何一个给定的 观察值序列(单词串),总可以通过viterbi算 法很快地可以得到一个可能性最大的状态 值序列(词性串)。算法的复杂度与观察值序 列的长度(句子中的单词个数)成正比。
歧义切分问题 交集型切分歧义 组合型切分歧义 多义组合型切分歧义
• 交集型歧义切分
中国人为了实现自己的梦想 中国/ 人为/ 了/ 实现/ 自己/ 的/ 梦想 中国人/ 为了/ 实现/ 自己/ 的/ 梦想
中/ 国人/ 为了/ 实现/ 自己/ 的/ 梦想 例如:中国产品质量、部分居民生活水 平
• 新的探索: A.Wu尝试将分词与句法分析融合为一体的 方法,用整个句子的句法结构来消除不正 确的歧义,对组合型歧义释放有效(组合型 歧义少数,交集型歧义较多)。 同时,句法分析本身就有很多歧义,对于 某些句子,反而产生误导。(王爱民)
基于深度学习方法的中文分词和词性标注研究
基于深度学习方法的中文分词和词性标注研究中文分词和词性标注是自然语言处理中的重要任务,其目的是将输入的连续文字序列切分成若干个有意义的词语,并为每个词语赋予其对应的语法属性。
本文将基于深度学习方法对中文分词和词性标注进行研究。
一、深度学习方法介绍深度学习是一种基于神经网络的机器学习方法,在自然语言处理领域中应用广泛。
经典的深度学习模型包括卷积神经网络(Convolutional Neural Network,CNN)、循环神经网络(Recurrent Neural Network,RNN)、长短时记忆网络(LongShort-Term Memory, LSTM)和门控循环单元(Gated Recurrent Unit, GRU)等。
在对中文分词和词性标注任务的研究中,CNN、RNN以及LSTM均被采用。
CNN主要用于序列标注任务中的特征提取,RNN及LSTM则用于序列建模任务中。
GRU是LSTM的一种简化版本,在应对大规模文本序列的过程中更为高效。
二、中文分词中文分词是将一段连续的汉字序列切分成有意义的词语。
传统的中文分词方法主要包括基于词典匹配的分词和基于统计模型的分词。
基于词典匹配的分词方法基于预先构建的词典,将待切分文本与词典进行匹配。
该方法精度较高,但需要较为完整的词典。
基于统计模型的分词方法则通过学习汉字之间的概率关系来进行分词。
该方法不依赖于完整的词典,但存在歧义问题。
深度学习方法在中文分词任务中也有较好的表现,通常采用基于序列标注的方法。
具体步骤如下:1. 以汉字为单位对输入文本进行编码;2. 使用深度学习模型进行序列标注,即对每个汉字进行标注,标记为B(词的开头)、M(词的中间)或E(词的结尾),以及S(单字成词);3. 将标注后的序列按照词语切分。
其中,深度学习模型可以采用CNN、RNN、LSTM或GRU等模型。
三、中文词性标注中文词性标注是为每个词语赋予其对应的语法属性,通常使用含有标注数据的语料库进行训练。
基于LSTM模型的分词及词性标注一体化设计
基于LSTM模型的分词及词性标注一体化设计摘要中文分词及词性标注是NLP领域的一项基础技术,分词及词性标注是否准确将直接影响着自然语言理解的准确性。
目前普遍采用Dictionary、N-gram、Maximum Entropy、HMM、CRF等模型来完成。
虽然也有很多对LSTM的研究,但几乎缺乏详细的推理过程。
而本文将对模型的架构图做出详细的说明,以及对模型做出详细的正向和反向推理过程。
实验表明该模型在应用于分词及标注能取得很好的效果。
关键词LSTM;分词;标注;分词标注一体化Design of word segmentation and POS Tagging Based on LSTMFAN ZhenSouth China Agricultural University ,College of Mathematics and Informatics,510000,Guangzhou,Guangdong,PRCAbstract Chinese word segmentation and POS tagging is a basic technology in NLP field,the accuracy of word segmentation and POS tagging will directly affect the accuracy of natural language understanding. At present,there are usually done by Dictionary,N-gram,Maximum Entropy,HMM,CRF and other models. Although there are many studies on LSTM,there is almost no detailed reasoning process. In this paper,we will give a detailed description of the model’s architecture diagram,and make a detailed forward and backward reasoning process of the model. Experiments show that this model can achieve good results in segmentation and POS tagging.Key words LSTM;segmentation;POS;integration of segmentation and POS 前言由于中文不同于英文,需要进行分词和词性标注等基础性的工程[1],才能准确的理解语义[2]。
基于深度学习的中文自动分词与词性标注模型研究
基于深度学习的中文自动分词与词性标注模型研究1. 引言中文自动分词与词性标注是中文文本处理和语义分析的重要基础任务。
传统方法在处理中文自动分词和词性标注时,通常采用基于规则或统计的方法,并且需要大量的特征工程。
然而,这些传统方法在处理复杂语境、歧义和未知词汇等问题时存在一定的局限性。
随着深度学习的发展,基于神经网络的自然语言处理方法在中文自动分词和词性标注任务上取得了显著的成果。
深度学习方法通过利用大规模的文本数据和端到端的学习方式,避免了传统方法中需要手动设计特征的问题,能够更好地解决复杂语境和未知词汇等挑战。
本文将重点研究基于深度学习的中文自动分词与词性标注模型,探讨这些模型在中文文本处理中的应用和效果,并对未来的研究方向进行展望。
2. 相关工作在深度学习方法应用于中文自动分词和词性标注之前,传统的方法主要基于规则或统计模型。
其中,基于规则的方法采用人工定义的规则来处理中文分词和词性标注任务,但这种方法需要大量人力投入且难以适应不同语境。
另一方面,基于统计模型的方法则依赖于大规模的语料库,通过统计和建模的方式进行分词和词性标注。
然而,这些方法在处理复杂语境和未知词汇时效果有限。
近年来,随着深度学习的兴起,基于神经网络的中文自动分词和词性标注模型逐渐成为研究热点。
其中,基于循环神经网络(RNN)的模型如BiLSTM-CRF(双向长短时记忆网络-条件随机场)模型被广泛使用并取得了令人瞩目的效果。
该模型利用LSTM单元来捕捉输入序列的上下文信息,并利用条件随机场模型来建模序列标注问题。
此外,基于注意力机制的模型如Transformer也在中文自动分词和词性标注任务中取得了优异的表现。
3. 深度学习方法在中文自动分词中的应用中文自动分词是将连续的汉字序列划分为具有独立语义的词组的任务。
传统的基于规则或统计的方法在处理未知词汇和复杂语境时存在一定的限制。
而基于深度学习的方法通过端到端的学习方式,可以更好地捕捉上下文信息,并通过大规模的语料库进行训练,从而提高分词的准确性和鲁棒性。
hanlp分词流程
hanlp分词流程
HanLP是一款开源的自然语言处理工具包,可以实现中文分词、词性标注、命名实体识别等功能。
下面将详细介绍HanLP的分词流程。
一、HanLP分词流程概览
HanLP的分词流程可以分为以下几个步骤:文本预处理、分词、词性标注、命名实体识别等。
二、文本预处理
在进行分词之前,需要对待处理的文本进行预处理。
预处理的目的是将文本转化为HanLP可以处理的格式,包括去除空格、标点符号等。
三、分词
分词是HanLP的核心功能之一。
HanLP采用了基于条件随机场(CRF)模型的分词方法,该方法能够在不依赖词典的情况下进行分词,具有较好的鲁棒性和泛化能力。
四、词性标注
词性标注是为分词结果中的每个词语标注其词性。
HanLP提供了预训练好的词性标注模型,可以自动为分词结果进行词性标注。
五、命名实体识别
命名实体识别是指识别文本中的人名、地名、组织机构名等实体。
HanLP采用了基于条件随机场(CRF)模型的命名实体识别方法,
能够较准确地识别出文本中的命名实体。
六、其他功能
除了上述功能外,HanLP还提供了其他一些功能,如关键词提取、摘要生成、文本分类等。
这些功能可以根据具体需求进行选择和使用。
HanLP的分词流程包括文本预处理、分词、词性标注、命名实体识别等步骤。
通过这些步骤,可以对中文文本进行有效的处理和分析,为后续的自然语言处理任务提供基础支持。
HanLP的功能强大且易于使用,是中文文本处理的重要工具之一。
nlp部分基本术语简释
nlp部分基本术语简释自然语言处理(Natural Language Processing,NLP)是计算机科学领域的一个重要研究方向,旨在让计算机具备理解人类语言的能力。
在NLP领域中,有一些基本术语需要了解,下面我将对其中的一些术语进行简单的解释。
1. 语言模型(Language Model):语言模型是根据一段文本的统计特征,预测下一个单词或句子的概率分布模型。
它可以用来生成新的语言序列或者评估一个句子的合理程度。
2. 分词(Tokenization):分词是将一段连续的文本切割成单个的词或者字符的过程。
它是NLP的基础步骤,常用于对句子进行处理和处理中文文本。
3. 词性标注(Part-of-Speech Tagging):词性标注是指为一段文本中的每个词标注其所属的词性,如名词、动词、形容词等。
它可以帮助计算机理解文本的语法结构和语义信息。
4. 命名实体识别(Named Entity Recognition,NER):命名实体识别是指识别一段文本中特定类型的实体,如人名、地名、组织机构等。
它可以帮助计算机理解文本中的重要信息和实体关系。
5. 文本分类(Text Classification):文本分类是指将一段文本划分到预定义的类别中。
它可以用于情感分析、垃圾邮件过滤、新闻分类等任务。
6. 机器翻译(Machine Translation):机器翻译是将一种语言的文本自动翻译为另一种语言的技术。
它可以帮助人们解决跨语言交流的问题。
7. 问答系统(Question Answering System):问答系统是指能够根据用户提出的问题,在知识库或大规模文本中找到相应答案的系统。
它常用于智能助手、搜索引擎等应用中。
8. 情感分析(Sentiment Analysis):情感分析是指识别一段文本中包含的情感倾向,如积极、消极、中立等。
它可以帮助企业了解用户对产品或服务的评价和态度。
以上介绍了一些NLP领域的基本术语,它们涵盖了NLP技术在不同应用中的核心概念。
中文分词案例
中文分词案例中文分词是自然语言处理中的一个重要任务,其目的是将连续的中文文本切分成单个的词语。
中文分词在很多应用中都起到了关键作用,例如机器翻译、信息检索、文本分类等。
本文将以中文分词案例为题,介绍一些常用的中文分词方法和工具。
一、基于规则的中文分词方法1. 正向最大匹配法(Maximum Matching, MM):该方法从左到右扫描文本,从词典中找出最长的词进行匹配,然后将该词从文本中删除。
重复这个过程,直到文本被切分完毕。
2. 逆向最大匹配法(Reverse Maximum Matching, RMM):与正向最大匹配法相反,该方法从右到左扫描文本,从词典中找出最长的词进行匹配,然后将该词从文本中删除。
重复这个过程,直到文本被切分完毕。
3. 双向最大匹配法(Bidirectional Maximum Matching, BMM):该方法同时使用正向最大匹配和逆向最大匹配两种方法,然后选择切分结果最少的作为最终结果。
二、基于统计的中文分词方法1. 隐马尔可夫模型(Hidden Markov Model, HMM):该方法将中文分词问题转化为一个序列标注问题,通过训练一个隐马尔可夫模型来预测每个字的标签,进而切分文本。
2. 条件随机场(Conditional Random Fields, CRF):与隐马尔可夫模型类似,该方法也是通过训练一个条件随机场模型来预测每个字的标签,进而切分文本。
三、基于深度学习的中文分词方法1. 卷积神经网络(Convolutional Neural Network, CNN):该方法通过使用卷积层和池化层来提取文本特征,然后使用全连接层进行分类,从而实现中文分词。
2. 循环神经网络(Recurrent Neural Network, RNN):该方法通过使用循环层来捕捉文本的时序信息,从而实现中文分词。
四、中文分词工具1. 结巴分词:结巴分词是一个基于Python的中文分词工具,它采用了一种综合了基于规则和基于统计的分词方法,具有较高的准确性和速度。
中文分词和词性标注模型
W1 < w1,t1 > ' < w1,t1 >
W2 < w2 , t2 > ' < w2,t2 >
输入字符串 C 一元粗分模型
… Wi
… Wn−1
Wn
未登录词识别
< wi , ti > ' < wn−1, tn−1 > ' < wn , tn > '
词性自动标注模型
< wi ,ti > < wn−1,tn−1 > < wn,tn >
(9)
假定一个标记的概率取决于出现在它前面的那个标记,
那就可以用 T 中每个标记的概率的乘积来表示:
P(T) ≈ P(t1 | t0)P(t2 | t1)"P(tn | tn−1)
(10)
因为 t0 是虚设的标记,所以 P(t1 | t0 ) 实际上是 P(t1) ,综
合起来,词性标记的统计模型可以表示为
第 36 卷 第 4 期 Vol.36 No.4 ·博士论文·
计算机工程 Computer Engineering
文章编号:1000—3428(2010)04—0017—03 文献标识码:A
中文分词和词性标注模型
2010 年 2 月 February 2010
中图分类号:TP18
刘遥峰,王志良,王传经
目标评估
输出词串序列和词性标注序列 <W,T >o
图 1 分词和词性标注处理过程
2.3 一元粗分模型
自动分词就是已知一个汉字串,求跟它对应的、有最大
概率的词串。即
W ' = arg max P(W | C)
