汉语语音合成
台州学院毕业设计(论文)文献综述
1 汉语语音合成技术综述
学生姓名:张超 学号:1230220015 指导教师:张石清
摘要:汉语语音合成技术经历了三十几年的发展,涌现出许多新技术、新模式。首先介绍了汉语语音合成系统的原理,在综合对比目前所有语音合成技术的基础上,以效果较好的合成技术为重点,对汉语语音合成系统的文本分析、韵律控制、语音合成、语料库的建立4个关键性模块的实现技术进行了详细论述。
关键词:语音合成;文本分析;韵律控制;语料库
1. 课题背景
随着计算机、智能手机等电子设备的发展,较为成熟、人性化的发音功能已经成为一个普遍的用户需求,因此语音合成技术亟待发展。英语语音合成系统经过几十年的发展已经形成了一个比较完备的模式,并且取得了较好的发音效果。而汉语语音合成系统由于汉语独特的发音特点,一直未取得令人满意的合成效果。随着近十几年的研究探索,尤其是国内相关科研机构及公司研发力度不断加强,涌现出了许多新理论、新技术,合成的汉语语音在自然度方面也取得了较大的进步。但不同的开发者各自为营,采用的思想、模式有一定的差别,对汉语语音合成系统的发展造成了一定的阻碍。本文将从汉语语音合成系统的基本原理出发,详细论述关键模块的技术特点,最后在分析比较的基础上,针对不同的应用环境提出了较为通用的开发方案。
2. 语音合成系统的原理
最初的语音合成方法是基于规则的合成方法,这种方法采用数字信号处理的技术,将发声过程看作一个模拟声门状态的源,以激励一个表征声道谐振特性的时变数字滤波器,主要用波形叠加的方法模拟人的声带、口腔等器官。后来随着语音合成技术的发展,拼接语音合成技术因为具有相对高质量的合成效果,基于规则的合成方法逐渐淡出了主流技术舞台,所以本文不再探讨基于规则的合成方法,而是对目前应用广泛的拼接语音合成技术进行详细论述。
基于拼接思想的汉语语音合成系统基本上借鉴了起步早且发展比较成熟的英语台州学院毕业设计(论文)文献综述
2 语音合成系统的发音模式,但由于汉语自身的特点,系统又有一些不同,如增加了分词模块等。汉语语音合成系统的流程图如图1所示。
首先系统读取所要发音的文本,由于汉语的词语与词语之间没有如英文中单词之间的空白来分隔,因此要根据制定好的文本分析规则对文本进行分析,以便经过语音合成后输出的语音在词与词之间加入适当的停顿,模仿人在朗读文章时的效果。接着为了使合成的语音具有较好的自然度,需要按照一定的韵律模型对发音的韵律进行分析、控制,以修饰原始的语音数据。最后按照相对应的拼接算法将不同的发音基本元素迸行拼接合成,从而获得整个文本的发音文件,实现语音输出的功能。
3. 汉语语音合成系统的关键技术
3.1 文本分析
文本分析的难点在于向文本加入适当的停顿,以此来模拟人在发音时的停顿效果,从而更好地实现汉语语意的表达。语句中的停顿主要包括词语之间的停顿和标点符号之间的停顿两种,标点符号的停顿是固定的,所以只要识别出即可实现。而词语的识别则需要一定的分词方法才能实现。目前的汉语的分词方法主要有无词库分词方法、有词库分词方法和基于统计学原理的可训练分词方法。
3.2 韵律控制
汉语语音的韵律包含了系统的感知信息和说话人的意图信息,在帮助听者理解语言及意图时十分有用。从听觉的角度出发,常常利用音长、音强、音高和音色4个语音听觉特征来描述韵律信息。
要实现汉语的韵律控制,需要建立合适的韵律模型。韵律模型以文本分析的结果为输入,台州学院毕业设计(论文)文献综述
3 完成从韵律符号到韵律的声学参数的转换,如音高、音长、音强等。韵律模型是文语转换系统中的重要组成部分,对合成语音的自然度起着至关重要的作用,要使文语转换系统能够产生接近自然语言的语音效果,建立完备的韵律模型是关键所在。
建立韵律模型的方法主要分为基于规则的方法和基于统计原理学习的方法两种。
3.3 语音拼接合成
经过了文本分析和韵律修饰两步之后,语音合成最后的工作就是把若干个与文本相对应的独立的语音文件合成一个语音文件,从而实现语音输出。目前主流的汉语语音拼接合成技术可以细分为基于语音编码的拼接合成技术和基于波形拼接的合成技术。
3.3 语音语料库的建立
语音语料库作为目前主流的语音拼接合成技术的重要组成部分,对整个语音合成系统发言的效果有很大的影响。一个高质量的语料库可以为系统提供良好的语音源文件支撑,从而实现高自然度的发言。
汉语自成独立语系,具有独特的规则结构和鲜明的特性。目前在语音合成方面对于汉语的发言单位的选取主要有两种观点。第一种观点是基于音节的合成技术,把每个汉字的发言作为基本的发言单元,不考虑汉语发言的具体细节,而是建立一个巨大的语料库,其中基本囊括所有汉字的发音样本,针对不同的汉字直接从语料库中搜索出相对应的发音进行拼接,从而实现发音。第二种观点是基于音素的合成技术,把每个汉字的发音再进行细分,获得汉语的音素,再把音素作为基本的发音单元,语音合成时对音素进行拼接,从而实现发音。基于音素的合成技术具体又分为两个方面:一方面认为汉语为单音节字,由若干独立音节形成句子,每个音节由声母韵母组成,所以把声母和韵母作为音索;另一方面认为元音、辅音才是音素的实际类别,声母、韵母则主要是一个字内部的前后两个部分语音成分之间的关系类别,采用声母和韵母作为合成基元无法解决音节间的协同发音,所以基于这种观点的开发者认为采用元音和辅音作为音素更加符合汉语的发音特点。
在语音合成技术中,语音语料库选择不同的合成基元,基元组合时的韵律特性以及相应的合成规则也不同。采用基于音节的合成技术简单高效,自然度高,但是对于每个汉字的音节数据都要存储,需要很大的存储空间,无法满足存储空间较小的嵌入式设备的发音需求;而基于音素的合成技术需要的存储量较少,但由于每个汉字都要由相应的音素合成,因此计算量大,算法复杂且自然度较低。 台州学院毕业设计(论文)文献综述
4 语音语料库的建立主要包括设计发音文本、录音及整理、语音标注、建立数据库系统和数据库管理系统4个过程。通过对自然语音的采集、切分、检索、统计等过程获取合适的发音基元,并按照一定的规则进行存储管理。其中比较关键的术是语音单元的切分技术。
语音单元的切分和标注的准确性对合成语音的质量影响很大,常用的自动切分方法有两种:一种是基于模板,另一种是基于模型,以隐马尔可夫模型(HMM)为代表。它们都是运用动态规划方法将一串语音单元的模板或是模型与给定的一句语音进行对齐,从而得到每个语音单元的起始时间,或者运用自动语音识别中称为强制对齐的术语。研究表明,基于隐马尔可夫模型的强制对齐比基于模板的方法能得到更好的切分准确度。
4. 总结与展望
纵观整个汉语语音合成系统的发展历程可知,其基本上与英语语音合成系统的发展历程相类似,尤其在发展初期,采用的新技术往往是从成熟的英语语音合成系统移
植过来的,没有根据汉语自身的特点进行设计研发。但是由于汉语具有许多与英语不同的文本及发音特点,而这些特点对于汉语发音的可理解度和自然度方面具有很大的影响,这就导致汉语的语音合成系统一直没有取得如英语一样的效果。不过近些年来,国内一些研究机构及公司加大了对汉语语音合成系统的研究力度,提出了一些针对汉语特点的发音模式,使得汉语语音合成系统取得了比较大的发展。
随着人工智能思想的引入,尤其是基于统计学原理的机器学习算法在语音合成系统方面的应用,使得系统设计人员从繁重的对汉语发音规律研究工作中解脱出来,这对汉语语音的合成效果起到了很大的提升作用。相信随着国内在这方面研究力度的加大,一定会有更新的发音模式被挖掘出来,在发音自然度方面实现质的提升。
台州学院毕业设计(论文)文献综述
5 参考文献
[1] 胡锡衡.正向最大匹配法在中文分词技术中的应用[J].鞍山师范学院学报,2008,10(2):42—45
[2] 侯传宇.马尔可夫及隐马尔可夫模型在数据挖掘中的应用[J].电脑知识与技术,2008(07):1187—1188
[3]Seghouane,et a1.The AIC Criterion and Symmetrizing the Kull—back-LeiblerDivergence[J].IEEE
Trans.on Neural Networks,2007,18(1):97—106
[4] 朱耀庭,李霞.中国计算机产业的下一个亮点——汉语语音合成的实用化[J].世界科技研究与发展,2002,24(5):49—54
[5] 梅勇,王群生,徐秉铮.将词类信息融人三元文法统计模型的汉语音字转换方法[J].电子科学学刊,1998,20(5):625—626
[6] 语音合成系统的关键技术与应用实例[J].杭州科技双月刊,2000(2):19-21
[7] 王志伟,邵艳秋,赵永贞,等.一个普通话文语转换系统中的韵律模型[J].计算机应用研究,2006(6):79—81
[8] 苏珊珊.基于波形拼接的语音合成技术研究口[J].福建电脑,2008(10):104—105
[9] 易洪川.从现代汉字字音看现代汉语语音的几个特点[J].语言教学与研究,2001(5):31—35
[10] 陈小莹,陈晨,华侃,等.语音语料库的设计研究[J].科技信息,2008(36):5-6
[11] 王丽娟,曹志刚.T Ts语音单元边界的自动切分[J].微电子学与计算机,2005,22(12):8-11
[12] 阿依木尼萨·胡甫尔,艾斯卡尔·艾木都拉.面向语音合成的维吾尔语音素自动切分算法研究[J].计算机应用与软件,2011,28(9):18—21
[13] 才让卓玛,才智杰.基于语料库的藏语T Ts技术研究[J].青海师范大学学报:自然科学版,2010(2):66—69
[14]Moreno P J.. Speech recognition in noisy environments[D].DCED
partment Carnegie Melton University 1996, 25-31.
[15] NGO W,Pong T-C Motion Analysis and Segmentation THroughSpatio-Temporal S1ices
Processing[J].IEEE Transactions onImage Processing,2003,12(3):341—355
台州学院毕业设计(论文)文献综述
6
基于语音合成法的汉语人名语音库的设计应用
第33卷第3期 2006年3月 应 用 科 技 Applied Science and Technology Vo1.33.No.3 Mar 2oo6
文章编号:1009—671X(2006)03—0010—03
基于语音合成法的汉语人名语音库的设计应用
王秀君,和应民
(哈尔滨工程大学信息与通信工程学院,黑龙江哈尔滨150001)
摘要:采用语音合成方法完成了汉语人名语音库的设计.声母部分直接采用录音样本,而韵母部分则通过激 励声道频率响应函数来合成语音,然后通过声韵母拼接来实现人名语音合成,以此建立人名语音库.可以实现 各种可能人名语音的合成,适合应用于多种电子白助系统中. 关键词:基音周期;声道频率响应;语音合成 中图分类号:TN912.3文献标识码:A
Design of speech database for Chinese names based on speech synthesis
WANG Xiu-jun,HE Ying—min
(School of Information and Communication Engineering,Harbin Engineering University,Harbin 150001,China)
Abstract:The design of speech database of Chinese names is accomplished by using speech synthesis.The conso・
nants use the recording sample directly,while the vowels is synthesized through exciting VTFR function.Then the
name pronunciation is synthesized through piecing together the consonant and vowel SO as to set up the name pro・-
CASIA语音合成语
(1) 语料名称(中、英文)
CASIA语音合成语料库
CASIA Corpus for speech synthesis
(2) 语料简述
CASIA语音合成语料库是在国家863子课题支持下,配合开放式语音合成体系的建立,而建立的语音合成语料。语料来自于新闻语料、小说、散文等,包括了汉语的所有音节、diphone,包括陈述句、疑问句等不同的风格。
(3) 单位名称(中、英文)
中国科学院自动化研究所
Institute of Automation, Chinese Academy of Sciences
(4) 开发时间
2003年12月至2004年6月
(5) 规模
文本语音数据,包括语句(陈述句5052句,疑问句500句,短消息500句)。
语音库名称 汉语普通话语音合成语料库
录音环境 PC 通道,16K采样,16bit量化,新闻语料、
规模 5052句,约7万个音节
数据量 741M字节,约6个小时
用途 语音合成。
录音人 女性。
语音库名称 汉语普通话疑问语句
录音环境 PC 通道,16K采样,16bit量化,对话
规模 500句(4个人),约8000个音节
用途 语音合成、语音分析
数据量 190M字节,约2小时。
录音人 两男两女
(6) 定价
[待商定]
(7) 相关技术文档
《CASIA语音合成语料库说明》
(8) 语料库样例
见《CASIA语音合成语料库说明》。
语音合成语料库技术报告
语⾳合成语料库技术报告
语⾳合成语料库TH-CoSS
技术报告
清华⼤学计算机科学与技术系⼈机交互与媒体集成研究所2003.12.
语⾳合成语料库技术报告
(TH-Corpus of Speech Synthesis)0.前⾔
在语⾳合成技术⽇益成熟⾛向市场的今天,作为语⾳合成的基础的语⾳合成语料库扮演着越来越重要的⾓⾊。作为语⾳合成和语⾳分析的物质基础,建⽴设计合理、⾼质量录⾳的语⾳语料库有着极为重要的研究价值和实⽤价值。本语⾳合成语料库(TsingHua - Corpus of Speech Synthesis, 简称TH-CoSS)是由清华⼤学⼈机交互与媒体集成研究所完成。该语料库可以⽤于语⾳合成的研究、开发和评测。根据研究、开发和市场的需要,本⽂简要介绍本语料库的设计与使⽤。
第⼀部分语⾳合成语料库的设计
该语⾳合成语料库由四部分组成:普通话TTS系统语料库,为汉语普通话朗读语句,男⼥声各1⼈,共约10000句。
普通话TTS系统测试语料库,为汉语普通话朗读语句,男⼥声各1⼈,约2000句。
普通话语调分析⽤数据,⾃然对话语句,多于1000句,覆盖多种语调和语⽓。
连续语流篇章语⾳数据库,选⾃⼴播或电视,以汉语标准普通话为主。
下⾯分别就其设计思想进⾏介绍,重点介绍普通话TTS系统语料库和普通话语调分析⽤语料库的设计与建⽴。1.1普通话TTS系统语料库设计
TTS系统建库语料语句以陈述句为主, 长度为5-25个⾳节,其中男声4535句,⼥声5406句。此外语料库还包含⼀定数量的轻声、⼉化⾳节组,以及上声单⾳节汉语⾳节表。1.1.1 设计⽤语料
我们针对基于⼤语料库汉语语⾳合成系统的需求,进⾏语⾳合成⽤语料库的设计。其原始语料来⾃《现代汉语词典》和2000年全年的⼈民⽇报,并且参考了国家语委公布的必读轻声和⼉化词表。1.1.2 设计原则
1.1.
2.1⽂本设计的⽬的和要求
语料库的设计是指选取语⾳数据的内容或选取录⾳⽂本。这是语料库的关键问题之⼀。涉及的问题包括:明确需求和⽬的;确定语⾳基本单位;收集语料资源;研制语料选取算法;⽬标是得到最⼩冗余度、最⼤覆盖率、科学合理的语料集。采⽤以语⾳学知识指导的计算机处理⽅法。语料库的⽂本设计包括以下⼯作:
NET平台下中文语音合成技术的研究与实践
ISSN 1009-3044 ‘
Compu ̄rKnowledgeandTechnology电脑知识与技术 Vo1.6,No.2,January 2010,pp.337—338 E—mail:xsjl@cccc.net.cn http://www.dnzs.net.cn Tel:+86—55 1—5690963 5690964
.NET平台下中文语音合成技术的研究与实践
乔梁 .陈欣2宋文强
(1.第三军医大学生物医学工程与医学影像学院,重庆400038;2.重庆王大软件职业技术学院,重庆400038)
摘要:该文介绍了SAPI SDK语音开发包的用途和使用方法,结合作者的实际工作,梳理了语音开发平台的概念及应用技巧,实现了
基于.NET平台的语音应用程序开发,并将这一技术应用于开放实验室管理。
关键词:SAPI SDK:中文语音合成:.NET平台;应用开发
中图分类号:TP311 文献标识码:A 文章编号:1009-3044(2010)02-337—02
The Study and Practice of Chinese TTS Technology in.NET
QIAO Liang ,CHEN Xin ,SONG wen—qiang。
(1.Department of Computer Science Third Military Medical University,Chongqing 400038,China;2.Chong ̄ng Zhengda Software poly—
technic CoHege,Chongqing 400038,China)
Abstract:This paper describes the uses of the SAPI SDK development kit.Combined with the author S actual work,combed the concept and application skills of voice development platform,realized voice application development for.NET—based platform.In the end,built an open laboratory management system with this technology.
浅析语音合成技术
科技情报开发与经济 SCI—TECH INFORMATION DEVELOPMENT&ECONOMY 2006年第16卷第18期 文章编号:1005-6033(2006)18—0216—02 新语音台成技本 琴 和 (贵州大学信息工程学院,贵州贵阳,550003) 摘要:语音合成技术是实现人机语音通信,建立一个有听说能力的口语系统所必需 的关键技术。分析了国内外语音合成技术发展现状,并对语音合成技术的发展方向进 行了讨论。 关键词:语音合成;共振峰合成;LPC合成 中图分类号:TV912.34 文献标识码:A 语音识别和语音合成技术是一种人机语言通信技术,属于计算机智 能接口技术。多媒体技术也主要是利用计算机语音处理和图像处理的能 力为人们提供一种更加方便、直观的人机界面。虽然人类的视觉系统是 一个高度并行的信息接受和处理系统,但作为人与人的信息交流,语音 却更为方便,更加直观,效率更高。既然语言是人与人之间的主要交流手 段,那么也应该是人和计算机之间的交流的重要手段,特别是对于汉语 来说,由于汉字的书写和录入比较烦琐,通过语音输入汉字信息就显的 特别重要,而计算机的微型化使语音输入代替键盘输入的必要性更加突 出。在计算机智能接口技术、多媒体技术研究中,语音处理技术有更大的 应用潜力。总之,语音识别与合成技术的应用前景是非常光明的。 1语音合成技术简介 语音技术的本质是基于它能将输入的语音转化为语言代码。语音是 信息的载体,语音识别的基本任务就是将输入的语音转化为相应的代 码。通过这个转化的过程,存储和传输这样的语言代码的时候,无论是存 储空间还是传输率都比语音直接存储和传输要方便的多。而且它还可以 把连续的语音信号变成一种只需要有限符号集中的代码,这样也很容易 被计算机或者专用的信息处理单元所理解,便于和人进行交流。因此,可 以实现许多广泛的应用,如声控应用、用于自动口语翻译、把语音识别和 合成技术相结合构成一种超低比特率的语音通信系统等。 2国内外语音合成技术发展现状 国内的汉语语音合成研究起步较晚,但从2O世纪8O年代初就基本 与国际同步。它大致经历了共振峰合成、LPC合成至应用基音同步叠加 技术的过程。同国外其他语种的文语转换系统一样,这些系统合成的句 子及篇章语音机器味较浓,其自然度还不能达到用户可广泛接受的程 度,从而制约了这项技术大规模进入市场。 我国语音识别研究工作起步于2O世纪5O年代,但近年来发展很 快,研究水平也从实验室逐步走向实用。从1987年开始执行国家863计 划后,国家863智能计算机专家组为语音识别技术研究专门立项,每两 年滚动一次,语音识别技术的研究水平已经基本上与国外同步,并在汉 语语音识别技术上具有自己的特点与优势,达到国际先进水平。采用嵌 人式芯片设计技术研发了语音识别专用芯片系统,该芯片以8位微控制 器(MCU)核心,加上低通滤波器,模,数(A/D),数/模(D/A),预放。功率放 大器,RAM,ROM。脉宽调幅(PWM)等模块,构成了一个完整的系统芯 片。芯片中包括了语音识别、语音编码、语音合成功能,可以识别3O条特 定人语音命令。识别率超过95%。其中的语音编码速率为16 kb/s。该芯片 既可以用于智能语音玩具。也可以与普通电话机相结合构成语音拨号电 话机。该系统的研发成果已经进入实用领域。一些应用型产品正在研发 中,其商品化的过程也越来越快。 目前,常用的语音合成技术主要有:共振峰合成、LPC合成、PS0LA 拼接合成和LMA声道模型技术。它们各有优缺点。人们在应用过程中往 216 收稿日期:2006—03—30
什么是计算机语音合成请解释几种常见的语音合成算法
什么是计算机语音合成请解释几种常见的语音合成算法
什么是计算机语音合成?请解释几种常见的语音合成算法
计算机语音合成是一种将文本或其他形式的符号输入转换为可听听声音的过程。它通过模拟人类语音的音频特征,利用不同的算法和技术,将文字内容转化为自然流畅的人工语音。语音合成技术在现代社会得到广泛应用,例如电话助手、语音导航、语音阅读等。
常见的语音合成算法有多种,下面将介绍几种常见的算法。
1. 文本到语音 (Text-to-Speech, TTS) 模型
TTS模型是机器学习和人工智能的一种应用,通过基于文本数据的机器学习算法,训练出可以将文本转换为语音的模型。这些模型通常由深度神经网络构建,通过学习大量的文本和相应的语音数据,模型能够将新的文本输入映射到相应的声音特征,从而合成自然流畅的人工语音。
2. 拼接合成 (Concatenative Synthesis)
拼接合成是一种基于数据库的语音合成技术。这种方法将大量录制的口语数据存储为数据库,然后根据输入的文本,选择相应的语音片段进行拼接从而生成合成语音。这种方法可以产生非常逼真的语音,因为它使用真实语音样本进行拼接,但是数据库大小和片段的匹配精度对合成质量有一定的影响。 3. 参数合成 (Parametric Synthesis)
参数合成是一种通过声学模型合成语音的方法。该方法将语音的声学特征转化为参数序列,然后再根据这些参数合成语音。参数合成的优势在于可以在较小的数据集上进行合成,但需要精确的声学模型进行参数的转化与合成。
4. 隐马尔可夫模型 (Hidden Markov Model, HMM)
隐马尔可夫模型是一种常用于语音合成的统计模型。HMM模型将人声语音划分为连续的音素单元,并且通过建立状态转移概率分布模拟语音的连续性。通过HMM模型,可以根据文本输入确定相应的状态序列,再通过状态序列合成出语音。这种方法在语音合成领域应用广泛,但对于长段文字的连续语音合成效果较差。
基于ADSP—2185m的嵌入式汉语语音合成系统
第l8卷 第3捌 2002年61}】 信号处理 SIGNAL PRoCESSING 、 】】8 No.3 Jun 2OO2
基于ADSP一2185m的嵌入式汉语语音合成系统
罗鑫周斌刘湘毅
(中唇科学技术大学电子S-程与信息稃学系,合肥230027 王仁华戴礼荣
中参盘讯飞信息稃技有限公司,合肥230088)
摘要:本文将介绍一个基于ADSP-2185m的嵌入式汉语语音台成系统;作为一个脱机独立系统.它叮以实时实现 汉语史语转换.输出较高自然度的台成语音.同时在硬件设计上具有体积小,性价比高,接u简 等特点 作为技术原型,
该系统口 以广泛应用于各种小型智能终端,为Hj户提供方便实用的语音信息服务,目前已经 车载定位信息播报系统和手
机短信息播撤系统中推r应用
关键词:嵌入式晤音合成基音同步叠加DSP
An Embedded Chinese 1_ext-To-Speech System based on ADSP-21 85m
Luo Xin Zhou Bin Liu Xiangyi Wang Renhua Dai Lirong
(Depaament ofElectronicEngineering andInformation Science,UniversityofScience&Technology ofChina,Hefei 23002) (。Anhuj USTC IFLYTEK CO.LTD.Hefei 230088)
Abstract:In this paper,an embedded Chinese text-to—speech system based on ADSP一2185m is introduced As a
stand—alone system,it cart implernent real—time Chinese Text-To-Speech,and produce speech with high naturalness In hardware
语音合成中的文本归一化问题
第11卷第2期
2010年4月 北华大学学报(社会科学版)
JOURNAL OF BEIHUA UNIVERSITY(SociM Sciences) V01.1l No.2
Apr.2010
・语文现代化・
语音合成中的文本归一化问题
冯志伟
(教育部语言文字应用研究所,北京100010)
摘要:文本归一化是语音合成中一个与语言规划联系最为密切的问题。英语文本
归一化的3个任务是:句子的词例还原,非标准词的处理,同形异义词的排歧。根据汉语
语音合成的实际,汉语文本归一化应当解决的问题是:汉语文本的词例还原,汉语文本非
标准词的处理,汉语文本同形异义词的排歧。此外,还应注意汉语语音合成中特殊韵律现
象的处理。
关键词:语音合成;词例还原;非标准词;同形异义词;排歧;韵律
中图分类号:H087文献标识码:A文章编号:1009—5101(2010)02—0041—09
一、语音合成技术的发展与应用
出生在斯洛伐克(当时属于匈牙利王国)的发明家
Wol ̄ang von Kempelen于1769年在维也纳为玛利亚・泰
莱撒女皇(Maria Theresa)制造了一个叫做图尔克的机器
(mechanical Turk)。图尔克机是一个会下象棋的自动机
器,它的前端是一个布满了齿轮的大木箱,在这个大木箱
的后面,坐着一个机器人,这个机器人在下象棋的时候,会
用自己的机械手来移动棋子。数十年问,这个图尔克机在
欧洲和美国进行巡回比赛,据说曾经打败了法国皇帝拿破
仑(Napolean Bonaparte),甚至还和英国数学家巴贝奇
(Charles Babbage)做过对弈,名噪一时。
但是,后来发现,这竟然是一场恶作剧。原来这个图
尔克机的全部动作都是由藏在大木箱内部的一个会下象
棋的活生生的人控制着的。不然,这个图尔克机也许可以
看成是人工智能的最早的一个成就呢!
Wolfgang yon Kempelen因此而声名狼藉,不过,我们也 不能把他看扁了。这个Wolfgang von Kempelen确实具有
基于波形音频段处理的中文语音合成研究
基于波形音频段处理的中文语音合成研究 罗三定,贾建华,沙莎 (中南大学信息科学与工程学院,长沙410083) 摘要:针对语音合成自然度不够理想的问题,文章提出了语音单元之间平稳过渡的 改进方法和在分词基础上的词的组合方法,给出了一些短语的组合规则,并时合成中 的语气处理规律进行了探讨,将这些规则和规律成功应用于汉语文本一语音转换系 统,获得了比较好的效果。 关键词:语音合成;语音自然度;拚接合成;规则合成 Abstract:Because the natural degree of speech synthesis is not good enough,this paper puts forward 1we methods,one is an improved method of smooth transition between phonetic units,another is a method of word combination based on segmentation.Besides.【t also studies on tone processing in synthesis.This paper present S solne rules and laws to improve the natural degree of speech synthesis. These rules and laws make our Chinese TTS better after they are applied. Key words:speech synthesis;natural degree of phonetic:connecting synthesis;ruled synthesis 0引言 随着计算机技术进入网络和多媒体时 代,语音合成技术已经广泛应用于信息咨询、 电话银行、办公自动化等多个领域.并继续向 前发展。目前,语音合成技术主要有基于规则 合成和基于拼接合成两种。基于规则合成主 要是计算参数的轨迹形成规则.完成语音的 参数合成;基于拚接合成则是存储语音基元. 合成时读取基元、挤接、韵律修饰、输出连续 语流 一 因为基于拼接合成中的语音基元取 自自然语音.它隐含了声调、重音、发音速度 等细微特性.合成的语音清晰自然.所以其质 量普遍高于基于规则合成.而且该种方法简 单直观、运算量小,因此获得了广泛应用。 但基于拼接方法合成的语音与自然语音 相比还有一定的差距,其主要表现为:合成语 收稿日期 作者简介 莎.副教授 基金项目 ・1G・ 音的自然度不够高,语音单元之间的过渡还 不够自然。因此,如何提高合成语音的自然 度,使合成的语音更加流畅是语音合成的关 键 本文针对这个问题从语音单元之间平稳 过渡处理、分段处理和语气处理三个方面进 行了探讨.并且将研究成果应用于我们的汉 语TTS系统。应用结果表明.合成后的语音 自然度明显提高,合成效果得到很大的改善。 l 语音合成中语音单元间平稳过渡处 理 在拼接语音合成中,如果简单地把各个 语音单元拼接起来.合成后的语音听起来时 快时慢.抖动很大,缺乏连贯性 因此,语音单 元之间必须进行过渡处理 在我们的系统中. 采用首尾交叉法进行过渡 所谓首尾交叉法.也就是对前一语音单 !-【】l l0 19I修回日期 “…1 12 n 5 定(1 s55) 别教授.主攻数据挖掘。j信息服井,多撵件技术;贾建华.男.硬十1_ .主攻多蝶体技术:抄 香}挂Dist:ibuted Admi ssion{;um rol Algorilhrn for Anyca st multimedia Flow/g001189 《电脑与信息技术) ̄2t1
语音合成中多音字识别的实现
科技资讯
科技资讯SIN&TNOLOGYINFORMTION2008NO.11SCIENCE&TECHNOLOGYINFORMATION学术论坛
人们一直希望实现完全意义的人机对话,即计算机能“说话”同时能听懂人们的说话。计算机“说话”相对容易。经过不断研究,目前并联共振峰合成、串联共振峰合成、线性预测合成等技术,特别是基音同步叠加技术(PSOLA)的应用,通过对人发出的原声进行波形拼接把文本转换为相应语音输出的声音基本上和普通人说话一样。但是对于汉语,由于存在多音字,在进行文本转换语音时需要解决转换为哪个读音的问题,特别是人名和地名读音。本文介绍文本转换语音技术,并在对汉语多音字概述基础上,提出一种多音字识别方法,给出在VC项目中具体实现过程1语音合成语音合成也称为“文语转换(TexttoSpeech,TTS)”,是采用一定技术,把文本(对汉语而言就是汉字)转换成人们能够听得懂的语音波形并由声卡等语音设备输出来。它是语言学、语音技术以及计算机技术等综合运用的产物,也是实现人机对话的必然趋势。语音合成系统可分为文本分析、韵律建模和语音合成三大部分。其中语音合成是最基本、最重要的模块。TTS基本原理如图1[1][2]。2语音合成实现90年代,微软公司不断深入研究语音技术,形成了较成熟的用于语音技术开发的工具包(MicrosoftSpeechSDK5.1),该工具包提供了关于语音处理的一套应用程序编程接口SAPI,可以到微软官方网站免费下载。如果要支持中文,还必须下载语言包,其中有简体中文语言包。下载后,先安装SDK5.1,再安装语言包。完成后,Win-dows操作系统的控制面板会出现“语音”控制项目。在“语音属性”对话框中可以看到“语音识别”和“文本语音转换系统”。要实现中文语音识别和合成,需要选择其中的MicrosoftSimplifiedChinese[3]。程序设计方法是:①在项目的应用文件(.cpp)中加入#in-clude。②在项目的“项目→设置→C/C++”下,选择“目录”中的“处理”,在“加入文件头路径”中加入“sapi.h”的路径。③在项目的“项目→设置→连接”下,选择“目录”中的“输入”,在“加入库路径”中加入“sapi.lib”的路径。TTS是以dll形式存在的,使用时必须初始化COM,结束时释放[3][4],程序框架如下:ISpVoice*pVoice=NULL;//COM初始化:if(FAILED(::CoInitialize(NULL)))returnFALSE;HRESULThr=CoCreateInstance(CLSID_SpVoice,NULL,CLSCTX_ALL,IID_ISpVoice,(void**)&pVoice);if(SUCCEEDED(hr)){hr=pVoice->Speak(L"Helloworld",0,NULL);pVoice->Release();pVoice=NULL;}//释放COM组件环境::CoUninitialize();returnTRUE;3汉语多音字汉语言使用中的最大障碍,不是难字,也不是冷僻字,而是多音字。难字、偏僻字对于计算机无所谓,只需从字典中找出并按照规则合成声音;但是,遇到多音字,特别是人名、地名中的多音字,由于缺乏上下文分析,计算机只能按照常用读音合成;而人名、地名多音字发音,往往不是常用发音。很多管理数据库包含人名、地名,如何让计算机正确识别人名、地名中的多音字显得尤其重要。同时,汉语言中,多音字占汉字总数的25.68%,其数量很大。4多音字识别方法一般来说,人名、地名在数据库中的位置比较固定,针对这一特点,要实现多音字处理就变得相对简单了。首先,建立多音字表;之后,当程序运行到人名、地名文本时,先判断是否为多音字;如果不是多音字,按照正常TTS转换输出语音,如果是多音字,按照人名、地名读音进行转换,以多音字合适读音输出。多音字识别程序设计如下。⑴初始化(VC++):①首先用文本编辑器(如记事本)打开资源文件(.rc文件)在其中加入多音字表,IDWWAVE"c:\\kav\\sound\\vocabulary.ini",保存资源文件。②程序应用时调用函数AfxGetInstanceHandle()获得实例句柄,其次用函数FindResource寻找多音字表。HRSRCFindResource(HMODULEhModule,LPCTSTRlpName,LPCTSTRlpType)找到多音字表后,用LoadResource加入该资源HGLOBALLoadResource(HMODULEhModule,HRSRChResInfo);③锁定资源内存块,并返回所标定内存块虚拟内存地址。如果资源被成功锁定,返回值指向资源开始处第一个字节:LPVOIDpv=LockResource()完成了多音字表加载,程序中可以像使用一般文件一样使用多音字表。⑵判断并转换多音字:当TTS运行到人名位置,逐位提取汉字并在多音字表中查找,如果找到,转换读音;否则,对该字不作处理。对于多音字表,程序设置一些控制,可以添加、删除和修改内容,以实现多音字表动态管理。⑶退出程序释放多音字表:不再使用多音字表时,解锁内存块,释放多音字表。程序正常结束时,系统也会自动释放多音字表。5结语本文对汉语中人名、地名多音字提出一种简单可行的处理方法,并在VC工程中给予具体实现。该方法可以以DLL形式加载到任何需要人名、地名语音合成场合,且多音字表动态生成,方便有效。方法不足之处是人名和地名位置必须固定。参考文献[1]张雄伟,等.现代语音处理技术及应用.机械工业出版社,2003第一版.[2]张大军.汉语文语转换系统HJ-TTS关键技术的研究与实现.中国科学院计算技术研究所博士研究生论文.[3]MicrosoftSpeechSDK(SAPI5.1).Microsoftcorporation.[4]毕晓君,等.利用TTS技术实现文本文件的语音合成[]计算机应用,,3()语音合成中多音字识别的实现周海涛(河南经贸职业学院河南郑州450053)摘要:汉语的多音字给语音合成带来很多问题,尤其是人名和地名。本文在简述语音合成技术及多音字基础上,提出一种汉语人名地名的多音字识别方法并在VC工程中加以实现。关键词:语音合成多音字工程中图分类号:H11文献标识码:A文章编号:1672-3791(2008)04(b)-0241-01
