语音增强--谱减法原理及源代码实现

处理宽带噪声的最通用技术是谱减法。

它利用语音信号的短时平稳特性,从带噪语音的短时谱值中减去噪声的短时谱,从而得到纯净语音的频谱,达到语音增强得目的。

谱减法包括幅度谱减法和功率谱减法:幅度谱减法就是在频域中从带噪语音的幅度谱上减去噪声的幅度谱作为语音信号的幅度谱;功率谱减法则是从带噪语音的功率谱中减去噪声的功率谱,得到纯净语音的功率谱估计,通过开方运算得到幅度谱。

由于人耳对语音频谱分量的相位感知不敏感,因此这些算法都是在幅度上进行的修正,相位部分则保持不变,仍然使用带噪语音的相位。

谱减法通过从带噪语音的短时谱估值中减去噪声的短时谱来达到语音增强得目的,算法简单且容易实现。

但在减去噪声谱后,还会有些较大功率谱分量的剩余部分,在频谱上呈现出随机出现的尖峰,在听觉上形成残留噪声。

这种噪声具有一定的节奏性起伏感,被称之为“音乐噪声”。

后来,Ephraim 等人又对谱减法进行了大量改进,部分解决了“音乐噪声”问题,但在带噪语言信噪比较低时其残余噪声还是很大,尤其是当信噪比小于5dB 的时候。

因此,如何最大限度地消除谱减法中的“音乐噪声”,仍将是人们今后研究的重要课题。

以下为MATLAB源码的实现
%基本谱减法
clear;
%[xx,fs]=wavread('E:\mywhisper\shu.wav');
%[xx,fs]=wavread('E:\speech\x\w1xun_01.wav');
%[xx,fs]=wavread('E:\speech\耳语音切割\b\w1ba_5');
[xx,fs]=wavread('MIC0.wav');% 读取音频文件yuan.wav,并返回采样数据给变量xx及采样率Fs
[team,row]=size(xx);%将数组xx的行数赋给team,列数赋给row
if row==2
x=(xx(:,1)+xx(:,2))/2;
yy=x;
%如果语音信号xx为2列,即信号为双声道,则将其转换成单声道信号,即取两列的平均值赋给x,并将x的值赋给yy
else
x=xx;
yy=x;
%若语音信号xx为单声道,则将xx的值赋给x,并将x的值赋给yy
end
x=x-mean(x)+0.1*rand(length(x),1);
N=length(x);%将语音信号长度赋给变量N
n=220;%对语音信号进行分帧,帧长为220
n1=160;%帧移为160
frame=floor((N-n)/(n-n1));%将分帧数赋给变量frame
%frame=floor(N/n);
for i=1:frame
y1=x((i-1)*(n-n1)+1:(i-1)*(n-n1)+n).*hamming(n);
%对每段分帧进行加窗处理
fy=fft(y1,n);
nen(i,:)=abs(fy).^2;% 将频域信号功率赋给矩阵变量nen
ang(i,:)=angle(fy);%将频域信号的相位角赋给矩阵变量ang
end
yuzhi=sum(sum(nen(2:5,:)))/(4*n);
for i=1:frame
nen(i,:)=nen(i,:)-yuzhi;
nen(i,find(nen(i,:)<0))=0;
%chuli=nen(i,1:n/2);
%chuli=chuli-yuzhi;
%chuli(find(chuli<0))=0;
%nen(i,:)=[chuli,fliplr(chuli)];
% nen(i,:)=filter(1,[0.5 0.5],nen(i,:));
% nen(i,find(nen(i,:)<0))=0;
end
for i=1:frame
nen(i,:)=sqrt(nen(i,:));%将纯语音功率谱开根,得到频域值
jie=nen(i,:).*exp(j*ang(i,:));
out(i,:)=real(ifft(jie))/hamming(n)'; %对纯语音频谱进行逆傅里叶变换,并取其实部,并进行去窗处理
end
zong=out(1,:)';%将第一帧中未重叠部分记入数组zong
jiewei=n;
for i=2:frame
zong(jiewei-n1+1:jiewei)=(zong(jiewei-n1+1:jiewei)+out(i,1:n1)')/2;
jiewei=jiewei+n-n1;% 使指针jiewei依次指向下一帧的帧尾
zong=[zong;out(i,n1+1:end)'];%将从第二帧开始的每一帧中未重叠部分记入数组zong
end
%zong=out(1,:)';
%for i=2:frame
%zong=[zong;out(i,:)'];
%end
%
%for i=1:frame
% zong=[zong,nen(i,:)'];
% zong(i*(n-n1)+1:(i-1)*(n-n1)+n)=zong(i*(n-n1)+1:(i-1)*(n-n1)+n)/2;
figure(1); %创建图1
subplot(211); %把图形窗口分成2*1个小窗口,取第1个小窗口
plot(x);%以数组x绘图基本二维曲线
axis([1,(n-n1)*frame+n,min(x),max(x)]);% 对当前二维图形对象的X轴和Y轴进行标定,x轴的范围为1到最后一个分帧结尾,y轴的范围为带噪语音时域最小值到最大值
subplot(212); %把图形窗口分成2*1个小窗口,取第2个小窗口
specgram(x,fs,1024,n,n1);%画出语音的语谱图
figure(2); %创建图2
subplot(211); %把图形窗口分成2*1个小窗口,取第1个小窗口
plot(zong); %以数组zong绘图基本二维曲线
axis([1,(n-n1)*frame+n,min(zong),max(zong)]); % 对当前二维图形对象的X轴和Y轴进行标定,x轴的范围为1到最后一个分帧结尾,y轴的范围为纯语音时域最小值到最大值
subplot(212); %把图形窗口分成2*1个小窗口,取第2个小窗口
specgram(zong,fs,1024,n,n1); %画出语音的语谱图
wavplay(x,fs);%播放单声道带噪语音音频
wavplay(zong,fs);%播放单声道纯净语音音频。

合集下载

语音识别技术中的语音增强方法

语音识别技术中的语音增强方法

语音识别技术中的语音增强方法语音识别技术是一种基于计算机的人机交互方式,它将人的语音信息转化为文本或命令,实现自然语言对计算机的控制和交流。

然而,由于语音信号受到环境噪音、语音质量等多种因素的影响,识别准确度可能会受到一定的影响。

为了提高语音识别的准确性和稳定性,语音增强方法应运而生。

一、噪声抑制技术噪声是语音识别中常见的干扰因素之一,它会降低语音信号的质量,阻碍识别系统的准确工作。

因此,噪声抑制技术成为解决这一问题的重要手段之一。

常见的噪声抑制方法包括:频域滤波法、时域滤波法和声学特征转换法。

1. 频域滤波法频域滤波法是基于频域分析的一种噪声抑制技术,它通过分析语音信号的频率特性,有选择性地抑制噪声成分,保留语音信号的有用信息。

常用的频域滤波方法包括谱减法、MMSE准则和Subspace方法等。

2. 时域滤波法时域滤波法是一种基于时域分析的噪声抑制方法,它通过分析语音信号在时间域上的特性,对噪声信号进行抑制。

经典的时域滤波方法有阻带滤波法、LMS自适应滤波法和Kalman滤波法等。

3. 声学特征转换法声学特征转换法是一种基于声学特征的噪声抑制方法,它通过对语音信号的声学特征进行转换,使其更适合于识别算法的处理。

常见的声学特征转换方法有Mel频率倒谱系数(MFCC)、倒频谱法和线性预测法等。

二、语音增强技术除了噪声抑制技术外,语音增强技术也是一种重要的语音处理手段。

它通过调节语音信号的频谱特性,改善语音信号的质量,为语音识别系统提供更清晰、准确的输入。

常见的语音增强技术包括谱减法、频谱平滑法和频谱估计法等。

1. 谱减法谱减法是一种常用的语音增强方法,它通过对语音信号的频谱进行减噪处理,去除噪声成分,提高语音信号的质量。

谱减法的基本原理是通过对语音信号的短时傅里叶变换,将频谱信息进行分析和处理。

2. 频谱平滑法频谱平滑法是一种通过平滑语音信号的频谱来增强语音质量的方法。

它通过对语音信号的频谱进行滤波,去除高频噪声成分,使得语音信号更加平滑。

基于谱减法的语音增强技术

基于谱减法的语音增强技术

算法实现流程
逆快速傅里叶变换(IFFT)
对增强后的频谱进行逆快速傅里叶变换,得到增强后的时域信号。
后处理
对增强后的信号进行后处理,如门限判决、非线性处理等,以提高增强效果。
算法优化与改进
01
02
03
自适应噪声估计
采用自适应滤波算法,根 据输入信号自动调整噪声 估计的参数,以提高噪声 估计的准确性和鲁棒性。
基于谱减法的语音增强技术是 一种常用的方法,通过去除噪 声成分来提高语音质量。
研究意义
基于谱减法的语音增强技术在实 际应用中具有重要意义,如语音 通话、语音助手、语音识别等。
通过对谱减法的研究,可以深入 了解语音信号的特性,为语音处
理技术的发展提供理论支持。
基于谱减法的语音增强技术还可 以为其他相关领域提供借鉴和参 考,如音频处理、音频分析等。
在实际应用中,谱减法常用于语音信 号处理领域,特别是在语音识别、语 音合成和语音存储等场景中。
谱减法还可以与其他语音增强技术结 合使用,如基于规则的增强方法、基 于神经网络的增强方法等,以进一步 提高语音增强的效果。
通过使用谱减法,可以有效降低噪声 干扰,提高语音信号的清晰度和可懂 度,从而提高语音处理系统的性能。
谱减法在语音增强中表现出较好的效果,能够有效降低噪声干扰,提高语 音质量。
通过对不同噪声环境下的实验,证明了谱减法在不同场景下的适用性和鲁 棒性。
与传统滤波器方法相比,谱减法具有计算复杂度低、处理速度快等优势, 适合实时语音处理应用。
研究不足与展望
当前研究主要集中在谱减法的基 本算法和改进上,对于复杂噪声 环境的适应性还有待提高。
鲁棒性分析
在不同噪声类型和强度下,谱减法均表现出较好的鲁 棒性。

基于谱减法的语音增强技术

基于谱减法的语音增强技术

主观听觉效果评价
听觉感受
通过人类听觉感受对增强后的语音进行主观评价,包括清晰度、自然度、噪声残留等方面。
平均意见得分
邀请多名听评者对增强后的语音进行打分,统计平均意见得分(MOS),以客观反映算法在实际应用 场景中的性能表现。
06
基于谱减法的语音增强技 术应用场景
通信系统中降噪处理
通话降噪
在移动通信、VoIP等通话场景中,利用谱减 法有效抑制背景噪声,提高通话清晰度。
实现步骤
谱减法的实现步骤包括带噪语音的预处理、噪声谱估计、语 音存在概率估计、增益函数计算和频谱修改等。其中,噪声 谱估计是谱减法的关键步骤之一,它的准确性直接影响到增 强效果。
技术应用与发展趋势
技术应用
谱减法已经被广泛应用于语音通信、语 音识别、语音合成等领域。例如,在语 音识别系统中,谱减法可以用于提高识 别率;在电话会议系统中,谱减法可以 用于抑制背景噪声,提高通话质量。
个性化定制
针对不同用户、场景和设备,提供个性化的语音增强方案,满足不 同需求。
多模态融合
结合音频、视频等多种信息模态,实现多模态语音增强,提高复杂环 境下的语音通信质量。
THANKS
感谢观看
基于谱减法的语 音增强技术
汇报人: 日期:
目录
• 引言 • 谱减法基本原理 • 谱减法实现过程 • 实验结果与性能评估 • 基于谱减法的语音增强技术应用
场景 • 总结与展望
01
优点
算法简单
谱减法原理简单,实现容易,计算复杂度低。
实时性好
谱减法处理速度快,适用于实时语音通信系统。
对平稳噪声有效
对于平稳噪声,谱减法可以取得较好的增强效果 。
谱减法实现过程

谱减法的语音信号增强

谱减法的语音信号增强

设计性实验4 语音信号增强一、实验目的1、了解语音信号噪声抑制的仿真方法及原理;2、利用谱想减法抑制语音中的噪声;二、实验要求1、仿真合成一段带噪语音;2、使用谱相减法对带噪语音进行增强;三、实验原理1、语音信号特点:语音信号是一种时变的非平稳的随机信号,但是人类的发声系统的生理结构的变化速度是有一定限度的,在一段时间内(10~30ms)人的声带和声道形状具有相对稳定性,可以认为其特性是不变的,因而语音的短时谱分析也有相对稳定性,在语音增强中可以利用短时谱的这种稳定性。

2、语音信号的处理方法根据语音信号的特点,可以将平稳过程中的处理方法和理论引入到语音信号的短时处理当中,将语音信号划分为很多短时的语音段,每个短时的语音段称为一个分析帧。

这样,对每一帧语音信号处理就相当于对特征固定的持续信号进行处理。

帧既可以是连续的,也可以采用交叠分帧,一般帧长取 10~30ms。

取数据时,前一帧和后一帧的交迭部分称为帧移,帧移与帧长之比一般取为0~1/2。

对取出的语音帧要经过加窗处理,即用一定的窗函数与信号相乘,从而形成加窗语音。

加窗的主要作用在于减少由分帧处理带来的频谱泄露,这是因为,分帧是对语音信号的突然截断,相当于语音信号的频谱与矩形窗函数频谱的周期卷积。

由于矩形窗频谱的旁瓣较高,信号的频谱会产生“拖尾”,即频谱泄露。

为此,可采用汉明窗,因为汉明窗旁瓣最低,可以有效地克服泄露现象,具有更平滑的低通特性,得到的频谱比较平滑。

汉明(Hamming)窗定义:3、谱减法简介谱相减方法是基于人的感觉特性,即语音信号的短时幅度比短时相位更容易对人的听觉系统产生影响,从而对语音短时幅度谱进行估计,适用于受加性噪声污染的语音。

谱减法的基本原理:图1 谱相减法原理图图中为加窗后的带噪信号,为的噪声信号功率谱,为增强后的语音信号。

由于人耳对语音相位不敏感,所以用原始含噪语音的相位代替估计语音的相位。

谱减法实现的几条公式如下:(1)(2)(3)由式(1)得到增强后的语音信号的功率谱;然后利用原始含噪语音的相位代替增强后语音的相位,恢复出增强后的语音信号。

音频信号处理中的语音增强算法研究综述

音频信号处理中的语音增强算法研究综述

音频信号处理中的语音增强算法研究综述引言:在现实生活中,由于各种环境因素的干扰,语音信号往往受到噪声的影响而变得模糊不清。

为了提高语音信号的质量和可理解性,研究者们致力于开发各种语音增强算法。

本文将对音频信号处理中的语音增强算法进行综述,从传统方法到深度学习方法,分析其原理、应用和优缺点。

传统语音增强算法:1. 统计模型方法统计模型方法是传统语音增强算法中常用的一种方法。

该方法通过对语音信号和噪声进行建模,通过最大似然准则来估计语音信号的参数,进而实现语音增强。

代表性的算法有谱减法(Spectral Subtraction)、最小均方误差法(Minimum Mean Square Error)等。

这些算法在一定程度上能够减小噪声的影响,提高语音信号的质量,但也存在一定的缺点,例如对于非平稳噪声和低信噪比情况下的处理效果并不理想。

2. 子空间方法子空间方法是基于统计模型方法的另一种改进方法。

该方法通过运用降维、投影等技术,将噪声信号和语音信号从不同的子空间中进行建模和分离。

其中,主成分分析(Principal Component Analysis)和独立分量分析(Independent Component Analysis)是常用的子空间方法。

这些方法具有较好的噪声抑制效果,但也存在对信号相关性的依赖性,对噪音类型的预先知识要求较高等问题。

深度学习方法:随着深度学习的快速发展,越来越多的研究者开始将其应用于语音增强领域,并取得了显著的成果。

1. 卷积神经网络(CNN)卷积神经网络是一种使用卷积层和池化层进行特征提取的神经网络模型。

在语音增强领域,研究者们通过将噪声信号和语音信号输入到CNN中,以降低噪声的影响并提取有用的语音特征。

例如,Deep Convolutional Neural Networks(DCNN)被广泛应用于单麦克风语音增强任务中,取得了较好的增强效果。

2. 循环神经网络(RNN)循环神经网络是一种具有记忆能力的神经网络模型,适用于连续序列数据的处理。

谱减法原理及其实现过程

谱减法原理及其实现过程

学校代码: 10128学号:语音信号处理专题报告(题目:谱减法原理及其实现过程学院:专业:学生姓名:学号:班级:二〇一二年六月谱减法原理及其实现过程摘要本文主要研究谱减法原理及其实现过程及了解其在语音增强中的应用,目的是增强语音质量,减少语音失真和提高其可懂度。

S. Boll 假设噪声是平稳的或缓慢变化的加性噪声,并且语音信号和噪声信号不相关的情况下,提出了谱减法(SS:Spectral Subtraction)。

该方法能够抑制背景噪声的影响,但由于其局部平稳性的假设与实际情况并不相符,因此效果不理想,残留的音乐噪声较大;Berouti在传统谱减法的基础上增加了调节噪声功率谱大小的系数和增强语音功率谱的最小值限制,提高了谱减法的性能,但是其修正系数和最小值是根据经验确定的,适应性较差;P. Lockwood在谱减法的基础上提出了非线性谱减法(NSS:Non-liner Spectral Subtraction),它根据语音信号的信噪比自适应调节语音增强的增益函数,提高了语音的信噪比,而信噪比并不能正确反映信号的听觉质量,因此用信噪比作为调整估计参数的依据并不能提高信号的听觉质量;Boh Lim Sim等人也提出了与此相近的改进算法,虽然提高了信号的信噪比,但残留的音乐噪声较大;Virag将人耳的掩蔽特性应用到非线性谱减法的增强算法中,部分解决了谱减法残留音乐噪声大的问题,但在信噪比较低或非平稳的情况下,其增强效果不理想;I.Cohen 等人首先估计语音信号概率密度函数,然后在此基础上改进了对数谱估计算法,使得改进的算法对非平稳噪声具有良好的抑制作用,该算法的缺点是语音信号的概率密度函数较难估计。

噪声参数估计的准确与否直接会影响谱减法语音增强效果,因此,带噪语音中背景噪声参数的估计问题值得关注。

最后,基于噪声与语音具有一定的相关性的实际情况,我们提出了算法的进一步改进设想,并对此思想做出了数学推导,得到了算法进一步改进的方向及可行性。

基于谱减法的内话系统语音增强技术

, v
() n
=
() 7
1
式中: 下标 W表示 加窗 信号 ; 示 复共轭 。根 据发 语 表
式 中: Ⅳ为帧 长 ; m为 帧 的编号 ; 每一 帧 中的各 点 。 n为
音前 的噪 声 与发语 音 期 间 的噪声 功率 谱 相 同 , 因而 可
利 用发 音前 ( 后 ) 寂 静帧 ” 估算 噪声 。 由于 s t 或 的“ 来 () 和 d t独立 , () 则互 谱 的统计 均值 为 0 所 以原 始语 音 的 ,
进行 改进 l此 方 法基 本思 想 是 : 3 l , ①采 用 被减 项权 值处
理的方法 , 即去除噪声时减去 ( ( J) f ) ( >1。 )
②采 用 功率 谱 修正 处理 方 法 , 式 ( ) 对 4 和式 ( ) 5 中所 涉
及 的功率谱计算 及 “改为 11和 “计算( .
Ab ta t sr c :No a a s se c oig tc n lg sd b ie S thn n o to y tm ( CS n argo n w d y , p e h v t e h oo y u e y Voc wi ig a d C nrlS se n c VS )i i ru d
在实 际对功 率谱 的计算 中 , 一小 段 加 窗信 号来 用
对受 污染 的语 音采集 , 计算 每一 帧语音 短 时能量
^一1 T
=
() l ∞ I=I ( ) +I ∞ l y ∞ { D( ) + s
S( D ( +5 ( D ( ww) f ) ) ) () 3 短时 过零率 为
分 帧 内可 以 近 似 看 作 是 一 平 稳 随 机 过 程 与 不 相 关 的

基于谱减法的语音增强技术


语音合成
谱减法可用于提取纯净的语音 特征,用于语音合成和声音重 建。
语音编码
在低比特率语音编码中,谱减 法可以压缩语音信号的动态范
围,提高编码效率。
谱减法的优缺点
优点
算法简单,计算量较小,实时性较好;在信噪比较高的情况下,能够获得较好 的语音增强效果。
缺点
对于非平稳噪声的处理效果较差;在信噪比较低时,增强后的语音可能产生失 真和残留噪声;此外,谱减法对于语音信号的频谱结构和特性有一定的假设和 限制,可能不适用于所有类型的语音信号。
03
基于谱减法的语音增强方法
基于谱减法的噪声估计
噪声谱估计
在语音增强中,首先需要对噪声 进行估计。基于谱减法的语音增 强方法通过分析语音信号的频谱
,估计噪声的频谱特性。
语音活动检测
为了准确估计噪声,需要进行语音 活动检测,区分语音段和静音段, 以便在静音段中估计噪声。
噪声更新机制
在语音活动过程中,噪声特性可能 会发生变化。为了跟踪这种变化, 需要采用一种有效的噪声更新机制 。
02
语音增强技术介绍
语音增强技术的定义和目标
定义
语音增强技术是一种处理语音信 号的方。
目标
语音增强技术的主要目标是去除 噪声和干扰,提升语音的可懂度 和感知质量,以及改善语音信号 的可用性。
语音增强技术的发展历程
01
02
03
早期方法
早期的语音增强技术主要 基于时域或频域的简单处 理方法,如滤波和谱减法 。
将处理后的频谱通过逆变 换转回到时域,得到增强 后的语音信号。
将处理后的语音保存为文 件或直接输出。
实验设计与评估指标
实验设计 • 选择不同种类的噪声环境,例如白噪声、交通噪声等。

改进的谱减法在语音增强中的应用

改进的谱减法在语音增强中的应用一、boll的改进谱减法基本理论1979年,s.f.boll提出一种改进的谱减法。

主要的改进点如下。

(1)在谱减法中使用信号的频谱幅值或功率谱改进的谱减公式为噪声段的平均谱值为当y=1时,算法相当于用谱幅值做谱减法;当y=2时,算法相当于用功率谱做谱减法。

式中,a为过减因子;β为增益补偿因子。

(2)计算平均谱值在相邻帧之间计算平均值:利用yi(k)取代xi(k),可以得到较小的谱估算方差。

(3)减少噪声残留在减噪过程中保留噪声的最大值,从而在谱减法中尽可能地减少噪声残留,从而削弱“音乐噪声”。

此处,max|nr(k)|代表最大噪声残余。

二、基本谱减法的实验boll的改进谱减法函数spectralsubim名称:spectralsubim功能:基于boll的改进谱减法语音降噪。

调用格式:output = spectralsubim(signal,wind, inc, nis, gamma, beta)说明:输入参数signal是输入的含噪语音信号;wind为窗函数或窗长;inc是帧移;nis是前导无话段帧数;gamma和beta是算法参数。

output是降噪后的信号。

函数代码如下:functionoutput=spectralsubim(signal,wind,inc,nis,gamma,beta)nwin=length(wind);if (nwin == 1) % 判断窗长是否为1,若为1,即表示没有设窗函数w = wind; % 是,帧长=windwnd=hamming(w);elsew = nwin; % 否,帧长=窗长wnd=wind;endnfft=w;y=enframe(signal,w,inc)';y=fft(y,nfft);yphase=angle(y(1:fix(end/2)+1,:)); %含噪语音的相位y=abs(y(1:fix(end/2)+1,:)).^gamma; %功率谱numberofframes=size(y,2);n=mean(y(:,1:nis)')'; %初始的能量谱均值d(k)nrm=zeros(size(n)); %噪声残余量最大值noisecounter=0;noiselength=9; %噪声平滑因子ys=y; %平均谱值for i=2:(numberofframes-1)ys(:,i)=(y(:,i-1)+y(:,i)+y(:,i+1))/3;endfor i=1:numberofframes[noiseflag, speechflag, noisecounter,dist]=vad_logspec(y(:,i).^(1/gamma),n.^(1/gamma),noise counter); %基于频谱距离的vad检测if speechflag==0n=(noiselength*n+y(:,i))/(noiselength+1); %更新并平滑噪声nrm=max(nrm,ys(:,i)-n); %更新最大的噪声残余x(:,i)=beta*y(:,i);elsed=ys(:,i)-n; %谱减if i>1 &&i<numberofframes %减少噪声残留项for j=1:length(d)if d(j)<nrm(j)d(j)=min([d(j) ys(j,i-1)-n(j)ys(j,i+1)-n(j)]);endendendx(:,i)=max(d,0);endendoutput=overlapadd2(x.^(1/gamma),yphase,w,inc);信噪比计算函数snr_calc名称:snr_calc功能:计算信噪比。

谱减法语音增强

0 引 言
净 的原 始 语 音 。 而 , 然 由于 干 扰 通 常 都 是 随 机 的 , 带 噪 语 音 中提 取 声 可 以 通 过 伪 随机 噪声 扰 动 的 方法 变换 成 与信 号 独 立 的 加 性 噪 声 。 从 完 全纯 净 的语 音 几 乎 不 可 能 。 在 这 种 情 况 下 , 音增 强 的 目的 主 要 这 里 仅讨 论加 性 噪声 。加 性 噪声 大 致 上 有 : 期 性 噪 声 、 冲 噪声 、 语 周 脉 有 两 个 一 是 改 进 语 音 质 量 , 除背 景 噪 声 , 听 者 乐于 接 受 , 感 宽 带 噪声 和 同声 道 其 他 语 音 的干 扰 等 。 消 使 不 觉疲 劳 , 这是 一 种 主 观 度 量 ; 二是 提 高语 音 可 懂 度 , 是 一 种 客 观度 这 11周期性噪声 : 特点是具有许 多离散的线谱 。主要来源于 . 其 量 。这两个 目的往往不能兼得。之前有一些对低信噪 比带噪语 音进 发动 机 等周 期 性 运 转 的机 械 。电气 干 扰 , 别 是 电源 交 流 声 , 会 引 特 也 行 语 音 增 强 的 方 法 , 以显著 地 降 低 背 景 噪 声 , 进 语 音 质 量 , 并 起 周期 性 噪声 。 然 , 可 改 但 显 这种 周期 性 噪 声 可 以用 梳 状 滤 波 器 予 以抑 制 , 这 可 以 用 数 字 信 号 处 理 的 方法 来 实现 。 如 图 1 示 , 图 中 D T 和 所 F 不 能提 高 语 音 的 可 懂度 , 至 略 有 下 降 。 甚 环 境 噪 声 污 染 使许 多语 音 处理 系统 的 性 能 急剧 恶 化 。 例 如 , I F 分别 为离 散 傅 里 叶 变 换 和 反 变 换 , 原 理 是 一 目 了然 的 。 语 DT 其 r————] r——————] r————1 音 识 别 已取 得 重 大 进展 , 在 步 入 实 用 阶 段 。 但 目前 的识 别 系统 大 正 噪 L— ——— r J—上塑 壁 l — I T +增 语 D—_- F I 堂 —D F一 强 音 都 是在 安静 环 境 中工 作 的 , 噪 声 环 境 中 尤 其 是 强 噪 声 环 境 , 音 带 语 在 语 一 图 1 语 音增 强 过程 图 识别 系统的识别率将受到严重影 响。低速率语 音编码 , 特别是参 数 然 而 ,实 际 环 境 中产 生 的 周 期 性 噪 声 并 非 简 单 地 只 含 线 谱 分 编 码 ( 码 器 即 为典 型 一 例)也 遇 到 类似 问题 。 声 , 由于 语 音 生成 模 型是 而是由许多窄谱 带组成 。而且 , 往往 是时变的 , 与语音信 号频 并 低速率参数编码 的基础 , 当模 型参 数的提取受到混杂在语音 中背景 量 , 必 噪 声 严 重 干 扰 时 , 建 语 音 的质 量 将 急剧 恶 化 , 至 变得 完 全 不 可 谱 重 叠 , 须采 用 自适 应 滤 波 的 方法 才 有 可 能 自动识 别和 区 分 噪 声 重 甚 懂 。 上述 情 况 下 , 音增 强作 为一 种 预 处理 手 段 , 失 为解 决 噪声 分 量 。 在 语 不 12脉 冲 噪 声 :脉 冲 噪 声 表 现 为 时 域 波 形 中 突 然 出 现 的 窄脉 . 污 染 的 ~ 种 有效 途 径 。 冲。 它来 源 于 爆 炸 、 击和 放 电 等 。 除脉 冲 噪 声 通 常 可 以在 时 域 内 撞 消 l 噪 声 特 性 其过 程如 下 : 据 带 噪 语 音信 号 幅度 的平 均 值 确 定 闭值 。 根 当信 噪 声 来 源取 决 于 实 际 的应 用 环 境 , 而 噪 声 特 性 可 以说 是 变化 进 行 , 因 判别 为脉 ; 噪 声 。然 后 对 它进 行 适 当 的 衰 中 无 穷 。噪 声 可 以 是 加性 的 , 可 以是 非 加 性 的 。对 于 非 加 性 噪 声 , 号 幅 度 超 出这 一 闭值 时 , 也 有
  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
相关文档
最新文档