声纹自动识别技术与声纹库建设应用_李敬阳

662012年第4期一、前言

声纹特征是人体重要生物特征之一,具有较强的稳

定性和个体特殊性。

语音作为证据用于司法鉴定方面,我国在1988年由中

国刑事警察学院文检系率先成立了全国第一个声纹鉴定实

验室,引进了美国KAY公司生产的7800型声谱仪。1989

年,公安部物证鉴定中心(时为公安部第二研究所)成立

了以案件鉴定为目的的声纹鉴定实验室,并引进新一代

KAY-5500声谱仪,推动了声纹技术在办案实践中的应

用。我国司法声纹鉴定技术经过20年的发展,以公安部物

证鉴定中心、最高人民检察院检察信息技术中心、广东省

公安厅、司法部司法鉴定中心等为代表的司法鉴定技术水

平已经取得长足进步。

近年来在声纹自动识别领域,我国也涌现出国际一

流研发团队,已经具备开展国际前沿技术研究、引领声纹

信息在公安领域实现大范围使用的实力。二、声纹自动识别技术

(一)声纹技术发展及现状

(二)声纹自动识别技术20世纪40年代初,美国贝尔实验室发明了声谱仪,并

且首先开始了声纹鉴定技术研究工作,并于60~70年代取

得重要进展,取得99.65%的正确率。此后声纹鉴定逐渐成

为案件侦查的一个重要技术。

目前声纹鉴定技术分为专家鉴定和自动识别两大领

域。专家鉴定方面,主要采用语音学分析方法,应用语音

学及统计分析技术,通过语音工作站测量、分析说话人的

语音声学特征(如声源特征、发音时的声道形状特征、发

音时的口腔及双唇特征以及语音信号时变频谱特征等),

然后采用统计判别方法对说话人语音是否同一作出判定。

语音学分析法是目前国内外司法领域说话人普遍采用的方

法,我国开展声纹鉴定的机构绝大多数均采用此方法。

声纹自动识别也称语音信号处理法,其基本原理声纹自动识别技术与声纹库建设应用

李敬阳胡国平王莉

1.公安部物证鉴定中心2.智能语音技术公安部重点实验室3.安徽省语音信息安全重点实验室122312

摘要:

关键词:本文首先简述声纹自动识别技术,接下来围绕声纹库建设应用的核心需求和技术要点,对声纹库建设所涉及的声纹

采集标准及专业设备研发、两级联动声纹库管理系统、高性能声纹检索引擎研发以及声纹采集入库等四项重要工作

进行思考和分析,阐述了近两年来各项工作所取得的进展,并对声纹库建设进行展望。

声纹自动识别 检索 数据库67PToliceechnology2012年第4期声纹鉴定技术研究

(见图1)是由系统对说话人语音的特征参数进行分离提

取和线性或非线性处理,建立语音模型,然后由系统运算

进行模式匹配,确定出与其最接近的若干已知说话人语

音,得出相似度的结果,其结果是多选的。还可以进一步

细分为说话人辨认(SpeakerIdentification)和说话人确认

(SpeakerVerification)。

声纹自动识别技术近几年在美国等国家深受重视,

例如美国国家标准技术署(NationalInstituteofStandard

andTechnology,NIST)举办的说话人识别评测,就是

针对实际应用需求,测试环境多、复杂度大,这些测试

能够准确体现参测系统在接近真实环境中的实际表现,

被认为是国际上水平最高、最严谨、最公平、结果最权

威的说话人语音识别系统测试。受邀参加评测的均为世

界顶级专业研究开发机构,包括美国麻省理工大学

(MIT)、意大利都灵理工大学(LPT)、法国科学研

究中心(LIMSI)等。近几年,我国清华大学、中国科学

院声学所、科大讯飞语音实验室也参加了测试。根据

2008、2010年NIST举办的全球说话人识别评测结果,

以科大讯飞为代表的我国声纹自动识别技术已经达到国

际领先水平。衡量声纹自动识别系统水平的一项重要指

标是在一定库容量下的等错误率,等错误率越低说明准

确度越高。目前国内外不同声纹自动识别系统水平参差

不齐,好的系统在NIST所制定的覆盖3000多人、10多个

语种以及各种信道的复杂情况测试集合上,对于2~3分

钟语音声纹识别的等错误率已经降到2.65%,达到实际

应用要求,成为司法说话人鉴定系统一个必不可缺的部

分。它能够准确快速筛选嫌疑人,并提供可靠的相似概

率,其结果与专家鉴定结论相互印证,极大提高了案件

侦破的效率和准确率。但是目前多数系统在解决海量数

据、不同信道以及噪声影响等关键技术方面效果还不理

想,离实际应用还有一些差距。[1]三、声纹库建设与应用

(一)声纹库建设的意义

随着近年来电信诈骗、绑架、敲诈勒索等案件呈现

不断上升趋势,声纹特征在公共安全领域的应用价值日益

突显。但目前相对于指纹和DNA而言,我国声纹的采

集、建库及管理应用能力等方面还有较大差距。当前,如

何在大量人群中快速准确地排查到犯罪嫌疑人,成为破案

关键所在。据文献报道,美、英等发达国家均建有犯罪人

员语音库,可以通过声纹自动识别技术快速锁定犯罪嫌疑

人,将侦查范围缩至极小,案件的侦破效率很高。

声纹库建设是我国公安机关“三项建设”的重要内

容之一,是集成了现代化声纹技术、信息技术和科学管理

的重要公安业务基础性工作,能够为处置重大突发事件、

侦破重大、疑难案件提供特殊而重要的技术支撑。与指纹

库、DNA库类似,声纹库建设是一项有着重要实战价值

的工作,具体表现在声纹特征具有非接触式采集的优点,

和已有DNA库和指纹库相关结合,可形成立体生物特征

库,建成后直接为多警种服务,是利用高科技手段在侦破

案件和诉讼活动中应用的一个新的增长点,将能有效提高

公安机关侦查破案的效率和能力,成为落实科技强警的重

要实践之一。

声纹库建设过程为:基于标准的声纹信息采集流

程,对被采集人员的声纹进行采集入库。声纹库的典型应

用模式是:当获得检材后,基于声纹检索技术,从声纹库

中获得与检材声纹最相似的前若干候选(列表),这些候682012年第4期前期研讨结果,声纹库管理系统拟采用省、部两级联动的

声纹库存储管理系统及声纹检索引擎,在各个基层信息采

集室部署专业声纹采集设备,并在市局部署声纹检索应用

客户端。整套系统各环节分工定义如图3所示。

声纹信息采集终端:主要部署在各基层信息采集室

中。采集系统按照标准声纹采集流程执行,要求填写被采

集人基本信息,具体包括姓名、身份证号、籍贯、口音、

文化水平、声音特点(如沙哑、尖、浑厚)等,采集端同

时集成对所采集声纹信息的质量评估功能,以确保所采集

的声纹信息达到入库要求。最终合格的声纹信息(以多通

道录音数据形式)及附带标注信息,通过专网上传汇总到

所在省级声纹库中。

省级声纹库管理中心:配备声纹库管理系统及声纹

检索引擎服务器集群。声纹库管理系统负责管理和保存本

省所有被采集人员的声纹信息。声纹检索引擎服务器负责

从上传的多通道录音数据中提取出用于声纹检索的声纹信

息,并上传到部级声纹库管理中心。声纹检索引擎服务器

同时处理各应用终端提交的声纹检索任务。

部级声纹库管理中心:配备声纹库管理系统及声纹

检索任务调配系统,负责保存全国声纹信息(不包括语音

数据部分)以及对应的身份等信息,以便作为省级声纹库

管理中心的备份。负责声纹检索任务调配系统、处理各省

中心提交的跨省声纹检索协查任务。

声纹应用终端:主要部署在各市局点,提供声纹信

息查找、下载及声纹检索任务提交和检索结果查看功能。

当某个地市出现了需要进行声纹检索的需求时,可以上传

检材,并指定检索范围(全省还是全国)和已知犯罪嫌疑选(列表)提交给鉴定专家进行进一步的声纹鉴定以确定

目标人或为案件侦查提供重要线索。声纹库建设及应用模

式如图2所示。

声纹建库的内容,参考指纹库及DNA库的建设经

验,主要包括以下四部分内容,下面逐一展开说明。

首先必须确保入库声纹的质量。因此需要通过科

学、系统的研究来制定针对自然人的声纹信息标准采集流

程,同时需要研制声纹采集的标准设备,并建立可操作的

声纹采集标准流程,形成公共安全行业标准,为声纹库建

设提供标准支撑,也确保采集入库的各个声纹能够发挥应

有的价值。

根据声纹自动识别技术现状及未来趋势分析,声纹

采集规范的制定应该特别注重以下几个方面:

(1)有效克服信道差异对识别结果的干扰,比如采

用多通道同时录音的方式提高声纹采集精度,且多个信道

的组合能够有效覆盖目前各种主流信道;

(2)充分考虑声纹信息采集内容的完整性;

(3)采集过程要有明确的可操作性。

高性能声纹检索引擎是声纹库建设及价值发挥的核

心。声纹库建设中,必须基于目前声纹识别领域的最新进

展,并且针对基于一个声纹检材片段在百万级声纹库中进

行检索以确定目标嫌疑人范围这一特殊任务,组织有实力

的技术团队进行针对性攻关。

明确声纹检索的关键指标,即在有限候选前提下,

声纹检索的召回率能够达到多少。根据未来可能实际应用

场景的预测和评估,声纹检索的性能应达到在包含50万个

自然人声纹的声纹库中,基于30秒有效语音以上的检材,

声纹检索引擎所给出的前100候选中,包含真正目标人的

召回率在98%以上。

要达到上述声纹检索性能,必须解决以下技术问题:

(1)文本无关的声纹识别;

(2)研究细节区分性算法来处理声纹的相似性;

(3)提高声纹检索的信道鲁棒性;

(4)检索速度及可扩展性问题,针对一个检材在百

万级声纹库中的声纹检索任务,耗时需要达到100秒以

内。

声纹库管理系统也是声纹库建设的重要工作,根据1.声纹采集设备的研制及标准的制定

2.高性能声纹检索引擎的研发

3.两级联动声纹库管理系统的研制(二)声纹库建设的主要内容

合集下载

声纹自动识别技术与声纹库建设应用_李敬阳

声纹自动识别技术与声纹库建设应用_李敬阳

662012年第4期一、前言

声纹特征是人体重要生物特征之一,具有较强的稳

定性和个体特殊性。

语音作为证据用于司法鉴定方面,我国在1988年由中

国刑事警察学院文检系率先成立了全国第一个声纹鉴定实

验室,引进了美国KAY公司生产的7800型声谱仪。1989

年,公安部物证鉴定中心(时为公安部第二研究所)成立

了以案件鉴定为目的的声纹鉴定实验室,并引进新一代

KAY-5500声谱仪,推动了声纹技术在办案实践中的应

用。我国司法声纹鉴定技术经过20年的发展,以公安部物

证鉴定中心、最高人民检察院检察信息技术中心、广东省

公安厅、司法部司法鉴定中心等为代表的司法鉴定技术水

平已经取得长足进步。

近年来在声纹自动识别领域,我国也涌现出国际一

流研发团队,已经具备开展国际前沿技术研究、引领声纹

信息在公安领域实现大范围使用的实力。二、声纹自动识别技术

(一)声纹技术发展及现状

(二)声纹自动识别技术20世纪40年代初,美国贝尔实验室发明了声谱仪,并

且首先开始了声纹鉴定技术研究工作,并于60~70年代取

得重要进展,取得99.65%的正确率。此后声纹鉴定逐渐成

为案件侦查的一个重要技术。

目前声纹鉴定技术分为专家鉴定和自动识别两大领

域。专家鉴定方面,主要采用语音学分析方法,应用语音

学及统计分析技术,通过语音工作站测量、分析说话人的

语音声学特征(如声源特征、发音时的声道形状特征、发

音时的口腔及双唇特征以及语音信号时变频谱特征等),

然后采用统计判别方法对说话人语音是否同一作出判定。

语音学分析法是目前国内外司法领域说话人普遍采用的方

法,我国开展声纹鉴定的机构绝大多数均采用此方法。

声纹自动识别也称语音信号处理法,其基本原理声纹自动识别技术与声纹库建设应用

李敬阳胡国平王莉

1.公安部物证鉴定中心2.智能语音技术公安部重点实验室3.安徽省语音信息安全重点实验室122312

摘要:

关键词:本文首先简述声纹自动识别技术,接下来围绕声纹库建设应用的核心需求和技术要点,对声纹库建设所涉及的声纹

210981038_基于SpeechBrain_的语音识别在语音问答中的应用探索

210981038_基于SpeechBrain_的语音识别在语音问答中的应用探索

图源网络1 概述

语音识别技术,也称自动

语音识别Automatic Speech

Recognition(ASR),是以语音为研究

对象,通过语音信号处理和模式识别

让机器自动识别和理解人类口述的语

言,从而把语音信号转变为相应的文

本或命令,是实现人机交互的重要桥

梁。语音识别包括两个步骤:训练和

识别。训练是指对收集到的海量语音

数据集通过信号处理和知识挖掘获取

“声学模型”和“语言模型”过程。

识别则是通过进行端点检测、降噪、

特征提取,利用训练好的“声学模型”

和“语言模型”对用户说话的特征向

量进行统计模式识别,也称为解码过

程,从而得到语音中包含的文字信息。基于SpeechBrain的语音识别在语音问答中的应用探索

李丹1,2(1桂林师范高等专科学校,广西 桂林 541199;2桂林信息科技学院,广西 桂林 541004)

作者简介:李丹,硕士,高级实验师,研究方向为计算机应用技术。基金项目:2019年度广西高校中青年教师科研基础能力提升项目

(2019KY1032)。语音识别技术方案大多都是以语音为

基础的,包括发音模型,声学模型和语言

模型等。语音识别模型历经三个阶段,从

最初的基于GMM-HMM的模型,发展到

基于DNN-HMM深度神经网络模型,再

到现在的端到端语音识别模型。常见的端

对端模型有CTC、RNN-T、atttention-

based encoder-decoder、LAS等模

型。语音识别技术的发展,是人工智能改

变大众生活的重要一环,其识别率越来越

高,应用领域也越来越广泛。文章基于

SpeechBrain语音识别在语音问答中的

应用进行探索,取得一定效果。

2 SpeechBrain语音

识别简介

开发者常用的语音工具主要有 Kaldi、ESPNet、CMU Sphinx、

HTK 等,它们各有各的不足之处。比

如Kaldi依赖大量的脚本语言,其核心

算法是用 C++ 编写的,当需要改变各

种神经网络结构时,开发者往往调试起

来非常困难和复杂。秉承着让语音开发

声纹判断在电话系统中的应用

声纹判断在电话系统中的应用

声纹判断在电话系统中的应用

导语

本文介绍58二手车使用声纹技术骚扰电话甄别方面所做的一些探索、应用和实践,希望对大家有所帮助和启发。

背景

二手车作为主要车辆信息发布平台,线上看车时大家了解二手车行情的一个重要渠道。随着二手车在线帖子数量的不断增长和用户量不断增加,大量在线展示电话数据就成了泄露个人信息一个切口,为保护用户的隐私电话,二手车技术团队自研了一套电话转接系统,用转接号码替换用户真实电话。随着技术更新迭代,电销机器人的出现,为客服工作节省人力成本的同时,以为我们平台带来一些烦恼。这种利用机器合成或是人工录音方式,通过批量电话,低成本的获取用户真实号码,多数用户在不知情的情况下把信息泄露了。我们还发现同一个用户会在一段时间内连续接到这类电话,可能用户会使对我们平台产生不信任感,影响二手车平台的价值输出。为了应对这类问题,二手车技术团队自主研发声纹识别工具,对电销号码进行拦截,保护用户信息。

系统介绍

语音识别与声纹识别有相似的之处,都是对采集到的声音信号做处理,提取特征并建立模型,然后做出判断。不同的是声纹识别目的是识别出说话人的身份,是一种生物特征的识别。半固定文本,SV(Speaker Verification)判断,确认某段语音是否是指定的某个人所说的,是“一对一判别”问题。人在将话时使用的发声器官在尺寸和形态方面每个人的差异很大,所以任何两个人的声纹图谱都有差异,主要体现在:共鸣方式特征、嗓音纯度特征、平均音高特征和音域特征。不同人的声音在语谱图中共振峰的分布情况不同,声纹识别正是通过比对两段语音的说话人在相同音素上的发声来判断是否为同一个人。 图1(声谱图)

我们遇到的问题是,一批电话号码使用相同录音,接通电话后使用设定好的录音问题与用户进行对话,进而向用户索要个人电话号码,这时不知情的用户可能就会把电话暴露给对方了。这些主叫号码在话单中出现次数并无规律,使用统计较难找出多数的电销号码,也有一定的误判概率,统计结果的每一段录音需要人去听,完成这项工作的成本较高,也有较大时间滞后性。我们使用人工加机器学习的方式提升拦截效率和拦截量,同时降低误判率。人工统计发现问题电话,用这种方式选取训练用的语料录音,用深度学习生成分类模型,用于判断电话录音是否是问题电话,如果符合问题电话特征,讲主叫号码放入黑名单,用于呼入拦截判断。目前的流程属于后置判断,通过对已有电话录音的分析,判断主叫电话是否应该被拦截。如果发现新录音,再循环上述流程。我们研发的声纹识别工具有三部分组成:模型文件系统,存储不同阶段获得的模型,进行模型训练。API,对外提供识别能力的接口,识别结果作为人工标记部分的输入。人工标记,把未识别(识别结果是-1)或识别错误(与统计结果不符)的数据进行人工标记。 图2(系统构成图)

基于声纹识别技术的身份验证系统设计与实现

基于声纹识别技术的身份验证系统设计与实现

基于声纹识别技术的身份验证系统设计与实现

声纹识别技术是一种通过分析人的语音特征来进行身份验证的先进技术。基于声纹识别技术的身份验证系统不仅可以增强安全性,还可以提供更好的用户体验。本文将探讨基于声纹识别技术的身份验证系统的设计与实现,并讨论其应用前景和挑战。

首先,基于声纹识别技术的身份验证系统的设计需要包括以下几个关键步骤:数据采集、特征提取、比对和决策。

数据采集是系统设计的第一步。在这一阶段,需要对用户的声音进行录制。为了保证系统的准确性和可靠性,应当确保采集到的语音数据覆盖用户不同的发音、语速和语调。此外,为了避免后续的杂音和不必要的干扰,数据采集应该在相对安静的环境中进行。

特征提取是身份验证系统的核心步骤。在这一阶段,系统需要将采集到的语音数据转化为可供比对的特征向量。常用的特征提取方法包括基于Mel频率倒谱系数(MFCC)和线性预测编码(LPC)的方法。这些方法能够提取出声音的频率和幅度特征,进而构建声纹模型。 比对是身份验证系统的关键步骤。在这一阶段,系统需要将用户的声纹特征与事先存储的模板进行比对。比对过程可以使用传统的模式匹配算法,如动态时间规整(DTW)或基于高斯混合模型(GMM)的算法。比对结果将决定用户是否被认证通过。

决策是身份验证系统的最后一步。根据比对的结果,系统需要进行决策,判断用户是被认证通过还是被拒绝。为了提高决策的准确性,系统可以设置一个阈值,如果比对得分超过这个阈值,则认为身份验证通过。当然,为了避免误判或拒绝合法用户的情况,系统还应该考虑设置一个容错范围。

基于声纹识别技术的身份验证系统的实现需要考虑到以下几个方面的问题:安全性、可靠性和实时性。

安全性是系统设计中最重要的考量因素之一。为了保护用户的隐私和数据安全,声纹特征应该进行加密存储和传输。此外,系统设计应该考虑到声纹模板的保护,防止被黑客盗取或恶意使用。

可靠性是系统设计中另一个关键因素。为了保证声纹识别的准确性和稳定性,系统需要具备高度的鲁棒性。这可以通过使用大量的训练样本和优化的特征提取算法来实现。此外,系统还应该能够应对噪声和不良环境的干扰,以保证识别的可靠性。

浅议声纹鉴定中噪声对语音频谱特征的影响及降噪处理

浅议声纹鉴定中噪声对语音频谱特征的影响及降噪处理

浅议声纹鉴定中噪声对语音频谱特征的影响及降噪处理

林暧辉;张伟颂;徐毓文

【期刊名称】《黑龙江科技信息》

【年(卷),期】2015(000)036

【摘 要】在介绍噪声特性的基础上探讨声纹鉴定中噪声对语音频谱特征的影响,及常用降噪方法.噪声对语音的基音频率、共振峰频率等会产生不利干扰,干扰程度与噪声强度有关.正确认识噪声对语音的影响,能便于在声纹鉴定中合理判断检材语音与样本语音的差异是本质差异还是噪声影响差异.

【总页数】2页(P129-130)

【作 者】林暧辉;张伟颂;徐毓文

【作者单位】广东省广州市公安局刑事技术所,广东广州510030;广东省广州市公安局刑事技术所,广东广州510030;广东省广州市公安局刑事技术所,广东广州510030

【正文语种】中 文

【相关文献】

1.浅谈声纹鉴定中语音样本的提取 [J], 谭超英

2.广州话语音声纹鉴定中的量化分析研究 [J], 李康生;苌伟力;李敬阳;熊志强;麦耘;余锦华;杨维权;贾笑玲;禤英韶;王莉

3.降噪处理及其对语音的影响 [J], 卞新伟;施少培;杨旭;陈晓红;奚建华;孙维龙;徐彻;钱煌贵 4.数字录音笔的音频特性对声纹鉴定中主要声学参量的影响 [J], 吴新原

5.人体生理信息的语音表征在声纹鉴定中的应用 [J], 耿浦洋;施少培;郭弘

因版权原因,仅展示原文概要,查看原文内容请购买

声纹鉴定技术研究——声纹鉴定技术综述

声纹鉴定技术研究——声纹鉴定技术综述

声纹鉴定技术研究——声纹鉴定技术综述

王英利;李敬阳;曹洪林

【期刊名称】《警察技术》

【年(卷),期】2012(000)004

【摘 要】声纹鉴定是为审判活动提供证据、为侦查活动提供线索的一种专门技术手段。声纹鉴定的主要内容有:语音同一认定、语音人身分析、录音真实性(完整性)检验、音源同一认定、录音器材鉴定、噪声分析、提高录音信噪比和语音内容辨识。语音同一认定的基本方法包括语音学分析法、语音信号处理法和综合方法。录音真实性(完整性)检验的基本方法包括听觉检验方法、频谱分析方法和数据分析方法。业内在声纹鉴定的称谓问题和语音同一认定结论的表述问题上存在不同观点。

【总页数】4页(P53-56)

【作 者】王英利;李敬阳;曹洪林

【作者单位】广东省公安司法鉴定中心;公安部物证鉴定中心;中国政法大学证据科学研究院

【正文语种】中 文

【中图分类】TN912.12

【相关文献】 1.声纹鉴定技术在刑事案件侦查中的应用2.声纹鉴定技术在确定银行客户存款金额中发挥的作用3.基层公安机关声纹鉴定语音检材和样本提取技术4.浅谈声纹检验鉴定技术5.情感语音合成技术或对声纹鉴定准确性产生影响

因版权原因,仅展示原文概要,查看原文内容请购买

  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
相关文档
最新文档