印刷体数字识别方法的研究---周初洪

中国仿真科技论坛电子期刊 NO.9

1 印刷体数字识别方法的研究

周初洪

(上海交通大学医学院资产管理处,上海,2006.2)

摘要:在信息化飞速发展的今天,光学字符识别是一个重要的信息录入与信息转化的手段。其中数字的识别有着非常广泛的应用。本文中作者结合工作实际,分别分析了十个阿拉伯数字的不同特征,设计了具有通用意义的可能性,着重研究探讨该技术的应用可行性,并且尝试将向其他方面推广该技术。

本文首先探讨数字识别技术的现实意义,然后转向技术层面,重点研究图像处理、特征识别、算法推敲等环节。在特征识别技术中提出了“伤口”算法。

在结合相关硬件进行的实际操作中,识别效果良好。

关键词:OCR、数字识别、编号扫描、图像处理

Research of Printed Digit Recognition

ZHOU Chu-hong

(Asset Dept , Medical College of Shanghai Jiao Tong University, Shanghai, 2006.2)

ABSTRACT: OCR(Optical Character Recognition) has become one of the important method in

gathering information and information transformation. Printed digit recognition has a promising

business feature in many fields in society. The author found something in practice, analyzed the

different characteristic of ten Arabic numerals respectively, designed to the possibility of the in

general use meaning, emphasizing that technical applied possibility of the research study, and

trying to expand that technique toward other aspects.

This text inquiries into numeral recognition to realistic meaning first, then turns to the

technique level, the point is to research picture processing, characteristic identification and

recognition, calculate way deliberation etc. Put forward "wound" calculate way in the

characteristic identification.

We have got a good result combined with related hardware on the database of MNIST and

practice.

Key Words: OCR printed digit recognition image processing

中国仿真科技论坛电子期刊 NO.9

2 1 绪论

1.1 问题的由来

作为光学字符识别技术(Optical Character Recognition, 简称OCR)的一个分支,数字识别(Numeral Recognition),它的研究对象是:使计算机能够自动识别写在传统载体(纸、标牌等)上的数字。

在条形码普遍使用和条码扫描技术日益成熟的今天,脱机印刷体数字的识别仍然具有非常重要的意义和不可代替的作用,比如:邮政编码、统计报表、银行票据、车牌监管、纸币编码识别等等。近几年,我院开始大力推广设备管理的网络化在很大程度上要依赖原始数据信息的输入,如果能通过对设备标牌上编码的识别技术带动设备普查、设备变更等日常工作的同步数字化,无疑会促进这一项目的进一步发展。在以往浩如烟海的标牌中虽然没有使用条形码,但是却有着非常规范的印刷体设备编码,所以作者就开始着手利用现有资源,尝试着用OCR技术组建设备管理网络。

图1.1 两种款式的现役设备编号标牌

1.1.1 传统设备检查中普遍存在的问题

1、设备较少的部门实现了设备普查,设备多的部门只能抽查。而抽查率由于人力和时限等原因普遍都不高。

2、各部门的设备保管员与设备检查人员重复检查。设备检查前一般都要求各保管员事先进行自查,然后我们再复查。自查的目的是让各保管员熟悉设备状况和安置地点,这样可以便于复查。但现在复查的时候还是需要双方人员反复走。这样既有碍各部门人员的正常工作,也极大地降低了检查效率,间接伤害了保管员的工作热情。

3、一些非常个人化的物品,比如笔记本电脑、移动硬盘等,往往检查不到。保管员对一些敏感人员也有难言之隐。

4、传统的账本正逐步取消,原先的“帐物卡”体系正向“网物卡”的现代管理模式过渡。管理模式的变革要求我们开发出一套全新的设备检查方式,与时俱进,克服上述不足,适应科学的、以人为本的管理理念。 中国仿真科技论坛电子期刊 NO.9

3 图像采集 预处理

1.1.2 设想方案

1、开发设计手持式设备检查仪。它能像条形码阅读器那样识别阅读标签上的设备编号,并能通过USB等接口与电脑相连。

2、检查某部门前一段时间(具体看该部门设备数量多少)把手持检查仪下发给该单位,让保管员拿着它先自查。这样一些正常、完好的设备大都能覆盖。有些未贴标牌、标牌残损或者手工书写的情况就能暴露出来。

3、自查结束后我们进驻该部门进行复查。从检查仪上导出已检查的设备编号,对照网上账本,对其中的一部分可以再次复查,重点对没有检查到的设备进行检查,重点听取保管员对某些设备出现问题的描述,重点填写好大型设备效益表等。

1.1.3 预期效果

1、设备检查率大大提高。在人力投入增加不多的情况下,实现了精细管理,更好了适应了设备众多化、复杂化的趋势。

2、认真的考核促进科学的管理。考核制度的变革可以引发管理模式的进步。比如规范贴牌、防止标牌污损等。

3、由于设备检查是一年一度的,所以作为管理部门,我们有半年左右的时间进行前期准备,包括检查仪的开发和适应性校验,对各部门保管员的培训等等。

4、对一些特殊设备,如空调或无法贴牌的移液器、狗笼兔笼等还是需要实地查看的。对个人化很强的物品,可以让保管员在自查阶段找到,这也比在几次复查内获得的效果好。

5、检查仪的识别率做不到百分百,面对数以万计的设备编号,它也许会出现比例很小的识别错误或者无法识别的情况。这可能缘于它自身,也可能是标牌污损或者使用不当。这时也需要一定的人工介入。

1.2 OCR方法简介

对多数OCR系统,其一般步骤如图1.2所示。

图1.2 一般识别过程

1、图像采集阶段,是取得要识别所要的原材料,即各个字符集的图像。主要利用光学仪器,如照相机、摄像机、扫描仪等等。

2、预处理阶段,是对上述采集到的图像进行识别前所必要的一些处理工作,主特征提取 识别判断 识别后处理 中国仿真科技论坛电子期刊 NO.9

4 要包括:对原始图像进行几何校正、去噪声、复原、二值化,对二值图像进行滤波处理,单字的分割、笔画提取等等,必要时修补缺口。

3、特征提取阶段,经处理过的图像包括很多特征,识别时就需要这些利用经过挑选、行之有效的特征。

4、在识别判断阶段,有些特征无法直接为计算机接受,所以需要经过特定处理。

5、识别后处理阶段,对错误识别、拒绝识别的部分进行挽救性识别。

1.3 阿拉伯数字识别方法简介

本文主要着眼于从0到9十个阿拉伯数字的识别,因此在此简单介绍一下目前流行的数字识别方法。在过去几十年中,人们提出了许多方法用于阿拉伯数字的识别,这些方法可分为两类,即所谓的全局方法和结构方法。

1、模板匹配法

2、从像素点统计分布的角度来抽取特征,主要方法有采样点方法,矩方法、特征轨迹方法等。这类方法能有效应付扭曲和变形的字符、有较好的稳定性、计算复杂度小,但是在一般情况下,特征的模板难以构成。

3、用全局变换和级数展开的方法抽取特征。此法可以减少特征向量的维数,且对于一些全局变量的形变,如平移和旋转,具有一定的不变性。这类方法主要有:Fourier变换、Walsh变换、Harr变换、Hadamard变换、K-L变换、Hough变换以及投影变换等。虽然一般而言此法的计算量较大,单特征抽取和模板生成都比较简单。

对结构方法而言,它一般是通过分析字符的轮廓或骨架来取得字符的几何和拓扑特征,它所关注的特征包括字符笔画端点,交叉点,笔画的交角,凹凸性等。这类方法对数学要求较少,对各种特征的定义和获取大都依赖研究者的直觉和经验,因此这一领域还是开放的,研究者可以不断提出新的特征和方法以达到更好的识别效果。一般来说,结构方法有较高的识别速度,而且对于字符的变形具有良好的抗干扰能力,同时对字符的旋转,平移和伸缩具有较好的稳定性,但是这类方法的特征抽取过程比较复杂,由于特征定义和抽取都直接依赖于研究者的直觉,对图像预处理要求较高。

对于印刷体阿拉伯数字的识别,上述两类方法都各自的优缺点。结构方法对细节变化较为敏感,对噪声大的图像识别率不高,同时结构法一般使用句法分类器进行分类,由于训练样本的限制,总有部分待识字符无法分类,拒识率高但是错误率很低。此法一般适用与印刷体数字或者规范数字的识别。统计方法对噪声不敏感,在噪声较大时还是有较好的稳定性,但这类方法对图像细节上的细微差别不灵敏,难以区分字符之间的细微差异,因此在待识字符比较相似时容易产生错误识别而且资源消耗先对前者较大。因此对于规范的印刷体数字,第一种方法比较合适,所谓宁愿拒绝识别也不要乱识别,没有识别的数字可以通过人工的方法再识别,但一旦误识别的就可能无法挽回了。

另外神经网络的方法也渐渐在数字识别领域得到广泛应用。神经网络方法的优点是:特征抽取较为简单,在神经网络的结构确定以后由通用的软件用于训练和识别,可通过更大的训练样本集来取得更高的识别率,同时由于它使用了统计性的特征,因此和统计方法一样有较高的抗干扰能力,又由于神经网络变换的非线性,使得它也和结构方法一样能区别出不同类别之间的细微差别。因此在实用

合集下载

印刷体数字快速识别算法在身份证编号数字识别中的应用

印刷体数字快速识别算法在身份证编号数字识别中的应用

印刷体数字快速识别算法在身份证编号数字识别中的应用

严国莉;黄山;李岱璋;尚建华

【期刊名称】《计算机工程》

【年(卷),期】2003(029)001

【摘 要】探讨了一种印刷体数字快速识别的算法及该算法在身份证图像编号数字识别中的应用,该算法根据印刷体数字字符结构,抽取数字特征;然后根据这些特征构造编码器,进行编码识别.实验表明该算法速度快,精度高,抗干扰性强.

【总页数】2页(P178-179)

【作 者】严国莉;黄山;李岱璋;尚建华

【作者单位】四川大学电气信息学院自动化系,成都,610065;四川大学电气信息学院自动化系,成都,610065;四川大学电气信息学院自动化系,成都,610065;四川大学电气信息学院自动化系,成都,610065

【正文语种】中 文

【中图分类】TP312

【相关文献】

1.切线距离在印刷体数字识别中的应用 [J], 谭锐;宣国荣

2.印刷体数字识别研究与实现 [J], 王育卜;白宝兴

3.基于投影方法的快速印刷体数字识别 [J], 吴迪;金长龙

4.基于神经网络的印刷体数字识别算法的研究 [J], 赖媛媛;原虹

5.一种鲁棒性的印刷体数字识别算法 [J], 滕书华;孙即祥;邵晓芳 因版权原因,仅展示原文概要,查看原文内容请购买

印刷体汉字识别技术的研究毕业设计 精品

印刷体汉字识别技术的研究毕业设计 精品

i 学校代码:10259

上海应用技术学院

学士学位论文

题 目: 硬刷题汉字识别技术的研究

专 业: 电气工程及其自动化

班 级: 09103212

姓 名: 沈佳骏

学 号: 0910321220

指导教师: 陈岚

二O一三年 六月六日

ii 印刷体汉字识别技术的研究

摘要:印刷体汉字识别技术是一种高速、自动的信息录入手段,成为未来计算机的重要职能接口,还可以作为办公自动化、新闻出版、机器翻译等领域的理想输入方式,有着广泛的应用前景。汉字识别的最终目的是使中文信息能更自然,更方便地输入计算机,以便于进一步处理。实际生活中,大量的书信、报纸、杂志内容需要输入计算机,这就是印刷体汉字识别要解决的问题。本文首先在第一章就汉字识别研究的意义和背景以及对目前存在的问题作了综述。第二章对印刷体汉字的识别过程进行基本概述。第三章对印刷体汉字识别作了详细阐述,论述了印刷体汉字识别的原理和预处理、特征抽取与分析、后处理过程;分析了统计模式识别方法、 结构模式识别方法以及人工神经网络模式识别方法;第四章用Matlab对系统进行了仿真;最后在第五章进行全文总结并预测了汉字识别技术研究今后的发展方向。

文档位图的印刷体数字智能检测与识别(提交版)

文档位图的印刷体数字智能检测与识别(提交版)

班 级 020651

学 号 02065008

本科毕业设计论文

题 目: 文档位图的印刷体数字智能检测与识别

学 院: 电子工程学院

专 业: 智能科学与技术

学生姓名: 张若愚

导师姓名: 钟 桦

毕业设计(论文)诚信声明书

本人声明:本人所提交的毕业论文《文档位图的印刷体数字智能检测与识别》是本人在指导教师指导下独立研究、写作的成果,论文中所引用他人的无论以何种方式发布的文字、研究成果,均在论文中加以说明;有关教师、同学和其他人员对本文的写作、修订提出过并为我在论文中加以采纳的意见、建议,均已在我的致谢辞中加以说明并深致谢意。

本论文和资料若有不实之处,本人承担一切相关责任。

论文作者: (签字) 时间: 年 月 日

指导教师已阅: (签字) 时间: 年 月 日

西 安 电 子 科 技 大 学

毕业设计(论文)任务书

学生姓名 张若愚 学号 02065008 指导教师 钟桦 职称 副教授

学院 电子工程学院 专业 智能科学与技术

题目名称 文档位图的印刷体数字智能检测与识别

任务与要求

字符识别是模式识别学科的一个传统研究领域。随着计算机硬件技术的发展,相关设备价格的迅速下降以及性能的迅速提升,人们希望计算机能听懂人类的自然语吉,看懂人们所写的各种文字,甚至理解人们此刻的心情。人类的这些需求都给模式识别及人工智能的应用提供了动力。

本课题主要研究二值文档图像中的印刷体数字检测与识别技术。利用智能方法对二值图像中的文本进行分割,对印刷体数字进行检测并完成识别的目的。要求精通c,matlab等语言,能够对典型算法进行软件仿真;对仿真结果进行分析讨论,指出优缺点,提出改进的思路,并对未来发展进行展望。

一种快速有效的印刷体汉字识别方法

一种快速有效的印刷体汉字识别方法

一种快速有效的印刷体汉字识别方法

倪桂博;张国立

【期刊名称】《华北电力大学学报(自然科学版)》

【年(卷),期】2008(035)003

【摘 要】笔划代表着汉字的内部特征,笔划穿越次数是对笔划进行全穿越,反映了汉字的整体特征,全穿越在粗分时区分汉字的能力不是太强,增加了二级识别的工作量.除了提取笔划全穿越外还提取笔划半穿越,并把半穿越的次数进行重新组合形成新的特征值.把全穿越和半穿越结合起来作为汉字的特征值,对汉字进行粗分,粗分不能区分的汉字,采用四个角的能量值密度特征对汉字进行细分.实验结果表明了该方法的有效性.与单独使用全穿透方法相比,提出的方法在粗分时区分汉字的能力增强,减少了二级识别的工作量.

【总页数】4页(P107-109,112)

【作 者】倪桂博;张国立

【作者单位】华北电力大学计算机科学与技术学院,河北,保定,071003;华北电力大学数理学院,河北,保定,071003

【正文语种】中 文

【中图分类】TP31

【相关文献】

1.一种用于表格处理的印刷体汉字识别方法 [J], 唐国维;刘显德;任庆东;邹德春;李凉 2.一种快速有效的印刷体文字识别算法 [J], 任金昌;赵荣椿;张炜

3.一种有效的雷达信号快速识别方法 [J], 杨建;周涛;何梓昂

4.一种复杂背景下的印刷体数字快速识别方法 [J], 孟岩;熊璋;李超

5.一种手写印刷体汉字识别方法 [J], 朱学芳;毕厚杰

因版权原因,仅展示原文概要,查看原文内容请购买

一种鲁棒性的印刷体数字识别算法

一种鲁棒性的印刷体数字识别算法

一种鲁棒性的印刷体数字识别算法

滕书华;孙即祥;邵晓芳

【期刊名称】《光学与光电技术》

【年(卷),期】2005(3)6

【摘 要】针对复杂版面中具有大偏转角度的数字型字符识别问题,提出了一种识别算法。该算法充分利用笔划拐点等结构特征构造编码器进行字符识别,无需事先校正并具有平移、旋转不变性。实验结果表明,该方法具有速度快、精度高、抗干扰性强的特点。

【总页数】4页(P12-15)

【关键词】字符识别;拐点;旋转不变件;编码器

【作 者】滕书华;孙即祥;邵晓芳

【作者单位】国防科学技术大学电子科学与工程学院

【正文语种】中 文

【中图分类】TP391.4

【相关文献】

1.一种新的鲁棒自适应广义预测控制算法及鲁棒性分析 [J], 周德云;佟明安

2.一种基于遗传算法的鲁棒性数字图像水印算法 [J], 焦春燕;熊吉忠

3.一种具有强实时性、强鲁棒性的图像匹配算法* [J], 李兵;刘磊;魏志强

4.一种对FAST角点算法加强鲁棒性改进的M-FAST算法 [J], 张秋豪;张徐杰

5.一种新的H_∞鲁棒自校正控制算法及鲁棒性分析 [J], 顾兴源;庞士宗 因版权原因,仅展示原文概要,查看原文内容请购买

印刷体数学字符根号的识别算法

印刷体数学字符根号的识别算法

上 海 工 程 技 术 大 学 学 报

JOURNAL OF SHANGHAI UNIVERSITY OF ENGINEERING SCIENCEVol

34 No

2

Jun.

2020第34 卷第2 期

2020年6月

文章编号

:1009 - 444X(2020)02- 0178 - 03

印刷体数学字符根号的识别算法

吴家明

,李家豪

,包庆鹏

,方 涛

(上海工程技术大学数理与统计学院

,上海201620

)

摘要

:针对数学公式识别难问题,基于印刷体根号的几何特征,定义首一特征线概念,并据此给

出印刷体数学公式中根号的识别算法,基于Matlab软件编程实现该算法.结果表明该算法能有

效识别一维印刷体数学公式中的根号,识别正确率达到100%.

关键词

:图像识别;数学公式;文本检测;字符分割

中图分类号

:O13 文献标志码

:A

Recognition Algorithm of Printed Mathematical Character Square Root

WU J0m)g ,

LI Jiah00 ,

BAO Qingpeng ,

FANG Tdo

(School of Mathematics, Physics and Statistics, Shanghai Universty of Engineering Science, Shanghai 201620, China)

Ab tract:Aimingatthedificultproblem of mathematical formula recognition theconceptofthefirst

featureline wasdefined based on the geometric features of printed square root

$and the recognition

algorithm of square rootin printed mathematical formula was given Based on Matlab software

印刷体数学公式识别系统的设计与实现——分割识别与重组

印刷体数学公式识别系统的设计与实现——分割识别与重组

一、图像分割

图像分割是将数学公式图像分割成字符或子公式的过程。常用的图像分割方法有基于阈值的分割和基于图像处理的分割。

基于阈值的分割方法,首先将图像转化为二值图像,然后根据像素点的亮度值进行分割。可以使用Otsu方法或自适应阈值方法确定分割阈值。分割后,可以利用形态学操作进行清理和结构化。

基于图像处理的分割方法,可以使用边缘检测算法(如Sobel算子、Canny算子)来检测边缘,并根据边缘进行分割。也可以使用基于区域的方法,如区域生长算法、区域分裂合并算法等。

二、字符识别

字符识别是将分割出的字符图像转化为对应的字符的过程。常用的字符识别方法有基于特征的方法和基于深度学习的方法。

基于特征的方法,首先通过图像预处理获得字符的特征向量,如HOG特征、SIFT特征等。然后利用分类算法如支持向量机(SVM)、k最近邻(KNN)等进行分类识别。

三、公式重组

公式重组是将识别出的字符按照其正确顺序组合成完整的数学公式的过程。常用的公式重组方法有基于语法的方法和基于排列组合的方法。

基于语法的方法,首先将字符按照其上下文关系进行分组。可以利用文法规则或状态机模型对字符之间的关系进行建模,然后根据模型进行分组,得到子公式。最后,根据公式的结构关系进行优化和重组,得到完整的数学公式。

基于排列组合的方法,首先对字符进行排列组合,生成所有可能的子公式。然后,通过公式检验器对生成的子公式进行验证,剔除不符合数学规则的子公式。最后,通过评估函数对剩余的子公式进行分数计算,并选择得分最高的子公式作为识别结果。

总结起来,印刷体数学公式识别系统的设计与实现主要涉及图像分割、字符识别和公式重组三个方面。在图像分割方面,可以使用基于阈值的方法或基于图像处理的方法进行分割。在字符识别方面,可以使用基于特征的方法或基于深度学习的方法进行识别。在公式重组方面,可以使用基于语法的方法或基于排列组合的方法进行重组。这些方法可以互补使用,提高印刷体数学公式识别的准确性和鲁棒性。

基于Django印刷体维吾尔文识别系统的设计与实现

第53卷第3期郑州大学学报(理学版)Vol.53No.3 2021年9月J.ZhengzhouUniv.(Nat.Sci.Ed.)Sep.2021

收稿日期:2020-08-25基金项目:国家自然科学基金项目(61433012);国家“973”重点基础研究计划基金项目(2014CB340506)。作者简介:熊黎剑(1996—),男,硕士研究生,主要从事OCR研究,E-mail:xiong_lijian@;通信作者:吾守尔·斯拉木(1941—),男,教授,中国工程院院士,主要从事多语种信息处理研究,E-mail:wushour@。基于Django印刷体维吾尔文识别系统的设计与实现

熊黎剑1,2,3, 吾守尔·斯拉木1,2,3, 许苗苗1,2,3

(1.新疆大学信息科学与工程学院 新疆乌鲁木齐830046;2.新疆多语种信息技术实验室 新疆乌鲁木齐830046;

3.新疆多语种信息技术研究中心 新疆乌鲁木齐830046)

摘要:光学字符识别(opticalcharacterrecognition,OCR)技术在图书数字化、文献管理等诸多领域得到了广泛应用,

而相比于已十分成熟的中文、英文印刷体识别系统,小文种(维吾尔文)印刷体识别还有研究空间和实际应用需求。针对传统识别方法特征表示不足等问题,结合日益兴起的深度学习技术,采用Python语言编程,选用经改进的卷积循环神经网络作为识别算法核心,并利用Django设计系统框架。实验表明,印刷体维文识别系统的精度达到95.7%,平均速度达到12.5fps。该系统实现了端到端的维文整词识别。

关键词:卷积循环神经网络;门控循环单元;连接时序分类器;印刷体维吾尔文中图分类号:TP391 文献标志码:A 文章编号:1671-6841(2021)03-0009-06DOI:10.13705/j.issn.1671-6841.2020277

0 引言

基于PCA变换和k近邻法印刷体数字图像识别

基于PCA变换和k近邻法的印刷体数字图像识别

摘要:随着当今社会的日新月异及信息化进程的快速发展,我们如今正被数字化时代笼罩着,数字正朝着庖代我们对话语和文字的语言表达、记忆的方向进展。本文通过pca变换和k近邻法对数字图像识别进行研究,比较了bayes方法、最近邻法和k-近邻法的识别效率,最后通过pca变换和k-近邻法的印刷体识别算法的系统设计实验,解释了k-近邻法的识别优势。

关键词:pca变换;k近邻法;数字识别

中图分类号:tp391

1pca的基本思想

pca是采取一种数学降维的方法,找出几个综合变量来代替原来众多的变量,使这些综合变量能尽可能地代表原来变量的信息量,而且彼此之间互不相关。这种将把多个变量化为少数几个互相无关的综合变量的统计分析方法就叫做主成分分析或主分量分析。

pca所要做的就是设法将原来众多具有一定相关性的变量,重新组合为一组新的相互无关的综合变量来代替原来变量。通常,数学上的处理方法就是将原来的变量做线性组合,作为新的综合变量,但是这种组合如果不加以限制,则可以有很多,应该如何选择呢?如果将选取的第一个线性组合即第一个综合变量记为f1,自然希望它尽可能多地反映原来变量的信息,这里“信息”用方差来测量,即希望var(f1)越大,表示f1包含的信息越多。因此在所有的线性组合中所选取的f1应该是方差最大的,故称f1为第一主成分。如果第一主成分不足以代表原来p个变量的信息,再考虑选取f2即第二个线性组合,为了有效地反映原来信息,f1已有的信息就不需要再出现在f2中,通过数学表达就是要求cov(f1,f2)=0,称f2为第二主成分,依此构造出第三、四……第p个主成分。

2k近邻法

2.1模式识别方法

模式识别是指对事物、现象的相关信息进行分析、处理从而进行有效的辨认、描述的过程,首先,选择一定的样本,结合样本间的相似度设计对识别样本进行分类决策的分类器。由预处理、模式特征或基元选择、识别组成,系统的简单框图如下图所示:

印刷体文字识别方法研究

西北工业大学硕士学位论文印刷体文字识别方法研究姓名:张炜申请学位级别:硕士专业:计算机应用技术指导教师:赵荣椿19990301摘要

《文字楚人类茨怠交滚爨垂簧手段,印别然汉字鼋}:{裂霹以有效黥提

高印刷资料的录入速度,它的突破会极大的促进全球的信息化进程。

本文逶邋对国内拜多静文字谬剩方法静深入磅究,结合爨】麓蒋汉字静

自身特点,提出了一种多级分类的综合统计识别方法。经过实验,取、得了令人满意的效采。P_,一一/一般的文字谚{别系绞出预处理、特征提取、模式匹配和后处理四

大模块组成。本文在许多关键技术方面提出了自己的方法:酋先,在

联处矬除段,晨嬲一‘秽麓棼毂颇斜较澎算法,若姆文字归~怨为36t36

点阵而爿;是传统的48+48点阵,宵效的减少了计算量,且几乎不会造

黢罄{鬟奉麴降低;撬爨馥送懿基予羚攫豹筠…纯,避免了笔爨浚失;

其次,在特征提取时,采用一种改进的粗外围特征,并进行二重分割,

充分傈涯特征的高度稳定经;采用162维平均线密度特蔹斓于鲴分类:

第三,程模式躁配时,针对各级特点,分别采用绝对值距离、欧氏距

离、以及类似泼加权准则判别;最詹,在后处理阶段,根据语言、文

字学知谈,采躜字频艇投秘上”F文缝溷关系分烈处理。

关键词

文字识另(印刷体汉字识彬多级分影预处理,婶、Y《Nv"文字识别,印刷体汉字识别’、多级分类’,预处理,(行、

翔一纯V,二耄务彤耨鬣提醇羯爨准潮

<ABSTRAC零

Writtenlanguageisanimportantmeansofcommunication,recognitionof

machineprintedcharacterCallimprovetheefficiencyofmaterialinputcommendably,

thebreakthroughofitcanacceleratetheprocedureofworld’sinformationexchange,

Inthispaper,basedonthecharacteristicsofprintedcharacters,Weproposeamulti-

  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
相关文档
最新文档