基于matlab的文字识别算法-课程设计.doc
《基于matlab的文字识别算法-课程设计.doc》由会员分享,可在线阅读,更多相关《基于matlab的文字识别算法-课程设计.doc(20页珍藏版)》请在咨信网上搜索。
1、沈阳理工大学课程设计专用纸摘 要本课程设计主要运用MATLAB的仿真平台设计进行文字识别算法的设计与仿真。也就是用于实现文字识别算法的过程.从图像中提取文字属于信息智能化处理的前沿课题,是当前人工智能与模式识别领域中的研究热点。由于文字具有高级语义特征,对图片内容的理解、索引、检索具有重要作用,因此,研究图片文字提取具有重要的实际意义.又由于静态图像文字提取是动态图像文字提取的基础,故着重介绍了静态图像文字提取技术。随着计算机科学的飞速发展,以图像为主的多媒体信息迅速成为重要的信息传递媒介,在图像中,文字信息(如新闻标题等字幕)包含了丰富的高层语义信息,提取出这些文字,对于图像高层语义的理解、
2、索引和检索非常有帮助。关键字:文字识别算法;静态图像文字提取;检索I目录1 课程设计目的32 课程设计要求43 相关知识54 课程设计分析85 系统实现96 系统测试与分析176。1 文字识别算法仿真结果176。2 基于字符及单词的识别196。2。1 基于字符的识别196。2。2 基于单词的识别206。3 现存算法的问题216。3。1 大多文字识别方法依赖于人工定义的特征216。3。2 脱离上下文的字符识别易造成显著的歧义216。3。3 简单的单词整体识别有着较大的局限性226。3。4 训练样本制作繁琐227 参考文献23II1 课程设计目的图像文字提取又分为动态图像文字提取和静态图像文字提取
3、两种,其中,静态图像文字提取是动态图像文字提取的基础,其应用范围更为广泛,对它的研究具有基础性,所以本文主要讨论静态图像的文字提取技术。静态图像中的文字可分成两大类:一种是图像中场景本身包含的文字, 称为场景文字; 另一种是图像后期制作中加入的文字,称为人工文字,如右图所示。场景文字由于其出现的位置、小、颜色和形态的随机性,一般难于检测和提取;而人工文字则字体较规范、大小有一定的限度且易辨认,颜色为单色,相对与前者更易被检测和提取,又因其对图像内容起到说明总结的作用,故适合用来做图像的索引和检索关键字。对图像中场景文字的研究难度大,目前这方面的研究成果与文献也不是很丰富,本文主要讨论图像中人工
4、文字提取技术.静态图像中文字的特点静态图像中文字(本文特指人工文字,下同)具有以下主要特征:(1)文字位于前端,且不会被遮挡;(2)文字一般是单色的;(3)文字大小在一幅图片中固定,并且宽度和高度大体相同,从满足人眼视觉感受的角度来说,图像中文字的尺寸既不会过大也不会过小;(4)文字的分布比较集中,排列一般为水平方向或垂直方向;(6)多行文字之间,以及单行内各个字之间存在不同于文字区域的空隙。在静态图片文字的检测与提取过程中,一般情况下都是依据上述特征进行处理的。数字图象处理静态图像文字提取一般分为以下步骤:文字区域检测与定位、文字分割与文字提取、文字后处理。其流程如图所示。图1 静态文字处理
5、流程图2 课程设计要求在高速发展的计算机软硬件技术的支撑下,多媒体技术的发展非常迅速,计算机技术从传统的办公和计算逐渐向人工智能和数字娱乐发展。在人工智能技术中,对环境信息的拾取处理和响应显得尤为重要,其中文本信息占环境信息很大一部分,为了使人工智能系统更为完善,则需要系统能够像人眼一样对周围环境信息进行理解,尤其是环境信息中的文本信息。实验表明,人类日常生活中,50%以上的信息量来源于眼睛捕捉的周围环境的图像,人眼可以快速捕捉到图像中感兴趣的信息,而对于计算机来说,一幅图像仅仅是杂乱的数据,如何让计算机想人眼一样快速读取图像中的信息并进行分类及检索等相应处理,一直是多年来计算机视觉和模式识别
6、研究者们探索的问题,如果能很好解决这些问题,能给工业生产及国防科技带来巨大的改进.文字是信息存储和传递的重要载体,在很多由摄像设备拍摄的图片中,都存在或多或少的文字,比如路牌、店名、车站牌、商品简介等,识别图片中的文字对计算机理解图像的整体内容有非常重大的作用。如何将图片中的文字信息抽象出来形成具有完整语义的信息,再将其表达出来用于信息传递,从而辅助人类的生产和生活是研究计算机视觉的学者们多年来一直致力于解决的问题。研究如何对自然场景图片中的字符进行识别,提取出有用信息,在获取图片文本信息的各个领域都有极大的商业价值。场景文字识别在日常生活也有着重要的地位,例如车牌的识别,盲人对周边环境信息的
7、获取、图书馆管理的数字化和髙效化,以及网络中对指定的内容的图像和视频的检索等.自然场景文本识别,就是将提取出来的自然场景图片中的进行识别,提取出信息用于进一步的处理。在对场景文字识别的研究中,获取自然场景图片时候,由于背景物体、光线、阴影、拍摄角度引起的图片背景千变万化,摄像器材的精度、拍摄人员的技术等软硬件的不同为拍摄同样的自然场景图片也带来了相当大的差别,被拍摄的图片中包含的文字大小、颜色、书写风格的各不相同等因素都为自然场景文字识别的实现增加的相当的难度.需要对自然场景图片中的识别首先需要对图片中的文本进行定位,然后再对己经精确定位的图片进行识别.文本定位技术作为整个自然场景文本信息获取
8、系统中的基础技术,已经得到较好发展,相同地,文本识别技术在近年来也得到了比较好的发展,但是由于文本的复杂性和随机性,较文本定位技术来说,文本识别技术发展较为缓慢。3相关知识1. 在Matlab中调用i1=imread(8。jpg),可得到原始图像,如图所示:图2文字识别算法调制器模型 2。 调用i2=rgb2gray(i1),则得到了灰度图像,如图所示:图3 灰度图像调用a=size(i1);b=size(i2);可得到:a=3,b=2 即三维图像变成了二维灰度图像3。 调用i3=(i2=thresh);其中thresh为门限,介于图4所示之间图4 thresh门限值图5 取得二值得到二值图像
9、,如图所示:图6 二值图像4。 把二值图像放大观察,可看到离散的黑点 对其采用腐蚀膨胀处理,得到处理后的图像,如图所示图7 腐蚀膨胀处理后的二值图像可见,腐蚀膨胀处理后的图像质量有了很大的改观.横向、纵向分别的腐蚀膨胀运算比横向、纵向同时的腐蚀膨胀运算好上很多。5、对腐蚀膨胀后的图像进行Y方向上的区域选定,限定区域后的图像如图所示: 扫描方法:中间往两边扫。6、对腐蚀膨胀后的图像进行X方向上的区域选定,限定区域后的图像如图11所示: 扫描方法:两边往中间扫,纵向扫描后的图像与原图像的对照。7。 调用i8=(iiXY=1),使背景为黑色(0),字符为白色(1),便于后期处理。8。 调用自定义函数
10、(字符获取函数)i9=getchar(i8)。9、调用自定义的字符获取函数对图像进行字符切割,并把切割的字符装入一维阵列。 10.调用以下代码,可将阵列word中的字符显示出来.for j=1:cnum cnum为统计的字符个数subplot(5,8,j),imshow(wordj),title(int2str(j)); 显示字符 end11. 调用以下代码,将字符规格化,便于识别: for j=1:cnum wordj=imresize(wordj,40 40); %字符规格化成4040end 12. 调用以下代码创建字符集:code=char(由于作者水平有限书中难免存在缺点和疏漏之处恳请
11、读批评指正,。);将创建的字符集保存在一个文件夹里面,以供匹配时候调用.13. 字符匹配采用模板匹配算法:将现有字符逐个与模板字符相减,认为相减误差最小的现有字符与该模板字符匹配.图8 字符匹配也就是说,字符A与模板字符T1更相似,我们可以认为字符集中的字符T2就是字符A.经模板匹配。 14、调用以下代码,将字符放入newtxt。txt文本:new=newtxt,。txt; c=fopen(new,a+); fprintf(c,sn,Code(1:cnum)); fclose(c); 4 课程设计分析1、算法具有局限性.对于左右结构的字符(如:川)容易造成误识别,“川”字将会被识别成三部分。当
12、图片中文字有一定倾斜角度时,这将造成识别困难。2、模板匹配效率低。对于处理大小为mTImes;m的字符,假设有n个模板字符,则识别一个字符至少需要m&TImes;mn2次运算,由于汉字有近万个,这将使得运算量十分巨大!此次字符识 别一共花了2。838秒。3、伸缩范围比较小。对于受污染的图片,转换成二值图像将使字符与污染源混合在一起.对于具体的图片,需反复选择合适的thresh进行二值化处理,甚至在处理之前必须进行各种滤波。5 系统实现文字识别算法仿真代码如下:function Stroke= StrDetect01(LeftD,Y1,Y2,ST,PT) ST为结构阈值,为了指定高度和宽度结构变
13、化的不同SL=0;SR=0;SV=0;Count=0;PT=5; 突变的阈值Str=T; T表示结构未定,Str用于保存当前的基本结构Stroke=T; 用于保存基本结构Range=Y2-Y1+1; 字符的宽度或者高度for j=Y1:Y2 Count=Count+1; if (abs(LeftD(j))PT) if (LeftD(j)0) SR=SR+1; else SV=SV+1; end end else % 检测到突变的决策 if (Count=fix(Range/4)+1) % 设定字符轮廓可能发生的突变范围 if ((SL=3)&(SR=3)) Str=C; else if ((S
14、V=2(SL+SR)((max(SL,SR)3)|(min(SL,SR)2)) Str=V; else if (SLSR)((SL=0.5SV)&((SR(SR+SV))) Str=L; else if (SRSL)((SR=0。5SV)&((SL=1)|(SL(SR+SV)))) Str=R; else if (max(SL,SR)=3)&(min(SL,SR)=2) Str=C; end end end end end Stroke=Stroke Str; end if ((j=2+Y1)&((j=ST)&(SR=ST)) Str=C;else if ((SV=2(SL+SR)&(max(
15、SL,SR)3)(min(SL,SR)2)) Str=V; else if (SLSR)((SL=0.5*SV)&(SRSL)&(SR=0.5*SV)(SL=(SR+SV) Str=R; else if (max(SL,SR)=3)(min(SL,SR)=2) Str=C; end end end end endStroke=Stroke Str; function Numeral=Recognition(StrokeTop,StrokeLeft,StrokeRight,StrokeBottom,Comp) 采用四边的轮廓结构特征和笔划统计(仅针对 0 和 8)识别残缺数字 Comp 是用于识
16、别 0和8 的底部补充信息StrT=T;StrL=T;StrR=T;StrB=T;RStr=T; % 用于保存识别出的数字temp XT=size(StrokeTop);temp XL=size(StrokeLeft);temp XR=size(StrokeRight);%temp XB=size(StrokeBottom);for Ti=2:XT if (StrokeTop(Ti)=C) if (XL=2)&(XR=2)) if (Comp=3)(StrokeBottom(2)=C)&(StrokeLeft(2)=C)&(StrokeRight(2)=C) RStr=8; else RStr
- 配套讲稿:
如PPT文件的首页显示word图标,表示该PPT已包含配套word讲稿。双击word图标可打开word文档。
- 特殊限制:
部分文档作品中含有的国旗、国徽等图片,仅作为作品整体效果示例展示,禁止商用。设计者仅对作品中独创性部分享有著作权。
- 关 键 词:
- 基于 matlab 文字 识别 算法 课程设计
1、咨信平台为文档C2C交易模式,即用户上传的文档直接被用户下载,收益归上传人(含作者)所有;本站仅是提供信息存储空间和展示预览,仅对用户上传内容的表现方式做保护处理,对上载内容不做任何修改或编辑。所展示的作品文档包括内容和图片全部来源于网络用户和作者上传投稿,我们不确定上传用户享有完全著作权,根据《信息网络传播权保护条例》,如果侵犯了您的版权、权益或隐私,请联系我们,核实后会尽快下架及时删除,并可随时和客服了解处理情况,尊重保护知识产权我们共同努力。
2、文档的总页数、文档格式和文档大小以系统显示为准(内容中显示的页数不一定正确),网站客服只以系统显示的页数、文件格式、文档大小作为仲裁依据,个别因单元格分列造成显示页码不一将协商解决,平台无法对文档的真实性、完整性、权威性、准确性、专业性及其观点立场做任何保证或承诺,下载前须认真查看,确认无误后再购买,务必慎重购买;若有违法违纪将进行移交司法处理,若涉侵权平台将进行基本处罚并下架。
3、本站所有内容均由用户上传,付费前请自行鉴别,如您付费,意味着您已接受本站规则且自行承担风险,本站不进行额外附加服务,虚拟产品一经售出概不退款(未进行购买下载可退充值款),文档一经付费(服务费)、不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
4、如你看到网页展示的文档有www.zixin.com.cn水印,是因预览和防盗链等技术需要对页面进行转换压缩成图而已,我们并不对上传的文档进行任何编辑或修改,文档下载后都不会有水印标识(原文档上传前个别存留的除外),下载后原文更清晰;试题试卷类文档,如果标题没有明确说明有答案则都视为没有答案,请知晓;PPT和DOC文档可被视为“模板”,允许上传人保留章节、目录结构的情况下删减部份的内容;PDF文档不管是原文档转换或图片扫描而得,本站不作要求视为允许,下载前自行私信或留言给上传者【w****g】。
5、本文档所展示的图片、画像、字体、音乐的版权可能需版权方额外授权,请谨慎使用;网站提供的党政主题相关内容(国旗、国徽、党徽--等)目的在于配合国家政策宣传,仅限个人学习分享使用,禁止用于任何广告和商用目的。
6、文档遇到问题,请及时私信或留言给本站上传会员【w****g】,需本站解决可联系【 微信客服】、【 QQ客服】,若有其他问题请点击或扫码反馈【 服务填表】;文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“【 版权申诉】”(推荐),意见反馈和侵权处理邮箱:1219186828@qq.com;也可以拔打客服电话:4008-655-100;投诉/维权电话:4009-655-100。