
杨俊业++王训伟
摘要: 本文首先介绍了OCR技术的发展背景,并指出了OCR文本识别系统在扫描仪,文本编辑等领域的应用和优势. 通过介绍OCR技术的工作原理,重点讨论了OCR文本识别系统的主要图像处理模块,布局分析模块,文本识别模块,文本校对模块和输出模块的功能,实现方法和技术要点. 最后,从更准确的文本编码库和一种或多种算法的改进两个方面分析了OCR文本识别技术的未来发展趋势.
关键字: OCR技术;图像识别;功能模块;文字编码库
I. 概述
OCR(光学字符识别)技术的中文名称是光学字符识别,通常是指通过电子输入设备(例如扫描仪和数码相机)使用纸质文档上的文本,表格和图像等信息. 模式识别算法分析字符的形态特征,确定汉字的标准编码,并将其以通用字符格式存储在文本文档中. 随着移动互联网,高级智能手机以及微信,QQ等社交网络的发展,带来了大量的图片信息. 图片已经成为互联网上信息交换的主要媒体之一. 如果信息由文本携带,我们可以通过搜索引擎进行检索. 但是,我们对图像和表格文本无能为力. 在这种情况下,计算机的OCR图像识别技术可以解决此问题. OCR实际上是让计算机将图像识别为可编辑文本,实现图像到文本的转换,并通过图像处理和图案识别技术识别光学字符. 这是自动识别技术研究和应用领域中的重要方面. 目前,大多数扫描仪制造商都将OCR技术集成到扫描仪软件中,以在扫描时实现OCR文本识别. 扫描仪和OCR文本识别技术的完美结合极大地满足了人们对扫描图像进行文本编辑的需求. ,OCR文本识别技术已成为大多数扫描仪软件的标准配置.

第二,OCR文本识别原理
OCR字符识别的原理是计算机对图像执行布局分析,处理和图案识别. 图像布局分析是指图像文本的预处理,文本图像的分割和坐标定位;文本图案识别是通过检测暗色和亮案,放大图像以确定其形状特征并进行提取和判断,最后通过图像的黑白点将二进制和字符代码进行匹配,然后根据到最接近的匹配度.
标准的OCR文本识别系统主要包括图像处理模块,布局分析模块,文本识别模块,文本校对模块和输出模块.
(1)图像处理模块
主要通过扫描仪设备扫描纸质期刊,学位等文献数据,一般建议扫描到折线图模式(灰度或彩识别率低),扩展名为tif图格式,图像分辨率为300DPI,图像应去污,黑边,图像居中和图像校正. 最好不要有阴影. 简而言之,在白色背景上将图像保持为黑色,图像页面要整洁以提高文本识别率.

(2)布局分析模块
它可以分为自动和手动方法. 自动布局分析程序主要使用黑白二进制方法,将所有文本区域部分逐页定位并存储相应的区域块坐标;手动布局分析是指手动传递鼠标将图像文本区域框起来,并选择用于文本识别的特定区域. 该方法主要用于从图像中提取特定区域中的文本并以文本识别为目标. 此外,还可以设置图像文本的水平和垂直布局以及中外字体信息,以提高文本识别率. 布局分析模块的原理主要是划分和更改布局,即要了解布局,分词,规范化等,可以选择自动或手动布局划分. 目的是告诉OCR软件将同一布局的中文和英文字体,图像,表格,水平和垂直版本分开,以便可以分别处理它们,并以什么顺序处理它们.
(3)文本识别模块
文本识别模块是OCR软件的核心部分. 文本识别主要使用黑白二进制方法. 以单个汉字“一个”为例,文本颜色反转,即白色变为黑色,黑色变为白色,单字图像区域分为上下两部分. 这样,每个单词可以划分为不同的区域. 以二进制方式转换不同区域的逆选择区域. 划分每个文本区域后,将生成一个二进制代码. 预先将每个标准文本的二进制编码存储在中,并将OCR文本识别的结果与标准中的二进制编码进行比较,从而选择最接近的二进制编码文本,最后获得文本识别结果. 如果找到具有高度相似性的代码,则系统会识别出错误的文本将以红色粗体显示,提示用户手动对其进行修改. 文本识别模块主要识别单个图像文本,因此必须逐行剪切图像,并且通常逐行识别汉字,即对单个单词进行识别,然后对其进行归一化.
(4)文本校对模块

文本校对主要分为垂直校对和水平校对. 垂直校对是指按顺序排列文本识别结果,在识别结果中调用所有相同的文本,在识别结果中显示所有相同的文本,并同时调用识别结果与原始图像进行手动比较. 水平校对是指根据我们的阅读习惯逐行进行校对,显示一行识别结果和相应的原始图像以进行校对,并手动纠正错别字,并重写标准文本编码库,以重写频繁出错的文本. 识别结果. 实现准确的文本识别.
(5)输出模块
可以将校对文本输出为文本或XML格式,并且可以完全编辑输出文本. 同时,原始图像文件可以输出为PDF文件,以浏览原始图像,也可以输出为移动阅读ePub格式等.
3. OCR文本识别的未来发展趋势
当前的OCR开发技术主要是从图像处理到图像清洗,去污,图像校正等,然后分析图形和文本以剪切文本并分离图形和文本. 最后ocr文字识别原理,使用黑白二进制方法获得二进制代码,但是用于文本的黑白二进制方法以及用于提取文本特征的方法已成为影响OCR文本识别率的关键,因此目前文本特征提取主要是一种统计特征提取方法,即通过对文本区域进行图像分割时,通过文本区域的黑点和白点将多个文本所分割的多个区域的黑点连接到形成空格数字的组合. 该算法是目前OCR文本特征的主流算法,文本识别率可以达到近95%的准确率. 但是,对于我们的汉字,汉字的特征是从象形文字演变而来的,因此我们也可以从汉字笔划中提取汉字的特征. 简而言之,我们可以获得字符笔划的端点和交点的数量和位置,或者使用笔划段作为特征,并使用特殊的比较方法进行比较. 当然,无论使用哪种识别算法,都必须在识别后比较标准编码的二进制文本. 输入字符并计算特征后,必须有一个比较或特征以进行比较. 的内容应包含所有标识字符集的字符集,根据通过与输入文本相同的特征提取方法获得的特征组ocr文字识别原理,标准编码库的准确性也将直接影响OCR的准确性字符识别.

因此,一方面,OCR文本识别技术的未来发展趋势在文本编码库中将更加准确. 使用准确的文本编码库与识别结果进行比较,选择最佳的文本识别结果,另一方面将一个算法转换为多种算法,我们还可以将多种算法获得的文本识别结果之间的比较用于最后选择最佳的文本识别结果,将大大提高OCR文本识别率.

《魅力中国》 2017年第20期
《魅力中国》的其他文章
电子信息科学与技术实践能力的培养分析
邮政系统支撑理论的构建与逻辑系统的构建
三阴性乳腺癌的分子靶向治疗及其研究进展
医院信息化建设实践中的问题研究
在新媒体环境下探讨产业的发展趋势
本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/jisuanjixue/article-222225-1.html
就是说实际购买力下降0
打吧
都是高手啊