admin管理员组

文章数量:1534924

2024年1月12日发(作者:)

用OCR软件进行扫描识别文本的技巧

扫描仪的一个重要功能就是通过OCR软件(即文字识别软件)将扫描后的文字图像转换成文本格式的文件,使文字处理软件能够调用处理。这样可以大大提高文字录入速度,极大地提高工作效率。目前,文字识别软件主要有《尚书OCR》、《汉王OCR》和《紫光OCR》等几种。

不过,我们在进行文字识别时经常会遇到识别率低的问题,其原因除了被识别稿件有问题外,主要还是我们没有掌握好扫描及OCR识别软件的使用技巧。那么进行文字识别时有哪些技巧呢?

一、根据识别稿的质量进行处理

进行扫描识别时,在可能的情况下应尽量选择清晰度与洁净度都很高的识别稿,识别稿的清晰度与洁净度的不同会使扫描后的识别率有很大差距。对一般的印刷稿、打印稿等质量较好的文稿进行识别,只要掌握好方法与技巧,其识别率一般可达到98%以上。而对报纸、杂志等清晰度不佳的原稿进行识别,无论使用何种识别软件都难以达到很高的识别率。

1.对一些带有下划线、分隔线等符号的文本原稿,有些OCR软件是识别不出的,一般会出现乱码。如果必须扫描带有这些符号的原稿,一是要确保使用的识别软件能够识别这些符号。二是使用工具擦掉这些特殊符号,使识别软件能正确识别这些文字。

如果扫描后的文档中含有OCR软件不能识别的图像、图形和一些特殊符号,可以考虑使用“擦拭”工具将文档中的图像、图形和一些特殊符号擦除,同时将图像上一些杂点也一并去除。使图像中除了文字没有多余的东西,这可以大大提高识别率并减少识别后的修改工作。

2.在扫描识别报纸或纸张较薄的文稿时,扫描时稿件背面的文字通常会透过纸张造成错字或乱码,使识别率大大降低。在对这类原稿扫描时,我们可以在原稿的背面覆盖一张黑纸,在进行正式扫描时,适当增加扫描对比度或亮度,即可有效提高识别率。

3.对于一些图文混排的原稿,扫描成一幅图像进行全区识别会严重影响OCR软件的识别率。我们可以根据实际情况将扫描后的版面切分成多个区域后再识别,切分区域的原则是:将图形、图像排除在区域之外(图1),尽量把文字字体、字号一致的划在一个区域内,不要嫌这个过程烦琐而选用自动切分区域,手动选取扫描区域会有更好识别效果,还应注意各识别区域不能有交叉情况。

图1 版面切分

二、扫描识别稿的操作技巧

1.首先要保持工作环境的清洁,扫描仪的玻璃板以及若干个反光镜片及镜头,其中任何一部分脏污都会影响扫描文字图像的效果。因此,保持扫描仪的清洁是确保文字图像扫描质量及识别率较高的重要前提。

2.扫描仪在刚开启时,光源的稳定性较差,而且光源的色温也没有达到正常工作所需的色温,所以开始扫描以前最好先让扫描仪预热一段时间。

3.在放置扫描原稿时,把扫描的文字材料摆放在扫描起始线正中,可以最大限度地避免由于光学透镜导致的失真而影响识别率。

4.扫描后的文字图像经常会有一定角度的倾斜,出现这种情况必须在扫描后使用自动或手动旋转工具进行纠正,OCR软件一般都设有自动纠偏和手动纠偏工具。否则OCR识别软件会将水平笔画当作斜笔画处理,识别率会下降很多。如果扫描后的文字图像倾斜角度超过15°,倾斜校正会产生较大的失真和误差,从而严重影响识别率,这种情况建议摆正原稿重新扫描。

三、扫描参数的设置

扫描参数的设置主要包括分辨率的设置及亮度和对比度的设置。

1.一般来讲,分辨率越高识别率也就会越高。但这也不是绝对的,对于一些过大过粗的字体,设置过高的分辨率,识别率可能会降低,而且设置高分辨率后,扫描速度会大大降低。根据实际经验,1、2、3号字的文稿推荐使用200dpi,4、小4、

5号字的文稿推荐使用300dpi,小5、6号字的文稿推荐使用400dpi,7、8号字的文稿推荐使用600dpi(图2)。

图2 选择分辨率

2.扫描时适当地调整好亮度和对比度值,对识别率的高低影响很大,在进行扫描亮度和对比度的设定时(图3),以扫描后的图像中文字的笔画较细、均匀,且没有明显断点为准。如果扫描后的文字图像存在黑点、黑斑或文字线条很粗很黑,分不清笔画,说明亮度值太小,应该增加亮度值再重新扫描。如果文字线条凹凸不平,有断线甚至图像中汉字轮廓严重残缺时,说明亮度值太大,应减小亮度后再重新扫描。如果要扫描质量比较差的文稿,比如报纸,扫描出的图像可能会出现大量的黑点,而且在字体的笔画上也会出现粘连现象,为获得较好的识别结果,必须仔细进行亮度和对比度值的调整,反复扫描多次才能获得比较理想的效果。

图3 扫描亮度和对比度的设定

四、识别后的处理工作

1.文字校正

文字校正是OCR识别工作中比较烦琐的一步。一般OCR软件对可能出现错误的文字,会显示出蓝色标记,请用户确认。但在没有提示出错的地方,也有可能出错。所以大家在校对时应该通读一遍,以提高文字录入的准确率。

2.识别后文本的保存

如果把识别后的文本简单复制粘贴到Word中保存处理,就需要去掉多余的硬回车,这样会非常麻烦。正确方法是:先将识别后的文本存盘,在存盘时设置为软回车就行了。对于《紫光OCR》,则需要在识别完成后,选择文件菜单下的导出命令,将存储类型选为TXT,段内回车字符选为无。注意:一定不要直接存盘,否则不能自动去掉文章的硬回车。《尚书OCR》、《汉王OCR》和《紫光OCR》都提供了段内去除硬回车的功能。

文本王OCR软件技巧:将PDF中的图文导至WORD文档

文本王在推广过程中,其OCR软件一直是以配套捆绑方式附赠。掌握文本王OCR软件的使用技巧,对大家节省时间和精力做事,是很有帮助的。下面就是一例文本王OCR软件使用实例:将PDF中的图文导至WORD文档。

有位网友咨询说,我在PDF文档里面有一本书,是用文本王传上去的。现在想知道有没有什么办法可以导出里面的文字,或者有什么好用的软件来分辨文字?关于这个问题,专家给她作了解答。

一、先用Adobe Acrobat中的导出功能,将这个文件导出为图像。做法:在上面菜单上选文件>导出>提取图像为>JPEG文件(其他二种也行,JPEG文件比较小),再按提示,选择一个适当的文件夹,保存图像。 这种方法保存下来的一张张图片,比你一页页保存省力多了,而且保留了原文件的全部信息。

小提示:Adobe Acrobat Reader 是一个查看、阅读和打印 PDF 文件的最佳工具。Adobe Acrobat 软件是一种高效的桌面工具,可实现不同的硬件平台和软件应用程序之间的信息共享,不受软件版本的不同和安装的字体的影响。

二、再用OCR文字识别软件识别。

OCR(光学字符识别)软件是专门用来识别图像文字的。可以将扫描到的图像格式的文字转化成可编辑的文字。就我个人经验看,众多的OCR软件中,汉王文本王比较好。它能批量识别,识别率高,可以直接生成word文档,能精确版面还原等,比较方便。

小提示:OCR(光学字符识别)软件是用来进行文字识别的。你用汉王文本王得到图像后,用它就可以将上面的图像文字识别转化为可以在Word等软件中进行编辑的文字。OCR软件与文本王、打印机不存在依赖关系。

汉王PDF OCR使用说明

版权声明

《汉王PDF OCR》V8.0 版权属于汉王科技股份有限公司所有。本公司免费授权您非商业用途任意使用和复制本软件,包括在任意多台计算机上同时使用本软件。但在未经许可的情况下,不得将本软件用于商业用途。未经汉王科技股份有限公司许可与授权,不得擅自更改该软件的内容及其产品包装。

本软件受版权法和国际条约的保护。

版权所有! @ 汉王科技股份有限公司。

产品特点

汉王PDF OCR是汉王OCR 6.0 和尚书七号的升级版,本软件新增打开与识别PDF文件功能,支持文字型PDF的直接转换和图像型PDF的OCR识别:既可以采用OCR的方式,将PDF文件转换为可编辑文档;也可以采用格式转换的方式直接转换文字型PDF文件为文本。

本软件系统应用OCR(Optical Character Recognition)技术,为满足书籍、报刊杂志、报表票据、公文档案等录入需求而设计的软件系统。

目前,许多信息资料需要转化成电子文档以便于各种应用及管理,但因信息数字化处理的方式落后,不但费时费力,而且资金耗费巨大,造成了大量文档资料的积压,因此急需一种快速高效的软件系统来满足这

种海量录入需求。本软件系统正是适用于个人、小型图书馆、小型档案馆、小型企业进行大规模文档输入、图书翻印、大量资料电子化的软件系统。

●识别字符

简体字符集:国标GB2312-80的全部一、二级汉字6800多个。

纯英文字符集。

简繁字集:除了简体汉字外,还可以混识台湾繁体字5400多个以及香港繁体字和GBK汉字。

●识别字体种类

能识别宋体、仿宋、楷、黑、魏碑、隶书、圆体、行楷等一百多种字体,并支持多种字体混排。

●识别字号

初号 小六号字体。

●表格识别

可以自动判断、拆分、识别和还原各种通用型印刷体表格。

初始设置

安装扫描仪

第一次使用扫描仪或者更换扫描仪时,都需要对扫描仪进行驱动安装和设置。请先按照扫描仪使用手册上的步骤正确安装扫描仪,然后打开应用程序,在应用程序界面内,按下“文件”菜单下的“选择扫描仪”命令,选择相应的扫描仪,如图所示:

系统设置

从“文件”菜单中点“系统配置”命令,进入系统设置界面,设置扫描任务的语言。如图所示:

支持的扫描任务语言有:中文简体、简繁混合、纯英文等。

如果选中“灰度彩色图像总存为JPG”,那么系统会自动将灰度彩色图像扫描保存成JPG格式。

如果选中“识别”页中的“自动倾斜校正”,在版面分析时,系统会自动校正倾斜的图像文件。如图所示:

操作详解

操作界面

工程图像识别界面包括主菜单、工具栏、图像文件管理区、侯选字区、识别结果区以及原图像显示区,如图所示:

文件管理区:对文件进行管理和整理。

1.打开文件:选择“文件”菜单,选择打开图像文件的路径,图像文件便显示在管理区用鼠标可将图像文件拖拽到管理区,也可将打开的图像页复制、粘贴到管理区。

2.删除文件:按键盘上的“Delete”键将文件删除。

3.调整文件:选中一个文件或按住Ctrl可以选择多个文件,把文件拖放到要调整的位置。

4.文件格式:本系统支持TIF、BMP、PDF,彩色灰度图还支持JPG格式。

5.文件语言:本系统支持中文简体、英文、简繁体混排方式、以及中英文混排方式。

6.图像文件重命名:选中文件,点击文件菜单选择可保存成TIF、BMP、JPG文件(说明:本系统不支持批量图像文件的改名)。

7.图像文件保存路径:在 中可以设置获取图像文件的路径、名称、格式。如该路径不存在,系统会提示是否创建该路径;如果要选择已存在的某个路径,可以点击“扫描到”按钮,弹出选择路径对话框,选择需要保存图像的路径。

侯选字区:修改识别结果时,可以选择侯选区的字直接修改当前字。

识别结果区:显示当前图像文件的识别结果。

原图像区:显示当前正处理的图像。

搜索区:百度、Google搜索。

获取图像

获取图像

获取图像有四种方式:通过点击工具栏上的 按钮打开已扫描好的图像文件;通过扫描仪批量扫描文稿;用鼠标将图像文件拖拽管理窗口;将打开的图像文件复制、粘贴到文件管理器中。

扫描文稿时,先准备好扫描仪,点击工具栏上的 进入扫描程序,将要扫描的稿件放置在扫描仪的适当位置上,屏幕上显示扫描仪配置窗口(这里以扫描仪AV620C为例)。在扫描之前,可以通过扫描窗口选择扫描精度、扫描方式和纸张大小。

本系统支持黑白二值模式、灰度模式以及彩色模式,即选择黑白扫描方式、灰度扫描方式和彩色扫描方式。建议不要大量采用灰度、彩色扫描模式扫描文件,因为彩色图像文件占用大量的内存和CPU,操作速度会很慢;而且背景图案会影响处理效果。

扫描亮度

亮度选择是否恰当直接关系到图像的清晰度,而图像的清晰度又直接影响后续的识别质量,因此必须根据稿件的实际质量来选择亮度。所要达到的扫描质量为保证每个扫描汉字的图像清晰,不能出现过浓或过淡。

扫描精度

对于其它类型的扫描仪可参照相应的使用手册进行选择。对于本系统而言,扫描精度控制在300dpi为好,这样既可保证良好的识别效果,又能减少扫描操作所需时间。

扫描之后的图像直接传送回本系统的图像处理界面。图像文件自动存储到系统默认路径下的默认文件名,文件名和识别参数显示在管理条窗口内。(扫描的具体操作请参考扫描仪使用手册)。

处理图像

图像反白

本功能只处理白底黑字的图像,若扫描得到的图像不是白底黑字,点“编辑”菜单中的“图像反白”命令作反白处理。

旋转图像

若发现当前图像不是正常位置显示,选择“编辑”菜单内的“旋转图像”菜单项,再选择相应的旋转方向,按90度旋转当前图像(可以连续旋转),将当前图像旋转到正常位置。

倾斜校正

自动倾斜校正:

若扫描后的图像是倾斜的,按系统测定的角度自动倾斜校正。选择“编辑”菜单的“自动倾斜校正”,可以对倾斜的图像作自动倾斜校正使之正常显示。

手动倾斜校正:

若图像是倾斜的或自动倾斜校正效果不佳,可选择“编辑”菜单的“手动倾斜校正”,出现界面如图所示:

手工调整横竖坐标,用鼠标点住图中水平红线左边的小方块,上下移动,使得水平线条与文本图像的倾斜角度一致;也可以用键盘上的上下箭头在按钮间切换,进行校正操作。

去除噪声

调整边框

若发现当前的图像带有多余的版面噪音,可以调整当前图像的图像框范围,将多余的或影响版面分割和识别准确率的版面噪音(扫描过程产生的黑线条、黑污点等)删去,以提高识别准确率。

点击 使用鼠标将光标箭头移动到当前图像边框处,此时箭头变为卡住图像边框的上下双箭头。按下鼠标左键,将该位置的图像边框向内移动,将多余的版面噪音框掉,有效图像为当前图像框范围内的图像。

剪切噪音

点击工具栏中的 按钮,按住鼠标左键,拖动鼠标选中图像中的噪音(黑点或黑框),放开鼠标左键,就可以将噪音清除。

辅助操作

缩放图像

可根据操作需要调整当前图像显示的大小。选择工具栏 按钮或 按钮,将当前图像做放大或缩小处理。如果在当前图像内双击鼠标“左键”,会放大显示图像;双击鼠标“右键”,会缩小显示图像。

恢复鼠标

当前鼠标为剪刀、画笔状态时,根据操作需要,点击 按钮可切换到鼠标状态。

分析图像

在版面分析前,先检查文件管理窗口内当前文件的语言,如果有误,请双击该参数,在下拉菜单内选定正确的识别参数。

自动版面分析

单击工具栏的 按钮,或选择“识别”菜单内选择“版面分析”命令,自动对当前文件或管理窗口内选定的一批文件进行版面分析。

若单击 按钮,或选择“识别”菜单上的“选择全部文件”命令,将全部文件选中,进行版面分析时,系统自动对全部图像文件进行版面分析。

调整分析结果

移动光标箭头到文件图像上的待调整图像框,点击1、2、3、4、5键,将当前框的属性标识为横栏、竖栏、表格、图像、英文;若框切分不对,可单击工具栏中的 按钮,或选择“识别”菜单内的“取消当前栏”,取消当前栏重新画框;若整页切分错误较多,可单击工具栏中的 按钮,或选择”识别”菜单内的“取消版面分析”,取消图像页的全部版面分析,手动进行版面分析。

在调整分析结果时,如果框的范围包含了其它属性框,被包含的框自动消失;当框的范围与已有的属性框交叉时,调整框大小无效。

手工版面分析

移动光标箭头到文件图像上的适当位置(例如文章段首),按住鼠标左键不放,拖动至另一适当位置(例如文章段尾),再放开左键,划分出所要识别的图像框图(见图像框线),重复此操作,以划分出全部图像框的框图。

另外,还可以定义各图像框的版面属性为横栏、竖栏、表格、图像 。

此外,移动光标箭头到文件图像上的待排序图像框内,按住鼠标左键不放,显示出蓝色箭头拖动至另一图像框内,再放开左键,以指定图像框的识别顺序(顺序标号在框线左上角),重复此操作,以指定文件全部图像框的识别顺序。

在已有版面分析的图像文件上重新画框时,如果框的范围包含了已有的属性框,被包含的框自动消失;当框的范围与已有的属性框交叉时,手动画框无效。

识别图像

识别图像

选中要识别的图像页,点击 按钮或选择“识别”菜单上的“开始识别”命令,对所选图像进行版面识别。当然也可以用“F8“快捷键识别选中图像。识别处理窗口如图所示:

说明当前正在识别的文件; 说明选中的要识别的文件数。

检查识别结果

识别过的图像,系统会将识别结果在识别窗口中显示出来。如果没有识别的图像,识别窗口为灰色,所以识别完图像后,应该检查有没有图像页是否有没识别的图像块。

校对

调整窗口显示

单击“显示”菜单,调出菜单如图所示:

做横校时,可以根据需要选择显示/关闭工具条、状态条、管理条及文本窗口;也可以选择显示方式:如显示全部,只显示管理条,只显示图像、文本方式。

另外,横校窗口中有三个控制窗口按钮,单击它们,可以调整文本窗口的结构和布局。如图所示:

1、 / :隐藏/显示识别结果的文本窗口。

2、 / :隐藏/显示侯选字、联想字以及符号修改栏。

3、 / :隐藏/显示光标当前行的对应原始图像。

字符校对

1、字符校对:对照随行显示的当前字符的原始图像校正识别结果。

2、字符修改:选择当前字的候选字替换识别有误的字,也可以调出输入法输入正确的字符。

3、字符编辑:在文本编辑区内可以进行退格、删除、撤消等操作,在窗口最下面的状态栏的 或 处单击,可以切换字符的键入方式。在“编辑”菜单内选择“剪切”“复制”或“粘贴”,可以对选定的文字做相应的操作。

保存图像

在工程操作时,想将经过处理后的图像保存,可以点“文件“菜单下的“保存图像”命令进行保存;如果想将处理后的图像文件保存到其它位置,可以点“文件”菜单下的“换名保存图像”命令,将图像文件换名保存。

结果输出

输出到指定格式文件

校对完成后的图像文件可以输出保存成文字处理软件(如WORD、WPS97等)可处理的文件,还可以保存成文本文件。点“输出”菜单,选择“到指定格式文件”,在弹出的“保存识别结果”窗口中,用户可以选择文件要存储的路径和文件类型。本系统的识别结果可以保存成*.RTF、*.TXT、和*.HTML以及*.XLS四种格式的文件。

如果选中“输出到外部编辑器”,则系统在保存文件的同时调入相应的文字处理程序。比如选择输出HTML格式,系统马上进入IE浏览器。

TXT格式只保存文字、表格部分,不保存图片;

RTF格式可以用WORD、WPS等文字处理软件编辑;

HTML格式可以输出到IE等网络浏览器;

XLS 格式可以用 Excel 等软件编辑。

PDF文件转换为RTF文件

打开PDF文件转换:点击“输出”菜单中“PDF转换为RTF文件”选项,或点击工具栏中“PDF转换为RTF”按钮,弹出下图对话框,您可以根据需要选择转换的图像页范围,点击“确定”,系统自动导出文件。

直接转换:在打开图像时,如果您选择的是PDF图像,打开对话框下方“PDF转换为RTF文件”和“PDF转换为TXT文件”按钮可用,点击该按钮,直接将PDF文件转换为可编辑文件。

特别提示:

如果勾选“转换后打开RTF文件”,在转换后自动打开,如果不勾选则只转换保存文件,不打开。

如果未安装Word,导出后不能正确打开浏览,只能生成文件。

PDF文件转换为RTF文件

打开PDF文件转换:点击“输出”菜单中“PDF转换为TXT文件”选项,或点击工具栏中“PDF转换为TXT”按钮,弹出下图对话框,您可以根据需要选择导出的图像页范围,点击“确定”弹出保存文件对话框,添加文件名,并点击保存后导出文件。

直接转换:在打开图像时,如果您选择的是PDF图像,打开对话框下方“PDF转换为RTF文件”和“PDF转换为TXT文件”按钮可用,点击该按钮,直接将PDF文件转换为可编辑文件。

如果勾选“转换后打开TXT文件”,在转换后自动打开,如果不勾选则只转换保存文件,不打开。

快捷键与工具按钮

快捷键

扫描文件: 按下“Ctrl+N”调出扫描程序,扫描图像文件。

打开文件: 按下“Ctrl+O”打开图像文件,追加图像文件。

保存图像: 按下“Ctrl+S”键保存图像。

图像反白: 按下“Ctrl+I”将图像反白。

自动倾斜校正: 按下“Ctrl+D”进行自动倾斜校正。

手动倾斜校正: 按下“Ctrl+M”进行手动倾斜校正。

版面分析: 按下“F5”键,对选中的文件进行版面分析。

取消版面分析: 按下“Ctrl+Del”键,取消当前页的版面分析。

取消当前栏: 按下“Del”键或“Esc”键,取消当前栏属性标识。

版面识别: 按下“F8”键,对选中的文件进行识别。

光标切换: 按下“F9”键,光标在剪刀、画线笔、鼠标三种状态间切换。

左转图像: 按下“Ctrl+L”将图像左转90度。

右转图像: 按下“Ctrl+R”将图像右转90度。

向后翻页: 按下“Page down”向后翻页。

向前翻页: 按下“Page up” 向前翻页。

撤消: 按下 “Ctrl+Z”键取消上一步操作。

剪切: 按下“Ctrl+X”键剪切选中的内容。

复制: 按下“Ctrl+C”键复制选中的内容。

粘贴: 按下“Ctrl+V”键粘贴选中的内容。

向后找可疑字: 按下“Ctrl+Tab”键。

向前找可疑字: 按下“Shift+Tab”键。

工具按钮

:扫描图像。

:打开扫描好的图像文件。

:将PDF文件转换为RTF文件。

:将PDF文件转换为TXT文件。

:图像放大。

:图像缩小。

:选中全部图像文件。

:对所选图像进行分析识别。

:对所选图像版面分析。

:取消选中图像页的版面分析。

:标记/修改当前图像框的属性。

:取消当前图像框属性。

:将光标切换成鼠标状态。

:去除版面噪音,如黑点、黑框等。

:在图像页上画线,弥补断线处或将表格填补成标准表格。

:向前/向后翻页。

注意事项

如果您的Windows操作系统未安装Flash插件,在启动程序时会提示下图信息,只需要点击“是”,执行安装即可。

无论何种原因(如网络速度慢甚至网络不通),未安装该插件都会不停的提示下图信息,您只有关闭程序并安装Flash插件才可正常使用。

联系我们

如果您在使用过程中有任何问题,请首先准备好以下资料,并与我们联系。

计算机型号和计算机上的外设清单

操作系统类型及计算机硬件配置

故障现象或屏幕上所显示的出错信息

问题发生原因及问题发生时您的操作

为解决这个问题您做了哪些尝试

地址:北京市海淀区东北旺西路8号5号楼三层

邮编:100094

技术支持:*****************.cn

本文标签: 图像识别扫描文件