admin管理员组

文章数量:1534214

2024年3月28日发(作者:)

从中国知网下载而来的资料,大都是.CAJ、.NH、.KDH、.PDF等格式,需使用

CAJViewer 全文浏览器进行查看。现在网上的许多资料都是以CAJ、PDF等文件格式提

供的,其中的文本不能被直接编辑。 网上提供了许多处理这种情况的软件,但是它们不是

效率低,就是只能提取其中部分文本。本文所述利用微软提供的OCR识别技术从CAJ、

PDF等文件中提取全部文本的方法,简便快捷,效率很高。

一、CAJ文件的识别

方法一、

(一)首先,从网上下载CAJ格式的资料文件保存到本地硬盘上。

(二)然后,启动CAJViewer浏览器程序,并在该程序中打开刚才保存的CAJ格式

的文件。浏览文件到最后一页后,不要关闭CAJ浏览器程序。

(三)在CAJ浏览器程序窗口中,选择“文件”→“打印”,并选择打印机为

Microsoft Office Document Image Writer打印机,勾选打印到文件选项和确定打印页

数。

(四)保存打印文件(*.prn)到适当位置。等待打印完成后,Microsoft Office

Document Image 自动打开刚才保存的打印文件。

(五)在Microsoft Office Document Image窗口中,选择“页面”菜单中的“选

择所有页面”菜单项,然后选择“工具”菜单中的“使用OCR识别文本”提取文本。

(六)选择“工具”下的 “将文本发送到word”,最后将把整个CAJ文件识别输出

到word文件中。

方法二、

CAJ文件直接可以复制、粘贴获得,打开文件→工具→文本选择、选择图像→复制、

粘贴就可以了。

方法三、

首先,启动CAJViewer浏览器程序,用CAJViewer7.02打开刚才保存的CAJ格式的

文件,然后在每页的左右两边分区域选取文字,再在选取区域内,单击右键“文字识别”,

这时会出现“文字识别结果”对话框,单击“复制到剪贴板”或“发送到Word”,即可

大功告成。不足:就是不能对整篇、整页文档进行识别。

二、PDF文件的识别

方法一、

(一)以文本形式保存的PDF文件,用acrobat 5 专业版,识别整个文件。直接打开

从网上下载的PDF格式文件另存为RTF文件,或者选择工具栏上的文字选择按钮,然后选

择文字区域,然后复制到Word中即可。

(二)以图片形式保存的PDF文件,将PDF文件打印到Microsoft Office Document

本文标签: 文件文本选择识别保存