admin管理员组

文章数量:1534902

2024年5月20日发(作者:)

如何将CAJ、PDF文件转化为word格式?

分享

首次分享者:饭醉分子 已被分享3次 评论(0)复制链接分享转载举报

从中国知网下载而来的资料,大都是.CAJ、.NH、.KDH、.PDF等格式,需使

用CAJViewer 全文浏览器进行查看。现在网上的许多资料都是以CAJ、PDF等文

件格式提供的,其中的文本不能被直接编辑。 网上提供了许多处理这种情况的

软件,但是它们不是效率低,就是只能提取其中部分文本。本文所述利用微软提

供的OCR识别技术从CAJ、PDF等文件中提取全部文本的方法,简便快捷,效率

很高。

一、CAJ文件的识别

方法一、

(一)首先,从网上下载CAJ格式的资料文件保存到本地硬盘上。

(二)然后,启动CAJViewer浏览器程序,并在该程序中打开刚才保存的

CAJ格式的文件。浏览文件到最后一页后,不要关闭CAJ浏览器程序。

(三)在CAJ浏览器程序窗口中,选择“文件”→“打印”,并选择打印机

为Microsoft Office Document Image Writer打印机,勾选打印到文件选项和

确定打印页数。

(四)保存打印文件(*.prn)到适当位置。等待打印完成后,Microsoft

Office Document Image 自动打开刚才保存的打印文件。

(五)在Microsoft Office Document Image窗口中,选择“页面”菜单中

的“选择所有页面”菜单项,然后选择“工具”菜单中的“使用OCR识别文本”

提取文本。

(六)选择“工具”下的 “将文本发送到word”,最后将把整个CAJ文件

识别输出到word文件中。

方法二、CAJ文件直接可以复制、粘贴获得,打开文件→工具→文本选择、

选择图像→复制、粘贴就可以了。

方法三、首先,启动CAJViewer浏览器程序,用CAJViewer7.02打开刚才保

存的CAJ格式的文件,然后在每页的左右两边分区域选取文字,再在选取区域内,

单击右键“文字识别”,这时会出现“文字识别结果”对话框,单击“复制到剪

贴板”或“发送到Word”,即可大功告成。不足:就是不能对整篇、整页文档

进行识别。

二、PDF文件的识别

方法一、(一)以文本形式保存的PDF文件,用acrobat 5 专业版,识

别整个文件。直接打开从网上下载的PDF格式文件另存为RTF文件,或者选择工

具栏上的文字选择按钮,然后选择文字区域,然后复制到Word中即可。

(二)以图片形式保存的PDF文件,将PDF文件打印到Microsoft Office

Document Image Writer打印机,选择打印形成的文件的保存位置,然后会自动

形成一个MDI文件,并且自动用Microsoft Office Document Image打开此文件,

然后在Microsoft Office Document Image中选择“工具”菜单中的“使用OCR

识别文本”,识别完成后,在选择“工具”下的,“将文本发送到word”,最

后将把整个PDF文件识别输出到word文件中。

(三)加密的PDF文件先下载解密软件,解密后在参照上述步骤1),2) 进

行。

(四)繁体PDF文件用上述步骤2)的方法识别到word后,用word中的“工

具”→“语言”→“中文繁简转换”

方法二、PDF和WORD相互转化,可以下载一个转化软件即Solid

Converter PDF 6.0 Build 669,直接转化也很方便。

方法三、打开文件→工具→基本工具→选择→选择文字复制、粘贴就可以了,

非常方便。

三、超星文件的识别

(一)全文件识别打印到Microsoft Office Document Image Writer打印

机,然后按上述PDF文件的识别步骤中第二点操作,要注意的是,超星打印功能

有点区别,因为超星是目录和全文分开的,所以打印时,需要分别把目录和正文

识别到Word中,再合并到一起。打印时要填入打印页码从1到最后一页,不要

选择打印全部。在打印选项中,要将页面比例设成真实大小,而不是整宽。注意

识别速度比其他格式要慢很多,请保持耐心。一般一本200多页的书,识别需要

几分钟的时间。

(二)超星文件识别相对比较麻烦一些,如果还有问题,可以先把超星打印

成完整的PDF文件,然后再用上述识别PDF文件的方法转成Word。

四、后记

经过试验,发现Microsoft Office Document Image 存在一些不稳定的问

题,如在用CAJ打印到Microsoft Office Document Image Writer时,发现用

CAJ5.5版本比较快,而CAJ5.0有时出现假死机。页面显示大时,转化的识别率

较高。如果页数多的文件,包括超星,可以分多次转化。

由于虚拟打印到Microsoft Office Document Image Writer 比较慢,并且

形成的虚拟文件很大,1本200多页的书大约是60M,因此会严重影响机器的运

本文标签: 文件选择识别打印文本