PDF文件

2022-10-21 11:10:44   第一文档网     [ 字体: ] [ 阅读: ] [ 文档下载 ]

#第一文档网# 导语】以下是®第一文档网的小编为您整理的《PDF文件》,欢迎阅读!
文件,PDF


一、CAJ文件的识别

(一)首先,从网上下载CAJ格式的资料文件保存到本地硬盘上。

(二)然后,启动CAJViewer浏览器程序,并在该程序中打开刚才保存的CAJ格式的文件。浏览文件到最后一页后,不要关闭CAJ浏览器程序。

(三)在CAJ浏览器程序窗口中,选择文件”→“打印,并选择打印机为Microsoft Office Document Image Writer打印机,勾选打印到文件选项和确定打印页数。

(四)保存打印文件*.prn到适当位置。等待打印完成后,Microsoft Office Document Image 自动打开刚才保存的打印文件。

(五)在Microsoft Office Document Image窗口中,选择页面菜单中的选择所有页面单项,然后选择工具菜单中的使用OCR识别文本提取文本。

(六)选择工具下的 将文本发送到word”,最后将把整个CAJ文件识别输出到word件中。

二、PDF文件的识别

(一)以文本形式保存的PDF文件,用acrobat 5 专业版,识别整个文件。直接打开从网上下载的PDF格式文件另存为RTF文件,或者选择工具栏上的文字选择按钮,然后选择文字区域,然后复制到Word中即可。

(二)图片形式保存的PDF文件,PDF文件打印到Microsoft Office Document Image Writer打印机,选择打印形成的文件的保存位置,然后会自动形成一个MDI文件,并且自动用Microsoft Office Document Image打开此文件,然后在Microsoft Office Document Im?age中选择工具菜单中的使用OCR识别文本,识别完成后,在选择工具下的,文本发送到word”,最后将把整个PDF文件识别输出到word文件中。 (三)加密的PDF文件先下载解密软件,解密后在参照上述步骤1),2) 进行。

(四)繁体PDF文件用上述步骤2)的方法识别到word后,word中的工具”→“语言”→“文繁简转换 三、超星文件的识别

(一)全文件识别打印到Microsoft Office Document Image Writer打印机,然后按上述PDF文件的识别步骤中第二点操作,要注意的是,超星打印功能有点区别,因为超星是目录和全文分开的,所以打印时,需要分别把目录和正文识别到Word中,再合并到一起。打印时要填入打印页码从1到最后一页,不要选择打印全部。在打印选项中,要将页面比例设成真实大小,而不是整宽。注意识别速度比其他格式要慢很多,请保持耐心。一般一本200页的书,识别需要几分钟的时间。

(二)超星文件识别相对比较麻烦一些,如果还有问题,可以先把超星打印成完整的PDF文件,然后再用上述识别PDF文件的方法转成Word 四、后记

经过试验,发现Microsoft Office Document Image 存在一些不稳定的问题,如在用CAJ打印到Microsoft Office Document Image Writer时,发现用CAJ5.5版本比较快,CAJ5.0有时出现假死机。页面显示大时,转化的识别率较高。如果页数多的文件,包括超星,可以分多次转化。

由于虚拟打印到Microsoft Office Document Image Writer 比较慢,并且形成的虚拟文件很大,1200多页的书大约是60M,因此会严重影响机器的运行速度、C盘和内存空间。建议配置好的机器一次转化不要超过200页,配置差的不要超过100页,同时打印时在任






务栏中会出现打印机图标,可以双击,看到打印任务的进度,避免误以为死机。转化完成后请删除c:\windows\temp目录下的虚拟打印文件,否则C盘很快会被用光。

4

PDF文中插图选中后可用快照功能然后粘贴到word文档中

CAJV格式的文字可用工具——文字识别——发送到word文档中或者使用工具——文本选择选中后复制到word文档中

CAJV文中插图使用工具——选择图像——发送到word文档中




本文来源:https://www.dy1993.cn/HHIx.html

相关推荐