2022-11-27 22:43:10
caj和pdf格式转换word
1. 如果不是图片类做成的pdf 你可以尝试用verypdf pdf2word 工具或者使用solid converter pdf 转换 但是如果是内嵌了字体的,那么就要看情况了,因为有的字体你系统里面有,转出来就没有问题,如果系统里面没有,那么转出来就是一堆乱码,那么就先要把这些pdf文件转成位图形式(也就是常说的pdf转曲)然后在用工具转,当然这时候上面的2个工具基本无能为力了
2. 对于是图片做成的pdf 那么我们就需要用ocr类软件进行识别了,你可以用比较简单的cajviewer来提取 但是只能是一页页提取文字,或者你可以使用readiris corporate 12软件来进行识别,但是readiris corporate 12呢需要下载支持韩语 日语还有简体中文的亚洲语言包才是识别中文,但是这个软件的ocr识别率是比较好的~~~~还有abbyy fine reader 也是ocr软件 识别率也是很好的,而且支持中文字符~~~
3. 对于一些不允许做修改的pdf文件(就是加密加了权限的pdf),那么就先要去除密码或者去除数字证书,才能照上面两个步骤做复制黏贴.希望对你有帮助
在cajviewer7.0中怎么把pdf转换成word
这个软件本身不能直接转成 word 格式的文档!它只能直接输出成 txt 格式的文本文档,转成 文本文档后 再使用 word 来打开 重新排版编辑!如果你是纯文本的 pdf……
不好用!还是找别的 转换器吧!
如何将pdf,caj,nh格式文章转换为word文档
转换成word文档
方法一
1.若安装有pdf professional,按照上述方法先转换成pdf文档,再把所得到的文件直接另存为word文档(.doc)。
2.若你的pdf阅读器不能把文档直接保存为word文档,使用第三方软件:pdf word 转换软件,下载地址见链接:
http://wenda.tianya.cn/wenda/thread?tid=7d6efc4721fbb847&clk=wttpcts
方法二
第一步:首先使用caj浏览器打开文档,接下来选择打印,在打开的“打印”设置窗口中将“打印机”栏中的“名称”设置为“microsoft office document image writer”,确认后将该nh文件输出为mdi格式的虚拟打印文件。
提示:如果你在“名称”设置的下拉列表中没有找到“microsoft office document image writer”项,那证明你在安装office 2003的时候没有安装该组件,请使用office 2003安装光盘中的“添加/删除组件”更新安装该组件。
第二步:运行microsoft office document imaging,并利用它来打开刚才保存的mdi文件,选择“工具→将文本发送到word”菜单,并在弹出的窗口中勾选“在输出时保持图片版式不变”,确认后系统提示“必须在执行此操作前重新运行ocr。这可能需要一些时间”,确认即可。
怎么才可以把pdf格式和 caj格式的资料以word的格式...
强烈推荐adobe reader 8打开pdf。
在网上的许多资料都是以caj、pdf等文件格式提供的,其中的文本不能被直接编辑。网上提供了许多处理这种情况的软件,但是它们不是效率低,就是只能提取其中部分文本。本文所述利用微软提供的ocr识别技术从caj、pdf等文件中提取全部文本的方法,简便快捷,效率很高。
从不同格式的文件中提取文本前需要做好以下准备工作,安装cajviewer5.5浏览器软件和acrobat 5 专业版浏览器软件安装office2003,并完全安装of?鄄fice工具microsoft office document imaging,然后在打印机里面会增加microsoft office document image writer打印机。 microsoft office document image可以非常准确的全文件识别转化中文、英文、表格。
一、caj文件的识别
(一)首先,从网上下载caj格式的资料文件保存到本地硬盘上。
(二)然后,启动cajviewer浏览器程序,并在该程序中打开刚才保存的caj格式的文件。浏览文件到最后一页后,不要关闭caj浏览器程序。
(三)在caj浏览器程序窗口中,选择“文件”→“打印”,并选择打印机为microsoft office document image writer打印机,勾选打印到文件选项和确定打印页数。
(四)保存打印文件(*.prn)到适当位置。等待打印完成后,microsoft office document image 自动打开刚才保存的打印文件。
(五)在microsoft office document image窗口中,选择“页面”菜单中的“选择所有页面”菜单项,然后选择“工具”菜单中的“使用ocr识别文本”提取文本。
(六)选择“工具”下的 “将文本发送到word”,最后将把整个caj文件识别输出到word文件中。
二、pdf文件的识别
(一)以文本形式保存的pdf文件,用acrobat 5 专业版,识别整个文件。直接打开从网上下载的pdf格式文件另存为rtf文件,或者选择工具栏上的文字选择按钮,然后选择文字区域,然后复制到word中即可。
(二)以图片形式保存的pdf文件,将pdf文件打印到microsoft office document image writer打印机,选择打印形成的文件的保存位置,然后会自动形成一个mdi文件,并且自动用microsoft office document image打开此文件,然后在microsoft office document im?鄄age中选择“工具”菜单中的“使用ocr识别文本”,识别完成后,在选择“工具”下的,“将文本发送到word”,最后将把整个pdf文件识别输出到word文件中。
(三)加密的pdf文件先下载解密软件,解密后在参照上述步骤1),2) 进行。
(四)繁体pdf文件用上述步骤2)的方法识别到word后,用word中的“工具”→“语言”→“中文繁简转换”
三、超星文件的识别
(一)全文件识别打印到microsoft office document image writer打印机,然后按上述pdf文件的识别步骤中第二点操作,要注意的是,超星打印功能有点区别,因为超星是目录和全文分开的,所以打印时,需要分别把目录和正文识别到word中,再合并到一起。打印时要填入打印页码从1到最后一页,不要选择打印全部。在打印选项中,要将页面比例设成真实大小,而不是整宽。注意识别速度比其他格式要慢很多,请保持耐心。一般一本200多页的书,识别需要几分钟的时间。
(二)超星文件识别相对比较麻烦一些,如果还有问题,可以先把超星打印成完整的pdf文件,然后再用上述识别pdf文件的方法转成word。
四、后记
经过试验,发现microsoft office document image 存在一些不稳定的问题,如在用caj打印到microsoft office document image writer时,发现用caj5.5版本比较快,而caj5.0有时出现假死机。页面显示大时,转化的识别率较高。如果页数多的文件,包括超星,可以分多次转化。
由于虚拟打印到microsoft office document image writer 比较慢,并且形成的虚拟文件很大,1本200多页的书大约是60m,因此会严重影响机器的运行速度、c盘和内存空间。建议配置好的机器一次转化不要超过200页,配置差的不要超过100页,同时打印时在任务栏中会出现打印机图标,可以双击,看到打印任务的进度,避免误以为死机。转化完成后请删除c:\windows\temp目录下的虚拟打印文件,否则c盘很快会被用光。