pdf转word什么格式-pdf格式的文件能转换成word格式吗

2022-11-24 07:49:15

pdf格式的文件能转换成word格式吗

下面介绍三种将pdf格式文件转换为microsoft word“doc”文档格式或纯文本文件的方法（版权本人所有，请勿转贴。呵呵）

一、文字内容的直接识别
如果是文本内容直接生成的pdf文件，可以采用以下最简单的两种办法实现文字识别。
1、在“adobe reader”或“adobe acrobat”软件显示窗口中先用“文本选择工具”选中要编辑的文本内容，再用复制键“ctrl＋c”把选中的文本内容复制到剪贴板中，然后，就可以在文本编辑软件中直接粘贴后编辑了。
2、在 “adobe acrobat”中将整个pdf文件“另存为”rtf文件格式，这样，就可以用“word”直接编辑了。

二、使用工具软件进行转换
如果pdf文件中包含有非标准编码，使用上述方法未必能够完全正确地被转换，或者转化过来的是乱码，而不能被文本编辑软件所直接使用。对于这种pdf文件，一般使用工具软件转换比较方便。这类的软件很多，而且多可以作为office文档编辑软件的插件使用，直接导入pdf文件进行编辑。比如：美国scansoft公司的“scansoft pdf converter for microsoft office”软件，能够在microsoft office中直接打开pdf文件，并且保留原来的格式和版面设计。美国voyagersoft llc 公司的“solid converter pdf”软件，可以将pdf 文件转换成可能被编辑的充分格式化和版面设置的microsoft word 文件, 保存文本、布局和图象等（见图1）。德国pixelplanet ltd 公司的“pdfgrabber”软件，可以将pdf文件格式转换成excel、rtf或者word格式。除此之外，还有“pdf to word”、“pdf2office ”等等软件，都是可以直接将pdf格式转换为doc、rtf或txt等格式的工具软件。使用起来非常方便，而且多可以保留pdf文件原来的格式和版面设计。

图 1 solid converter 版面设置和格式化选择界面

三、使用ocr方法进行识别
如果pdf格式源文件为扫描产生的文件，则文件为图像组成。对于图像中的文字内容即使使用了前面两种识别转换方法，也无法作为文本内容在文档编辑软件中直接使用。所以，需要使用ocr方法进行识别。通常也有两种方法：
1、使用万方数据文字识别插件。该插件是北京万方数据股份有限公司研制的专用于acrobat reader 4.0 以上版本软件的一个ocr工具，能够对pdf文件进行ocr整页识别或选择部分区域运行识别，并将识别结果保存为文本文件。
当插件安装成功后，启动acrobat reader，在“工具”菜单中会出现一个“万方ocr识别工具”选项，在快速工具栏上也会显示两个“万方ocr识别工具” 按钮（图2），一个提供整页识别功能，一个提供选择部分区域识别功能。例如：单击ocr整页识别按钮后进入ocr识别准备状态，鼠标指针将转变为ocr字样。在pdf文件浏览窗口点击所显示的pdf文件内容，出现提示框询问是否把当前页保存为tiff图像文件，单击[是]按钮，将弹出文件保存对话框，输入要保存的文件名，单击[确定]按钮即可将当前页保存到磁盘。单击[否]按钮会对当前页进行识别，并弹出识别窗口，识别窗口内的文字部分即为识别的结果。单击[保存]按钮以文本文件的形式把识别结果保存到磁盘。
万方数据文字识别插件主要对数字复印机产品所加工的pdf文件进行ocr识别，对于其他图像文字识别效果就不理想了。

图 2 “万方ocr识别工具” 按钮

2、使用第三方ocr软件识别。现国内比较流行的有清华紫光、北大、汉王、尚书等ocr软件，通常对汉字的识别能力都不错。
第一步，需要将pdf格式文件转换为图像文件。可以采用屏幕图像掠取软件，将屏幕显示的pdf文件中的文字抓取下来的办法，然后将其保存为图像文件。也可以直接利用“adobe acrobat“软件中的文件“另存为”功能，将pdf格式文件分页保存为tiff格式图像文件。不过，要注意的是要选择单色、300dpi以上精度保存图像文件才能提高ocr识别精度（见图3）。

图 3 设置tiff文件的精度
第二步，进行ocr文字识别。下面以“清华th-ocr 2000 千禧板”为例（见图4）。
操作步骤为：
（1）“文件”菜单下，“打开”图像文件（可以一次识别多个图像文件内容）；
（2）逐个图像文件内容进行ocr识别(个别图像在识别时需要进行倾斜校正、文稿校对等处理)；
（3）识别完毕，自动生成与图像文件名相同，扩展文件名为txt的文本文件，就可以对它们进行编辑了。

pdf如何转换成word格式

pdf已经是图片格式了要转word只能如下
一、“选择文字工具，选好了贴到word里”
如果你的pdf文件是用文字制做而不是图片制做的，可以“在adobe acrobat 7.0中有选择文字的工具，可以选好了贴到word里”。但是根据你介绍的情况，你的pdf文件是用图片做的，所以不能用这种方法。

二、批量截图
截图的办法对于不是很清楚的图片来说，并不可取，因为它要么会损失信息，要么会如楼主所说加大工作量。

我建议你先用adobe acrobat中的导出功能，将这个文件导出为图像。做法：在上面菜单上选文件>导出>提取图像为>jpeg文件（其他二种也行，jpeg文件比较小），再按提示，选择一个适当的文件夹，保存图像。
这种方法保存下来的一张张图片，比你一页页截图省力多了，而且保留了原文件的全部信息。不过500页可不一个小数，会很慢，但至少不用你亲自动手干预了。

三、批量识别
如果你想进行编辑，就必须进行ocr识别。关键在于你如何能够批量进行这个工作。

好一点的ocr软件都可以一次导入多幅图片进行识别，然后输出。不过，好像500页的确有点多了，我从来也没有超过50页的记录，通常也就是二、三十页。就算50页，也比一页一页强，是吧？

我用过不少ocr软件，觉得汉王文本王、清华紫光th比较好用。它们的识别率都非常高，还可以识别表格、繁体字、英文、竖排文字等；输出方式也很灵活，可以只输出文字，也可以按原稿排版格式输出word文件；使用起来也都不复杂。不知你用的是什么版本的汉王，识别率会那么低。我有的时候识别质量很次的报纸上的文章，它的识别率也还是可以接受的。

四、提高识别率
如果你的底图质量非常差的话，建议你先在图片处理软件中将导出的图片进行放大、去点、锐化等处理，然后再送到ocr中识别。

我估计，你可能还是送入ocr的图片损失了部分原文的信息，造成识别率下降。因为你既然能放大，放大后截图的识别率还可以，那就说明原图的信息足够ocr识别了。只是你在操作过程中损失了部分东西。

所以，我建议你：
1）先将你的pdf文件导出5－10页图片出来
2）用汉王等ocr软件进行批量识别（识别中注意将不规则的部分框除）
3）输出成word文档

如果它们能很顺利地被识别出来，那后面的事就不用我说了。如果不行，那就真的是你的底图的问题了，这就需要对导出的图片进行批量修正处理。

要把pdf格式转化成word文档用什么软件?

adobe acrobat 打开pdf ,然后导出word,下载地址： http://download.pchome.net/utility/file/browse/download-10195.html

pdf格式的怎样转换成word格式?

pdf转word
1. 可检索内容的pdf（内容可以用鼠标选中的非双层pdf）文件
推荐用下面软件转换
1.1 用 anybizsoft pdf converter v2 转换
1.2 用 solid converter pdf v6转换，
这两个效果都是蛮好的，特别是solid converter pdf v6 .
2. 对于是图片做成的pdf（特别是扫描件做成的pdf）文件
推荐用下面软件转换
2.1 页数比较少的用 cajviewer 7.0 （带ocr组件完整版），支持直接打开pdf文件，识别文字。
2.2 页数比较多的可以用 readiris corporate 12软件来进行识别（需要安装亚洲语言包，不然不识别中文）
2.3 页数比较多的还可以用 abbyy finereader 9或者9以上版本（有简体中文版）进行识别转换。
这个软件的识别率很高，转换出来的版面基本保持原样,还可以手动人工框选识别，缺点就是识别速度较慢。
上面几个软件的识别率都还可以，不建议用什么office组件识别，太麻烦识别率也不高。
3. 对于一些不允许做修改的pdf文件（就是加密加了权限的pdf），那么就先要去除密码或者去除数字证书，才能照上面两个步骤做~~~

上一页：PDF转Word使用哪款浏览器最方便？

下一页：pdf如何到word中-如何把pdf文件复制到word上