离线 PDF 转 Word:选对工具
不上传就把 PDF 转成 DOCX。弄清 PDF to Word 实际产出什么(版式保留但不可编辑的整页图片)、什么时候 Scanned PDF to Word 的 OCR 才名副其实,以及批量版本如何一次处理整个文件夹。附一份普通合同和一张扫描收据示例,两者各走各的路。
你的进度
把一个 PDF 变成 DOCX,却不上传到任何地方。1FileTool 有三个独立的 Word 工具,它们做的事情真的不一样——本教程把同一批文件分别送进对应的那一个,让差异不再是惊喜。
你需要什么
- 已安装 1FileTool
- 两个示例 PDF:一份普通的文字协议和一张扫描收据(包在 PDF 里的图片——里面没有真实文字)
pdf-to-word-offline.zip
示例文件 · 29.5 KB
- agreement-text.pdf2.5 KB
- scan-receipt.pdf36.8 KB
先保护好原始文件
Replace source 默认开启:输出会覆盖原文件且不保留备份。在跟着操作之前,请打开 Settings › General 关闭 Replace source,或另选一个输出文件夹。
这些工具上的开关叫 Put converted file at same location:开,DOCX 落在原 PDF 旁边;关,去你的输出文件夹。两种都不动原文件。
步骤
1. 打开 PDF to Word
打开 PDF Tools › PDF to Word("Preserve PDF layout in DOCX"),把 agreement-text.pdf 拖到区域上。
2. 运行并打开 DOCX
按 Run on 1 file。agreement-text_converted.docx 写在 PDF 旁边(开关关掉则在输出文件夹)。在 Word 里打开:每一页以整页图片出现,和原件一模一样。
这就是诚实的取舍:PDF to Word 通过把每页嵌成图片来保留版式。 文档看起来完全相同——但文字不可编辑。
3. 想要可编辑文字就跑基于文本的工具
要真正能编辑的文字,打开 PDF Tools › Scanned PDF to Word,再拖一次 agreement-text.pdf。这个会在页面上跑 OCR,写出朴素可编辑的段落——版式被简化成一栏干净的文字。
4. 转换真正的扫描件
把 scan-receipt.pdf 拖到 Scanned PDF to Word 上。这正是这个工具存在的意义:PDF 没有可提取文本,OCR 读像素,你拿回可编辑文字。
5. 一次处理整个文件夹
一摞文件用 PDF Tools › Batch PDF to Word 一次跑完,用的是视觉(整页图片)模式——每个源文件产出一个 *_converted.docx。
结果
一个 PDF 产出两种不同的 DOCX,各有各的存在理由:视觉版看起来一模一样但不可编辑,OCR 版朴素但可编辑。当一个 PDF 完全没有文本层时,OCR 是唯一入口——在扫描收据上跑一遍就证明了它确实能用。
如果不管用
- "No text could be extracted from this PDF. Try Scanned PDF to Word."——文件是扫描件或纯图片;换工具。
- DOCX 里是图片而不是可编辑文字:那是 PDF to Word 在照它的承诺干活——保版式。要编辑请用 Scanned PDF to Word。
- OCR 输出有错别字:OCR 引擎仅支持英文,对干净扫描效果最好;手写和非英文文本超出这个版本的能力。
- 找不到 DOCX:检查 Put converted file at same location 开关——开是"在 PDF 旁边",关是你的输出文件夹。
接下来试试
对你正在转换的文件做离线 PDF 压缩——如果 PDF 来自扫描仪,OCR 文档讲了文本引擎能读什么、不能读什么。