PDF 转 Word:visual 与 text 模式、扫描版 PDF
离线把 PDF 转成 .docx——visual 模式把每页嵌为图片以保留排版但文字不可编辑,text 模式经 OCR 输出可编辑段落,Scanned PDF to Word 处理没有文本层的扫描件,另有批量版本处理整叠文件。三者互不替代,选对工具比转换本身更重要。
1FileTool 在你的 Mac 上离线把 PDF 转成 Word——文件不会上传,结果以 <name>_converted.docx 落盘。有三个工具覆盖这件事,选哪个取决于你在意的是排版还是可编辑的文字。
先保护好原始文件
Replace source 默认开启:输出会覆盖原文件且不保留备份。在跟着操作之前,请打开 Settings › General 关闭 Replace source,或另选一个输出文件夹。
三个工具
- PDF Tools › PDF to Word——visual 模式。每一页都作为整页图片嵌入 .docx,所以 Word 文件看起来和 PDF 一模一样。排版最重要时选它。(PDF to Word)
- PDF Tools › Scanned PDF to Word——对每页跑 OCR 并输出普通段落。PDF 是扫描件且你需要可编辑文字时选它。(Scanned PDF to Word)
- PDF Tools › Batch PDF to Word——对整个拖入的文件夹应用 visual 模式。(Batch PDF to Word)
两种模式各产出什么
Visual 模式——PDF to Word 和 Batch PDF to Word 的默认——渲染每个 PDF 页面并以图片形式放进文档。字体、表格、图片、分栏排版逐像素保留。代价是:里面的文字是图片的一部分,在 Word 里无法编辑。
Text 模式——Scanned PDF to Word 用的方式——提取真实文字并写成普通段落。结果完全可编辑,但复杂排版会塌缩成简单的段落流:多栏扫描件会变成单栏文字。
转换扫描版 PDF
扫描件是一页的照片——没有可复制的文本层。Scanned PDF to Word 对每页运行英文 OCR,把识别出的词写成段落:
- 把扫描版 PDF 拖到 Scanned PDF to Word 上。
- 运行。OCR 明显比普通转换慢——每一页都要先渲染再识别。
- 打开
<name>_converted.docx校对一遍。干净扫描件上的 OCR 相当接近;手写、印章和浅淡的文字需要手工修正。
如果你只要文字、不需要 Word 文件,OCR 会直接输出一个 .txt。
如果跑出来是空的
没有文本层也没有可识别图像内容的 PDF 可能报错,提示你改用 Scanned PDF to Word。用那个工具重跑这个文件——它用 OCR 而不是提取。