PDF 转 Word:visual 与 text 模式、扫描版 PDF

离线把 PDF 转成 .docx——visual 模式把每页嵌为图片以保留排版但文字不可编辑,text 模式经 OCR 输出可编辑段落,Scanned PDF to Word 处理没有文本层的扫描件,另有批量版本处理整叠文件。三者互不替代,选对工具比转换本身更重要。

1FileTool 在你的 Mac 上离线把 PDF 转成 Word——文件不会上传,结果以 <name>_converted.docx 落盘。有三个工具覆盖这件事,选哪个取决于你在意的是排版还是可编辑的文字。

先保护好原始文件

Replace source 默认开启:输出会覆盖原文件且不保留备份。在跟着操作之前,请打开 Settings › General 关闭 Replace source,或另选一个输出文件夹。

三个工具

  • PDF Tools › PDF to Word——visual 模式。每一页都作为整页图片嵌入 .docx,所以 Word 文件看起来和 PDF 一模一样。排版最重要时选它。(PDF to Word)
  • PDF Tools › Scanned PDF to Word——对每页跑 OCR 并输出普通段落。PDF 是扫描件且你需要可编辑文字时选它。(Scanned PDF to Word)
  • PDF Tools › Batch PDF to Word——对整个拖入的文件夹应用 visual 模式。(Batch PDF to Word)

两种模式各产出什么

Visual 模式——PDF to Word 和 Batch PDF to Word 的默认——渲染每个 PDF 页面并以图片形式放进文档。字体、表格、图片、分栏排版逐像素保留。代价是:里面的文字是图片的一部分,在 Word 里无法编辑。

Text 模式——Scanned PDF to Word 用的方式——提取真实文字并写成普通段落。结果完全可编辑,但复杂排版会塌缩成简单的段落流:多栏扫描件会变成单栏文字。

转换扫描版 PDF

扫描件是一页的照片——没有可复制的文本层。Scanned PDF to Word 对每页运行英文 OCR,把识别出的词写成段落:

  1. 把扫描版 PDF 拖到 Scanned PDF to Word 上。
  2. 运行。OCR 明显比普通转换慢——每一页都要先渲染再识别。
  3. 打开 <name>_converted.docx 校对一遍。干净扫描件上的 OCR 相当接近;手写、印章和浅淡的文字需要手工修正。

如果你只要文字、不需要 Word 文件,OCR 会直接输出一个 .txt。

如果跑出来是空的

没有文本层也没有可识别图像内容的 PDF 可能报错,提示你改用 Scanned PDF to Word。用那个工具重跑这个文件——它用 OCR 而不是提取。

相关内容

Keep the next file job off the internet.

Every tool is in the free download. Upgrade once, when the daily limit starts getting in your way.

PrivateOfflinePay once

No account, no credit card. Pro includes a 7-day money-back guarantee.