把扫描件 OCR 成文本(英文)

用离线 OCR 从扫描版 PDF 中提取文字:仅支持英文识别,输出为纯 .txt 文件而不是可搜索 PDF——这里写清了对手写体、低分辨率扫描和非英文内容应该抱有的预期,以及识别失败时的替代做法。本节如实说明英文 OCR 的边界,以及结果不满足需求时的替代路径。

1FileTool 的 OCR 工具在你的 Mac 上把扫描版 PDF 变成纯文本文件——不上传,也不走云端 OCR 服务。它只识别英文,输出 .txt 文件,而不是可搜索的 PDF。

先保护好原始文件

Replace source 默认开启:输出会覆盖原文件且不保留备份。在跟着操作之前,请打开 Settings › General 关闭 Replace source,或另选一个输出文件夹。

对扫描件运行 OCR

  1. 打开 PDF Tools › OCR(工具页)。
  2. 拖入扫描版 PDF。
  3. 运行。每页以 300 DPI 渲染后再识别,所以长扫描件要花些时间——进度按页显示。
  4. 在输出位置找到 <name>_ocr.txt。页面之间以一行 --- Page Break --- 分隔。

你能得到什么(和得不到什么)

  • 输出是纯 .txt——只有文字和换行,没有排版和字体。两栏扫描件会被直接通读。
  • 识别仅支持英文。其他语言的页面会出来乱码或空白。
  • 干净、平整、对比度合适的扫描件识别效果好。手写、印章、拍歪的照片、热敏纸上的浅字需要手工清理。
  • OCR 不会产出可搜索 PDF——它做的是提取文本。想要在 Word 里拿到可编辑段落,用 Scanned PDF to Word。

如果你需要文字进入别的格式

  • Scanned PDF to Word 跑的是同一套 OCR,但输出为纯段落的 .docx——见 PDF 转 Word。
  • PDF Tools › Extract Text 复制数字版 PDF 的内嵌文本层——瞬间完成,但对扫描件找不到东西,因为扫描件没有文本层。

相关内容

用到的工具

Keep the next file job off the internet.

Every tool is in the free download. Upgrade once, when the daily limit starts getting in your way.

PrivateOfflinePay once

No account, no credit card. Pro includes a 7-day money-back guarantee.