把扫描件 OCR 成文本(英文)
用离线 OCR 从扫描版 PDF 中提取文字:仅支持英文识别,输出为纯 .txt 文件而不是可搜索 PDF——这里写清了对手写体、低分辨率扫描和非英文内容应该抱有的预期,以及识别失败时的替代做法。本节如实说明英文 OCR 的边界,以及结果不满足需求时的替代路径。
1FileTool 的 OCR 工具在你的 Mac 上把扫描版 PDF 变成纯文本文件——不上传,也不走云端 OCR 服务。它只识别英文,输出 .txt 文件,而不是可搜索的 PDF。
先保护好原始文件
Replace source 默认开启:输出会覆盖原文件且不保留备份。在跟着操作之前,请打开 Settings › General 关闭 Replace source,或另选一个输出文件夹。
对扫描件运行 OCR
- 打开 PDF Tools › OCR(工具页)。
- 拖入扫描版 PDF。
- 运行。每页以 300 DPI 渲染后再识别,所以长扫描件要花些时间——进度按页显示。
- 在输出位置找到
<name>_ocr.txt。页面之间以一行--- Page Break ---分隔。
你能得到什么(和得不到什么)
- 输出是纯
.txt——只有文字和换行,没有排版和字体。两栏扫描件会被直接通读。 - 识别仅支持英文。其他语言的页面会出来乱码或空白。
- 干净、平整、对比度合适的扫描件识别效果好。手写、印章、拍歪的照片、热敏纸上的浅字需要手工清理。
- OCR 不会产出可搜索 PDF——它做的是提取文本。想要在 Word 里拿到可编辑段落,用 Scanned PDF to Word。
如果你需要文字进入别的格式
- Scanned PDF to Word 跑的是同一套 OCR,但输出为纯段落的
.docx——见 PDF 转 Word。 - PDF Tools › Extract Text 复制数字版 PDF 的内嵌文本层——瞬间完成,但对扫描件找不到东西,因为扫描件没有文本层。
相关内容
- PDF 转 Word:visual 与 text 模式
- 保护和遮蔽 PDF——如果 Detect PII 报告文件是扫描件,先做 OCR
- 本地 OCR 与隐私
- 为什么文件永不上传
- 压缩 PDF
用到的工具