在 PDF 中检测并遮盖 PII

扫描 PDF 中的个人数据(邮箱、电话、SSN、卡号、IBAN、IP 地址),用 Auto-Redact PII 一次删除全部命中并让页面重渲染为图像,再用 Verify Redaction 证明已无可提取内容——全程在你的机器上本地运行。

Detect PII 扫描 PDF 文本中的个人数据,Auto-Redact PII 一次性删除所有命中项,Verify Redaction 再扫描输出结果来证明没有可提取的残留。整个闭环都在本地运行——文档不会离开你的机器。

先保护好原始文件

Replace source 默认开启:输出会覆盖原文件且不保留备份。在跟着操作之前,请打开 Settings › General 关闭 Replace source,或另选一个输出文件夹。

Detect PII

Privacy › Detect PII 读取一个 PDF 中可提取的文本,报告找到的每个命中项,按页分组——结果显示为 "N items found across M pages"。预览会被打码(例如 jo********@om),所以在共享屏幕上查看扫描结果也是安全的。

匹配六个类别:

类型能抓到什么
Email[email protected]
Phone国际和本地格式,9–15 位数字
Social Security number123-45-6789
Credit card13–19 位数字,带校验和验证,随机数串不会误报
IBAN国际银行账号
IP address合法的 0.0.0.0–255.255.255.255

扫描只能看到 PDF 实际包含的文本。扫描件——一页纸的照片——没有文本层,所以即使人能读出来,报告也会是空的。这种情况下应用也会提示:跑 OCR 看看扫描能找到什么,或者用 Redact Content 手动遮盖可见区域。

Auto-Redact PII

Privacy › Auto-Redact PII 拿到扫描结果,一趟删除所有命中项。这是 Pro 功能。

有两点让它成为真正的遮盖,而不是在表面画个黑框:

  • 受影响的页面会被栅格化——渲染成图像并把遮盖画进去——所以底下的文字在文件里彻底不存在了,而不只是被一个矩形盖住。
  • 流程失败即拒:如果某页无法安全渲染,这次运行会报告失败,而不是交出一个只盖表面的结果。

代价是:栅格化的页面变成了文字的图像。显示和打印效果完全一致,但该页的文字不再可选中、不可搜索——对 PDF 来说,这正是目的。

Verify Redaction

Privacy › Verify Redaction 对你的输出文件跑同样的扫描,报告仍可提取的内容:剩余文本长度加上残留的 PII 命中。"Clean — no extractable text remains" 是文件出手前你想要的结果。如果它报告 "N items still extractable",重跑扫描看看什么活了下来——可能是匹配器漏掉的模式,或者没被动过的某页上的文字。

每次遮盖后都要 verify。这就是"看起来涂黑了"和"可证明地消失了"之间的差别。

什么时候该直接销毁

如果源文档在干净副本发出后压根不该存在,File Shredder 会在删除前用随机数据覆盖原文件——默认三遍。这是永久性的;无法恢复。

相关内容

Keep the next file job off the internet.

Every tool is in the free download. Upgrade once, when the daily limit starts getting in your way.

PrivateOfflinePay once

No account, no credit card. Pro includes a 7-day money-back guarantee.