在 PDF 中检测并遮盖 PII
扫描 PDF 中的个人数据(邮箱、电话、SSN、卡号、IBAN、IP 地址),用 Auto-Redact PII 一次删除全部命中并让页面重渲染为图像,再用 Verify Redaction 证明已无可提取内容——全程在你的机器上本地运行。
Detect PII 扫描 PDF 文本中的个人数据,Auto-Redact PII 一次性删除所有命中项,Verify Redaction 再扫描输出结果来证明没有可提取的残留。整个闭环都在本地运行——文档不会离开你的机器。
先保护好原始文件
Replace source 默认开启:输出会覆盖原文件且不保留备份。在跟着操作之前,请打开 Settings › General 关闭 Replace source,或另选一个输出文件夹。
Detect PII
Privacy › Detect PII 读取一个 PDF 中可提取的文本,报告找到的每个命中项,按页分组——结果显示为 "N items found across M pages"。预览会被打码(例如 jo********@om),所以在共享屏幕上查看扫描结果也是安全的。
匹配六个类别:
| 类型 | 能抓到什么 |
|---|---|
[email protected] | |
| Phone | 国际和本地格式,9–15 位数字 |
| Social Security number | 123-45-6789 |
| Credit card | 13–19 位数字,带校验和验证,随机数串不会误报 |
| IBAN | 国际银行账号 |
| IP address | 合法的 0.0.0.0–255.255.255.255 |
扫描只能看到 PDF 实际包含的文本。扫描件——一页纸的照片——没有文本层,所以即使人能读出来,报告也会是空的。这种情况下应用也会提示:跑 OCR 看看扫描能找到什么,或者用 Redact Content 手动遮盖可见区域。
Auto-Redact PII
Privacy › Auto-Redact PII 拿到扫描结果,一趟删除所有命中项。这是 Pro 功能。
有两点让它成为真正的遮盖,而不是在表面画个黑框:
- 受影响的页面会被栅格化——渲染成图像并把遮盖画进去——所以底下的文字在文件里彻底不存在了,而不只是被一个矩形盖住。
- 流程失败即拒:如果某页无法安全渲染,这次运行会报告失败,而不是交出一个只盖表面的结果。
代价是:栅格化的页面变成了文字的图像。显示和打印效果完全一致,但该页的文字不再可选中、不可搜索——对 PDF 来说,这正是目的。
Verify Redaction
Privacy › Verify Redaction 对你的输出文件跑同样的扫描,报告仍可提取的内容:剩余文本长度加上残留的 PII 命中。"Clean — no extractable text remains" 是文件出手前你想要的结果。如果它报告 "N items still extractable",重跑扫描看看什么活了下来——可能是匹配器漏掉的模式,或者没被动过的某页上的文字。
每次遮盖后都要 verify。这就是"看起来涂黑了"和"可证明地消失了"之间的差别。
什么时候该直接销毁
如果源文档在干净副本发出后压根不该存在,File Shredder 会在删除前用随机数据覆盖原文件——默认三遍。这是永久性的;无法恢复。
相关内容
- 从照片和 PDF 删除元数据
- 隐私与网络行为
- Redact Content 工具——手动按区域遮盖
- OCR 工具——用于没有文本层的扫描件
- 元数据卫生指南