PDF の PII を検出して墨消し
PDF をスキャンしてメール・電話番号・SSN・カード番号・IBAN・IP アドレスなどの個人データを検出し、Auto-Redact PII で全ヒットを一括削除、Verify Redaction で消えたことを証明します——すべてローカルで実行されます。
Detect PII は PDF のテキストをスキャンして個人データを探し、Auto-Redact PII が全ヒットを一括削除し、Verify Redaction が結果を再スキャンして抽出可能なものが残っていないことを証明します。ループ全体がローカルで動きます——ドキュメントがマシンを離れることはありません。
まず元ファイルを守る
Replace source はデフォルトでオンです。出力が元ファイルを上書きし、バックアップは残りません。手順を始める前に Settings › General を開いて Replace source をオフにするか、別の出力フォルダを選んでください。
Detect PII
Privacy › Detect PII は PDF が持つ抽出可能なテキストを読み、見つかったヒットをページごとにグループ化して報告します——結果は「N items found across M pages」と表示されます。プレビューはマスクされるので(例:jo********@om)、スキャン結果自体は共有画面で見ても安全です。
6つのカテゴリをマッチします:
| タイプ | 捕捉するもの |
|---|---|
[email protected] | |
| Phone | 国際・国内形式、9〜15桁 |
| Social Security number | 123-45-6789 |
| Credit card | 13〜19桁、チェックサム検証済みでランダムな数字列はフラグされません |
| IBAN | 国際銀行口座番号 |
| IP address | 有効な 0.0.0.0〜255.255.255.255 |
スキャンは PDF が実際に含んでいるテキストだけを見ます。スキャン文書——ページの写真——にはテキストレイヤーがないので、人間には読めてもレポートは空で返ってきます。その場合はアプリ側もその旨を伝えます:OCR を実行してスキャンが何を見つけるか確認するか、Redact Content で見えている領域を手動で墨消ししてください。
Auto-Redact PII
Privacy › Auto-Redact PII はスキャン結果を受け取り、全ヒットを1パスで削除します。Pro 機能です。
これがただ黒い箱を上に描くのではなく、本物の墨消しである理由は2つあります:
- 影響を受けるページはラスタライズされます——墨消しを描き込んだ状態で画像にレンダリングされるので、下のテキストはファイル内に一切存在しなくなります。矩形の下に隠れているだけではありません。
- パスはフェイルクローズです:ページを安全にレンダリングできない場合、見た目だけの覆いを出荷するのではなく、実行は失敗を報告します。
トレードオフとして、ラスタライズされたページはテキストの画像になります。表示も印刷も同一ですが、そのページのテキストは選択も検索もできなくなります——PDF では、それが目的です。
Verify Redaction
Privacy › Verify Redaction は出力ファイルに同じスキャンを実行し、まだ抽出可能なものを報告します:残ったテキスト量と残存する PII ヒットです。ドキュメントを手放す前に欲しい結果は「Clean — no extractable text remains」です。「N items still extractable」と報告されたら、スキャンを再実行して何が生き残ったかを確認します——マッチャーが見逃したパターンか、触れられなかったページ上のテキストです。
墨消しのたびに必ず検証してください。「黒く塗られたように見える」と「証明可能に消えた」の違いです。
代わりに破壊すべきとき
クリーンなコピーを出した後に元の文書が存在すべきでないなら、File Shredder が削除前に元ファイルをランダムデータで上書きします——デフォルトで3パス。これは永続的で、復元はできません。
関連ページ
- 写真と PDF のメタデータを削除
- プライバシーとネットワーク挙動
- Redact Content ツール——手動の領域指定墨消し
- OCR ツール——テキストレイヤーのないスキャン文書向け
- メタデータ衛生ガイド
使用するツール