PDF から個人データを見つけて本当に削除する
PDF 内のメールアドレス、電話番号、SSN、カード番号などを検出し、テキストをコピーしても復元できない本物の墨消しを行い、Verify Redaction でファイルがクリーンであることを検証します——練習用の偽データ入りサンプル付きです。
進捗
PDF から個人データを見つけて永久に削除します——生きたテキストの上に黒いハイライトを引くのではなく、本物の墨消しです。1FileTool の Detect PII はメール、電話番号、SSN、カード番号、IBAN、IP アドレスをスキャンし、Auto-Redact PII(Pro)がファイルから焼き尽くし、Verify Redaction が抽出可能なものが残っていないことを証明します。
必要なもの
- 1FileTool のインストール
- 以下のサンプル契約書——中の識別子はすべて意図的に偽物です(
000-00-0000、[email protected]、Visa のテストカード番号) - ワンクリック墨消しステップには Pro が必要。Detect と Verify のステップは無料です
redact-pii-from-a-pdf.zip
サンプルファイル · 2.0 KB
- contract-fake-pii.pdf1.9 KB
まず元ファイルを守る
Replace source はデフォルトでオンです。出力が元ファイルを上書きし、バックアップは残りません。手順を始める前に Settings › General を開いて Replace source をオフにするか、別の出力フォルダを選んでください。
手順
1. Detect PII を実行
Privacy Tools › Detect PII を開き、contract-fake-pii.pdf をドロップして Run on 1 file を押します。レポートはすぐに表示されます:「6 items found across 1 page」——各一致が独自の行に、タイプバッジ(「Email address」「Social Security number」「Credit card number」…)、ja********om のようなマスク済みプレビュー、ページ番号付きで表示されます。
2. 墨消し前にレポートを読む
何かを削除する前に、何が捕捉されたかを確認します。レポートが「This PDF has no extractable text, so it is probably scanned」と言う場合、そのファイルはすでにピクセルです——うまくいかない場合の注記に進んでください。
3. Auto-Redact PII を実行
Privacy Tools › Auto-Redact PII を開き、同じ PDF をドロップして実行ボタンを押します。すべての一致を再検出し、それぞれを永久に焼き尽くします:影響を受けるページは一致部分を塗りつぶした状態で画像として再レンダリングされるので、コピー&ペーストでテキストを復元できません。結果は出力フォルダに redacted_contract-fake-pii.pdf として書き込まれます。
無料プランではこのステップは親切なエラーで止まります——「One-click PII redaction is a Pro feature… Scanning for PII is free.」。Pro がなくても、Detect のレポートは、ソース文書を編集して PDF を再エクスポートすれば何を削除すべきか正確に教えてくれます。
4. 出力を検証する
Privacy Tools › Verify Redaction を開き、redacted_contract-fake-pii.pdf をドロップします。墨消しページは画像として再レンダリングされているので、答えは「Clean — no extractable text remains in this PDF.」で返ってきます。コンプライアンスに聞かれたときのために、スクリーンショットを残す価値のあるチェックです。
5. データをコピーしてみる
説得力のあるテスト:墨消し済み PDF を任意のビューアで開き、そのメールを選択または検索してみてください——あった場所には選択できるものが何もありません。普通のエディタで描いたボックスは下のテキストレイヤーをそのまま残しますが、これは残しません。
結果
サンプル契約書は6つの個人識別子を持って入り、redacted_contract-fake-pii.pdf として抽出可能な一致ゼロで出てきます——黒いボックスを目視するのではなく、アプリ自身の Verify ステップによって検証済みです。
うまくいかない場合
- 「This PDF has no extractable text」——それはスキャンまたは写真です。PII 検出はテキストレイヤーを読みます。画像のみの PDF では、PDF エディタで領域を視覚的に墨消しするか、先に OCR でページを変換してください。
- 「No personal data found」——良いニュースか、検出器がカバーしない形式です(メール、電話、SSN、カード番号、IBAN、IP は認識しますが、名前や住所は認識しません)。
- 「PRO_REQUIRED」/アップセルエラー:Auto-Redact には Pro が必要です。無料ユーザーでも Detect の完全なレポートを取得でき、PDF を再作成すればすべて削除できます。
- 一致が生き残った:出力に対して Detect を再実行してください——何か残っていれば Verify が「N items are still extractable」と言うので分かります。
次に試すこと
GPS とカメラデータを削除は同じ問題の画像側をカバーします。Privacy Tools › Strip Metadata も、PDF を共有する前に author/title メタデータをこそぎ落とせます。