PDF में PII पहचानें और redact करें
निजी डेटा के लिए PDF स्कैन करें, हर हिट Auto-Redact PII से हटाएं, फिर Verify Redaction से साबित करें कि खत्म हुआ — सब लोकल आपकी मशीन पर।
Detect PII निजी डेटा के लिए PDF का टेक्स्ट स्कैन करती है, Auto-Redact PII एक पास में हर मैच हटा देती है, और Verify Redaction नतीजे को दोबारा स्कैन करके साबित करती है कि कुछ निकालने योग्य नहीं बचा। पूरा लूप लोकल चलता है — दस्तावेज़ आपकी मशीन से कभी नहीं निकलती।
पहले अपनी ओरिजिनल फ़ाइलें सुरक्षित करें
Replace source डिफ़ॉल्ट ऑन है: आउटपुट ओरिजिनल फ़ाइल को ओवरराइट करती है और कोई बैकअप नहीं रखा जाता। साथ चलने से पहले, Settings › General खोलें और Replace source ऑफ करें, या एक अलग आउटपुट फ़ोल्डर चुनें।
Detect PII
Privacy › Detect PII एक PDF का निकालने योग्य टेक्स्ट पढ़ती है और हर पाए गए हिट की रिपोर्ट प्रति पेज ग्रुप करके देती है — नतीजा "N items found across M pages" पढ़ता है। प्रीव्यू masked हैं (जैसे jo********@om), इसलिए स्कैन आउटपुट खुद शेयर्ड स्क्रीन पर देखने के लिए सुरक्षित है।
छह श्रेणियों का मिलान होता है:
| प्रकार | क्या पकड़ती है |
|---|---|
[email protected] | |
| Phone | अंतरराष्ट्रीय और स्थानीय फ़ॉर्मैट, 9–15 अंक |
| Social Security number | 123-45-6789 |
| Credit card | 13–19 अंक, checksum से सत्यापित ताकि बेतरतीब नंबर शृंखलाएं flag न हों |
| IBAN | अंतरराष्ट्रीय बैंक खाता नंबर |
| IP address | वैध 0.0.0.0–255.255.255.255 |
स्कैन सिर्फ़ वह टेक्स्ट देखती है जो PDF में वास्तव में मौजूद है। स्कैन किए दस्तावेज़ — पेज की तस्वीर — में कोई टेक्स्ट लेयर नहीं होती, इसलिए रिपोर्ट खाली आती है भले ही इंसान उसे पढ़ सके। ऐप उस स्थिति में यह कहती है: OCR चलाएं ताकि देखें स्कैन क्या पाती, या Redact Content से दिखने वाले क्षेत्र हाथ से redact करें।
Auto-Redact PII
Privacy › Auto-Redact PII स्कैन लेती है और एक पास में हर हिट हटा देती है। यह एक Pro फ़ीचर है।
दो बातें इसे ऊपर खींचा गया सिर्फ़ काला बॉक्स के बजाय असली redaction बनाती हैं:
- प्रभावित पेज rasterize होते हैं — redaction पेंट की हुई इमेज में रेंडर होते हैं — इसलिए नीचे का टेक्स्ट फ़ाइल में बिल्कुल मौजूद नहीं रहता, केवल आयत के नीचे छिपा नहीं।
- यह पास फेल-क्लोज़्ड है: अगर पेज सुरक्षित रूप से रेंडर न हो सके, रन विफलता रिपोर्ट करती है बजाय कॉस्मेटिक कवर-अप भेजने के।
समझौता: rasterize हुए पेज टेक्स्ट की इमेज बन जाते हैं। वे एक जैसे दिखते और प्रिंट होते हैं, लेकिन उस पेज का टेक्स्ट अब न चुनने योग्य है न खोजने योग्य — PDF के लिए, यही मक़सद है।
Verify Redaction
Privacy › Verify Redaction आपकी आउटपुट फ़ाइल पर वही स्कैन चलाकर रिपोर्ट करती है कि अब भी क्या निकालने योग्य है: बचे टेक्स्ट की लंबाई और कोई बचे PII हिट। "Clean — no extractable text remains" वह नतीजा है जो आप दस्तावेज़ के हाथ से निकलने से पहले चाहते हैं। अगर यह "N items still extractable" रिपोर्ट करे तो स्कैन दोबारा चलाएं ताकि देखें क्या बचा — matcher से छूटा पैटर्न, या ऐसे पेज का टेक्स्ट जिसे छुआ नहीं गया।
हर redaction के बाद verify करें। यह "काला दिखता है" और "साबित ग़ायब" के बीच फ़र्क है।
कब नष्ट करना बेहतर है
अगर साफ़ कॉपी जाने के बाद स्रोत दस्तावेज़ का अस्तित्व ही नहीं होना चाहिए तो File Shredder ओरिजिनल को डिलीट करने से पहले रैंडम डेटा से ओवरराइट करती है — डिफ़ॉल्ट तीन पास। यह स्थायी है; कोई रिकवरी नहीं।
संबंधित पेज
- फ़ोटो और PDF से मेटाडेटा हटाएं
- प्राइवेसी और नेटवर्क व्यवहार
- Redact Content टूल — मैनुअल, क्षेत्र-आधारित redaction
- OCR टूल — बिना टेक्स्ट लेयर वाले स्कैन किए दस्तावेज़ों के लिए
- मेटाडेटा हाइजीन गाइड
इस्तेमाल किए टूल