PDF से संवेदनशील सामग्री हटाना: PolyPDF की सीमाएँ
संक्षिप्त उत्तर
PolyPDF संवेदनशील पीडीएफ सामग्री को हटाने से एक चिह्नित टोकन हटा दिया जाता है जब यह सामान्य खोज योग्य पाठ होता है, लेकिन यह व्यवहार हर पीडीएफ संरचना के लिए सामान्य नहीं होता है। रेखांकित अक्षर, वेक्टर कलाकृति, और पुन: प्रयोज्य रूप सामग्री के अंदर निहित छवियां ब्लैक फिल के अंतर्गत रह सकती हैं, इसलिए ब्लैक क्षेत्र कभी भी चेक नहीं होता है: फ़ाइल को सहेजें, इसे फिर से खोलें, फिर टेक्स्ट को दोबारा खोजें और निकालें। दस्तावेज़ से साफ़ छिपा हुआ डेटा मेटाडेटा, पृष्ठ थंबनेल, अनुलग्नक और जावास्क्रिप्ट क्रियाओं के लिए अलग-अलग विकल्प प्रदान करता है; सेविंग नई PolyPDF/प्रोड्यूसर और/ModDate प्रविष्टियाँ लिखती है, और सीधे पेज पर रखा गया अटैचमेंट जीवित रह सकता है। जब भी गोपनीयता पूर्ण निष्कासन पर निर्भर हो तो एक अनुमोदित विशेषज्ञ वर्कफ़्लो का उपयोग करें।
एक काला आयत संवेदनशील पीडीएफ सामग्री को हटाना नहीं है, और एक पूर्ण छिपे हुए पीडीएफ डेटा क्लीनअप पास का मतलब यह नहीं है कि हर छिपी हुई वस्तु मिल गई है। PolyPDF एक चिह्नित क्षेत्र के अंतर्गत सामान्य खोजने योग्य पाठ को हटा देता है और आपके द्वारा चुनी गई संरचनाओं को साफ़ कर देता है, लेकिन गोपनीय रिलीज़ के लिए अभी भी जांच की आवश्यकता होती है जो वास्तव में पीडीएफ के अंदर की सामग्री से मेल खाती है।
- समीक्षा जारी करें
- PolyPDF 1.5.1 (बिल्ड 23) के साथ संरेखित . पहले के वॉकथ्रू और स्क्रीनशॉट नीचे उनके संस्करण बरकरार रखते हैं।
- पूर्वाभ्यास सत्यापित
- के साथ परीक्षण किया गया
- PolyPDF 1.5.0 (बिल्ड 22); 1.4.0 से स्क्रीनशॉट (बिल्ड 17)
- प्लेटफार्म
- मैकओएस और विंडोज़
क्या संवेदनशील पीडीएफ सामग्री को हटाना और दस्तावेज़ के प्रत्येक हैंडल से छिपे हुए डेटा को साफ़ करना है
संवेदनशील पीडीएफ सामग्री को हटाना और दस्तावेज़ से छिपे हुए डेटा को साफ करना पीडीएफ के विभिन्न हिस्सों पर काम करता है, और न ही यह एक सार्वभौमिक स्क्रबर है। संवेदनशील पीडीएफ सामग्री को हटाने से खोज योग्य टेक्स्ट ऑपरेटरों को फिर से लिखा जाता है जो एक चिह्नित क्षेत्र को काटते हैं। जब हटाने के लिए कोई समर्थित टेक्स्ट नहीं होता है, तब भी PolyPDF ब्लैक फिल खींचता है और ऑपरेशन पूरा करता है, इसलिए वेक्टर रूपरेखा, पथ में परिवर्तित टेक्स्ट और अन्य ग्राफिक्स इसके नीचे फ़ाइल में रह सकते हैं।
यदि PolyPDF रिपोर्ट करता है कि कोई पाठ नहीं हटाया गया है, तो संवेदनशील पीडीएफ सामग्री में से कुछ भी नहीं हटाया गया है - चाहे पृष्ठ कितना भी काला क्यों न दिखे। वहां रुकें और उस सामग्री को स्वीकृत सामग्री हटाने वाले वर्कफ़्लो में ले जाएं।
| सामग्री या संरचना | क्या होता है? | क्या करें? |
|---|---|---|
| खोजने योग्य पाठ | जब चिह्नित क्षेत्र टेक्स्ट-शो ऑपरेशन में मैप हो जाता है तो हटा दिया जाता है | सहेजी गई कॉपी को दोबारा खोलें, फिर पुष्टि करने के लिए खोजें और निकालें |
| रेखांकित या सदिश अक्षरांकन | कमांड पूरा होने तक ब्लैक फिल के अंतर्गत रह सकता है | काले क्षेत्र को हटाने जैसा न समझें |
| रेखापुंज और नेस्टेड छवियाँ | शीर्ष-स्तरीय प्लेसमेंट का पता लगाया जाता है; प्रपत्र सामग्री में निहित छवियाँ नहीं हो सकती हैं | एक छवि-जागरूक वर्कफ़्लो का उपयोग करें और आउटपुट का निरीक्षण करें |
| मेटाडेटा और कैटलॉग संरचनाएँ | दस्तावेज़ से छिपा हुआ डेटा साफ़ करें आपके द्वारा चुनी गई श्रेणियों को लक्षित करता है | पूर्ण स्वीप मानने के बजाय सहेजी गई फ़ाइल का निरीक्षण करें |
| अनुलग्नक और क्रियाएँ | सीधे पृष्ठ पर रखा गया अनुलग्नक पास से बच सकता है | संरचनात्मक निरीक्षण या किसी विशेषज्ञ छिपी पीडीएफ डेटा सफाई प्रक्रिया का उपयोग करें |
PolyPDF उन पृष्ठों को अस्वीकार कर देता है जिन्हें वह सुरक्षित रूप से दोबारा नहीं लिख सकता है - उदाहरण के लिए, एक पृष्ठ जो पुन: प्रयोज्य फॉर्म XObject के माध्यम से अपना पाठ खींचता है। इनकार करना काम करने में विफलता नहीं है; इसका मतलब है कि पेज को एक अलग टूल की आवश्यकता है।
समर्थित खोजने योग्य पाठ के लिए एक रूढ़िवादी वर्कफ़्लो
- स्रोत पीडीएफ को डुप्लिकेट करें और मूल को ऐसे स्थान पर रखें जहां कार्य प्रक्रिया इसे अधिलेखित न कर सके।
- लक्ष्य को खोजकर और चुनकर पुष्टि करें कि यह सामान्य खोजने योग्य पाठ है। यदि यह एक स्कैन, एक छवि, एक रूपरेखा, या एक वेक्टर पथ है, तो यह वर्कफ़्लो इसे नहीं हटाएगा।
- टूल से संवेदनशील सामग्री हटाएं चुनें और प्रत्येक समर्थित टेक्स्ट आइटम के चारों ओर एक तंग क्षेत्र बनाएं। कुछ भी लागू करने से पहले दोहराए गए नामों, शीर्षलेखों, पादलेखों और समान पृष्ठों की समीक्षा करें।
- संवेदनशील पीडीएफ सामग्री हटाने को लागू करें और परिणाम पढ़ें। एक इनकार, एक त्रुटि, या "कोई पाठ नहीं हटाया गया" परिणाम का मतलब है कि फ़ाइल से कुछ भी नहीं निकला - काले रंग की उपस्थिति पर भरोसा न करें।
- एक नए उम्मीदवार फ़ाइल नाम के तहत सहेजें, इसे बंद करें, और उसी सहेजी गई फ़ाइल को फिर से खोलें।
- संपूर्ण सहेजी गई फ़ाइल से टेक्स्ट खोजें और निकालें। पूर्व क्षेत्र में चयन करने और कॉपी करने का प्रयास करें और दूसरे प्राप्तकर्ता-शैली व्यूअर में इसका निरीक्षण करें।
- गोपनीय, विनियमित, विशेषाधिकार प्राप्त या कानूनी रूप से संवेदनशील सामग्री के लिए, संगठन की अनुमोदित संवेदनशील पीडीएफ सामग्री हटाने और निरीक्षण प्रक्रिया का पालन करें, भले ही ये जांच पास हो जाएं।
इस तरह के टोकन के लिए, सहेजी गई फ़ाइल एक समीक्षक द्वारा चलाए जा सकने वाले सभी तीन चेक के तहत खाली वापस आती है: इन-ऐप खोज, टेक्स्ट निष्कर्षण, और असम्पीडित फ़ाइल की बाइट खोज। उन चेकों में केवल पाठ शामिल होता है और कुछ नहीं। एक एकल शीट टेक्स्ट ऑपरेटर्स, रैस्टर पिक्सल्स, वेक्टर लेटरिंग, क्लिपिंग पथ और पुन: प्रयोज्य फॉर्म सामग्री को मिश्रित कर सकती है, और इस पृष्ठ पर छवि बिल्कुल वैसी ही छोड़ दी गई थी जैसी वह थी।
छवियों, रूपरेखाओं और नेस्टेड ग्राफ़िक्स को एक अलग समस्या मानें
PolyPDF संवेदनशील पीडीएफ सामग्री हटाने को लागू करने से पहले शीर्ष-स्तरीय छवि प्लेसमेंट का पता लगाता है, लेकिन वह जांच प्रत्येक नेस्टेड फॉर्म एक्सऑब्जेक्ट के माध्यम से दोबारा नहीं होती है, इसलिए पुन: प्रयोज्य फॉर्म सामग्री के अंदर एम्बेडेड एक छवि इसके पीछे फिसल सकती है। आउटलाइन में परिवर्तित किया गया टेक्स्ट, टेक्स्ट-शो ऑपरेशन के बजाय वेक्टर आर्टवर्क है, और यह फिल के नीचे भी रह सकता है।
- उपस्थिति से सामग्री प्रकार का अनुमान न लगाएं. किसी स्ट्रिंग को खोजने में सक्षम होना आपको बताता है कि यह टेक्स्ट है; यह आपको शेष पृष्ठ के बारे में कुछ नहीं बताता।
- किसी पृष्ठ को समतल, रेखापुंज, प्रिंट या कवर न करें और यह मान लें कि केवल वह कदम ही सुरक्षा या रिकॉर्ड की आवश्यकता को पूरा करता है।
- स्कैन किए गए पृष्ठ या छवि-आधारित पहचानकर्ता के लिए, एक अनुमोदित छवि-जागरूक संवेदनशील पीडीएफ सामग्री हटाने वाले उपकरण का उपयोग करें और परिणामी पिक्सेल और पीडीएफ संरचना को सत्यापित करें।
- रूपरेखा या वेक्टर लेटरिंग के लिए, एक ऐसी प्रक्रिया की आवश्यकता होती है जो एक अपारदर्शी आकार जोड़ने के बजाय अंतर्निहित ड्राइंग कमांड को हटा देती है या बदल देती है।
- यदि आप स्वतंत्र रूप से अंतिम फ़ाइल का निरीक्षण नहीं कर सकते हैं, तो केवल PolyPDF परिणाम के आधार पर संवेदनशील सामग्री जारी न करें।
दूसरा व्यूअर विज़ुअल इंटरऑपरेबिलिटी के लिए उपयोगी है, लेकिन यह फोरेंसिक निरीक्षण उपकरण नहीं है। गोपनीय रिलीज़ के लिए पाठ निष्कर्षण, वस्तु निरीक्षण और एक अनुमोदित समीक्षा रिकॉर्ड की आवश्यकता हो सकती है।
स्कोप्ड क्लीनअप पास के रूप में दस्तावेज़ से साफ़ छिपे हुए डेटा का उपयोग करें
दस्तावेज़ से साफ़ छिपा हुआ डेटा दस्तावेज़ मेटाडेटा और एक्सएमपी पैकेट, पेज थंबनेल, अनुलग्नक, जावास्क्रिप्ट और क्रियाओं और वैकल्पिक फॉर्म या हस्ताक्षर-फ़ील्ड हटाने के लिए अलग-अलग विकल्प प्रदान करता है। वे लेबल वर्णन करते हैं कि पास क्या लक्ष्य रखता है; वे इस बात की गारंटी नहीं देते कि पीडीएफ ऑब्जेक्ट ग्राफ़ में प्रत्येक स्थान का दौरा किया जाता है।
- मौजूदा दस्तावेज़ मेटाडेटा साफ़ कर दिया गया है, लेकिन सहेजने से नई PolyPDF /निर्माता और /ModDate प्रविष्टियाँ लिखी जाती हैं। परिणाम कभी भी मेटाडेटा-मुक्त फ़ाइल नहीं होता है.
- कैटलॉग जावास्क्रिप्ट नाम वृक्ष हटा दिया गया है। एनोटेशन, फॉर्म फ़ील्ड, रूपरेखा या नेस्टेड श्रृंखलाओं के माध्यम से पहुंचने वाली कार्रवाइयों के साथ जाने की गारंटी नहीं है।
- अनुलग्नक सफ़ाई संपूर्ण नहीं है. अटैचमेंट क्लीनअप के चयन के साथ, एक सीधा फाइलअटैचमेंट एनोटेशन और इसका एम्बेडेड पेलोड बाइट के लिए पास बाइट से बच गया।
- पेज टेक्स्ट और छवियाँ बिल्कुल वहीं रहती हैं जहाँ वे हैं, शीर्ष-स्तरीय छवियाँ और छवियाँ फॉर्म XObject में समान रूप से निहित होती हैं। दस्तावेज़ से छिपा हुआ डेटा साफ़ करना एक संवेदनशील पीडीएफ सामग्री हटाने का कदम नहीं है।
- प्रपत्र और हस्ताक्षर-फ़ील्ड हटाना विनाशकारी है और डिफ़ॉल्ट रूप से बंद है। इसे तभी चालू करें जब आप उन क्षेत्रों को खोने का इरादा रखते हों।
- अछूता स्रोत रखें और प्रत्येक उम्मीदवार आउटपुट को एक अलग नाम के तहत सहेजें ताकि आंशिक सफाई रिकॉर्ड प्रतिलिपि को प्रतिस्थापित न करे।
परिणाम संदेश यह गिनता है कि पास ने क्या हटाया, न कि क्या बचा। रिलीज़ का निर्णय आपके द्वारा निरीक्षण की गई सहेजी गई फ़ाइल पर आधारित करें, न कि संवाद लेबल या पूर्णता संदेश पर।
सहेजे गए बाइट्स को सत्यापित करें, पूर्णता संदेश को नहीं
सटीक उम्मीदवार फ़ाइल को बंद करें और दोबारा खोलें ताकि प्रत्येक चेक इन-मेमोरी दृश्य के बजाय सहेजे गए बाइट्स पर आधारित हो। एक संपूर्ण समीक्षा एक से अधिक सतहों के माध्यम से जानकारी का अनुसरण करती है: प्रस्तुत पृष्ठ, खोजने योग्य पाठ, दस्तावेज़ गुण, एम्बेडेड-फ़ाइल संरचनाएं, एनोटेशन, फॉर्म फ़ील्ड, बुकमार्क, लिंक और क्रियाएं।
- पूर्ण संवेदनशील मानों और उपयोगी अंशों की खोज करें, फिर प्रत्येक पृष्ठ के विरुद्ध स्वतंत्र पाठ निष्कर्षण चलाएँ।
- उच्च ज़ूम पर और दूसरे पीडीएफ व्यूअर में निरीक्षण करें, जिसमें प्रिंट या निर्यात आउटपुट भी शामिल है जब प्राप्तकर्ता उन पथों का उपयोग करते हैं।
- एम्बेडेड फ़ाइलों की सूची बनाने और एनोटेशन, फॉर्म, रूपरेखा और अतिरिक्त-क्रिया प्रविष्टियों का निरीक्षण करने के लिए एक अनुमोदित संरचनात्मक निरीक्षण उपकरण का उपयोग करें।
- पुष्टि करें कि पृष्ठ संख्या, बुकमार्क, लिंक, फॉर्म, हस्ताक्षर, परतें और प्रिंट स्वरूप अभी भी रिलीज़ आवश्यकताओं से मेल खाते हैं।
- इनपुट फ़ाइल नाम या हैश, आउटपुट फ़ाइल नाम, समीक्षक, दिनांक, टूल संस्करण और प्रक्रिया के लिए ऑडिट ट्रेल की आवश्यकता होने पर की गई जांच को रिकॉर्ड करें।
कारगर उदाहरण: उस फ़ाइल पर अभ्यास करें जिसे आप फेंक सकते हैं
इससे पहले कि आप किसी वास्तविक फ़ाइल को स्पर्श करें, उससे मिलती-जुलती एक पीडीएफ बनाएं: सामान्य खोजने योग्य पाठ के रूप में एक पहचानकर्ता, एक रेखापुंज छवि, और - यदि वास्तविक ड्राइंग में वे हैं - एक पुन: प्रयोज्य फॉर्म XObject के माध्यम से खींचा गया पाठ। पहचानकर्ता से संवेदनशील सामग्री हटाएं और देखें कि PolyPDF किन हिस्सों को संभालता है और किसे अस्वीकार करता है। एक पृष्ठ जिसका पाठ फॉर्म XObject से आता है, संवेदनशील पीडीएफ सामग्री को हटाकर आधे के बजाय सीधे अस्वीकार कर दिया जाता है, जो कि वह व्यवहार है जिसे आप एक समय सीमा के बजाय एक समय सीमा से पहले देखना चाहते हैं।
क्षेत्र लागू करें, एक नए नाम के तहत सहेजें, फ़ाइल बंद करें, और उसी फ़ाइल को फिर से खोलें। पहचानकर्ता खोजें, प्रत्येक पृष्ठ का पाठ निकालें, और पुष्टि करें कि गिनती शून्य आती है। जहां ऐसा नहीं है - या जहां संवेदनशील सामग्री एक छवि, एक रूपरेखा, या एक वेक्टर पथ थी - उस सामग्री को एक अलग टूल की आवश्यकता होती है।
छिपे हुए पीडीएफ डेटा क्लीनअप का भी उसी तरह अभ्यास करें। एक प्रतिलिपि से प्रारंभ करें जिसमें दस्तावेज़ मेटाडेटा, एक जावास्क्रिप्ट प्रविष्टि, एक अनुलग्नक और छवियां हों; दस्तावेज़ से साफ़ छिपा हुआ डेटा चलाएँ; फिर सहेजी गई फ़ाइल का निरीक्षण करें। उम्मीद करें कि जावास्क्रिप्ट प्रविष्टि और मूल मेटाडेटा गायब हो जाएगा, ताजा निर्माता और मॉडडेट मेटाडेटा सेव पर लिखा गया है, और अनुलग्नक और दोनों छवियां अभी भी मौजूद हैं।
एक रिहर्सल आपको बताता है कि PolyPDF आपकी तरह की ड्राइंग पर कैसे व्यवहार करता है। यह PolyPDF को संवेदनशील दस्तावेजों के लिए एकमात्र संवेदनशील पीडीएफ सामग्री हटाने या छिपे हुए पीडीएफ डेटा क्लीनअप नियंत्रण बनाने का कोई कारण नहीं है।
अक्सर पूछे जाने वाले प्रश्न
क्या ब्लैक बॉक्स बनाने से पीडीएफ से संवेदनशील सामग्री स्थायी रूप से हट जाती है?
नहीं, एक अपारदर्शी उपस्थिति फ़ाइल में खोजने योग्य पाठ, वेक्टर पथ, उल्लिखित अक्षर या छवि पिक्सेल छोड़ सकती है। पुष्टि करें कि समर्थित पाठ वास्तव में हटा दिया गया था और सामग्री-उपयुक्त निरीक्षण प्रक्रिया का उपयोग करें।
क्या PolyPDF स्कैन किए गए पृष्ठ छवि के अंदर पाठ से संवेदनशील सामग्री को हटा सकता है?
नहीं, PolyPDF कुछ शीर्ष-स्तरीय छवि ओवरलैप का पता लगाता है, लेकिन फॉर्म सामग्री के अंदर नेस्ट की गई छवियां उस जांच से आगे निकल सकती हैं, और संवेदनशील पीडीएफ सामग्री हटाने से पिक्सेल नहीं हटते हैं। स्कैन किए गए पृष्ठों के लिए अनुमोदित छवि-जागरूक वर्कफ़्लो का उपयोग करें।
क्या दस्तावेज़ से छिपा हुआ डेटा साफ़ करने से हर अनुलग्नक और स्क्रिप्ट हट जाती है?
नहीं, कैटलॉग जावास्क्रिप्ट नाम वृक्ष को हटा दिया गया है, लेकिन सीधे पृष्ठ पर रखा गया अनुलग्नक अपने पेलोड अपरिवर्तित के साथ जीवित रह सकता है, और एनोटेशन, फॉर्म फ़ील्ड, रूपरेखा या नेस्टेड संरचनाओं के माध्यम से पहुंचने वाली कार्रवाइयों को इसके साथ जाने की गारंटी नहीं है। सहेजे गए पीडीएफ का संरचनात्मक रूप से निरीक्षण करें।
क्या मुझे डिजिटल हस्ताक्षरित पीडीएफ से संवेदनशील सामग्री हटा देनी चाहिए?
पृष्ठ सामग्री बदलने से हस्ताक्षर अमान्य हो सकता है या फ़ाइल द्वारा अवरुद्ध किया जा सकता है। एक अधिकृत अहस्ताक्षरित स्रोत प्राप्त करें, स्वीकृत निष्कासन वर्कफ़्लो को पूरा करें, नए मुद्दे को सत्यापित करें, और सामग्री परिवर्तन समाप्त होने के बाद ही हस्ताक्षर करें।
स्रोत और आगे पढ़ना
- एनआईएसटी एसपी 800-122: व्यक्तिगत रूप से पहचाने जाने योग्य जानकारी की गोपनीयता की सुरक्षा के लिए मार्गदर्शिका
- PolyPDF 1.5.0 संवेदनशील पीडीएफ सामग्री हटाना और छिपा हुआ पीडीएफ डेटा क्लीनअप व्यवहार - संवेदनशील पीडीएफ सामग्री को हटाने से एक चिह्नित क्षेत्र के अंतर्गत सामान्य खोजने योग्य पाठ हटा दिया जाता है; प्रपत्र XObject के माध्यम से पाठ खींचने वाले पृष्ठों को आंशिक रूप से संवेदनशील पीडीएफ सामग्री को हटाने के बजाय अस्वीकार कर दिया जाता है। दस्तावेज़ से छिपा हुआ डेटा साफ़ करें, आपके द्वारा चुनी गई श्रेणियों को साफ़ करता है और फ़ाइल में प्रत्येक संरचना को पार नहीं करता है।
उस फ़ाइल पर अभ्यास करें जिसे आप फेंक सकते हैं
MacOS या Windows के लिए PolyPDF डाउनलोड करें और पहले एक डिस्पोजेबल कॉपी पर टेक्स्ट सेंसिटिव पीडीएफ कंटेंट रिमूवल चलाएं और दस्तावेज़ से छिपे हुए डेटा को साफ़ करें। जब गोपनीयता पूर्ण निष्कासन पर निर्भर करती है तो इसे अपना एकमात्र रिलीज़ नियंत्रण न बनाएं।
बिना किसी परीक्षण टाइमर के निःशुल्क: एनोटेशन, समीक्षा, अंशांकन, प्रति दस्तावेज़ 3 हाथ से बनाए गए माप, और संशोधन पैकेज देखना। प्रतीक खोज, प्लगइन्स और संशोधन पैकेज परिवर्तन या प्रकाशन के लिए प्रो की आवश्यकता होती है।






