PDF schwärzen und bereinigen: Grenzen von PolyPDF
Kurzantwort
Beim Entfernen sensibler PDF-Inhalte in PolyPDF wird ein markiertes Token entfernt, wenn es sich um normalen durchsuchbaren Text handelt. Dieses Verhalten lässt sich jedoch nicht auf jede PDF-Struktur übertragen. Umrissene Schriftzüge, Vektorgrafiken und in wiederverwendbaren Formularinhalten verschachtelte Bilder können unter der schwarzen Füllung verbleiben, daher ist der schwarze Bereich niemals die Prüfung: Speichern Sie die Datei, öffnen Sie sie erneut, suchen Sie dann und extrahieren Sie den Text erneut. „Ausgeblendete Daten aus Dokument entfernen“ bietet separate Optionen für Metadaten, Seitenminiaturansichten, Anhänge und JavaScript-Aktionen. Beim Speichern werden neue PolyPDF /Producer- und /ModDate-Einträge geschrieben, und ein direkt auf der Seite platzierter Anhang kann überleben. Verwenden Sie einen zugelassenen Spezialisten-Workflow, wenn die Vertraulichkeit eine vollständige Entfernung erfordert.
Bei einem schwarzen Rechteck handelt es sich nicht um die Entfernung sensibler PDF-Inhalte, und ein abgeschlossener Bereinigungsdurchlauf versteckter PDF-Daten bedeutet nicht, dass jedes versteckte Objekt gefunden wurde. PolyPDF entfernt gewöhnlichen durchsuchbaren Text unter einem markierten Bereich und löscht die von Ihnen ausgewählten Strukturen. Bei der vertraulichen Freigabe sind jedoch noch Überprüfungen erforderlich, die mit dem tatsächlich im PDF enthaltenen Inhalt übereinstimmen.
- Release-Rezension
- Abgestimmt auf PolyPDF 1.5.1 (Build 23). . Frühere exemplarische Vorgehensweisen und Screenshots behalten ihre Versionen unten bei.
- Komplettlösung überprüft
- Getestet mit
- PolyPDF 1.5.0 (Build 22); Screenshots von 1.4.0 (Build 17)
- Plattformen
- macOS und Windows
Welche sensiblen PDF-Inhalte entfernen und versteckte Daten aus Dokumenten bereinigen, jeder Griff
Das Entfernen sensibler PDF-Inhalte und das Bereinigen versteckter Daten aus Dokumenten funktioniert an verschiedenen Teilen einer PDF-Datei, und es gibt auch keinen universellen Scrubber. Beim Entfernen sensibler PDF-Inhalte werden die durchsuchbaren Textoperatoren neu geschrieben, die einen markierten Bereich überschneiden. Wenn kein unterstützter Text zum Entfernen vorhanden ist, zeichnet PolyPDF trotzdem die schwarze Füllung und schließt den Vorgang ab, sodass Vektorumrisse, in Pfade umgewandelter Text und andere Grafiken in der darunter liegenden Datei verbleiben können.
Wenn PolyPDF meldet, dass kein Text entfernt wurde, wurde nichts mit sensiblen PDF-Inhalten entfernt – egal wie schwarz die Seite aussieht. Stoppen Sie hier und verschieben Sie das Material in einen genehmigten Workflow zum Entfernen von Inhalten.
| Inhalt oder Struktur | Was passiert | Was zu tun ist |
|---|---|---|
| Durchsuchbarer Text | Wird entfernt, wenn der markierte Bereich dem Textanzeigevorgang zugeordnet ist | Öffnen Sie die gespeicherte Kopie erneut, suchen Sie sie und extrahieren Sie sie zur Bestätigung |
| Umrissene oder Vektorbeschriftung | Kann unter der schwarzen Füllung bleiben, während der Befehl ausgeführt wird | Behandeln Sie den schwarzen Bereich nicht als Entfernung |
| Raster- und verschachtelte Bilder | Platzierungen auf oberster Ebene werden erkannt; Im Formularinhalt verschachtelte Bilder sind möglicherweise nicht verschachtelt | Verwenden Sie einen bildbewussten Workflow und überprüfen Sie die Ausgabe |
| Metadaten und Katalogstrukturen | „Ausgeblendete Daten aus Dokument bereinigen“ zielt auf die von Ihnen ausgewählten Kategorien ab | Untersuchen Sie die gespeicherte Datei, anstatt von einer vollständigen Durchsuchung auszugehen |
| Anhänge und Aktionen | Ein direkt auf der Seite platzierter Anhang kann den Pass überleben | Verwenden Sie eine Strukturinspektion oder einen speziellen Prozess zur Bereinigung versteckter PDF-Daten |
PolyPDF lehnt Seiten ab, die es nicht sicher umschreiben kann – beispielsweise eine Seite, deren Text über ein wiederverwendbares Form-XObject gezeichnet wird. Eine Weigerung ist kein Versäumnis, eine Lösung zu finden; Das bedeutet, dass die Seite ein anderes Tool benötigt.
Ein konservativer Workflow für unterstützten durchsuchbaren Text
- Duplizieren Sie das Quell-PDF und bewahren Sie das Original an einem Ort auf, an dem es vom Arbeitsprozess nicht überschrieben werden kann.
- Bestätigen Sie, dass es sich bei dem Ziel um normalen durchsuchbaren Text handelt, indem Sie ihn suchen und auswählen. Wenn es sich um einen Scan, ein Bild, eine Kontur oder einen Vektorpfad handelt, wird dieser Workflow ihn nicht entfernen.
- Wählen Sie das Tool zum Entfernen vertraulicher Inhalte aus und zeichnen Sie einen engen Bereich um jedes unterstützte Textelement. Überprüfen Sie wiederholte Namen, Kopf- und Fußzeilen und ähnliche Seiten, bevor Sie etwas anwenden.
- Wenden Sie die Entfernung sensibler PDF-Inhalte an und lesen Sie das Ergebnis. Eine Ablehnung, ein Fehler oder das Ergebnis „Kein Text entfernt“ bedeutet, dass nichts aus der Datei herausgekommen ist – verlassen Sie sich nicht auf die schwarze Darstellung.
- Speichern Sie unter einem neuen Kandidatendateinamen, schließen Sie ihn und öffnen Sie genau die gespeicherte Datei erneut.
- Suchen und extrahieren Sie Text aus der gesamten gespeicherten Datei. Versuchen Sie, den vorherigen Bereich auszuwählen und zu kopieren, und überprüfen Sie ihn in einem zweiten Viewer im Empfängerstil.
- Befolgen Sie bei vertraulichen, regulierten, privilegierten oder rechtlich sensiblen Inhalten den von der Organisation genehmigten Prozess zum Entfernen und Überprüfen sensibler PDF-Inhalte, auch wenn diese Prüfungen erfolgreich sind.
Bei einem Token wie diesem ist die gespeicherte Datei bei allen drei Prüfungen, die ein Prüfer durchführen kann, leer: In-App-Suche, Textextraktion und eine Byte-Suche der unkomprimierten Datei. Diese Schecks beziehen sich auf Text und sonst nichts. Auf einem einzigen Blatt können Textoperatoren, Rasterpixel, Vektorbeschriftungen, Beschneidungspfade und wiederverwendbare Formularinhalte gemischt werden, und das Bild auf dieser Seite wurde genau so belassen, wie es war.
Behandeln Sie Bilder, Umrisse und verschachtelte Grafiken als separates Problem
PolyPDF erkennt Bildplatzierungen auf der obersten Ebene, bevor es eine Entfernung sensibler PDF-Inhalte anwendet. Diese Prüfung wird jedoch nicht durch jedes verschachtelte Formular-XObjekt wiederholt, sodass ein in wiederverwendbaren Formularinhalt eingebettetes Bild daran vorbeirutschen kann. In Konturen umgewandelter Text ist eine Vektorgrafik und kein Textanzeigevorgang und kann auch unter der Füllung verbleiben.
- Schließen Sie den Inhaltstyp nicht vom Erscheinungsbild ab. Wenn Sie nach einer Zeichenfolge suchen können, wissen Sie, dass es sich um Text handelt. Es sagt Ihnen nichts über den Rest der Seite.
- Glätten, rastern, drucken oder bedecken Sie eine Seite nicht und gehen Sie davon aus, dass dieser Schritt allein eine Sicherheits- oder Aufzeichnungsanforderung erfüllt.
- Verwenden Sie für eine gescannte Seite oder eine bildbasierte Kennung ein zugelassenes Tool zum Entfernen sensibler PDF-Inhalte mit Bilderkennung und überprüfen Sie die resultierenden Pixel und die PDF-Struktur.
- Für Umriss- oder Vektorbeschriftungen ist ein Prozess erforderlich, der die zugrunde liegenden Zeichenbefehle entfernt oder ersetzt, anstatt eine undurchsichtige Form hinzuzufügen.
- Wenn Sie die endgültige Datei nicht unabhängig prüfen können, geben Sie sensibles Material nicht allein aufgrund des PolyPDF-Ergebnisses frei.
Ein zweiter Viewer ist für die visuelle Interoperabilität nützlich, aber kein forensisches Inspektionstool. Für eine vertrauliche Freigabe sind möglicherweise eine Textextraktion, eine Objektinspektion und ein genehmigtes Überprüfungsprotokoll erforderlich.
Verwenden Sie das Bereinigen verborgener Daten aus dem Dokument als bereichsbezogenen Bereinigungsdurchlauf
„Clean Hidden Data from Document“ bietet separate Optionen für Dokumentmetadaten und XMP-Pakete, Seitenminiaturansichten, Anhänge, JavaScript und Aktionen sowie die optionale Entfernung von Formular- oder Signaturfeldern. Diese Etiketten beschreiben, worauf der Pass abzielt. Sie sind keine Garantie dafür, dass jeder Ort im PDF-Objektdiagramm besucht wird.
- Vorhandene Dokumentmetadaten werden gelöscht, aber beim Speichern werden neue PolyPDF /Producer- und /ModDate-Einträge geschrieben. Das Ergebnis ist niemals eine metadatenfreie Datei.
- Der JavaScript-Namensbaum des Katalogs wurde entfernt. Es ist nicht garantiert, dass Aktionen, die über Anmerkungen, Formularfelder, Umrisse oder verschachtelte Ketten erreicht werden, damit einhergehen.
- Die Bereinigung von Anhängen ist nicht erschöpfend. Bei aktivierter Anhangsbereinigung überstanden eine direkte FileAttachment-Anmerkung und ihre eingebettete Nutzlast den Durchgang Byte für Byte.
- Seitentext und Bilder bleiben genau dort, wo sie sind, sowohl Bilder der obersten Ebene als auch Bilder, die in einem Formular-XObject verschachtelt sind. Das Bereinigen versteckter Daten aus dem Dokument ist kein Schritt zum Entfernen sensibler PDF-Inhalte.
- Das Entfernen von Formularen und Signaturfeldern ist destruktiv und standardmäßig deaktiviert. Schalten Sie es nur ein, wenn Sie beabsichtigen, diese Felder zu verlieren.
- Behalten Sie die unberührte Quelle bei und speichern Sie jede Kandidatenausgabe unter einem eindeutigen Namen, damit eine teilweise Bereinigung die Datensatzkopie nicht ersetzt.
Die Ergebnismeldung zählt, was der Pass entfernt hat, nicht was übrig bleibt. Treffen Sie eine Freigabeentscheidung auf der Grundlage der von Ihnen überprüften gespeicherten Datei und nicht auf der Grundlage der Dialogbezeichnungen oder der Abschlussmeldung.
Überprüfen Sie die gespeicherten Bytes, nicht die Abschlussmeldung
Schließen Sie die genaue Kandidatendatei und öffnen Sie sie erneut, sodass jede Prüfung auf gespeicherten Bytes und nicht auf der In-Memory-Ansicht basiert. Eine vollständige Überprüfung verfolgt die Informationen über mehr als eine Oberfläche: gerenderte Seiten, durchsuchbaren Text, Dokumenteigenschaften, eingebettete Dateistrukturen, Anmerkungen, Formularfelder, Lesezeichen, Links und Aktionen.
- Suchen Sie nach allen sensiblen Werten und nützlichen Fragmenten und führen Sie dann eine unabhängige Textextraktion für jede Seite durch.
- Überprüfen Sie bei hohem Zoom und in einem zweiten PDF-Viewer, einschließlich Druck- oder Exportausgabe, wenn Empfänger diese Pfade verwenden.
- Verwenden Sie ein zugelassenes Strukturinspektionstool, um eingebettete Dateien zu inventarisieren und Anmerkungen, Formulare, Umrisse und zusätzliche Aktionseinträge zu überprüfen.
- Bestätigen Sie, dass Seitenanzahl, Lesezeichen, Links, Formulare, Signaturen, Ebenen und Druckdarstellung weiterhin den Veröffentlichungsanforderungen entsprechen.
- Zeichnen Sie den Namen oder Hash der Eingabedatei, den Namen der Ausgabedatei, den Prüfer, das Datum, die Toolversionen und die durchgeführten Prüfungen auf, wenn für den Prozess ein Audit-Trail erforderlich ist.
Ausgearbeitetes Beispiel: Üben Sie mit einer Datei, die Sie wegwerfen können
Bevor Sie eine echte Datei anfassen, erstellen Sie ein Wegwerf-PDF, das dieser ähnelt: eine Kennung als normaler durchsuchbarer Text, ein Rasterbild und – sofern die echte Zeichnung darüber verfügt – Text, der durch ein wiederverwendbares Form-XObject gezeichnet wird. Entfernen Sie vertrauliche Inhalte aus der Kennung und beobachten Sie, welche Teile PolyPDF verarbeitet und welche ablehnt. Eine Seite, deren Text aus einem Form-XObject stammt, wird direkt und nicht zur Hälfte abgelehnt, wobei sensible PDF-Inhalte entfernt werden. Dies ist das Verhalten, das Sie vor Ablauf einer Frist und nicht während einer Frist sehen möchten.
Wenden Sie die Region an, speichern Sie sie unter einem neuen Namen, schließen Sie die Datei und öffnen Sie genau diese Datei erneut. Suchen Sie nach der Kennung, extrahieren Sie den Text jeder Seite und stellen Sie sicher, dass die Anzahl Null ergibt. Wo dies nicht der Fall ist – oder wenn der sensible Inhalt ein Bild, eine Gliederung oder ein Vektorpfad war – benötigt dieser Inhalt ein anderes Werkzeug.
Üben Sie die Bereinigung versteckter PDF-Daten auf die gleiche Weise. Beginnen Sie mit einer Kopie, die Dokumentmetadaten, einen JavaScript-Eintrag, einen Anhang und Bilder enthält; Führen Sie saubere versteckte Daten aus dem Dokument aus. Überprüfen Sie dann die gespeicherte Datei. Erwarten Sie, dass der JavaScript-Eintrag und die ursprünglichen Metadaten verschwunden sind, beim Speichern neue Producer- und ModDate-Metadaten geschrieben wurden und der Anhang und beide Bilder noch vorhanden sind.
Eine Probe zeigt Ihnen, wie sich PolyPDF auf Ihre Art von Zeichnung verhält. Dies ist kein Grund, PolyPDF zur einzigen Steuerung zur Entfernung sensibler PDF-Inhalte oder zur versteckten Bereinigung von PDF-Daten für sensible Dokumente zu machen.
Häufig gestellte Fragen
Werden durch das Zeichnen einer Blackbox vertrauliche Inhalte dauerhaft aus einer PDF-Datei entfernt?
Nein. Ein undurchsichtiges Erscheinungsbild kann durchsuchbaren Text, Vektorpfade, umrissene Buchstaben oder Bildpixel in der Datei hinterlassen. Bestätigen Sie, dass der unterstützte Text tatsächlich entfernt wurde, und verwenden Sie einen inhaltsgerechten Prüfprozess.
Kann PolyPDF vertrauliche Inhalte aus Text in einem gescannten Seitenbild entfernen?
Nein. PolyPDF erkennt einige Bildüberlappungen auf der obersten Ebene, aber in Formularinhalten verschachtelte Bilder können diese Prüfung passieren, und beim Entfernen sensibler PDF-Inhalte werden keine Pixel entfernt. Verwenden Sie einen zugelassenen bildbewussten Workflow für gescannte Seiten.
Entfernt das Bereinigen versteckter Daten aus dem Dokument alle Anhänge und Skripte?
Nein. Der JavaScript-Namensbaum des Katalogs wird entfernt, aber ein Anhang, der direkt auf der Seite platziert wird, kann mit unveränderter Nutzlast überleben, und es ist nicht garantiert, dass Aktionen, die über Anmerkungen, Formularfelder, Umrisse oder verschachtelte Strukturen erreicht werden, damit einhergehen. Untersuchen Sie das gespeicherte PDF strukturell.
Sollte ich sensible Inhalte aus einem digital signierten PDF entfernen?
Das Ändern des Seiteninhalts kann eine Signatur ungültig machen oder durch die Datei blockiert werden. Besorgen Sie sich eine autorisierte, nicht signierte Quelle, schließen Sie den genehmigten Entfernungsworkflow ab, überprüfen Sie das neue Problem und signieren Sie erst, nachdem die Inhaltsänderungen abgeschlossen sind.
Quellen und weiterführende Literatur
- NIST SP 800-122: Leitfaden zum Schutz der Vertraulichkeit personenbezogener Daten
- PolyPDF 1.5.0 entfernt sensible PDF-Inhalte und verstecktes PDF-Datenbereinigungsverhalten – Durch die Entfernung sensibler PDF-Inhalte wird normaler durchsuchbarer Text unter einem markierten Bereich entfernt. Seiten, die Text über ein Form-XObject zeichnen, werden abgelehnt, anstatt dass sensible PDF-Inhalte teilweise entfernt werden. „Ausgeblendete Daten aus Dokument bereinigen“ löscht die von Ihnen ausgewählten Kategorien und durchläuft nicht jede Struktur in der Datei.
Üben Sie mit einer Datei, die Sie wegwerfen können
Laden Sie PolyPDF für macOS oder Windows herunter und entfernen Sie zunächst textempfindliche PDF-Inhalte und bereinigen Sie versteckte Daten aus dem Dokument auf einer Einwegkopie. Machen Sie es nicht zu Ihrer einzigen Freigabekontrolle, wenn die Vertraulichkeit von der vollständigen Entfernung abhängt.
Kostenlos ohne Test-Timer: Anmerkung, Überprüfung, Kalibrierung, 3 handerstellte Messungen pro Dokument und Anzeige des Revisionspakets. Symbolsuche, Plugins und Änderungen oder Veröffentlichungen von Revisionspaketen erfordern Pro.






