Caviarder et nettoyer un PDF : limites de PolyPDF
Réponse rapide
La suppression du contenu PDF sensible à PolyPDF supprime un jeton marqué lorsqu'il s'agit d'un texte consultable ordinaire, mais ce comportement ne se généralise pas à toutes les structures PDF. Les lettres décrites, les illustrations vectorielles et les images imbriquées dans le contenu d'un formulaire réutilisable peuvent rester sous le remplissage noir, de sorte que la zone noire ne constitue jamais la vérification : enregistrez le fichier, rouvrez-le, puis recherchez et extrayez à nouveau le texte. nettoyer les données cachées du document offre des choix distincts pour les métadonnées, les vignettes de page, les pièces jointes et les actions JavaScript ; l'enregistrement écrit de nouvelles entrées PolyPDF /Producer et /ModDate, et une pièce jointe placée directement sur la page peut survivre. Utilisez un flux de travail spécialisé agréé chaque fois que la confidentialité dépend de la suppression complète.
Un rectangle noir ne constitue pas une suppression de contenu PDF sensible, et une passe de nettoyage des données PDF cachées ne signifie pas que tous les objets cachés ont été trouvés. PolyPDF supprime le texte consultable ordinaire sous une région marquée et efface les structures que vous sélectionnez, mais la publication confidentielle nécessite toujours des vérifications qui correspondent au contenu réellement présent dans le PDF.
- Examen de la version
- Aligné sur PolyPDF 1.5.1 (build 23) sur . Les procédures pas à pas et captures d'écran antérieures conservent leurs versions ci-dessous.
- Procédure pas à pas vérifiée
- Testé avec
- PolyPDF 1.5.0 (version 22) ; captures d'écran de la version 1.4.0 (build 17)
- Plateformes
- macOS et Windows
Quelle suppression de contenu PDF sensible et nettoyage des données cachées du document chaque poignée
la suppression du contenu PDF sensible et le nettoyage des données cachées du document fonctionnent sur différentes parties d'un PDF, et aucun épurateur universel n'est non plus. la suppression du contenu PDF sensible réécrit les opérateurs de texte consultables qui croisent une région marquée. Lorsqu'il n'y a pas de texte pris en charge à supprimer, PolyPDF dessine toujours le remplissage noir et termine l'opération, de sorte que les contours vectoriels, le texte converti en chemins et autres graphiques peuvent rester dans le fichier situé en dessous.
Si PolyPDF signale qu'aucun texte n'a été supprimé, rien n'a été supprimé du contenu PDF sensible, quelle que soit la couleur noire de la page. Arrêtez-vous là et déplacez ce matériel vers un flux de travail de suppression de contenu approuvé.
| Contenu ou structure | Que se passe-t-il | Que faire |
|---|---|---|
| Texte consultable | Supprimé lorsque la région marquée correspond à l'opération d'affichage de texte | Rouvrez la copie enregistrée, puis recherchez et extrayez pour confirmer |
| Lettrage décrit ou vectoriel | Peut rester sous le remplissage noir pendant que la commande se termine | Ne traitez pas la zone noire comme une suppression |
| Images raster et imbriquées | Les emplacements de premier niveau sont détectés ; les images imbriquées dans le contenu du formulaire peuvent ne pas être | Utilisez un flux de travail sensible aux images et inspectez le résultat |
| Métadonnées et structures de catalogue | nettoyer les données cachées du document cible les catégories que vous sélectionnez | Inspectez le fichier enregistré plutôt que de supposer un balayage complet |
| Pièces jointes et actions | Une pièce jointe placée directement sur la page peut survivre au passage | Utilisez l’inspection structurelle ou un processus spécialisé de nettoyage des données PDF cachées |
PolyPDF refuse les pages qu'il ne peut pas réécrire en toute sécurité – une page qui dessine son texte via un formulaire XObject réutilisable, par exemple. Un refus n’est pas un échec de contournement ; cela signifie que cette page a besoin d'un outil différent.
Un flux de travail conservateur pour le texte consultable pris en charge
- Dupliquez le PDF source et conservez l'original là où le processus de travail ne peut pas l'écraser.
- Confirmez que la cible est un texte de recherche ordinaire en le recherchant et en le sélectionnant. S'il s'agit d'une numérisation, d'une image, d'un contour ou d'un chemin vectoriel, ce flux de travail ne le supprimera pas.
- Choisissez l'outil Supprimer le contenu sensible de l'outil et tracez une zone étroite autour de chaque élément de texte pris en charge. Examinez les noms répétés, les en-têtes, les pieds de page et les pages similaires avant d'appliquer quoi que ce soit.
- Appliquez la suppression du contenu PDF sensible et lisez le résultat. Un refus, une erreur ou un résultat « aucun texte supprimé » signifie que rien n'est sorti du fichier – ne vous fiez pas à l'apparence noire.
- Enregistrez sous un nouveau nom de fichier de candidat, fermez-le et rouvrez exactement ce fichier enregistré.
- Recherchez et extrayez le texte de l’ensemble du fichier enregistré. Essayez de sélectionner et de copier dans l'ancienne région et inspectez-la dans une deuxième visionneuse de style destinataire.
- Pour le contenu confidentiel, réglementé, privilégié ou juridiquement sensible, suivez le processus de suppression et d’inspection du contenu PDF sensible approuvé par l’organisation, même lorsque ces vérifications réussissent.
Pour un jeton comme celui-ci, le fichier enregistré revient vide sous les trois vérifications qu'un réviseur peut exécuter : recherche dans l'application, extraction de texte et recherche d'octets du fichier non compressé. Ces chèques couvrent le texte et rien d'autre. Une seule feuille peut mélanger des opérateurs de texte, des pixels raster, des lettrages vectoriels, des chemins de détourage et du contenu de formulaire réutilisable, et l'image de cette page est restée exactement telle qu'elle était.
Traitez les images, les contours et les graphiques imbriqués comme un problème distinct
PolyPDF détecte les placements d'images de niveau supérieur avant d'appliquer une suppression de contenu PDF sensible, mais cette vérification ne se répète pas dans chaque formulaire XObject imbriqué, de sorte qu'une image intégrée dans le contenu d'un formulaire réutilisable peut passer devant. Le texte converti en contours est une illustration vectorielle plutôt qu'une opération d'affichage de texte, et il peut également rester sous le remplissage.
- Ne déduisez pas le type de contenu de l’apparence. Être capable de rechercher une chaîne vous indique qu'il s'agit de texte ; cela ne vous dit rien sur le reste de la page.
- N'aplatissez pas, ne tramez pas, n'imprimez pas ou ne couvrez pas une page et supposez que cette étape à elle seule répond à une exigence de sécurité ou d'enregistrement.
- Pour une page numérisée ou un identifiant basé sur une image, utilisez un outil de suppression de contenu PDF sensible et sensible aux images approuvé et vérifiez les pixels et la structure PDF résultants.
- Pour le lettrage avec contour ou vectoriel, exigez un processus qui supprime ou remplace les commandes de dessin sous-jacentes plutôt que d'ajouter une forme opaque.
- Si vous ne pouvez pas inspecter indépendamment le fichier final, ne publiez pas de documents sensibles sur la base du seul résultat PolyPDF.
Un deuxième visualiseur est utile pour l’interopérabilité visuelle, mais ce n’est pas un outil d’inspection médico-légale. La divulgation confidentielle peut nécessiter l'extraction de texte, l'inspection de l'objet et un enregistrement d'examen approuvé.
Utiliser les données cachées propres du document comme passe de nettoyage étendue
nettoyer les données cachées du document offre des choix distincts pour les métadonnées du document et les paquets XMP, les vignettes de page, les pièces jointes, JavaScript et les actions, ainsi que la suppression facultative des formulaires ou des champs de signature. Ces étiquettes décrivent les objectifs du laissez-passer ; ils ne garantissent pas que chaque emplacement du graphique d'objet PDF soit visité.
- Les métadonnées du document existant sont effacées, mais l'enregistrement écrit de nouvelles entrées PolyPDF /Producer et /ModDate. Le résultat n’est jamais un fichier sans métadonnées.
- L'arborescence des noms JavaScript du catalogue est supprimée. Il n'est pas garanti que les actions atteintes via des annotations, des champs de formulaire, des contours ou des chaînes imbriquées vont avec.
- Le nettoyage des pièces jointes n’est pas exhaustif. Avec le nettoyage des pièces jointes sélectionné, une annotation FileAttachment directe et sa charge utile intégrée ont survécu au passage octet par octet.
- Le texte et les images de la page restent exactement là où ils se trouvent, les images de niveau supérieur et les images imbriquées dans un Form XObject. nettoyer les données cachées du document n'est pas une étape de suppression de contenu PDF sensible.
- La suppression des formulaires et des champs de signature est destructrice et désactivée par défaut. Activez-le uniquement lorsque vous avez l'intention de perdre ces champs.
- Conservez la source intacte et enregistrez chaque sortie candidate sous un nom distinct afin qu'un nettoyage partiel ne remplace pas la copie d'enregistrement.
Le message de résultat compte ce que la passe a supprimé, pas ce qui reste. Basez une décision de publication sur le fichier enregistré que vous avez inspecté, et non sur les étiquettes de la boîte de dialogue ou le message d'achèvement.
Vérifiez les octets enregistrés, pas le message d'achèvement
Fermez et rouvrez le fichier candidat exact afin que chaque vérification soit basée sur les octets enregistrés plutôt que sur la vue en mémoire. Un examen complet suit les informations à travers plusieurs surfaces : pages rendues, texte consultable, propriétés du document, structures de fichiers intégrés, annotations, champs de formulaire, signets, liens et actions.
- Recherchez l'intégralité des valeurs sensibles et des fragments utiles, puis exécutez une extraction de texte indépendante sur chaque page.
- Inspectez avec un zoom élevé et dans une deuxième visionneuse PDF, y compris la sortie d'impression ou d'exportation lorsque les destinataires utilisent ces chemins.
- Utilisez un outil d’inspection structurelle approuvé pour inventorier les fichiers intégrés et inspecter les entrées d’annotations, de formulaires, de plans et d’actions supplémentaires.
- Vérifiez que le nombre de pages, les signets, les liens, les formulaires, les signatures, les calques et l'apparence de l'impression correspondent toujours aux exigences de la version.
- Enregistrez le nom ou le hachage du fichier d'entrée, le nom du fichier de sortie, le réviseur, la date, les versions de l'outil et les vérifications effectuées lorsque le processus nécessite une piste d'audit.
Exemple concret : répétez sur un fichier que vous pouvez jeter
Avant de toucher un vrai fichier, créez un PDF jetable qui lui ressemble : un identifiant sous forme de texte consultable ordinaire, une image raster et, si le dessin réel en contient, du texte dessiné via un formulaire XObject réutilisable. supprimez le contenu sensible de l’identifiant et observez quelles parties PolyPDF gère et lesquelles il refuse. Une page dont le texte provient d'un formulaire XObject est refusée purement et simplement plutôt que la moitié avec le contenu PDF sensible supprimé, ce qui est le comportement que vous souhaitez voir avant une date limite plutôt que pendant celle-ci.
Appliquez la région, enregistrez sous un nouveau nom, fermez le fichier et rouvrez ce fichier exact. Recherchez l'identifiant, extrayez le texte de chaque page et confirmez que le décompte revient à zéro. Là où ce n’est pas le cas – ou lorsque le contenu sensible était une image, un contour ou un chemin vectoriel – ce contenu a besoin d’un outil différent.
Répétez le nettoyage des données PDF cachées de la même manière. Partez d'une copie contenant des métadonnées du document, une entrée JavaScript, une pièce jointe et des images ; exécuter des données cachées propres à partir du document ; puis inspectez le fichier enregistré. Attendez-vous à ce que l'entrée JavaScript et les métadonnées d'origine aient disparu, que les nouvelles métadonnées Producer et ModDate soient écrites lors de la sauvegarde, et que la pièce jointe et les deux images soient toujours présentes.
Une répétition vous indique comment PolyPDF se comporte sur votre type de dessin. Ce n'est pas une raison pour faire de PolyPDF le seul contrôle de suppression de contenu PDF sensible ou de contrôle de nettoyage de données PDF cachées pour les documents sensibles.
Questions fréquemment posées
Dessiner une boîte noire supprime-t-il définitivement le contenu sensible d’un PDF ?
Non. Une apparence opaque peut laisser du texte consultable, des chemins vectoriels, des lettres encadrées ou des pixels d'image dans le fichier. Confirmez que le texte pris en charge a bien été supprimé et utilisez un processus d'inspection adapté au contenu.
PolyPDF peut-il supprimer le contenu sensible du texte contenu dans une image de page numérisée ?
Non. PolyPDF détecte certains chevauchements d'images de niveau supérieur, mais les images imbriquées dans le contenu du formulaire peuvent passer outre cette vérification, et la suppression du contenu PDF sensible ne supprime pas les pixels. Utilisez un flux de travail approuvé prenant en charge les images pour les pages numérisées.
Le nettoyage des données cachées du document supprime-t-il toutes les pièces jointes et tous les scripts ?
Non. L'arborescence des noms JavaScript du catalogue est supprimée, mais une pièce jointe placée directement sur la page peut survivre avec sa charge utile inchangée, et les actions atteintes via des annotations, des champs de formulaire, des plans ou des structures imbriquées ne sont pas garanties de l'accompagner. Inspectez structurellement le PDF enregistré.
Dois-je supprimer le contenu sensible d’un PDF signé numériquement ?
La modification du contenu de la page peut invalider une signature ou être bloquée par le fichier. Obtenez une source autorisée non signée, terminez le flux de travail de suppression approuvé, vérifiez le nouveau problème et signez uniquement une fois les modifications de contenu terminées.
Sources et lectures complémentaires
- NIST SP 800-122 : Guide pour la protection de la confidentialité des informations personnellement identifiables
- Suppression du contenu PDF sensible de PolyPDF 1.5.0 et comportement de nettoyage des données PDF masquées — la suppression du contenu PDF sensible supprime le texte consultable ordinaire sous une région marquée ; les pages qui dessinent du texte via un Form XObject sont refusées plutôt que partiellement avec le contenu PDF sensible supprimé. nettoyer les données cachées du document efface les catégories que vous sélectionnez et ne traverse pas toutes les structures du fichier.
Répétez sur un fichier que vous pouvez jeter
Téléchargez PolyPDF pour macOS ou Windows et exécutez d'abord la suppression du contenu PDF sensible au texte et nettoyez d'abord les données cachées du document sur une copie jetable. N'en faites pas votre seul contrôle de libération lorsque la confidentialité dépend de la suppression complète.
Gratuit sans minuterie d'essai : annotation, révision, étalonnage, 3 mesures créées à la main par document et visualisation du package de révision. La recherche de symboles, les plugins et les modifications ou la publication du package de révision nécessitent Pro.






