OCR de plans PDF numérisés | Guide PolyPDF
Réponse rapide
Pour OCR un plan PDF numérisé dans PolyPDF 1.5, enregistrez une copie de travail, choisissez Document › OCR et laissez la reconnaissance de l'ensemble du document se terminer. PolyPDF utilise l'OCR local, ajoute une couche de recherche au mieux lorsqu'elle est prise en charge et analyse la structure AEC telle que les planifications, les cartouches, les étiquettes de dessin et les dimensions. Exportez les tableaux reconnus depuis Fichier › Exporter › Classeur Excel (Tableaux + Texte)… pendant que cette session OCR est toujours ouverte. Rouvrez le PDF enregistré, recherchez des termes représentatifs et vérifiez visuellement chaque valeur critique.
L'OCR peut transformer une numérisation à plat en un document que vous pouvez rechercher, mais elle ne transforme pas les pixels incertains en texte faisant autorité. Le flux de travail utile est la reconnaissance, les tests ciblés et la vérification manuelle de tout ce qui est conséquent.
- Examen de la version
- Aligné sur PolyPDF 1.5.1 (build 23) sur . Les procédures pas à pas et captures d'écran antérieures conservent leurs versions ci-dessous.
- Procédure pas à pas vérifiée
- Testé avec
- PolyPDF 1.5.0 (version 22) ; captures d'écran de la version 1.4.0 (build 17)
- Plateformes
- macOS et Windows
Confirmez d'abord que le PDF a réellement besoin d'OCR
Ouvrez le PDF et essayez de sélectionner un mot avec l'outil de sélection de texte. Recherchez ensuite un titre de feuille ou une note évidente. Si vous pouvez sélectionner des caractères individuels et que la recherche les trouve déjà, la page comporte un calque de texte ; L'OCR peut ajouter du texte en double ou bruyant plutôt que de l'aide. Si la sélection traite la page comme une seule image et que la recherche ne renvoie rien, c'est un bon candidat OCR.
| Comportement de page observé | Source probable | Étape suivante |
|---|---|---|
| Les mots sont sélectionnés et recherchés correctement | PDF né numérique avec texte | Utilisez le calque existant ; L'OCR est généralement inutile |
| La page entière se comporte comme une image | Exportation scan ou raster | Exécuter l'OCR sur une copie |
| Certaines notes sélectionnent mais d'autres non | Texte et images vectoriels mixtes | Testez soigneusement ; La valeur OCR peut varier selon la page |
| Le texte est sélectionnable mais incorrect | Couche OCR existante de mauvaise qualité | Conservez la source et comparez les résultats avant de remplacer un flux de travail |
L'OCR modifie la visibilité du texte, pas la géométrie du dessin. Il ne calibre pas la feuille, ne valide pas les dimensions et ne confirme pas qu'une note a été correctement reconnue.
Exécuter l'OCR dans PolyPDF
- Dupliquez le PDF source ou utilisez Enregistrer sous pour que la numérisation originale reste intacte.
- Fermez les documents volumineux sans rapport si la numérisation est longue ou contient beaucoup d'images, puis ouvrez la copie de travail.
- Choisissez Document ›OCR. L'OCR démarre pour le document actuel ; la boîte de dialogue actuelle n'offre pas de sélecteur de plage de pages ou de langue.
- Gardez la boîte de dialogue ouverte pour suivre la progression ou fermez-la si vous souhaitez que l'exécution se poursuive en arrière-plan. Choisissez Annuler l'OCR lorsque vous devez arrêter ; une exécution annulée annule son résultat.
- Attendez le message de fin avant de juger la recherche. Les numérisations et les jeux de construction volumineux peuvent prendre du temps.
- Enregistrez le document reconnu sous un nom de fichier distinct, fermez-le et rouvrez ce fichier enregistré.
- Recherchez plusieurs termes sur différentes pages et copiez de courts passages en texte brut pour vérifier la qualité de la reconnaissance.
Examiner la structure AEC et exporter les tableaux avant de fermer la session
Depuis PolyPDF 1.4.4, OCR crée également un modèle de session en cours de planifications probables, de champs de cartouche, d'étiquettes de dessin et de détail, de dimensions, de régions, de lignes et de cellules. Ceci est utile pour la révision et le transfert de feuilles de calcul, mais cela est toujours déduit des pixels de la page et du texte sélectionnable, et non d'une base de données de planification faisant autorité.
| Résultat | Où il vit | Que faire |
|---|---|---|
| Calque de texte consultable | Enregistré au format PDF là où il est pris en charge | Enregistrez, fermez, rouvrez et recherchez des termes représentatifs |
| Tables et champs AEC reconnus | Session OCR de documents ouverts en cours | Vérifiez les lignes et les cellules, puis exportez avant de fermer ou de recharger structurellement le document |
| Classeur Excel | Un fichier .xlsx distinct que vous choisissez | Ouvrez-le dans une application de feuille de calcul et comparez les cellules conséquentes avec le dessin |
- Terminez l'exécution OCR et inspectez les noms de table, les en-têtes, les lignes et les dimensions reconnus.
- Choisissez Fichier › Exporter › Classeur Excel (Tableaux + Texte)… tandis que la session de document reconnue reste ouverte.
- Enregistrez le classeur sous un nom lié au dessin source et au problème.
- Ouvrez le classeur et comparez les quantités critiques, les dimensions, les balises et les cellules de planification avec le PDF visible.
- Traitez les cellules fusionnées, les règles pâles, l’écriture manuscrite, les étiquettes pivotées et les lignes denses comme des zones de révision à haut risque.
Le modèle de table structurée est constitué de données de session. L'enregistrement et la réouverture préservent la couche PDF consultable, mais vous ne devez pas supposer que le modèle de tableau déduit sera toujours disponible à moins que vous n'exécutiez à nouveau l'OCR. Exportez le classeur avant de fermer la session.
Comprendre les limites du langage et du script
La disponibilité de la reconnaissance provient du système d'exploitation et de la prise en charge des langues installées, de sorte que les langues proposées par un ordinateur Mac ou Windows peuvent différer d'un autre. La couche de recherche intégrée actuelle de PolyPDF est limitée aux scripts latins, grecs et cyrilliques. Le système d'exploitation peut reconnaître le texte dans des scripts supplémentaires, mais PolyPDF ne promet pas d'intégrer ces caractères en tant que couche consultable dans le PDF.
- Considérez les cartouches à script mixte comme un cas de révision spécial.
- Installez et activez la prise en charge de la langue du système d'exploitation nécessaire avant le démarrage du projet, puis testez avec une page représentative.
- N'en déduisez pas qu'un nom de langue affiché garantit une précision égale pour les polices, la qualité de numérisation, les rotations ou les notes manuscrites.
- Lorsque PolyPDF signale que le texte reconnu ne peut pas être intégré, utilisez toute exportation de texte proposée comme aide à la révision, et non comme preuve que le PDF lui-même peut être recherché dans ce script.
Vérifiez les termes qui comptent pour le poste
Un test de recherche générale peut réussir alors que les identifiants dont vous avez besoin échouent toujours. Construisez un petit ensemble de vérification à partir du document : un numéro de feuille, un nom de pièce, une abréviation matérielle, une dimension et une note contenant de la ponctuation. Recherchez chaque valeur exactement, puis essayez un fragment distinctif. Inspectez à la fois les véritables résultats et les emplacements évidents que la recherche a manqués.
- Attendez-vous à une confusion entre des formes similaires telles que O et 0, I et 1, S et 5, ou des points décimaux et du bruit de balayage.
- Les notes pivotées, les polices condensées, les impressions diazo décolorées, les numérisations asymétriques et les lignes de croisement de texte sont des entrées plus difficiles.
- Ne copiez jamais une dimension, une quantité, une étiquette d'équipement ou une valeur de spécification dérivée de l'OCR dans un travail en aval sans la comparer à l'image de la page.
- Les résultats de recherche sont une aide à la navigation. Le dessin visible reste la source qu’il faut revoir.
Cas d'utilisation travaillé : recherchez « Surface du navire » sur un dessin technique numérisé
La page NACA présentée ici est une analyse raster sans texte extractible avant OCR : la recherche sur SURFACE renvoie « Aucune correspondance ». Une fois l'exécution de l'ensemble du document terminée, nous avons enregistré le résultat, quitté PolyPDF, rouvert le PDF enregistré et répété la même recherche. PolyPDF a renvoyé trois résultats et sélectionné une occurrence « Surface du navire » sur le dessin.
La copie du texte du PDF enregistré renvoie « RAPPORT DU COMITÉ CONSULTATIF NATIONAL POUR L'AÉRONAUTIQUE », « Surface du navire » et « U.S. S. Akron ». Le même texte contient également des erreurs dans les petites étiquettes en italique et la notation des dimensions, utilisez donc les résultats OCR pour la navigation et comparez chaque identifiant, note ou mesure conséquent avec l'analyse visible.
Ce que l'OCR n'établit pas
- L'OCR est une reconnaissance au mieux, et non une garantie de transcription ou un service de validation de dessins.
- Un calque de texte consultable ne rend pas le PDF accessible. L’ordre de lecture, les titres, le texte alternatif, les étiquettes de formulaire et toute autre structure d’accessibilité nécessitent un examen séparé.
- L'OCR ne supprime pas les pixels confidentiels. Si une numérisation doit supprimer du contenu PDF sensible, utilisez un flux de travail de suppression de contenu PDF sensible prenant en compte les images et vérifiez le résultat.
- La reconnaissance s'exécute localement via les capacités de la plate-forme, mais la disponibilité de la langue du système d'exploitation et les résultats peuvent différer d'un ordinateur à l'autre.
- Une barre de progression terminée signifie que l'exécution est terminée. Cela ne signifie pas que chaque mot a été trouvé ou intégré correctement.
Pour les travaux conséquents, définissez l'utilisation acceptable avant d'exécuter l'OCR : la navigation et la découverte sont raisonnables ; l’extraction non vérifiée des dimensions, des quantités ou du langage de conformité ne l’est pas.
Questions fréquemment posées
PolyPDF OCR fonctionne-t-il dans le cloud ?
PolyPDF utilise l'OCR du système d'exploitation local plutôt qu'un service de reconnaissance cloud PolyPDF. Les langues disponibles peuvent toujours dépendre du système d'exploitation et des modules linguistiques installés.
Quels scripts PolyPDF peut-il intégrer en tant que texte PDF consultable ?
Dans la version actuelle, la couche de recherche intégrée est limitée aux écritures latines, grecques et cyrilliques. La reconnaissance de plate-forme peut couvrir davantage de scripts, mais cela ne signifie pas que PolyPDF peut tous les intégrer dans le PDF.
Puis-je choisir une plage de pages ou une langue OCR ?
Pas dans la boîte de dialogue OCR actuelle. Il démarre l'exécution d'un document entier et s'appuie sur les capacités de reconnaissance de la plate-forme plutôt que d'exposer les contrôles de plage de pages et de langue.
PolyPDF peut-il exporter un planning OCR vers Excel ?
Oui. Une fois que l'OCR a créé sa structure AEC de session en cours, choisissez Fichier > Exporter > Classeur Excel (Tableaux + Texte)…. Examinez les lignes et les cellules résultantes par rapport au dessin ; L'OCR et la reconstruction de table sont la meilleure solution.
L'OCR rend-il accessible un PDF numérisé ?
Le texte consultable est un ingrédient, mais l'accessibilité dépend également de l'ordre de lecture, de la structure du document, du texte alternatif, de l'étiquetage du formulaire et de la révision humaine.
Sources et lectures complémentaires
- NTRS de la NASA : NACA U.S.S. Analyse technique d'Akron — Le dossier de la NASA marque le rapport comme étant public et déclare qu'il s'agit d'un ouvrage du gouvernement américain dont l'usage public est autorisé.
- Apple Vision : Reconnaître le texte dans les images
- Microsoft Learn : espace de noms Windows.Media.Ocr
- PolyPDF 1.5 : OCR AEC local et exportation de tableaux — La structure AEC et l'export Excel ont été introduits en 1.4.4. La couche de recherche intégrée couvre les scripts latins, grecs et cyrilliques, et la disponibilité des langues dépend du système d'exploitation de l'ordinateur et de la prise en charge installée.
Testez l'OCR sur une analyse représentative
Téléchargez PolyPDF pour macOS ou Windows, exécutez l'OCR sur une copie non sensible et testez les étiquettes et les notes exactes que votre flux de travail doit trouver.
Gratuit sans minuterie d'essai : annotation, révision, étalonnage, 3 mesures créées à la main par document et visualisation du package de révision. La recherche de symboles, les plugins et les modifications ou la publication du package de révision nécessitent Pro.


