OCR de planos escaneados en PDF | Guía PolyPDF
Respuesta rápida
Para realizar OCR en un plano PDF escaneado en PolyPDF 1.5, guarde una copia de trabajo, seleccione Documento › OCR y deje que finalice la ejecución del reconocimiento de todo el documento. PolyPDF utiliza OCR local, agrega una capa de búsqueda de mejor esfuerzo cuando sea compatible y analiza la estructura AEC, como programaciones, bloques de título, etiquetas de dibujo y dimensiones. Exporte tablas reconocidas desde Archivo > Exportar > Libro de Excel (Tablas + Texto)… mientras la sesión de OCR aún está abierta. Vuelva a abrir el PDF guardado, busque términos representativos y verifique visualmente cada valor crítico.
El OCR puede convertir un escaneo plano en un documento que se puede buscar, pero no convierte píxeles inciertos en texto autorizado. El flujo de trabajo útil es el reconocimiento, las pruebas específicas y la verificación manual de cualquier cosa importante.
- Revisión de lanzamiento
- Alineado con PolyPDF 1.5.1 (compilación 23) en . Los tutoriales y capturas de pantalla anteriores conservan sus versiones a continuación.
- Tutorial verificado
- Probado con
- PolyPDF 1.5.0 (compilación 22); capturas de pantalla de 1.4.0 (compilación 17)
- Plataformas
- MacOS y Windows
Primero confirme que el PDF realmente necesita OCR
Abra el PDF e intente seleccionar una palabra con la herramienta de selección de texto. Luego busque el título de una hoja o una nota obvia. Si puede seleccionar caracteres individuales y la búsqueda ya los encuentra, la página tiene una capa de texto; El OCR puede agregar texto duplicado o con ruido en lugar de ayudar. Si la selección trata la página como una imagen y la búsqueda no devuelve nada, es un buen candidato para OCR.
| Comportamiento observado de la página | fuente probable | Siguiente paso |
|---|---|---|
| Seleccione y busque palabras correctamente. | PDF nacido digital con texto | Utilice la capa existente; El OCR suele ser innecesario |
| Toda la página se comporta como una imagen. | Escaneo o exportación rasterizada | Ejecute OCR en una copia |
| Algunas notas seleccionan pero otras no. | Texto e imágenes vectoriales mixtas | Pruebe con cuidado; El valor de OCR puede variar según la página. |
| El texto se puede seleccionar pero es incorrecto. | Capa OCR existente de baja calidad | Conserve la fuente y compare los resultados antes de reemplazar cualquier flujo de trabajo |
OCR cambia la visibilidad del texto, no la geometría del dibujo. No calibra la hoja, no valida las dimensiones ni confirma que una nota fue reconocida correctamente.
Ejecute OCR en PolyPDF
- Duplique el PDF de origen o utilice Guardar como para que el escaneo original permanezca intacto.
- Cierre los documentos grandes no relacionados si el escaneo es largo o tiene muchas imágenes y luego abra la copia de trabajo.
- Elija Documento › OCR. Se inicia el OCR para el documento actual; el cuadro de diálogo actual no ofrece un rango de páginas ni un selector de idioma.
- Mantenga el cuadro de diálogo abierto para ver el progreso o ciérrelo si desea que la ejecución continúe en segundo plano. Elija Cancelar OCR cuando necesite detenerse; una ejecución cancelada descarta su resultado.
- Espere el mensaje de finalización antes de juzgar la búsqueda. Los escaneos y conjuntos de construcción de gran tamaño pueden llevar tiempo.
- Guarde el documento reconocido con un nombre de archivo distinto, ciérrelo y vuelva a abrir el archivo guardado.
- Busque varios términos de diferentes páginas y copie pasajes cortos en texto plano para inspeccionar la calidad del reconocimiento.
Revisar la estructura de AEC y exportar tablas antes de cerrar la sesión.
Desde PolyPDF 1.4.4, OCR también crea un modelo de sesión actual de horarios probables, campos de bloque de título, etiquetas de dibujo y detalles, dimensiones, regiones, filas y celdas. Esto es útil para revisión y transferencia de hojas de cálculo, pero aún se infiere de los píxeles de la página y del texto seleccionable, no de una base de datos de programación autorizada.
| Resultado | donde vive | que hacer |
|---|---|---|
| Capa de texto con capacidad de búsqueda | Guardado en PDF donde sea compatible | Guardar, cerrar, volver a abrir y buscar términos representativos |
| Tablas y campos AEC reconocidos | Sesión actual de OCR de documentos abiertos | Revise las filas y celdas, luego exporte antes de cerrar o recargar estructuralmente el documento. |
| libro de excel | Un archivo .xlsx separado que elijas | Ábrelo en una aplicación de hoja de cálculo y compara las celdas resultantes con el dibujo. |
- Finalice la ejecución de OCR e inspeccione los nombres, encabezados, filas y dimensiones de las tablas reconocidas.
- Elija Archivo › Exportar › Libro de Excel (Tablas + Texto)… mientras la sesión del documento reconocido permanece abierta.
- Guarde el libro de trabajo con un nombre vinculado al dibujo y edición de origen.
- Abra el libro de trabajo y compare cantidades críticas, dimensiones, etiquetas y celdas de programación con el PDF visible.
- Trate las celdas fusionadas, las reglas débiles, la escritura a mano, las etiquetas rotadas y las líneas densas como áreas de revisión de alto riesgo.
El modelo de tabla estructurada son datos de sesión. Al guardar y volver a abrir se conserva la capa de PDF con capacidad de búsqueda, pero no debe asumir que el modelo de tabla inferido seguirá estando disponible a menos que ejecute OCR nuevamente. Exporte el libro de trabajo antes de cerrar la sesión.
Comprender los límites del idioma y la escritura
La disponibilidad de reconocimiento proviene del sistema operativo y del soporte de idiomas instalado, por lo que los idiomas ofrecidos por una computadora Mac o Windows pueden diferir de otra. La capa de búsqueda integrada actual de PolyPDF se limita a las escrituras latina, griega y cirílica. El sistema operativo puede reconocer texto en secuencias de comandos adicionales, pero PolyPDF no promete incrustar esos caracteres como una capa de búsqueda en el PDF.
- Trate los cajetines de escritura mixta como un caso de revisión especial.
- Instale y habilite el soporte de idioma del sistema operativo necesario antes de que comience el proyecto, luego pruebe con una página representativa.
- No infiera que el nombre de un idioma mostrado garantiza la misma precisión en todas las fuentes, calidad de escaneo, rotaciones o notas escritas a mano.
- Cuando PolyPDF informa que el texto reconocido no se puede incrustar, utilice cualquier exportación de texto ofrecida como ayuda de revisión, no como prueba de que el PDF en sí se puede buscar en ese script.
Verificar los términos que son importantes para el trabajo.
Una prueba de búsqueda general puede pasar mientras los identificadores que necesita aún fallan. Cree un pequeño conjunto de verificación a partir del documento: un número de hoja, un nombre de habitación, una abreviatura de material, una dimensión y una nota que contenga puntuación. Busque cada valor exactamente y luego pruebe con un fragmento distintivo. Inspeccione tanto los resultados reales como las ubicaciones obvias que la búsqueda omitió.
- Espere confusión entre formas similares como O y 0, I y 1, S y 5, o puntos decimales y ruido de escaneo.
- Las notas rotadas, las fuentes condensadas, las impresiones diazo descoloridas, los escaneos sesgados y el texto que cruza líneas son entradas más difíciles.
- Nunca copie una dimensión, cantidad, etiqueta de equipo o valor de especificación derivados de OCR en un trabajo posterior sin compararlos con la imagen de la página.
- Los resultados de la búsqueda son una ayuda para la navegación. El dibujo visible sigue siendo la fuente que debe ser revisada.
Caso de uso resuelto: buscar “Superficie del barco” en un dibujo de ingeniería escaneado
La página NACA que se muestra aquí es un escaneo rasterizado sin texto extraíble antes del OCR: la búsqueda en SUPERFICIE arroja "No hay coincidencias". Una vez finalizada la ejecución de todo el documento, guardamos el resultado, salimos de PolyPDF, volvimos a abrir el PDF guardado y repetimos la misma búsqueda. PolyPDF arrojó tres resultados y seleccionó una aparición de "Superficie del barco" en el dibujo.
Al copiar el texto del PDF guardado se obtiene "INFORME DEL COMITÉ ASESOR NACIONAL DE AERONÁUTICA", "Superficie del barco" y "U.S. S. Akron". El mismo texto también contiene errores en pequeñas etiquetas en cursiva y notación de dimensiones, así que utilice visitas de OCR para la navegación y compare cada identificador, nota o medida consecuente con el escaneo visible.
Lo que no establece la OCR
- OCR es un reconocimiento del mejor esfuerzo, no una garantía de transcripción ni un servicio de validación de dibujos.
- Una capa de texto con capacidad de búsqueda no hace que el PDF sea accesible. El orden de lectura, los títulos, el texto alternativo, las etiquetas de los formularios y otras estructuras de accesibilidad requieren una revisión por separado.
- OCR no elimina píxeles confidenciales. Si en un escaneo se debe eliminar el contenido PDF confidencial, utilice un flujo de trabajo de eliminación de contenido PDF confidencial con reconocimiento de imágenes y verifique el resultado.
- El reconocimiento se ejecuta localmente a través de las capacidades de la plataforma, pero la disponibilidad del idioma del sistema operativo y los resultados pueden diferir entre las computadoras.
- Una barra de progreso completada significa que la ejecución finalizó. No significa que cada palabra haya sido encontrada o incrustada correctamente.
Para trabajos importantes, defina el uso aceptable antes de ejecutar OCR: la navegación y el descubrimiento son razonables; La extracción no revisada de dimensiones, cantidades o lenguaje de cumplimiento no lo es.
Preguntas frecuentes
¿PolyPDF OCR se ejecuta en la nube?
PolyPDF utiliza OCR del sistema operativo local en lugar de un servicio de reconocimiento en la nube PolyPDF. Los idiomas disponibles aún pueden depender del sistema operativo y de los paquetes de idiomas instalados.
¿Qué scripts puede incrustar PolyPDF como texto PDF con capacidad de búsqueda?
En la versión actual, la capa de búsqueda integrada se limita a las escrituras latina, griega y cirílica. El reconocimiento de plataforma puede cubrir más scripts, pero eso no significa que PolyPDF pueda incrustarlos todos en el PDF.
¿Puedo elegir un rango de páginas o idioma de OCR?
No en el cuadro de diálogo OCR actual. Inicia una ejecución de todo el documento y se basa en las capacidades de reconocimiento de la plataforma en lugar de exponer controles de idioma y rango de páginas.
¿Puede PolyPDF exportar un cronograma OCR a Excel?
Sí. Después de que OCR cree su estructura AEC de la sesión actual, elija Archivo › Exportar › Libro de Excel (Tablas + Texto)…. Revise las filas y celdas resultantes con el dibujo; El OCR y la reconstrucción de tablas son el mejor esfuerzo.
¿El OCR hace accesible un PDF escaneado?
No. El texto con capacidad de búsqueda es un ingrediente, pero la accesibilidad también depende del orden de lectura, la estructura del documento, el texto alternativo, el etiquetado de los formularios y la revisión humana.
Fuentes y lecturas adicionales
- NASA NTRS: NACA U.S.S. Escaneo de ingeniería de Akron — El registro de la NASA marca el informe como Público y afirma que es un trabajo del gobierno de Estados Unidos con uso público permitido.
- Apple Vision: reconocer texto en imágenes
- Microsoft Learn: espacio de nombres Windows.Media.Ocr
- PolyPDF 1.5: OCR AEC local y exportación de tablas — La estructura AEC y la exportación a Excel se introdujeron en 1.4.4. La capa de búsqueda integrada cubre escrituras latinas, griegas y cirílicas, y la disponibilidad del idioma depende del sistema operativo de la computadora y del soporte instalado.
Pruebe OCR en un escaneo representativo
Descargue PolyPDF para macOS o Windows, ejecute OCR en una copia no confidencial y pruebe las etiquetas y notas exactas de las hojas que su flujo de trabajo necesita encontrar.
Gratis sin temporizador de prueba: anotación, revisión, calibración, 3 mediciones creadas a mano por documento y visualización del paquete de revisión. La búsqueda de símbolos, los complementos y los cambios o la publicación del paquete de revisión requieren Pro.


