OCR em plantas PDF digitalizadas | Guia PolyPDF
Resposta rápida
Para fazer o OCR de um desenho PDF digitalizado no PolyPDF 1.5, salve uma cópia de trabalho, escolha Documento › OCR e deixe a execução do reconhecimento de todo o documento terminar. PolyPDF usa OCR local, adiciona uma camada pesquisável de melhor esforço quando suportada e analisa a estrutura AEC, como tabelas, blocos de título, etiquetas de desenho e dimensões. Exporte tabelas reconhecidas de Arquivo › Exportar › Pasta de trabalho do Excel (tabelas + texto)… enquanto a sessão de OCR ainda está aberta. Reabra o PDF salvo, pesquise termos representativos e verifique visualmente cada valor crítico.
O OCR pode transformar uma digitalização plana em um documento que você pode pesquisar, mas não transforma pixels incertos em texto oficial. O fluxo de trabalho útil é o reconhecimento, testes direcionados e verificação manual de qualquer coisa importante.
- Revisão de lançamento
- Alinhado com PolyPDF 1.5.1 (build 23) em . As orientações e capturas de tela anteriores mantêm suas versões abaixo.
- Passo a passo verificado
- Testado com
- PolyPDF 1.5.0 (compilação 22); capturas de tela de 1.4.0 (compilação 17)
- Plataformas
- macOS e Windows
Primeiro confirme se o PDF realmente precisa de OCR
Abra o PDF e tente selecionar uma palavra com a ferramenta de seleção de texto. Em seguida, pesquise um título ou nota de planilha óbvia. Se você puder selecionar caracteres individuais e a pesquisa já os encontrar, a página terá uma camada de texto; OCR pode adicionar texto duplicado ou com ruído em vez de ajudar. Se a seleção tratar a página como uma imagem e a pesquisa não retornar nada, é um bom candidato para OCR.
| Comportamento observado da página | Fonte provável | Próxima etapa |
|---|---|---|
| Palavras selecionadas e pesquisadas corretamente | PDF digital nascido com texto | Use a camada existente; OCR geralmente é desnecessário |
| A página inteira se comporta como uma imagem | Digitalização ou exportação raster | Execute o OCR em uma cópia |
| Algumas notas selecionam, mas outras não | Texto e imagens vetoriais mistos | Teste com cuidado; O valor do OCR pode variar de acordo com a página |
| O texto é selecionável, mas incorreto | Camada de OCR existente de baixa qualidade | Mantenha a fonte e compare os resultados antes de substituir qualquer fluxo de trabalho |
OCR altera a capacidade de descoberta do texto, não a geometria do desenho. Ele não calibra a planilha, não valida dimensões nem confirma se uma nota foi reconhecida corretamente.
Execute OCR em PolyPDF
- Duplique o PDF de origem ou use Salvar como para que a digitalização original permaneça intacta.
- Feche documentos grandes não relacionados se a digitalização for longa ou com muitas imagens e abra a cópia de trabalho.
- Escolha Documento › OCR. OCR é iniciado para o documento atual; a caixa de diálogo atual não oferece um intervalo de páginas ou seletor de idioma.
- Mantenha a caixa de diálogo aberta para observar o progresso ou feche-a se quiser que a execução continue em segundo plano. Escolha Cancelar OCR quando precisar parar; uma execução cancelada descarta seu resultado.
- Aguarde a mensagem de conclusão antes de julgar a pesquisa. Grandes digitalizações e conjuntos de construção podem levar tempo.
- Salve o documento reconhecido com um nome de arquivo distinto, feche-o e reabra o arquivo salvo.
- Pesquise vários termos em páginas diferentes e copie passagens curtas em texto simples para inspecionar a qualidade do reconhecimento.
Revise a estrutura do AEC e exporte tabelas antes de fechar a sessão
Desde o PolyPDF 1.4.4, o OCR também cria um modelo de sessão atual de programações prováveis, campos de bloco de título, desenhos e rótulos de detalhes, dimensões, regiões, linhas e células. Isso é útil para revisão e entrega de planilhas, mas ainda é inferido a partir de pixels de página e texto selecionável – e não de um banco de dados de programação oficial.
| Resultado | Onde mora | O que fazer |
|---|---|---|
| Camada de texto pesquisável | Salvo em PDF onde houver suporte | Salvar, fechar, reabrir e pesquisar termos representativos |
| Tabelas e campos AEC reconhecidos | Sessão atual de OCR de documento aberto | Revise as linhas e células e exporte antes de fechar ou recarregar estruturalmente o documento |
| Pasta de trabalho do Excel | Um arquivo .xlsx separado que você escolhe | Abra-o em um aplicativo de planilha e compare as células consequentes com o desenho |
- Conclua a execução do OCR e inspecione os nomes, títulos, linhas e dimensões das tabelas reconhecidas.
- Escolha Arquivo › Exportar › Pasta de trabalho do Excel (tabelas + texto)… enquanto a sessão do documento reconhecido permanece aberta.
- Salve a pasta de trabalho com um nome vinculado ao desenho e problema de origem.
- Abra a pasta de trabalho e compare quantidades críticas, dimensões, tags e células de cronograma com o PDF visível.
- Trate células mescladas, linhas esmaecidas, caligrafia, rótulos girados e linhas densas como áreas de revisão de alto risco.
O modelo de tabela estruturada são dados de sessão. Salvar e reabrir preserva a camada pesquisável do PDF, mas você não deve presumir que o modelo de tabela inferido ainda estará disponível, a menos que você execute o OCR novamente. Exporte a pasta de trabalho antes de fechar a sessão.
Entenda o idioma e o limite do script
A disponibilidade do reconhecimento vem do sistema operacional e do suporte a idiomas instalado, portanto, os idiomas oferecidos por um computador Mac ou Windows podem ser diferentes de outro. A atual camada pesquisável incorporada do PolyPDF é limitada a scripts latinos, gregos e cirílicos. O sistema operacional pode reconhecer texto em scripts adicionais, mas o PolyPDF não promete incorporar esses caracteres como uma camada pesquisável no PDF.
- Trate os blocos de título com scripts mistos como um caso de revisão especial.
- Instale e ative o suporte ao idioma do sistema operacional necessário antes do início do projeto e teste com uma página representativa.
- Não infira que um nome de idioma exibido garante precisão igual em fontes, qualidade de digitalização, rotações ou notas manuscritas.
- Quando o PolyPDF relatar que o texto reconhecido não pode ser incorporado, use qualquer exportação de texto oferecida como auxílio de revisão, não como prova de que o próprio PDF pode ser pesquisado nesse script.
Verifique os termos que são importantes para o trabalho
Um teste de pesquisa geral pode passar enquanto os identificadores necessários ainda falham. Construa um pequeno conjunto de verificação a partir do documento: um número de folha, um nome de sala, uma abreviatura de material, uma dimensão e uma nota contendo pontuação. Pesquise cada valor exatamente e tente um fragmento distinto. Inspecione os resultados verdadeiros e os locais óbvios que a pesquisa não encontrou.
- Espere confusão entre formas semelhantes, como O e 0, I e 1, S e 5, ou pontos decimais e ruído de varredura.
- Notas giradas, fontes condensadas, impressões diazo desbotadas, digitalizações distorcidas e linhas cruzadas de texto são entradas mais difíceis.
- Nunca copie uma dimensão, quantidade, etiqueta de equipamento ou valor de especificação derivado de OCR em um trabalho posterior sem compará-lo com a imagem da página.
- Os resultados da pesquisa são uma ajuda à navegação. O desenho visível continua sendo a fonte que deve ser revista.
Caso de uso resolvido: encontre “Superfície do navio” em um desenho de engenharia digitalizado
A página NACA mostrada aqui é uma varredura raster sem texto extraível antes do OCR: a pesquisa em SURFACE retorna “Sem correspondências”. Após a execução de todo o documento, salvamos o resultado, saímos do PolyPDF, reabrimos o PDF salvo e repetimos a mesma pesquisa. PolyPDF retornou três resultados e selecionou uma ocorrência “Superfície do navio” no desenho.
Copiar o texto do PDF salvo retorna “RELATÓRIO DO COMITÊ CONSULTIVO NACIONAL PARA AERONÁUTICA”, “Superfície do navio” e “US Akron”. O mesmo texto também contém erros em pequenos rótulos em itálico e notação de dimensão, portanto, use ocorrências de OCR para navegação e compare cada identificador, nota ou medida consequente com a digitalização visível.
O que o OCR não estabelece
- OCR é um reconhecimento de melhor esforço, não uma garantia de transcrição ou serviço de validação de desenho.
- Uma camada de texto pesquisável não torna o PDF acessível. A ordem de leitura, os títulos, o texto alternativo, os rótulos dos formulários e outras estruturas de acessibilidade requerem revisão separada.
- OCR não remove pixels confidenciais. Se uma digitalização precisar remover conteúdo de PDF confidencial, use um fluxo de trabalho de remoção de conteúdo de PDF sensível com reconhecimento de imagem e verifique a saída.
- O reconhecimento é executado localmente por meio dos recursos da plataforma, mas a disponibilidade e os resultados do idioma do sistema operacional podem diferir entre computadores.
- Uma barra de progresso concluída significa que a execução terminou. Isso não significa que todas as palavras foram encontradas ou incorporadas corretamente.
Para trabalhos consequentes, defina o uso aceitável antes de executar o OCR: a navegação e a descoberta são razoáveis; a extração não revisada de dimensões, quantidades ou linguagem de conformidade não é.
Perguntas frequentes
O PolyPDF OCR funciona na nuvem?
PolyPDF usa OCR de sistema operacional local em vez de um serviço de reconhecimento em nuvem PolyPDF. Os idiomas disponíveis ainda podem depender do sistema operacional e dos pacotes de idiomas instalados.
Quais scripts o PolyPDF pode incorporar como texto PDF pesquisável?
Na versão atual, a camada pesquisável incorporada está limitada às escritas latina, grega e cirílica. O reconhecimento da plataforma pode abranger mais scripts, mas isso não significa que o PolyPDF possa incorporar todos eles no PDF.
Posso escolher um intervalo de páginas ou idioma de OCR?
Não está na caixa de diálogo OCR atual. Ele inicia a execução de todo o documento e depende dos recursos de reconhecimento da plataforma, em vez de expor o intervalo de páginas e os controles de idioma.
O PolyPDF pode exportar uma programação de OCR para Excel?
Sim. Depois que o OCR construir sua estrutura AEC da sessão atual, escolha Arquivo › Exportar › Pasta de trabalho do Excel (tabelas + texto)…. Revise as linhas e células resultantes em relação ao desenho; OCR e reconstrução de tabela são o melhor esforço.
O OCR torna acessível um PDF digitalizado?
Não. O texto pesquisável é um ingrediente, mas a acessibilidade também depende da ordem de leitura, da estrutura do documento, do texto alternativo, da rotulagem do formulário e da revisão humana.
Fontes e leituras adicionais
- NASA NTRS: NACA U.S.S. Varredura de engenharia de Akron — O registro da NASA marca o relatório como Público e afirma que é um trabalho do governo dos EUA com uso público permitido.
- Apple Vision: reconhecendo texto em imagens
- Microsoft Learn: namespace Windows.Media.Ocr
- PolyPDF 1.5: OCR AEC local e exportação de tabela — A estrutura AEC e a exportação para Excel foram introduzidas em 1.4.4. A camada pesquisável incorporada abrange scripts latinos, gregos e cirílicos, e a disponibilidade do idioma depende do sistema operacional do computador e do suporte instalado.
Teste o OCR em uma digitalização representativa
Baixe o PolyPDF para macOS ou Windows, execute o OCR em uma cópia não confidencial e teste as etiquetas e notas exatas das folhas que seu fluxo de trabalho precisa encontrar.
Gratuito, sem cronômetro de teste: anotação, revisão, calibração, 3 medições criadas à mão por documento e visualização do pacote de revisão. Pesquisa de símbolos, plug-ins e alterações ou publicação de pacotes de revisão exigem Pro.


