扫描版PDF图纸的OCR识别指南
简要回答
要在 PolyPDF 1.5 中对扫描的 PDF 图纸进行 OCR,请保存工作副本,选择文档 › OCR,然后让整个文档识别运行完成。 PolyPDF 使用本地 OCR,在支持的情况下添加尽力搜索层,并分析 AEC 结构,例如明细表、标题栏、绘图标签和尺寸。从文件 > 导出 > Excel 工作簿(表格 + 文本)导出已识别的表格...,同时 OCR 会话仍处于打开状态。重新打开保存的 PDF,搜索代表性术语,并直观地验证每个关键值。
OCR 可以将平面扫描件变成可以搜索的文档,但它不能将不确定的像素变成权威文本。有用的工作流程是识别、有针对性的测试以及对任何后续结果的手动验证。
- 发布审核
- 与 PolyPDF 1.5.1(build 23)对齐 。早期的演练和屏幕截图保留了下面的版本。
- 演练已验证
- 测试用
- PolyPDF 1.5.0(版本 22); 1.4.0(版本 17)的屏幕截图
- 平台
- macOS 和 Windows
首先确认PDF确实需要OCR
打开 PDF 并尝试使用文本选择工具选择一个单词。然后搜索明显的工作表标题或注释。如果您可以选择单个字符并且搜索已找到它们,则该页面具有文本层; OCR 可能会添加重复或嘈杂的文本,而不是提供帮助。如果选择将页面视为一张图像并且搜索未返回任何内容,则它是一个很好的 OCR 候选者。
| 观察到的页面行为 | 可能的来源 | 下一步 |
|---|---|---|
| 正确选择和搜索单词 | 带文本的原生数字 PDF | 使用现有图层; OCR 通常是不必要的 |
| 整个页面的行为就像一个图像 | 扫描或光栅导出 | 对副本运行 OCR |
| 有些注释选择,但其他注释不选择 | 混合矢量文本和图像 | 仔细测试; OCR 值可能因页面而异 |
| 文本可以选择但不正确 | 现有的低质量 OCR 层 | 在替换任何工作流程之前保留源并比较结果 |
OCR 改变了文本的可发现性,而不是绘图几何形状。它不会校准纸张、验证尺寸或确认钞票已被正确识别。
在 PolyPDF 中运行 OCR
- 复制源 PDF 或使用“另存为”,使原始扫描件保持不变。
- 如果扫描较长或图像较多,请关闭不相关的大型文档,然后打开工作副本。
- 选择文档 › OCR。开始对当前文档进行 OCR 识别;当前对话框不提供页面范围或语言选择器。
- 保持对话框打开以观察进度,或者如果您希望运行在后台继续,则将其关闭。当需要停止时选择取消OCR;取消的运行会丢弃其结果。
- 等待完成消息后再判断搜索。大型扫描和构建集可能需要时间。
- 将识别的文档保存在不同的文件名下,关闭它,然后重新打开该保存的文件。
- 从不同页面搜索多个术语并将短段落复制为纯文本以检查识别质量。
在关闭会话之前查看 AEC 结构和导出表
自 PolyPDF 1.4.4 起,OCR 还构建了可能的时间表、标题块字段、绘图和详细标签、尺寸、区域、行和单元格的当前会话模型。这对于审阅和电子表格切换很有用,但它仍然是从页面像素和可选文本推断的,而不是权威的时间表数据库。
| 结果 | 它住在哪里 | 该怎么办 |
|---|---|---|
| 可搜索文本层 | 在支持的情况下保存到 PDF 中 | 保存、关闭、重新打开和搜索代表性术语 |
| 公认的 AEC 表和字段 | 当前开放文档 OCR 会话 | 检查行和单元格,然后在关闭或从结构上重新加载文档之前导出 |
| Excel工作簿 | 您选择的单独的 .xlsx 文件 | 在电子表格应用程序中打开它,并将相应单元格与绘图进行比较 |
- 完成 OCR 运行并检查已识别的表名称、标题、行和维度。
- 选择文件 › 导出 › Excel 工作簿(表格 + 文本)...,同时识别的文档会话保持打开状态。
- 使用与源图形和问题相关的名称保存工作簿。
- 打开工作簿并将关键数量、尺寸、标签和明细表单元格与可见 PDF 进行比较。
- 将合并单元格、模糊规则、手写、旋转标签和密集线条视为高风险审核区域。
结构化表模型是会话数据。保存并重新打开会保留可搜索的 PDF 图层,但您不应假设推断的表模型仍然可用,除非您再次运行 OCR。在关闭会话之前导出工作簿。
了解语言和文字边界
识别可用性取决于操作系统及其安装的语言支持,因此一台 Mac 或 Windows 计算机提供的语言可能与另一台不同。 PolyPDF 当前的嵌入式可搜索层仅限于拉丁文、希腊文和西里尔文脚本。操作系统可能会识别其他脚本中的文本,但 PolyPDF 不承诺将这些字符作为可搜索层嵌入到 PDF 中。
- 将混合脚本标题块视为特殊审查案例。
- 在项目开始之前安装并启用所需的操作系统语言支持,然后使用代表性页面进行测试。
- 请勿推断显示的语言名称可以保证字体、扫描质量、旋转或手写笔记的同等准确性。
- 当 PolyPDF 报告无法嵌入已识别的文本时,请使用任何提供的文本导出作为审阅辅助工具,而不是作为 PDF 本身在该脚本中可搜索的证据。
验证与工作相关的条款
一般搜索测试可以通过,但您需要的标识符仍然失败。根据文档构建一个小型验证集:图纸编号、房间名称、材料缩写、尺寸和包含标点符号的注释。精确搜索每个值,然后尝试一个独特的片段。检查真实命中和搜索遗漏的明显位置。
- 类似形状(例如 O 和 0、I 和 1、S 和 5)或小数点和扫描噪声之间可能会出现混淆。
- 旋转的注释、压缩的字体、褪色的重氮印刷、倾斜的扫描和文本交叉线条都是较难的输入。
- 切勿将 OCR 派生的尺寸、数量、设备标签或规格值复制到下游工作中,而不将其与页面图像进行比较。
- 搜索结果是一种导航帮助。可见的绘图仍然是必须审查的来源。
工作用例:在扫描的工程图纸上查找“船舶表面”
此处显示的 NACA 页面是光栅扫描,在 OCR 之前没有可提取的文本:搜索 SURFACE 返回“无匹配项”。整个文档运行完成后,我们保存结果,退出 PolyPDF,重新打开保存的 PDF,然后重复相同的搜索。 PolyPDF 返回了三个结果并在绘图上选择了一个“船舶表面”出现点。
从保存的 PDF 中复制文本将返回“报告国家航空咨询委员会”、“船舶表面”和“U.S.S. Akron”。同一文本还包含小斜体标签和尺寸符号中的错误,因此请使用 OCR 命中进行导航,并将每个相应的标识符、注释或测量值与可见扫描进行比较。
OCR 未建立的内容
- OCR 是尽力识别,而不是转录保证或绘图验证服务。
- 可搜索的文本层并不能使 PDF 变得易于访问。阅读顺序、标题、替代文本、表单标签和其他辅助功能结构需要单独审查。
- OCR 不会删除机密像素。如果扫描必须删除敏感 PDF 内容,请使用图像感知敏感 PDF 内容删除工作流程并验证输出。
- 识别通过平台功能在本地运行,但操作系统语言的可用性和结果可能因计算机而异。
- 完成的进度条表示运行已完成。这并不意味着每个单词都被正确找到或嵌入。
对于后续工作,在运行 OCR 之前定义可接受的用途:导航和发现是合理的;未经审查的尺寸、数量或合规性语言的提取不是。
常见问题
PolyPDF OCR 是否在云端运行?
PolyPDF 使用本地操作系统 OCR,而不是 PolyPDF 云识别服务。可用语言仍然取决于操作系统和安装的语言包。
PolyPDF 可以将哪些脚本嵌入为可搜索的 PDF 文本?
在当前版本中,嵌入的可搜索层仅限于拉丁文、希腊文和西里尔文脚本。平台识别可能会覆盖更多的脚本,但这并不意味着PolyPDF可以将所有脚本嵌入到PDF中。
我可以选择页面范围或 OCR 语言吗?
不在当前 OCR 对话框中。它启动整个文档运行并依赖于平台识别功能,而不是公开页面范围和语言控件。
PolyPDF 可以将 OCR 计划导出到 Excel 吗?
是的。 OCR 构建其当前会话 AEC 结构后,选择文件 › 导出 › Excel 工作簿(表格 + 文本)…。根据绘图检查生成的行和单元格; OCR 和表格重建是尽最大努力。
OCR 能否使扫描的 PDF 变得易于访问?
不会。可搜索文本是其中之一,但可访问性还取决于阅读顺序、文档结构、替代文本、表单标签和人工审核。
来源和进一步阅读
- NASA NTRS:NACA U.S.S.阿克伦工程扫描 — NASA 记录将报告标记为公开,并声明它是美国政府的作品,允许公众使用。
- Apple Vision:识别图像中的文本
- Microsoft Learn:Windows.Media.Ocr 命名空间
- PolyPDF 1.5:本地 AEC OCR 和表格导出 — 1.4.4 中引入了 AEC 结构和 Excel 导出。嵌入式可搜索层涵盖拉丁文、希腊文和西里尔文脚本,语言可用性取决于计算机的操作系统和安装的支持。
在代表性扫描件上测试 OCR
下载适用于 macOS 或 Windows 的 PolyPDF,在非敏感副本上运行 OCR,并测试您的工作流程需要查找的确切工作表标签和注释。
免费,无试用计时器:注释、审阅、校准、每个文档 3 个手动创建的测量以及修订包查看。符号搜索、插件和修订包更改或发布需要 Pro。


