स्कैन की गई PDF ड्राइंग पर OCR
संक्षिप्त उत्तर
PolyPDF 1.5 में स्कैन की गई पीडीएफ ड्राइंग को OCR करने के लिए, एक कार्यशील प्रतिलिपि सहेजें, दस्तावेज़ › OCR चुनें, और संपूर्ण दस्तावेज़ पहचान को समाप्त होने दें। PolyPDF स्थानीय ओसीआर का उपयोग करता है, जहां समर्थित है वहां सर्वोत्तम प्रयास वाली खोज योग्य परत जोड़ता है, और शेड्यूल, शीर्षक ब्लॉक, ड्राइंग लेबल और आयाम जैसे एईसी संरचना का विश्लेषण करता है। फ़ाइल › निर्यात › एक्सेल वर्कबुक (टेबल्स + टेक्स्ट)… से मान्यता प्राप्त तालिकाएँ निर्यात करें, जबकि वह ओसीआर सत्र अभी भी खुला है। सहेजे गए पीडीएफ को फिर से खोलें, प्रतिनिधि शब्द खोजें, और प्रत्येक महत्वपूर्ण मान को दृष्टिगत रूप से सत्यापित करें।
OCR एक फ़्लैट स्कैन को ऐसे दस्तावेज़ में बदल सकता है जिसे आप खोज सकते हैं, लेकिन यह अनिश्चित पिक्सेल को आधिकारिक टेक्स्ट में नहीं बदलता है। उपयोगी वर्कफ़्लो मान्यता, लक्षित परीक्षण और परिणामी किसी भी चीज़ का मैन्युअल सत्यापन है।
- समीक्षा जारी करें
- PolyPDF 1.5.1 (बिल्ड 23) के साथ संरेखित . पहले के वॉकथ्रू और स्क्रीनशॉट नीचे उनके संस्करण बरकरार रखते हैं।
- पूर्वाभ्यास सत्यापित
- के साथ परीक्षण किया गया
- PolyPDF 1.5.0 (बिल्ड 22); 1.4.0 से स्क्रीनशॉट (बिल्ड 17)
- प्लेटफार्म
- मैकओएस और विंडोज़
पहले पुष्टि करें कि पीडीएफ को वास्तव में ओसीआर की आवश्यकता है
पीडीएफ खोलें और टेक्स्ट-चयन टूल से एक शब्द चुनने का प्रयास करें। फिर एक स्पष्ट शीट शीर्षक या नोट खोजें। यदि आप अलग-अलग वर्णों का चयन कर सकते हैं और खोज उन्हें पहले से ही ढूंढ लेती है, तो पृष्ठ में एक टेक्स्ट परत होती है; ओसीआर मदद के बजाय डुप्लिकेट या शोर वाला टेक्स्ट जोड़ सकता है। यदि चयन पृष्ठ को एक छवि के रूप में मानता है और खोज से कुछ नहीं मिलता है, तो यह एक अच्छा ओसीआर उम्मीदवार है।
| पृष्ठ व्यवहार का अवलोकन किया गया | संभावित स्रोत | अगला कदम |
|---|---|---|
| शब्द सही ढंग से चुनें और खोजें | पाठ के साथ बोर्न-डिजिटल पीडीएफ | मौजूदा परत का उपयोग करें; ओसीआर आमतौर पर अनावश्यक है |
| संपूर्ण पृष्ठ एक छवि की तरह व्यवहार करता है | स्कैन या रेखापुंज निर्यात | एक प्रति पर OCR चलाएँ |
| कुछ नोट्स का चयन होता है लेकिन अन्य का नहीं | मिश्रित वेक्टर पाठ और छवियाँ | सावधानी से परीक्षण करें; OCR मान पृष्ठ के अनुसार भिन्न हो सकता है |
| पाठ चयन योग्य है लेकिन ग़लत है | मौजूदा निम्न-गुणवत्ता वाली OCR परत | किसी भी वर्कफ़्लो को बदलने से पहले स्रोत रखें और परिणामों की तुलना करें |
ओसीआर पाठ की खोज क्षमता को बदलता है, ड्राइंग ज्यामिति को नहीं। यह शीट को कैलिब्रेट नहीं करता है, आयामों को मान्य नहीं करता है, या पुष्टि नहीं करता है कि नोट सही ढंग से पहचाना गया था।
PolyPDF में OCR चलाएँ
- स्रोत पीडीएफ को डुप्लिकेट करें या सेव एज़ का उपयोग करें ताकि मूल स्कैन अछूता रहे।
- यदि स्कैन लंबा है या छवि-भारी है तो असंबंधित बड़े दस्तावेज़ बंद करें, फिर कार्यशील प्रतिलिपि खोलें।
- दस्तावेज़ ›ओसीआर चुनें। वर्तमान दस्तावेज़ के लिए OCR प्रारंभ होता है; वर्तमान संवाद पृष्ठ-श्रेणी या भाषा चयनकर्ता की पेशकश नहीं करता है।
- प्रगति देखने के लिए संवाद को खुला रखें, या यदि आप पृष्ठभूमि में रन जारी रखना चाहते हैं तो इसे बंद कर दें। जब आपको रुकने की आवश्यकता हो तो OCR रद्द करें चुनें; रद्द किया गया रन अपना परिणाम रद्द कर देता है।
- खोज का निर्णय लेने से पहले पूर्णता संदेश की प्रतीक्षा करें। बड़े स्कैन और निर्माण सेट में समय लग सकता है।
- मान्यता प्राप्त दस्तावेज़ को एक अलग फ़ाइल नाम के तहत सहेजें, इसे बंद करें, और उस सहेजी गई फ़ाइल को फिर से खोलें।
- पहचान की गुणवत्ता का निरीक्षण करने के लिए विभिन्न पृष्ठों से कई शब्द खोजें और छोटे अंशों को सादे पाठ में कॉपी करें।
सत्र बंद करने से पहले एईसी संरचना और निर्यात तालिकाओं की समीक्षा करें
PolyPDF 1.4.4 के बाद से, OCR संभावित शेड्यूल, शीर्षक-ब्लॉक फ़ील्ड, ड्राइंग और विवरण लेबल, आयाम, क्षेत्र, पंक्तियों और कोशिकाओं का एक वर्तमान-सत्र मॉडल भी बनाता है। यह समीक्षा और स्प्रेडशीट हैंडऑफ़ के लिए उपयोगी है, लेकिन इसका अनुमान अभी भी पेज पिक्सल और चयन योग्य टेक्स्ट से लगाया जाता है—एक आधिकारिक शेड्यूल डेटाबेस नहीं।
| नतीजा | यह कहाँ रहता है | क्या करें? |
|---|---|---|
| खोजने योग्य पाठ परत | जहां समर्थित है वहां पीडीएफ में सहेजा गया | प्रतिनिधि शब्दों को सहेजें, बंद करें, दोबारा खोलें और खोजें |
| मान्यता प्राप्त एईसी टेबल और फ़ील्ड | वर्तमान ओपन-डॉक्यूमेंट ओसीआर सत्र | पंक्तियों और कोशिकाओं की समीक्षा करें, फिर दस्तावेज़ को बंद करने या संरचनात्मक रूप से पुनः लोड करने से पहले निर्यात करें |
| एक्सेल वर्कबुक | आपके द्वारा चुनी गई एक अलग .xlsx फ़ाइल | इसे एक स्प्रेडशीट ऐप में खोलें और ड्राइंग के साथ परिणामी कोशिकाओं की तुलना करें |
- ओसीआर रन समाप्त करें और मान्यता प्राप्त तालिका नामों, शीर्षकों, पंक्तियों और आयामों का निरीक्षण करें।
- फ़ाइल › निर्यात › एक्सेल वर्कबुक (टेबल्स + टेक्स्ट)… चुनें, जबकि मान्यता प्राप्त दस्तावेज़ सत्र खुला रहता है।
- स्रोत ड्राइंग और अंक से जुड़े नाम के तहत कार्यपुस्तिका को सहेजें।
- कार्यपुस्तिका खोलें और दृश्यमान पीडीएफ के साथ महत्वपूर्ण मात्राओं, आयामों, टैग और शेड्यूल सेल की तुलना करें।
- मर्ज की गई कोशिकाओं, फीके नियमों, लिखावट, घुमाए गए लेबल और सघन लाइनवर्क को उच्च जोखिम वाले समीक्षा क्षेत्रों के रूप में मानें।
संरचित तालिका मॉडल सत्र डेटा है। सहेजना और फिर से खोलना खोजे जाने योग्य पीडीएफ परत को सुरक्षित रखता है, लेकिन आपको यह नहीं मानना चाहिए कि अनुमानित तालिका मॉडल तब भी उपलब्ध होगा जब तक आप ओसीआर दोबारा नहीं चलाते। सत्र बंद करने से पहले कार्यपुस्तिका निर्यात करें.
भाषा और लिपि की सीमा को समझें
पहचान की उपलब्धता ऑपरेटिंग सिस्टम और उसके स्थापित भाषा समर्थन से आती है, इसलिए एक मैक या विंडोज कंप्यूटर द्वारा दी जाने वाली भाषाएं दूसरे से भिन्न हो सकती हैं। PolyPDF की वर्तमान एम्बेडेड खोज योग्य परत लैटिन, ग्रीक और सिरिलिक लिपियों तक सीमित है। ऑपरेटिंग सिस्टम अतिरिक्त स्क्रिप्ट में टेक्स्ट को पहचान सकता है, लेकिन PolyPDF उन अक्षरों को पीडीएफ में खोजने योग्य परत के रूप में एम्बेड करने का वादा नहीं करता है।
- मिश्रित-स्क्रिप्ट शीर्षक ब्लॉकों को एक विशेष समीक्षा मामले के रूप में मानें।
- प्रोजेक्ट शुरू होने से पहले आवश्यक ओएस भाषा समर्थन स्थापित करें और सक्षम करें, फिर एक प्रतिनिधि पृष्ठ के साथ परीक्षण करें।
- यह निष्कर्ष न निकालें कि प्रदर्शित भाषा का नाम फ़ॉन्ट, स्कैन गुणवत्ता, रोटेशन या हस्तलिखित नोट्स में समान सटीकता की गारंटी देता है।
- जब PolyPDF रिपोर्ट करता है कि मान्यता प्राप्त पाठ को एम्बेड नहीं किया जा सकता है, तो किसी भी प्रस्तावित पाठ निर्यात को समीक्षा सहायता के रूप में उपयोग करें, न कि सबूत के रूप में कि पीडीएफ स्वयं उस स्क्रिप्ट में खोजने योग्य है।
उन शर्तों को सत्यापित करें जो नौकरी के लिए मायने रखती हैं
एक सामान्य खोज परीक्षा उत्तीर्ण हो सकती है जबकि आपके लिए आवश्यक पहचानकर्ता अभी भी विफल हो जाते हैं। दस्तावेज़ से एक छोटा सा सत्यापन सेट बनाएं: एक शीट नंबर, एक कमरे का नाम, एक सामग्री संक्षिप्त नाम, एक आयाम और विराम चिह्न वाला एक नोट। प्रत्येक मान को सटीक रूप से खोजें, फिर एक विशिष्ट खंड आज़माएँ। वास्तविक हिट और खोज से छूटे स्पष्ट स्थानों दोनों का निरीक्षण करें।
- O और 0, I और 1, S और 5, या दशमलव बिंदुओं और स्कैन शोर जैसी समान आकृतियों के बीच भ्रम की अपेक्षा करें।
- घुमाए गए नोट्स, संक्षिप्त फ़ॉन्ट, फीके डायज़ो प्रिंट, तिरछे स्कैन और टेक्स्ट क्रॉसिंग लाइनवर्क कठिन इनपुट हैं।
- ओसीआर-व्युत्पन्न आयाम, मात्रा, उपकरण टैग, या विनिर्देश मान को पृष्ठ छवि से तुलना किए बिना डाउनस्ट्रीम कार्य में कभी भी कॉपी न करें।
- खोज परिणाम एक नेविगेशन सहायता हैं. दृश्यमान रेखाचित्र वह स्रोत बना हुआ है जिसकी समीक्षा की जानी चाहिए।
व्यावहारिक उपयोग का मामला: स्कैन की गई इंजीनियरिंग ड्राइंग पर "जहाज की सतह" ढूंढें
यहां दिखाया गया NACA पेज एक रैस्टर स्कैन है जिसमें OCR से पहले कोई निकालने योग्य टेक्स्ट नहीं है: SURFACE पर खोज करने पर "कोई मिलान नहीं" मिलता है। संपूर्ण दस्तावेज़ चलाने के बाद, हमने परिणाम सहेजा, PolyPDF को छोड़ दिया, सहेजे गए PDF को फिर से खोला, और वही खोज दोहराई। PolyPDF ने तीन परिणाम लौटाए और ड्राइंग पर एक "जहाज की सतह" घटना का चयन किया।
सहेजे गए पीडीएफ से टेक्स्ट कॉपी करने पर "वैमानिकी के लिए राष्ट्रीय सलाहकार समिति की रिपोर्ट," "जहाज की सतह," और "यू.एस. एक्रोन" रिटर्न मिलता है। उसी पाठ में छोटे इटैलिक लेबल और आयाम नोटेशन में त्रुटियां भी हैं, इसलिए नेविगेशन के लिए ओसीआर हिट का उपयोग करें और दृश्यमान स्कैन के साथ प्रत्येक परिणामी पहचानकर्ता, नोट या माप की तुलना करें।
OCR क्या स्थापित नहीं करता है
- ओसीआर सर्वोत्तम प्रयास वाली मान्यता है, प्रतिलेखन वारंटी या ड्राइंग-सत्यापन सेवा नहीं।
- खोजने योग्य टेक्स्ट परत पीडीएफ को सुलभ नहीं बनाती है। पढ़ने के क्रम, शीर्षकों, वैकल्पिक पाठ, फॉर्म लेबल और अन्य पहुंच संरचना के लिए अलग से समीक्षा की आवश्यकता होती है।
- OCR गोपनीय पिक्सेल नहीं हटाता. यदि स्कैन में संवेदनशील पीडीएफ सामग्री हटाई जानी चाहिए, तो छवि-जागरूक संवेदनशील पीडीएफ सामग्री हटाने वाले वर्कफ़्लो का उपयोग करें और आउटपुट को सत्यापित करें।
- पहचान प्लेटफ़ॉर्म क्षमताओं के माध्यम से स्थानीय रूप से चलती है, लेकिन ओएस भाषा की उपलब्धता और परिणाम कंप्यूटर के बीच भिन्न हो सकते हैं।
- पूर्ण प्रगति पट्टी का अर्थ है रन समाप्त। इसका मतलब यह नहीं है कि हर शब्द सही ढंग से पाया गया या एम्बेड किया गया।
परिणामी कार्य के लिए, ओसीआर चलाने से पहले स्वीकार्य उपयोग को परिभाषित करें: नेविगेशन और खोज उचित हैं; आयामों, मात्राओं या अनुपालन भाषा का बिना समीक्षा किया गया निष्कर्षण नहीं है।
अक्सर पूछे जाने वाले प्रश्न
क्या PolyPDF OCR क्लाउड में चलता है?
PolyPDF, PolyPDF क्लाउड पहचान सेवा के बजाय स्थानीय ऑपरेटिंग-सिस्टम OCR का उपयोग करता है। उपलब्ध भाषाएँ अभी भी OS और स्थापित भाषा पैक पर निर्भर हो सकती हैं।
कौन सी स्क्रिप्ट्स PolyPDF को खोजने योग्य पीडीएफ टेक्स्ट के रूप में एम्बेड कर सकती हैं?
वर्तमान रिलीज़ में, एम्बेडेड खोज योग्य परत लैटिन, ग्रीक और सिरिलिक लिपियों तक सीमित है। प्लेटफ़ॉर्म पहचान में अधिक स्क्रिप्ट शामिल हो सकती हैं, लेकिन इसका मतलब यह नहीं है कि PolyPDF उन सभी को पीडीएफ में एम्बेड कर सकता है।
क्या मैं पृष्ठ श्रेणी या ओसीआर भाषा चुन सकता हूँ?
वर्तमान OCR संवाद में नहीं. यह संपूर्ण दस्तावेज़ चलाना शुरू करता है और पेज-रेंज और भाषा नियंत्रण को उजागर करने के बजाय प्लेटफ़ॉर्म पहचान क्षमताओं पर निर्भर करता है।
क्या PolyPDF एक्सेल में OCR शेड्यूल निर्यात कर सकता है?
हाँ. ओसीआर अपनी वर्तमान सत्र एईसी संरचना बनाने के बाद, फ़ाइल › निर्यात › एक्सेल वर्कबुक (टेबल्स + टेक्स्ट)… चुनें। ड्राइंग के सामने परिणामी पंक्तियों और कोशिकाओं की समीक्षा करें; ओसीआर और टेबल पुनर्निर्माण सर्वोत्तम प्रयास हैं।
क्या ओसीआर स्कैन की गई पीडीएफ को सुलभ बनाता है?
नहीं, खोजने योग्य पाठ एक घटक है, लेकिन पहुंच पढ़ने के क्रम, दस्तावेज़ संरचना, वैकल्पिक पाठ, फॉर्म लेबलिंग और मानव समीक्षा पर भी निर्भर करती है।
स्रोत और आगे पढ़ना
- नासा एनटीआरएस: एनएसीए यू.एस.एस. एक्रोन इंजीनियरिंग स्कैन - नासा रिकॉर्ड रिपोर्ट को सार्वजनिक चिह्नित करता है और बताता है कि यह अमेरिकी सरकार का काम है और सार्वजनिक उपयोग की अनुमति है।
- ऐप्पल विज़न: छवियों में टेक्स्ट को पहचानना
- माइक्रोसॉफ्ट लर्न: Windows.Media.Ocr नेमस्पेस
- PolyPDF 1.5: स्थानीय एईसी ओसीआर और टेबल निर्यात - एईसी संरचना और एक्सेल निर्यात 1.4.4 में पेश किए गए थे। एम्बेडेड खोज योग्य परत लैटिन, ग्रीक और सिरिलिक लिपियों को कवर करती है, और भाषा की उपलब्धता कंप्यूटर के ऑपरेटिंग सिस्टम और स्थापित समर्थन पर निर्भर करती है।
प्रतिनिधि स्कैन पर ओसीआर का परीक्षण करें
MacOS या Windows के लिए PolyPDF डाउनलोड करें, एक गैर-संवेदनशील कॉपी पर OCR चलाएँ, और सटीक शीट लेबल और नोट्स का परीक्षण करें जिन्हें आपके वर्कफ़्लो को खोजने की आवश्यकता है।
बिना किसी परीक्षण टाइमर के निःशुल्क: एनोटेशन, समीक्षा, अंशांकन, प्रति दस्तावेज़ 3 हाथ से बनाए गए माप, और संशोधन पैकेज देखना। प्रतीक खोज, प्लगइन्स और संशोधन पैकेज परिवर्तन या प्रकाशन के लिए प्रो की आवश्यकता होती है।


