Metlivi ब्लॉग

यह कैसे जांचें कि स्कैन किए गए डायरी अटैचमेंट के अंदर का टेक्स्ट सर्च करने योग्य है या नहीं

यदि आप स्कैन किए गए अटैचमेंट के अंदर मौजूद किसी शब्द के ज़रिए पुरानी डायरी प्रविष्टि खोजना चाहते हैं, तो ऐसा शब्द खोजें जिसके वहां होने की आपको पुष्टि हो, फिर यह सुनिश्चित करें कि मेल खाने वाला परिणाम टाइप किए गए नोट या फ़ाइल नाम के बजाय अटैचमेंट की ओर संकेत करता है। कोई स्कैन केवल एक इमेज हो सकता है, मौजूदा टेक्स्ट लेयर वाला PDF हो सकता है, या ऐसी इमेज हो सकता है जिसे ऐप द्वारा OCR के ज़रिए प्रोसेस किया जाना ज़रूरी हो। सर्च करने योग्य टेक्स्ट तक पहुंचने के ये अलग-अलग तरीके हैं, और इनका सपोर्ट ऐप, फ़ाइल प्रकार, प्लान और डिवाइस के आधार पर भिन्न होता है।

30 सितंबर 20264 मिनट का पठनरोज़मर्रा का सौंदर्य और आत्म-अभिव्यक्तिलेखक: Metlivi Editorial Team
खंड 1

किसी अटैचमेंट के लिए “सर्च करने योग्य” का क्या अर्थ है?

एक सफल ऐप सर्च कई अलग-अलग चीज़ों से मेल खा सकती है: डायरी नोट का टाइप किया गया मुख्य भाग (body), अटैचमेंट का फ़ाइल नाम, PDF में पहले से एम्बेडेड चयन योग्य (selectable) टेक्स्ट, या ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) के माध्यम से इमेज से पहचाने गए शब्द। केवल परिणाम दिखने से यह पता नहीं चलता कि मैच किस माध्यम से हुआ। उदाहरण के लिए, “Station” सर्च करने से कुछ भी साबित नहीं होता यदि नोट में ही “Station ticket” लिखा है या फ़ाइल का नाम `Station.pdf` है।

स्कैन किया गया PDF सामान्य दस्तावेज़ जैसा दिख सकता है, जबकि उसमें केवल पेज इमेज ही शामिल हो सकती हैं। यदि आप PDF व्यूअर में किसी प्रिंटेड शब्द को सेलेक्ट नहीं कर पा रहे हैं, तो यह एक संकेत है कि PDF में टेक्स्ट लेयर की कमी हो सकती है; यह इस बात का प्रमाण नहीं है कि आपका नोट ऐप क्या OCR कर सकता है। इसके विपरीत, सेलेक्ट किया जा सकने वाला PDF टेक्स्ट इमेज पहचान के बिना भी सर्च करने योग्य हो सकता है। फ़ाइल को किसी PDF व्यूअर में जांचें और ऐप का अलग से परीक्षण करें।

खंड 2

किसी ज्ञात शब्द के साथ नियंत्रित परीक्षण (controlled test) करें

यदि संभव हो तो अटैचमेंट की एक कॉपी या किसी डिस्पोजेबल नोट का उपयोग करें। स्कैन के अंदर स्पष्ट रूप से दिखाई देने वाला कोई विशिष्ट शब्द चुनें, और सुनिश्चित करें कि वह शब्द नोट के शीर्षक, टाइप किए गए मुख्य भाग या फ़ाइल नाम में मौजूद न हो। फिर:

यह एक प्रक्रिया है, किसी विशिष्ट खाते के परीक्षण की रिपोर्ट नहीं। किसी क्वेरी का असफल होना अपने आप में निर्णायक नहीं है: हो सकता है कि OCR अक्षम (disabled) हो, प्रोसेसिंग अभी भी चल रही हो, फ़ॉर्मेट असमर्थित हो, या वर्तमान डिवाइस में प्रासंगिक इंडेक्स न हो।

ऐप के सामान्य सर्च इंटरफ़ेस में चुने गए शब्द को खोजें।
परिणाम का निरीक्षण करें और पुष्टि करें कि यदि ऐप मैच का स्थान बताता है, तो क्या वह अटैचमेंट के कारण नोट की पहचान करता है।
अटैचमेंट खोलें। यदि यह एक PDF है, तो PDF रीडर में चुने गए शब्द को सेलेक्ट और कॉपी करने का प्रयास करें।
किसी अन्य शब्द के लिए दोबारा खोजें जो केवल टाइप किए गए नोट में मौजूद हो। तुलना करें कि प्रत्येक परिणाम किस आधार पर दिया गया है।
यदि उपलब्ध हो, तो पहचाने गए OCR टेक्स्ट का निरीक्षण करें या ऐप की दस्तावेज़ीकृत OCR क्रिया का उपयोग करें। पुष्टि करें कि चुने गए शब्द को वास्तव में पहचाना गया था, न कि परिणाम से सिर्फ़ उसका अनुमान लगाया गया था।
खंड 3

पहले फ़ॉर्मेट और टेक्स्ट लेयर की जांच करें

दर्ज करें कि अटैचमेंट JPEG/PNG है, स्कैन किया गया PDF है, या चयन योग्य टेक्स्ट वाला PDF है। फिर प्रत्येक फ़ॉर्मेट के लिए ऐप के वर्तमान सपोर्ट दस्तावेज़ों को अलग-अलग जांचें। Joplin के [OCR दस्तावेज़](https://joplinapp.org/help/apps/ocr/) में कहा गया है कि इसका OCR PNG और JPEG इमेज और PDF फ़ाइलों को स्कैन करता है, और इमेज और PDF प्रोसेसिंग डेस्कटॉप ऐप में उपलब्ध है। यह PDF लिंक या इमेज के लिए OCR टेक्स्ट देखने का विकल्प भी बताता है। इससे निकाले गए टेक्स्ट और उसमें अपेक्षित शब्द दिखाई दे रहा है या नहीं, दोनों की जांच करना संभव हो जाता है।

Microsoft के [OneNote OCR निर्देश](https://support.microsoft.com/en-us/office/copy-text-from-pictures-and-file-printouts-using-ocr-in-onenote-93a70a2f-ebcd-42dc-9f0b-19b09fd775b4) चित्रों और फ़ाइल प्रिंटआउट से टेक्स्ट कॉपी करने का वर्णन करते हैं। बहु-पृष्ठ (multi-page) प्रिंटआउट के लिए, निर्देश एक पृष्ठ या सभी पृष्ठों से कॉपी करने का विकल्प देते हैं और चेतावनी देते हैं कि कुछ परिणामों में 24-48 घंटे लग सकते हैं। यह OneNote चित्रों या प्रिंटआउट से पहचान और टेक्स्ट निष्कर्षण का वर्णन करता है; यह मानकर न चलें कि हर प्रकार की अटैच की गई फ़ाइल को उसी तरह से प्रोसेस किया जाता है।

खंड 4

अकाउंट और डिवाइस की स्थितियों को ऐप सपोर्ट से अलग रखें

हो सकता है कि कोई ऐप सामान्य रूप से OCR का समर्थन करता हो, लेकिन आपका खाता, प्लान, सेटिंग्स या वर्तमान डिवाइस यह तय कर सकते हैं कि यह किसी विशेष अटैचमेंट के लिए काम करता है या नहीं। Evernote का [सर्च फ़ीचर पेज](https://evernote.com/features/search) वर्तमान में बताता है कि इसके Personal, Professional और Enterprise प्लान PDF, Office दस्तावेज़ों, इमेज, प्रस्तुतियों और स्कैन किए गए दस्तावेज़ों में टेक्स्ट खोज सकते हैं। उस क्षमता पर निर्भर रहने से पहले अपडेट किए गए प्लान विवरण और अपने स्वयं के प्लान की जांच करें।

Joplin एक अन्य महत्वपूर्ण अंतर का उल्लेख करता है: OCR स्कैनिंग इसके डेस्कटॉप ऐप में चलती है, जबकि मोबाइल ऐप सिंक के माध्यम से OCR डेटा तक पहुंच सकते हैं। इसलिए फ़ोन पर परिणाम न मिलने से यह साबित नहीं होता कि फ़ाइल को इंडेक्स नहीं किया जा सकता; पहले डेस्कटॉप प्रोसेसिंग की जांच करें और देखें कि सिंक किया गया डेटा उपलब्ध है या नहीं। अधिक व्यापक रूप से, वर्तमान दस्तावेज़ों के अनुसार ऐप संस्करण, लागू प्लान, OCR सेटिंग, फ़ाइल प्रकार, प्रोसेसिंग स्थिति और सिंक स्थिति की पुष्टि करें। यह मानकर न चलें कि किसी फ़ाइल को अपलोड करने से उसका टेक्स्ट अपने आप निकल जाता है या प्रत्येक डिवाइस स्थानीय रूप से इंडेक्स बनाता है।

खंड 5

परिणाम को ध्यान से पढ़ें और विफलताओं का विश्लेषण करें

यदि ज्ञात शब्द ऐप के OCR टेक्स्ट में दिखाई देता है लेकिन सर्च करने पर नोट नहीं मिलता है, तो समस्या संभवतः सर्च या सिंक पथ में आगे है; ऐप के सर्च दस्तावेज़ों की जांच करें और प्रोसेसिंग या सिंक पूरा होने के बाद दोबारा प्रयास करें। यदि OCR टेक्स्ट में वह शब्द छूट जाता है, तो स्कैन की स्पष्टता, ओरिएंटेशन, भाषा सेटिंग्स और लिखावट प्रिंटेड है या हस्तलिखित, इसकी जांच करें। Joplin का कहना है कि उसका वर्तमान सिस्टम प्रिंटेड टेक्स्ट और स्पष्ट इमेज के लिए विश्वसनीय है, लेकिन लिखावट का समर्थन नहीं करता है; Microsoft भी आगाह करता है कि OCR की प्रभावशीलता इमेज की गुणवत्ता पर निर्भर करती है। इसलिए पहचान संबंधी त्रुटियां परिणाम न मिलने का एक संभावित कारण हैं।

यदि शब्द PDF में सेलेक्ट किया जा सकता है लेकिन नोट ऐप के ज़रिए नहीं मिलता है, तो सत्यापित करें कि ऐप केवल इमेज वाले स्कैन के साथ-साथ एम्बेडेड टेक्स्ट वाले PDF को भी इंडेक्स करता है या नहीं। यदि केवल फ़ाइल नाम या टाइप किया गया नोट ही परिणाम दिखाता है, तो यह पुष्टि करता है कि वे फ़ील्ड सर्च करने योग्य हैं, लेकिन अटैचमेंट के शब्दों के बारे में कुछ नहीं बताता। परिणाम दर्ज करते समय इन जांचों को अलग रखें।

खंड 6

क्षमताओं का एक संक्षिप्त रिकॉर्ड रखें

जिस भी ऐप का आप मूल्यांकन करते हैं, उसके लिए ऐप और डिवाइस, लागू होने पर अकाउंट प्लान, अटैचमेंट फ़ॉर्मेट, PDF शब्द सेलेक्ट करने योग्य है या नहीं, OCR सेटिंग और प्रोसेसिंग स्थिति, सिंक स्थिति और सटीक परीक्षण परिणाम नोट करें। रिकॉर्ड करें कि मैच करने वाला टेक्स्ट नोट, फ़ाइल नाम, मौजूदा PDF टेक्स्ट लेयर या OCR टेक्स्ट में से कहां से आया है। यह “सर्च काम करती हुई प्रतीत होती है” को एक ऐसी जांच में बदल देता है जिसे आप डिवाइस, प्लान, सेटिंग्स या फ़ाइल फ़ॉर्मेट बदलने के बाद दोहरा सकते हैं।

संबंधित लेख

इस विषय को आगे पढ़ें