पुरानी डायरियों को खोजने योग्य संग्रह (सर्च करने योग्य आर्काइव) में कैसे बदलें
पुरानी डायरियों को खोजने योग्य बनाने के लिए, प्रत्येक मूल पृष्ठ को एक स्पष्ट इमेज के रूप में सुरक्षित रखें, ओसीआर (OCR) या सावधानीपूर्वक ट्रांसक्रिप्शन के माध्यम से टेक्स्ट तैयार करें, और फिर हर पृष्ठ को एक निश्चित तारीख, वॉल्यूम और पेज पहचानकर्ता (ID) से जोड़ें। टैग्स का एक छोटा, सुसंगत सेट जोड़ें और अनिश्चित तिथियों और शब्दों का इमेज से मिलान करें। इसका उद्देश्य सही प्रसंग को ढूँढना और उसके मूल पृष्ठ पर वापस लौटना है—न कि हर प्रविष्टि को बिल्कुल साफ़-सुथरा दिखाना या डायरी को दोबारा लिखना।\n\nयह गाइड उन लोगों के लिए है जिनके पास पहले से ही कागज़ी डायरियाँ या स्कैन हैं और वे उन्हें तारीख, नाम, स्थान या विषय के आधार पर खोजना चाहते हैं। नीचे दिया गया वर्कफ़्लो सुरक्षित रखी जाने वाली फ़ाइलों को खोज-सहायक टूल्स से अलग रखता है, ताकि ओसीआर की गलतियाँ और बाद के संपादन उस वास्तविक रिकॉर्ड को न मिटाएँ जो पन्ने पर लिखा है।
यह तय करें कि खोज परिणाम आपको कहाँ तक ले जाने चाहिए
स्कैनिंग या टैगिंग करने से पहले, उन खोजों को लिख लें जो आप करने की उम्मीद करते हैं। उदाहरण के लिए: “मार्च 1998 की प्रविष्टियाँ दिखाएँ,” “पुराने अपार्टमेंट के हर ज़िक्र को खोजें,” या “वह पन्ना खोलें जहाँ मैंने ट्रेन यात्रा के बारे में लिखा था।” ये अलग-अलग आवश्यकताओं को दर्शाते हैं: तारीखों के लिए सुसंगत दिनांक फ़ील्ड की आवश्यकता होती है, विषयों के लिए टैग या खोजने योग्य टेक्स्ट चाहिए, और पेज-स्तर की पुनर्प्राप्ति के लिए स्थिर पेज संदर्भों की आवश्यकता होती है।
ऐसी सबसे छोटी इकाई चुनें जो उपयोगी बनी रहे। एक ऐसी डायरी जिसमें प्रति पृष्ठ एक दिनांकित प्रविष्टि है, वह प्रति पृष्ठ एक रिकॉर्ड के रूप में काम कर सकती है। यदि प्रविष्टियाँ कई पन्नों में फैली हैं, तो प्रविष्टि को ही रिकॉर्ड मानें और उसके पहले और अंतिम पृष्ठ के पहचानकर्ता अपने पास रखें। यदि तारीख स्पष्ट नहीं है या कोई प्रविष्टि किसी विभाजक (डिवाइडर) के पार जारी रहती है, तो अनुमान लगाने के बजाय उस अनिश्चितता को दर्ज करें। D03-p014 जैसा एक स्थिर पहचानकर्ता वॉल्यूम 3, पेज 14 की ओर संकेत कर सकता है, भले ही आप बाद में इमेज फ़ाइलों का नाम बदल दें।
यह एक व्यावहारिक डिज़ाइन विकल्प है, कोई अभिलेखीय (archival) नियम नहीं। लाइब्रेरी ऑफ कांग्रेस के व्यक्तिगत संग्रह संसाधनों में व्यक्तिगत संग्रहों को स्कैन करने और डिजिटल सामग्री को संरक्षित करने के दिशानिर्देश शामिल हैं; इसके व्यापक दिशानिर्देश बताते हैं कि डिजिटल सामग्री को सुलभ बने रहने के लिए तकनीक पर निर्भर रहना पड़ता है (Library of Congress, Personal Digital Archiving)। यही कारण है कि एक खोज रिकॉर्ड को वापस पेज इमेज की ओर इंगित करना चाहिए और आपको मूल स्कैन की एक उपयोगी प्रतिलिपि रखनी चाहिए।
चरण 1: प्रोसेसिंग से पहले एक सूची (इन्वेंट्री) बनाएँ
डायरियों और वॉल्यूम को उनके भौतिक क्रम में सूचीबद्ध करें। एक वॉल्यूम लेबल, अनुमानित तिथि सीमा, क्या पन्नों पर संख्या अंकित है, और कोई भी अंतराल या आवेषण (इन्सर्ट) जिसके बारे में आप पहले से जानते हैं, उसे दर्ज करें। इन्वेंट्री को पूरी तरह से सटीक तारीखों पर निर्भर न करें: अज्ञात तिथियों वाली नोटबुक को भी क्रम में एक स्थान की आवश्यकता होती है।
इन्वेंट्री से जुड़े विवरणात्मक, स्थिर फ़ाइल नामों का उपयोग करें, उदाहरण के लिए किसी इमेज के लिए D03_p014_master.tif और उसके ट्रांसक्रिप्शन के लिए D03_p014.txt। पूरे प्रोसेस में एक ही पहचानकर्ता प्रारूप रखें। तारीख को फ़ाइल नाम की एकमात्र कुंजी (key) के रूप में उपयोग न करें; हो सकता है कि किसी प्रविष्टि में कोई तारीख न हो, अनिश्चित तारीख हो, या ऐसी तारीख हो जिसे बाद में सुधारा गया हो। यदि आप प्रोसेसिंग को कई सत्रों में विभाजित करते हैं, तो इन्वेंट्री में अंतिम पूर्ण किए गए पृष्ठ को चिह्नित करें ताकि छूटे हुए और दोहराए गए पन्नों को आसानी से पहचाना जा सके।
चरण 2: पृष्ठों को इस तरह कैप्चर करें कि टेक्स्ट की जाँच की जा सके
पन्नों को पढ़ने के क्रम में स्कैन या फ़ोटोग्राफ़ करें, जिसमें खाली या जानबूझकर छोड़े गए पन्ने भी शामिल हैं जब उनकी स्थिति मायने रखती हो। पूरे पन्ने को दृश्य में रखें, हाशिए के नोट्स (marginal notes) को कटने से बचाएं, और यह सुनिश्चित करें कि कैप्चर की गई इमेज में लिखावट पढ़ने योग्य हो। यदि कोई पन्ना नाज़ुक है, तो उसे इस तरह से सपाट या प्रेस न करें जिससे नुकसान का खतरा हो; कैप्चर विधि को अनुकूलित करें या मूल्यवान अथवा नाज़ुक सामग्री के लिए उचित संरक्षण सलाह लें।
संदर्भ प्रति (रेफरेंस कॉपी) के रूप में एक उच्च-गुणवत्ता वाली पेज इमेज रखें और आवश्यकतानुसार छोटी या खोजने योग्य डेरिवेटिव प्रतियाँ बनाएँ। लाइब्रेरी ऑफ कांग्रेस अपने संग्रह संसाधनों के हिस्से के रूप में व्यक्तिगत स्कैनिंग मार्गदर्शन प्रदान करती है। NARA का डिजिटलीकरण मार्गदर्शन संघीय रिकॉर्ड्स के लिए लिखा गया है, न कि व्यक्तिगत डायरियों के लिए, लेकिन यह स्पष्ट करता है कि डिजिटलीकरण की गुणवत्ता और गुणवत्ता प्रबंधन एक विश्वसनीय रूपांतरण वर्कफ़्लो के स्पष्ट हिस्से हैं (NARA digitization resources)। व्यक्तिगत संग्रह के लिए इसका व्यावहारिक सबक सरल है: टेक्स्ट पर भरोसा करने से पहले प्रतिनिधि छवियों की समीक्षा करें और धुंधले, कटे हुए, तिरछे या पढ़ने में कठिन पन्नों का निरीक्षण करें।
चरण 3: ओसीआर जोड़ें, फिर इमेज के साथ उसकी समीक्षा करें
ओसीआर मुद्रित या हस्तलिखित पेज इमेज को ऐसे टेक्स्ट में बदल सकता है जिसे कंप्यूटर द्वारा खोजा जा सके, बशर्ते चुना गया टूल उस लिपि और हस्तलेखन शैली का समर्थन करता हो। इसके आउटपुट को एक खोज सहायक (finding aid) के रूप में मानें, न कि एक सत्यापित ट्रांसक्रिप्शन के रूप में। पुरानी लिखावट, फीकी स्याही, असामान्य वर्तनी, संक्षिप्ताक्षर, अतिरिक्त प्रविष्टियाँ और पेज का नुकसान गलत या लापता शब्द उत्पन्न कर सकते हैं। यदि खोज में कुछ नहीं मिलता है, तो यह स्थापित नहीं होता कि वह शब्द डायरी में मौजूद नहीं है।
पहले एक छोटे नमूने को प्रोसेस करें। ऐसे पन्ने चुनें जो पूरे संग्रह का प्रतिनिधित्व करते हों: स्पष्ट लिखावट, सघन लिखावट, अलग-अलग पेन या कागज़, और कोई भी गैर-अंग्रेज़ी टेक्स्ट। जाँचें कि क्या आउटपुट उपयोगी है और क्या टूल भाषा और लेखन प्रणाली को पहचानता है। यदि ओसीआर अविश्वसनीय है, तो केवल उन्हीं प्रविष्टियों या पन्नों का ट्रांसक्रिप्शन करें जिन्हें आप सबसे अधिक खोजना चाहते हैं, या एक हाइब्रिड दृष्टिकोण का उपयोग करें: इमेज को सुरक्षित रखें, मैन्युअल रूप से जाँचा गया एक संक्षिप्त ट्रांसक्रिप्ट दर्ज करें, और अनिश्चित शब्दों को फ़्लैग करें। किसी लेखक की वर्तनी को चुपचाप "सही" न करें या संक्षिप्ताक्षरों का विस्तार न करें; यदि आप खोज को बेहतर बनाने के लिए किसी शब्द को मानकीकृत (normalise) करते हैं, तो मूल शब्दों को बनाए रखें और मानकीकृत संस्करण को अलग से लेबल करें।
गुणवत्ता नियंत्रण के लिए, प्रत्येक ओसीआर पंक्ति का निरीक्षण करें जिसमें कोई महत्वपूर्ण नाम, तारीख या खोज शब्द शामिल हो जिस पर आप निर्भर रहने का इरादा रखते हैं। यदि आप हर पंक्ति की जाँच नहीं कर सकते हैं, तो ट्रांसक्रिप्ट को असमीक्षित (unreviewed) के रूप में चिह्नित करें और जाँची गई सीमा को रिकॉर्ड करें। [?] या [अस्पष्ट] जैसी परंपरा के साथ अनिश्चितता को स्पष्ट रखें, और अनिश्चित टेक्स्ट को पेज इमेज से लिंक करें। ट्रांसक्रिप्ट अधूरा होने पर भी आपका आर्काइव उपयोगी बना रहता है, बशर्ते आप देख सकें कि क्या जाँचा गया है और क्या नहीं।
चरण 4: एक संक्षिप्त मेटाडेटा रिकॉर्ड का उपयोग करें
प्रत्येक पृष्ठ या प्रविष्टि को ऐसे फ़ील्ड्स के साथ एक संक्षिप्त रिकॉर्ड दें जो उसका पता लगाने और उसकी व्याख्या करने में मदद करते हों। एक व्यावहारिक प्रारंभिक सेट इस प्रकार है:
यह संरचना सामान्य विवरणात्मक मेटाडेटा विचारों को दर्शाती है, न कि किसी औपचारिक मानक को अपनाने की अनिवार्यता को। डबलिन कोर मेटाडेटा इनिशिएटिव (Dublin Core Metadata Initiative) की उपयोगकर्ता मार्गदर्शिका शीर्षक, पहचानकर्ता, विषय, दिनांक, विवरण और अधिकारों जैसे गुणों का वर्णन करती है, और चर्चा करती है कि मेटाडेटा मान कैसे बनाए जाएं (DCMI, Creating Metadata)। एक निजी डायरी इंडेक्स के लिए, वे विचार शीर्षक या प्रविष्टि लेबल, एक स्थिर आईडी, उपयोगी विषयों, तारीखों और एक्सेस नोट्स में तब्दील हो जाते हैं। आप एक स्प्रेडशीट के साथ शुरुआत कर सकते हैं; जब तक संग्रह या आपकी खोज की ज़रूरतें बहुत अधिक न बढ़ जाएँ, तब तक किसी समर्पित डेटाबेस की आवश्यकता नहीं होती है।
डायरी में जो लिखा है उसे अपनी व्याख्या से अलग रखें। उदाहरण के लिए, लिखें 'लिखी गई तारीख: 4/5' और 'मानकीकृत तारीख: अज्ञात' यदि आप नहीं जानते कि तारीख का मतलब 5 अप्रैल है या 4 मई। 'संभवतः वसंत 2001' जैसा नोट एक अनुमान फ़ील्ड का हिस्सा है, न कि मूल तारीख फ़ील्ड का। यह अलगाव स्रोत साक्ष्य को बदले बिना बाद में सुधार को संभव बनाता है।
चरण 5: पुनर्प्राप्ति (रिट्रीवल) के लिए टैग चुनें, न कि विस्तृत विवरण के लिए
एक छोटी शब्दावली से शुरुआत करें जो संभावित खोजों को दर्शाती हो: लोग, स्थान, बार-बार होने वाली गतिविधियाँ, परियोजनाएँ, या नामित घटनाएँ। एक ही वर्तनी का लगातार उपयोग करें, और जब कोई व्यक्ति या स्थान कई नामों से दिखाई दे तो उपनामों (aliases) का उपयोग करें। एक टैग को सामग्री को पुनः प्राप्त करने में मदद करनी चाहिए; इसके लिए किसी पृष्ठ की हर चीज़ का सारांश प्रस्तुत करना आवश्यक नहीं है।
प्रत्येक वाक्यांश के लिए एक नया टैग बनाने से बचें। यदि आपके नोट्स में "ट्रेन," "रेल," और "6:10 वाली गाड़ी" सभी एक ही आवर्ती विषय को संदर्भित करते हैं, तो तय करें कि क्या आपको 'ट्रेन यात्रा' जैसे एक मानकीकृत टैग की आवश्यकता है और ट्रांसक्रिप्ट में मूल शब्दों को बनाए रखें। ऐसे संवेदनशील वर्णनात्मक लेबल न जोड़ें जो आपके निर्धारित पुनर्प्राप्ति कार्य में मदद नहीं करते हैं। सामयिक खोजों के लिए, फुल-टेक्स्ट सर्च पर्याप्त हो सकती है; मैन्युअल टैग तब सबसे मूल्यवान होते हैं जब ओसीआर कमज़ोर हो या जब आपको अलग-अलग शब्दों के बावजूद संबंधित अंशों को एक साथ इकट्ठा करने की आवश्यकता हो।
चरण 6: खोज का परीक्षण करें और कमज़ोर कड़ियों को ठीक करें
कुछ वास्तविक खोजों को आज़माएँ जो आपके लक्ष्य से मेल खाती हों: एक सटीक तारीख, एक व्यक्ति, एक स्थान, एक आवर्ती विषय, और एक ऐसा वाक्यांश जिसे ओसीआर गलत पढ़ सकता है। जाँचें कि क्या प्रत्येक परिणाम आपको सही इमेज और पृष्ठ पर ले जाता है। यदि कोई खोज किसी ज्ञात अंश को छोड़ देती है, तो कारण का पता लगाएं: दिनांक फ़ील्ड असंगत हो सकता है, नाम के कई रूप हो सकते हैं, ओसीआर विफल हो सकता है, या परिणाम किसी बिना इंडेक्स वाले नोट में छिपा हो सकता है।
सिस्टम के प्रासंगिक हिस्से को बेहतर बनाने के लिए विफलता का उपयोग करें, न कि अंधाधुंध मेटाडेटा जोड़ने के लिए। यदि इससे बार-बार होने वाली खोज हल हो जाती है, तो किसी व्यक्ति के नाम के लिए एक उपनाम (alias) जोड़ें। जब स्रोत इमेज से पढ़ना स्पष्ट हो जाए तो ओसीआर को सही करें। यदि कोई प्रविष्टि कई पृष्ठों में फैली हुई है, तो पेज-स्तर का नोट जोड़ें। समीक्षा किए गए पृष्ठों, किए गए सुधारों और अनसुलझे मामलों के साथ एक संक्षिप्त प्रोसेसिंग लॉग रखें; इससे आपको वास्तविक नकारात्मक खोज परिणाम और एक गैर-प्रोसेस किए गए अनुभाग के बीच अंतर करने में मदद मिलती है।
गोपनीयता, सीमाएँ, और एक उपयोगी ठहराव बिंदु
एक खोजने योग्य टेक्स्ट प्रतिलिपि बंद नोटबुक की तुलना में डायरी की सामग्री को अधिक आसानी से उजागर कर सकती है। क्लाउड ओसीआर सेवा या साझा संग्रह का उपयोग करने से पहले, विचार करें कि क्या इसके भंडारण, पहुंच और हटाने के नियम आपकी आवश्यकताओं के अनुरूप हैं। यदि सामग्री स्थानीय रहनी चाहिए, तो ऐसा वर्कफ़्लो चुनें जो छवियों और टेक्स्ट दोनों को आपके नियंत्रण में रखे। साझा पहुंच के लिए, तय करें कि कौन से वॉल्यूम या फ़ील्ड को सार्वजनिक या साझा करना उचित है; खोज इंडेक्स में सब कुछ शामिल होना आवश्यक नहीं है।
कागज़ी डायरियों को केवल इसलिए न फेंकें क्योंकि उन्हें डिजिटाइज़ कर दिया गया है। एक स्कैन पृष्ठ के दृश्य को संरक्षित करता है, जबकि ओसीआर एक व्युत्पन्न (derived) टेक्स्ट सहायता है और इसमें त्रुटियां हो सकती हैं। इसी तरह, यह प्रणाली इस बात की गारंटी नहीं दे सकती कि हर हस्तलिखित शब्द खोजने योग्य होगा। इसकी गुणवत्ता पृष्ठ की स्थिति, कैप्चर की स्पष्टता, लिखावट, भाषा समर्थन और आपके द्वारा की जाने वाली समीक्षा की मात्रा पर निर्भर करती है।
एक उचित ठहराव बिंदु तब आता है जब प्रत्येक डायरी पृष्ठ का एक स्थिर संदर्भ हो, आपकी इच्छित खोजों के लिए आवश्यक तिथियाँ और टैग सुसंगत हों, और महत्वपूर्ण खोज परिणामों का एक नमूना वापस सही पृष्ठ तक ले जाए। एक वॉल्यूम के साथ शुरुआत करें, वर्कफ़्लो का परीक्षण करें, फिर इसे बाकी हिस्सों तक विस्तारित करें। इमेज को सुरक्षित रखें, अनिश्चित टेक्स्ट को अनिश्चित के रूप में स्पष्ट रखें, और मेटाडेटा को केवल इतना काम करने दें कि ज़रूरत पड़ने पर वह अंश को वापस सामने ला सके।
