जाल: PDF जो टेक्स्ट जैसी दिखती है पर है नहीं
यह समस्या बार-बार होती है — आप कोई स्कैन की गई डॉक्यूमेंट PDF व्यूअर में खोलते हैं, टेक्स्ट बिल्कुल सामान्य दिखता है, तो आप किसी पैराग्राफ को सेलेक्ट करके कॉपी करने की कोशिश करते हैं — और कुछ नहीं होता, या सिर्फ एक बॉक्स सा बन जाता है। यही असली संकेत है। एक स्कैन किया हुआ पेज, या डॉक्यूमेंट की फोटो जो PDF के रूप में सेव की गई हो, उसमें असल में कोई टेक्स्ट डेटा होता ही नहीं है। फाइल फॉर्मेट के लिहाज़ से यह सिर्फ एक तस्वीर है, बिल्कुल किसी पहाड़ की फोटो जैसी। सामान्य कॉपी-पेस्ट और टेक्स्ट एक्सट्रैक्शन टूल के पास निकालने के लिए कुछ होता ही नहीं, क्योंकि कोई टेक्स्ट लेयर है ही नहीं।
इसीलिए स्कैन की गई PDF में Ctrl+F से सर्च करने पर भी कुछ नहीं मिलता, भले ही आप अपनी आँखों से पेज पर वह शब्द साफ देख सकें — कंप्यूटर अक्षर नहीं पढ़ रहा, वह सिर्फ पिक्सल दिखा रहा है जो इंसान को अक्षरों जैसे दिखते हैं।
OCR असल में अलग क्या करता है
ऑप्टिकल कैरेक्टर रिकॉग्निशन (OCR) इस समस्या को इंसान की तरह पेज को "देखकर" हल करता है, न कि किसी न होने वाले टेक्स्ट डेटा को पढ़कर। हर पेज को हाई-रेज़ोल्यूशन इमेज में बदला जाता है, और एक रिकॉग्निशन इंजन उसमें मौजूद आकारों को पहचानता है, यह अंदाज़ा लगाते हुए कि आम तौर पर अक्षर और शब्द कैसे दिखते हैं, और इस तरह एक तस्वीर से असली, कंप्यूटर द्वारा पढ़ा जा सकने वाला टेक्स्ट बना देता है।
यह टेक्स्ट लेयर पढ़ने से कहीं ज्यादा भारी काम है, इसीलिए OCR में सामान्य PDF-to-text कन्वर्ज़न से ज्यादा समय लगता है — यह पहले से मौजूद डेटा नहीं निकाल रहा, बल्कि पिक्सल-दर-पिक्सल अंदाजा लगाकर टेक्स्ट बना रहा है।
OCR से अच्छे रिज़ल्ट पाने का तरीका
यहाँ स्कैन की क्वालिटी सबसे ज्यादा मायने रखती है। साफ, अच्छी रोशनी वाला, हाई-रेज़ोल्यूशन स्कैन बहुत सटीक पहचाना जाता है — यह पूरी तरह परखी हुई टेक्नोलॉजी है इस काम के लिए। लेकिन तिरछी खींची गई धुंधली फोटो, कम रेज़ोल्यूशन वाला फैक्स स्कैन, या हाथ से लिखा हुआ टेक्स्ट कहीं ज्यादा गलतियाँ देगा, क्योंकि जिन आकारों से इंजन मिलान करने की कोशिश कर रहा है, वे खुद ही धुंधले या अस्पष्ट हैं।
अगर आपके पास सोर्स पर कंट्रोल है (जैसे किसी कागज़ को दोबारा स्कैन करना), तो सीधा और ज्यादा DPI पर स्कैन करना, फोन से तिरछी फोटो खींचने से कहीं बेहतर नतीजा देगा।
OCR किसके लिए है, और किसके लिए नहीं
OCR तभी इस्तेमाल करें जब आपकी PDF में कोई इस्तेमाल करने लायक टेक्स्ट लेयर न हो — स्कैन की गई डॉक्यूमेंट, फोटो खींचे गए पेज, या पुरानी फाइलें जो कभी डिजिटल टाइप नहीं हुईं। अगर पक्का न हो, तो पहले सामान्य PDF to Text टूल आज़माएं; अगर वह खाली या बेतरतीब टेक्स्ट दे, तो यह पक्का हो जाता है कि आपको OCR की जरूरत है। सामान्य, डिजिटली बनी PDF (जैसे एक्सपोर्ट की गई रिपोर्ट या Word से बनी PDF) पर OCR का इस्तेमाल न करें — उनमें पहले से ही सही टेक्स्ट लेयर होता है और सामान्य एक्सट्रैक्शन तेज़ और ज्यादा सटीक होगा।
एक बात पहले से जान लें: यह रिकॉग्निशन अंग्रेज़ी टेक्स्ट के लिए काम करता है। दूसरी भाषाओं के दस्तावेज़ों के लिए उस भाषा के अनुसार सेट किया गया अलग रिकॉग्निशन इंजन चाहिए होगा।