Blog

स्कैन की गई PDF से टेक्स्ट कैसे निकालें (जब कॉपी-पेस्ट काम न करे)

स्कैन की गई PDF पर सामान्य टेक्स्ट एक्सट्रैक्शन क्यों फेल हो जाता है, और OCR तस्वीर जैसी दिखने वाली फाइल से टेक्स्ट कैसे निकालता है।

Also available in:EnglishHinglish

जाल: PDF जो टेक्स्ट जैसी दिखती है पर है नहीं

यह समस्या बार-बार होती है — आप कोई स्कैन की गई डॉक्यूमेंट PDF व्यूअर में खोलते हैं, टेक्स्ट बिल्कुल सामान्य दिखता है, तो आप किसी पैराग्राफ को सेलेक्ट करके कॉपी करने की कोशिश करते हैं — और कुछ नहीं होता, या सिर्फ एक बॉक्स सा बन जाता है। यही असली संकेत है। एक स्कैन किया हुआ पेज, या डॉक्यूमेंट की फोटो जो PDF के रूप में सेव की गई हो, उसमें असल में कोई टेक्स्ट डेटा होता ही नहीं है। फाइल फॉर्मेट के लिहाज़ से यह सिर्फ एक तस्वीर है, बिल्कुल किसी पहाड़ की फोटो जैसी। सामान्य कॉपी-पेस्ट और टेक्स्ट एक्सट्रैक्शन टूल के पास निकालने के लिए कुछ होता ही नहीं, क्योंकि कोई टेक्स्ट लेयर है ही नहीं।

इसीलिए स्कैन की गई PDF में Ctrl+F से सर्च करने पर भी कुछ नहीं मिलता, भले ही आप अपनी आँखों से पेज पर वह शब्द साफ देख सकें — कंप्यूटर अक्षर नहीं पढ़ रहा, वह सिर्फ पिक्सल दिखा रहा है जो इंसान को अक्षरों जैसे दिखते हैं।

OCR असल में अलग क्या करता है

ऑप्टिकल कैरेक्टर रिकॉग्निशन (OCR) इस समस्या को इंसान की तरह पेज को "देखकर" हल करता है, न कि किसी न होने वाले टेक्स्ट डेटा को पढ़कर। हर पेज को हाई-रेज़ोल्यूशन इमेज में बदला जाता है, और एक रिकॉग्निशन इंजन उसमें मौजूद आकारों को पहचानता है, यह अंदाज़ा लगाते हुए कि आम तौर पर अक्षर और शब्द कैसे दिखते हैं, और इस तरह एक तस्वीर से असली, कंप्यूटर द्वारा पढ़ा जा सकने वाला टेक्स्ट बना देता है।

यह टेक्स्ट लेयर पढ़ने से कहीं ज्यादा भारी काम है, इसीलिए OCR में सामान्य PDF-to-text कन्वर्ज़न से ज्यादा समय लगता है — यह पहले से मौजूद डेटा नहीं निकाल रहा, बल्कि पिक्सल-दर-पिक्सल अंदाजा लगाकर टेक्स्ट बना रहा है।

OCR से अच्छे रिज़ल्ट पाने का तरीका

यहाँ स्कैन की क्वालिटी सबसे ज्यादा मायने रखती है। साफ, अच्छी रोशनी वाला, हाई-रेज़ोल्यूशन स्कैन बहुत सटीक पहचाना जाता है — यह पूरी तरह परखी हुई टेक्नोलॉजी है इस काम के लिए। लेकिन तिरछी खींची गई धुंधली फोटो, कम रेज़ोल्यूशन वाला फैक्स स्कैन, या हाथ से लिखा हुआ टेक्स्ट कहीं ज्यादा गलतियाँ देगा, क्योंकि जिन आकारों से इंजन मिलान करने की कोशिश कर रहा है, वे खुद ही धुंधले या अस्पष्ट हैं।

अगर आपके पास सोर्स पर कंट्रोल है (जैसे किसी कागज़ को दोबारा स्कैन करना), तो सीधा और ज्यादा DPI पर स्कैन करना, फोन से तिरछी फोटो खींचने से कहीं बेहतर नतीजा देगा।

OCR किसके लिए है, और किसके लिए नहीं

OCR तभी इस्तेमाल करें जब आपकी PDF में कोई इस्तेमाल करने लायक टेक्स्ट लेयर न हो — स्कैन की गई डॉक्यूमेंट, फोटो खींचे गए पेज, या पुरानी फाइलें जो कभी डिजिटल टाइप नहीं हुईं। अगर पक्का न हो, तो पहले सामान्य PDF to Text टूल आज़माएं; अगर वह खाली या बेतरतीब टेक्स्ट दे, तो यह पक्का हो जाता है कि आपको OCR की जरूरत है। सामान्य, डिजिटली बनी PDF (जैसे एक्सपोर्ट की गई रिपोर्ट या Word से बनी PDF) पर OCR का इस्तेमाल न करें — उनमें पहले से ही सही टेक्स्ट लेयर होता है और सामान्य एक्सट्रैक्शन तेज़ और ज्यादा सटीक होगा।

एक बात पहले से जान लें: यह रिकॉग्निशन अंग्रेज़ी टेक्स्ट के लिए काम करता है। दूसरी भाषाओं के दस्तावेज़ों के लिए उस भाषा के अनुसार सेट किया गया अलग रिकॉग्निशन इंजन चाहिए होगा।

Try PDF OCR nowFree, runs in your browser — no sign-up.

Frequently asked questions