कॉपी-पेस्ट का सबसे पहला (और गलत) तरीका
जब भी PDF की किसी टेबल से डेटा चाहिए होता है, सबसे पहला ख्याल आता है — सेलेक्ट करो, कॉपी करो, और Excel या Google Sheets में पेस्ट कर दो। लेकिन यह लगभग कभी सही तरीके से काम नहीं करता। कभी पूरी रो एक ही सेल में लंबी लाइन बनकर आ जाती है, कभी कॉलम आपस में मिल जाते हैं, कभी रो का क्रम ही बिगड़ जाता है। यह आपकी स्प्रेडशीट की गलती नहीं है — असल वजह यह है कि PDF में "टेबल" जैसी कोई चीज़ होती ही नहीं। इसमें बस यह जानकारी होती है कि हर टेक्स्ट पेज पर कहाँ है, इसलिए PDF व्यूअर का कॉपी फंक्शन सिर्फ अंदाजा लगा रहा होता है।
एक सही PDF-to-CSV कन्वर्जन यह काम सही तरीके से करता है — हर टेक्स्ट का पोजीशन देखा जाता है, एक ही लाइन में आने वाले टेक्स्ट को एक रो में जोड़ा जाता है, और जहाँ सामान्य से ज्यादा गैप हो वहाँ अलग-अलग कॉलम में बाँटा जाता है। यह वही तरीका है जो हमारी आँखें टेबल पढ़ते समय अपने-आप करती हैं, बस यहाँ यह कंप्यूटर द्वारा किया जाता है।
कुछ टेबल एकदम सही आती हैं, कुछ नहीं — ऐसा क्यों
यह तरीका उन टेबलों पर सबसे अच्छा काम करता है जिनमें स्पेसिंग एक जैसी और साफ हो — जैसे Excel से एक्सपोर्ट की गई टेबल, बिलिंग सॉफ्टवेयर से बनी टेबल, या अच्छी तरह फॉर्मेट की गई रिपोर्ट्स। अगर टेबल पहले Excel में बनी थी और फिर PDF में एक्सपोर्ट हुई है, तो नतीजा लगभग परफेक्ट मिलेगा।
जहाँ यह दिक्कत देता है वह है ऐसी टेबल जिनमें कोई सेल दो लाइनों में फैली हो, सेल आपस में मर्ज हों, या कॉलम की चौड़ाई हाथ से अलग-अलग सेट की गई हो। ऐसे मामलों में एक रो को गलती से दो रो मान लिया जाता है, या गलत जगह से बाँट दिया जाता है। इसलिए हमेशा पहले कुछ रो चेक कर लें, पूरी फाइल पर आँख बंद करके भरोसा न करें।
स्कैन की गई PDF वाली दिक्कत
एक चीज़ जो यह टूल नहीं कर सकता, वह है ऐसी टेबल से डेटा निकालना जो असल में एक फोटो या स्कैन हो, असली टेक्स्ट न हो — किसी प्रिंटेड पेज को स्कैन करके बनाई गई PDF में कोई टेक्स्ट लेयर होती ही नहीं, वह सिर्फ टेबल की एक तस्वीर होती है। ऐसी फाइल कन्वर्ट करने पर खाली या लगभग खाली रिजल्ट मिलेगा — इसमें कुछ गलत नहीं हुआ, बस निकालने के लिए टेक्स्ट डेटा मौजूद ही नहीं है।
इसका हल है — पहले उस स्कैन की गई PDF को OCR टूल से गुजारें ताकि असली टेक्स्ट लेयर बन जाए, फिर उस OCR वाले आउटपुट को कन्वर्ट करें। यह एक एक्स्ट्रा स्टेप है, लेकिन इसे स्किप कर देना ही सबसे बड़ी वजह होती है जब लोग सोचते हैं कि "टेबल एक्सट्रैक्शन काम ही नहीं कर रहा", जबकि असली समस्या सोर्स फाइल की टाइप है।
एक ही डॉक्यूमेंट में कई टेबल हों तो क्या करें
अगर आपकी PDF में अलग-अलग पेजों पर अलग टेबल हैं — जैसे किसी क्वार्टरली रिपोर्ट में पेज 2 पर समरी टेबल और पेज 8 पर डिटेल टेबल — तो पूरी फाइल को एक साथ कन्वर्ट करने पर सब कुछ एक ही CSV में मिल जाएगा, जो आमतौर पर तब सही नहीं होता जब दोनों टेबल के कॉलम स्ट्रक्चर अलग-अलग हों।
बेहतर तरीका यह है कि पहले जरूरी पेज अलग करके अपनी खुद की PDF बना लें, फिर हर हिस्से को अलग-अलग कन्वर्ट करें। इस तरह हर CSV फाइल ठीक एक ही टेबल से मैच करेगी, और कॉलम हेडर भी सही तरीके से एक-दूसरे से जुड़े रहेंगे।