PDF तालिकाओं को Markdown में बदलें
PDF से पूरी तरह निकालने में सबसे कठिन चीज़ तालिका है, क्योंकि PDF को यह पता ही नहीं होता कि उसमें तालिका है। डेटा में न पंक्तियाँ होती हैं, न सेल, न किनारे — केवल ऐसे निर्देशांकों पर रखा पाठ जो संयोग से एक सीध में आ जाता है। तालिका लौटाने का अर्थ है उस संरेखण को पहचानना।
अपनी PDF या Word फ़ाइल यहाँ छोड़ें
या अपने कंप्यूटर से कोई फ़ाइल चुनें
PDF या Word (.docx) · अधिकतम 50 MB
PDF से तालिका को Markdown में कैसे निकालें?
PDF को इस पृष्ठ के कनवर्टर पर छोड़ें। लगातार कई पंक्तियों में एक ही स्तंभ स्थिति पर संरेखित होने वाला पाठ तालिका के रूप में पहचाना जाता है और GitHub Flavored Markdown पाइप तालिका के रूप में दिया जाता है।
PDF तालिका कॉपी करने पर सब गड्डमड्ड क्यों हो जाता है?
कॉपी करने पर पाठ बनाए जाने के क्रम में मिलता है, पढ़ने के क्रम में नहीं, और PDF में सेल की सीमाएँ होती ही नहीं। स्तंभ संरचना को क्षैतिज निर्देशांकों से दोबारा निकालना पड़ता है, जो कॉपी-पेस्ट करता ही नहीं।
PDF तालिका को Markdown में बदलने के चरण
- 1
दस्तावेज़ बदलें
PDF को कनवर्टर पर छोड़ें। तालिकाएँ बाक़ी दस्तावेज़ के साथ अपने आप पहचानी जाती हैं।
- 2
स्तंभ गिनती जाँचें
पूर्वावलोकन को मूल से मिलाएँ। कोई स्तंभ लगातार ख़ाली हो तो प्रायः स्रोत में कोई शीर्षक दो स्तंभों पर फैला था।
- 3
बचे हुए सेल सुधारें
बाएँ पैनल में Markdown सीधे संपादित करें। पाइप तालिका सादा पाठ है, इसलिए सेल जोड़ना या मिलाना छोटा सा बदलाव है।
- 4
गंतव्य में चिपकाएँ
तालिका को GitHub, Obsidian, README या किसी डॉक्स साइट में चिपकाएँ। GFM पाइप तालिकाएँ इन सब में रेंडर होती हैं।
तालिका पहचान कैसे काम करती है
PDF के हर पाठ खंड के साथ एक क्षैतिज निर्देशांक और चौड़ाई होती है। जब दो खंडों के बीच का क्षैतिज अंतर मुख्य फ़ॉन्ट की ऊँचाई के लगभग डेढ़ गुना से अधिक होता है, कनवर्टर वहीं पंक्ति को विभाजित करता है — यह दूरी शब्दों के बीच की जगह से कहीं अधिक है, पर स्तंभों के बीच की खाई से कम।
अकेले इस नियम से दोनों ओर से संरेखित अनुच्छेदों पर ग़लती होती, क्योंकि उनमें भी चौड़े अंतर होते हैं। इसलिए पहचानकर्ता एक दूसरी शर्त जोड़ता है: ये अंतर लगातार पंक्तियों में एक ही जगह पड़ने चाहिए। शब्दों के बीच की जगह कभी पंक्तियों के आर-पार संरेखित नहीं होती; असली स्तंभ हमेशा होता है।
कोई खंड तभी तालिका के रूप में निकलता है जब कम से कम दो लगातार पंक्तियाँ कम से कम दो दोहराई गई स्तंभ स्थितियाँ साझा करें। बाक़ी सब कुछ अनुच्छेद पाठ ही रहता है।
क्या बचता है और क्या नहीं
Markdown की तालिका लिखावट जानबूझकर सीमित रखी गई है, और यही तय करती है कि कोई भी कनवर्टर अधिक से अधिक क्या बचा सकता है।
- बचता है: स्तंभ संरचना, पंक्ति क्रम, सेल का पाठ, और सेल के भीतर का बोल्ड या इटैलिक
- बचता है: पहली पंक्ति शीर्ष पंक्ति मानी जाती है, जैसा लगभग हर दस्तावेज़ में होता है
- खोता है: मर्ज किए गए सेल, जिनका Markdown में कोई रूप नहीं, वे सबसे बाएँ स्तंभ में सिमट जाते हैं
- खोता है: नेस्टेड तालिकाएँ, सेल की पृष्ठभूमि, किनारे और स्तंभ चौड़ाई
- लगभग: कई पंक्तियों में लिपटा सेल पाठ एक ही सेल में जोड़ दिया जाता है
पहचान कब मुश्किल होती है
जिन तालिकाओं में स्तंभ संरेखण एक जैसा नहीं होता, वे कठिन हैं: जहाँ हर सेल अलग-अलग बीच में रखा हो, या जहाँ दाएँ संरेखित अंकों का स्तंभ बाएँ संरेखित पड़ोसी से बहुत कम अंतर पर हो। पहचानकर्ता का झुकाव पाठ को अनुच्छेद रहने देने की ओर है, बजाय ऐसी तालिका गढ़ने के जो थी ही नहीं, क्योंकि ग़लत तालिका सादे पाठ से ज़्यादा मुश्किल से साफ़ होती है।
वित्तीय विवरण, मूल्य सूचियाँ, विनिर्देश पत्रक और तुलना तालिकाएँ आमतौर पर अच्छी तरह बदलती हैं। डिब्बेदार खानों वाले सघन फ़ॉर्म आमतौर पर नहीं, क्योंकि उनकी संरचना खींची गई आयतों से आती है, पाठ संरेखण से नहीं।
अक्सर पूछे जाने वाले प्रश्न
- क्या केवल तालिकाएँ निकालकर बाक़ी छोड़ी जा सकती हैं?
- अपने आप नहीं। पूरा दस्तावेज़ बदलता है और तालिकाएँ अपनी जगह रहती हैं। चूँकि आउटपुट सादा पाठ है, आसपास के अनुच्छेद हटाने में कुछ ही सेकंड लगते हैं।
- कई पृष्ठों पर फैली तालिका का क्या होता है?
- हर पृष्ठ अलग से पहचाना जाता है, इसलिए पृष्ठ बदलने पर जारी रहने वाली तालिका दो तालिकाएँ बनाती है। उन्हें मिलाने के लिए बस दोहराई गई शीर्ष पंक्ति हटानी होती है।
- क्या दाएँ संरेखित अंकों के स्तंभ पहचाने जाते हैं?
- आमतौर पर हाँ। पहचान सेल के बाएँ किनारे से समूह बनाती है, इसलिए अलग-अलग चौड़ाई वाले दाएँ संरेखित अंकों का स्तंभ कभी-कभी टूट सकता है। योग मूल से मिला लें।
- क्या Markdown के बजाय CSV मिल सकता है?
- फ़िलहाल नहीं। Markdown पाइप तालिका को स्प्रेडशीट या छोटी सी स्क्रिप्ट से आसानी से CSV बनाया जा सकता है, और CSV निर्यात योजना में है।