PDF तालिकाओं को Markdown में बदलें

PDF से पूरी तरह निकालने में सबसे कठिन चीज़ तालिका है, क्योंकि PDF को यह पता ही नहीं होता कि उसमें तालिका है। डेटा में न पंक्तियाँ होती हैं, न सेल, न किनारे — केवल ऐसे निर्देशांकों पर रखा पाठ जो संयोग से एक सीध में आ जाता है। तालिका लौटाने का अर्थ है उस संरेखण को पहचानना।

23 रेटिंग के आधार पर 5 में से 5.0

अपनी PDF या Word फ़ाइल यहाँ छोड़ें

या अपने कंप्यूटर से कोई फ़ाइल चुनें

PDF या Word (.docx) · अधिकतम 50 MB

PDF से तालिका को Markdown में कैसे निकालें?

PDF को इस पृष्ठ के कनवर्टर पर छोड़ें। लगातार कई पंक्तियों में एक ही स्तंभ स्थिति पर संरेखित होने वाला पाठ तालिका के रूप में पहचाना जाता है और GitHub Flavored Markdown पाइप तालिका के रूप में दिया जाता है।

PDF तालिका कॉपी करने पर सब गड्डमड्ड क्यों हो जाता है?

कॉपी करने पर पाठ बनाए जाने के क्रम में मिलता है, पढ़ने के क्रम में नहीं, और PDF में सेल की सीमाएँ होती ही नहीं। स्तंभ संरचना को क्षैतिज निर्देशांकों से दोबारा निकालना पड़ता है, जो कॉपी-पेस्ट करता ही नहीं।

PDF तालिका को Markdown में बदलने के चरण

  1. 1

    दस्तावेज़ बदलें

    PDF को कनवर्टर पर छोड़ें। तालिकाएँ बाक़ी दस्तावेज़ के साथ अपने आप पहचानी जाती हैं।

  2. 2

    स्तंभ गिनती जाँचें

    पूर्वावलोकन को मूल से मिलाएँ। कोई स्तंभ लगातार ख़ाली हो तो प्रायः स्रोत में कोई शीर्षक दो स्तंभों पर फैला था।

  3. 3

    बचे हुए सेल सुधारें

    बाएँ पैनल में Markdown सीधे संपादित करें। पाइप तालिका सादा पाठ है, इसलिए सेल जोड़ना या मिलाना छोटा सा बदलाव है।

  4. 4

    गंतव्य में चिपकाएँ

    तालिका को GitHub, Obsidian, README या किसी डॉक्स साइट में चिपकाएँ। GFM पाइप तालिकाएँ इन सब में रेंडर होती हैं।

तालिका पहचान कैसे काम करती है

PDF के हर पाठ खंड के साथ एक क्षैतिज निर्देशांक और चौड़ाई होती है। जब दो खंडों के बीच का क्षैतिज अंतर मुख्य फ़ॉन्ट की ऊँचाई के लगभग डेढ़ गुना से अधिक होता है, कनवर्टर वहीं पंक्ति को विभाजित करता है — यह दूरी शब्दों के बीच की जगह से कहीं अधिक है, पर स्तंभों के बीच की खाई से कम।

अकेले इस नियम से दोनों ओर से संरेखित अनुच्छेदों पर ग़लती होती, क्योंकि उनमें भी चौड़े अंतर होते हैं। इसलिए पहचानकर्ता एक दूसरी शर्त जोड़ता है: ये अंतर लगातार पंक्तियों में एक ही जगह पड़ने चाहिए। शब्दों के बीच की जगह कभी पंक्तियों के आर-पार संरेखित नहीं होती; असली स्तंभ हमेशा होता है।

कोई खंड तभी तालिका के रूप में निकलता है जब कम से कम दो लगातार पंक्तियाँ कम से कम दो दोहराई गई स्तंभ स्थितियाँ साझा करें। बाक़ी सब कुछ अनुच्छेद पाठ ही रहता है।

क्या बचता है और क्या नहीं

Markdown की तालिका लिखावट जानबूझकर सीमित रखी गई है, और यही तय करती है कि कोई भी कनवर्टर अधिक से अधिक क्या बचा सकता है।

  • बचता है: स्तंभ संरचना, पंक्ति क्रम, सेल का पाठ, और सेल के भीतर का बोल्ड या इटैलिक
  • बचता है: पहली पंक्ति शीर्ष पंक्ति मानी जाती है, जैसा लगभग हर दस्तावेज़ में होता है
  • खोता है: मर्ज किए गए सेल, जिनका Markdown में कोई रूप नहीं, वे सबसे बाएँ स्तंभ में सिमट जाते हैं
  • खोता है: नेस्टेड तालिकाएँ, सेल की पृष्ठभूमि, किनारे और स्तंभ चौड़ाई
  • लगभग: कई पंक्तियों में लिपटा सेल पाठ एक ही सेल में जोड़ दिया जाता है

पहचान कब मुश्किल होती है

जिन तालिकाओं में स्तंभ संरेखण एक जैसा नहीं होता, वे कठिन हैं: जहाँ हर सेल अलग-अलग बीच में रखा हो, या जहाँ दाएँ संरेखित अंकों का स्तंभ बाएँ संरेखित पड़ोसी से बहुत कम अंतर पर हो। पहचानकर्ता का झुकाव पाठ को अनुच्छेद रहने देने की ओर है, बजाय ऐसी तालिका गढ़ने के जो थी ही नहीं, क्योंकि ग़लत तालिका सादे पाठ से ज़्यादा मुश्किल से साफ़ होती है।

वित्तीय विवरण, मूल्य सूचियाँ, विनिर्देश पत्रक और तुलना तालिकाएँ आमतौर पर अच्छी तरह बदलती हैं। डिब्बेदार खानों वाले सघन फ़ॉर्म आमतौर पर नहीं, क्योंकि उनकी संरचना खींची गई आयतों से आती है, पाठ संरेखण से नहीं।

अक्सर पूछे जाने वाले प्रश्न

क्या केवल तालिकाएँ निकालकर बाक़ी छोड़ी जा सकती हैं?
अपने आप नहीं। पूरा दस्तावेज़ बदलता है और तालिकाएँ अपनी जगह रहती हैं। चूँकि आउटपुट सादा पाठ है, आसपास के अनुच्छेद हटाने में कुछ ही सेकंड लगते हैं।
कई पृष्ठों पर फैली तालिका का क्या होता है?
हर पृष्ठ अलग से पहचाना जाता है, इसलिए पृष्ठ बदलने पर जारी रहने वाली तालिका दो तालिकाएँ बनाती है। उन्हें मिलाने के लिए बस दोहराई गई शीर्ष पंक्ति हटानी होती है।
क्या दाएँ संरेखित अंकों के स्तंभ पहचाने जाते हैं?
आमतौर पर हाँ। पहचान सेल के बाएँ किनारे से समूह बनाती है, इसलिए अलग-अलग चौड़ाई वाले दाएँ संरेखित अंकों का स्तंभ कभी-कभी टूट सकता है। योग मूल से मिला लें।
क्या Markdown के बजाय CSV मिल सकता है?
फ़िलहाल नहीं। Markdown पाइप तालिका को स्प्रेडशीट या छोटी सी स्क्रिप्ट से आसानी से CSV बनाया जा सकता है, और CSV निर्यात योजना में है।

संबंधित कन्वर्टर

Further reading