My PDF 2 MD के बारे में

अंतिम समीक्षा

My PDF 2 MD आपके PDF दस्तावेज़ों को Markdown में बदलता है, बिना उन्हें कहीं अपलोड किए। यह पृष्ठ बताता है कि इसे कौन चलाता है, रूपांतरण कैसे होता है, किन दस्तावेज़ों पर यह चूक जाता है, और आपकी फ़ाइलें कभी न पाने वाले मुफ़्त टूल का खर्च कैसे निकलता है।

यह साइट कौन चलाता है

My PDF 2 MD को MyPDF2MD.com बनाता और चलाता है, जो Kozhikode, Kerala, India में स्थित एक स्वतंत्र सॉफ़्टवेयर परियोजना है। इसके पीछे कोई वेंचर फंड नहीं है, यह किसी दस्तावेज़-प्रोसेसिंग API का मुखौटा नहीं है, और आपके बदले हुए किसी दस्तावेज़ को यह आगे नहीं बेचता।

साइट एक छोटी टीम चलाती है। किसी chatbot के पीछे सपोर्ट कतार नहीं है — मेल सीधे एक व्यक्ति तक पहुँचता है। सामान्य प्रश्न support@mypdf2md.com पर जाएँ; निजी डेटा से जुड़ी कोई भी बात privacy@mypdf2md.com पर। दोनों का उत्तर पाँच कार्यदिवसों के भीतर मिलता है, और यदि आप मेल नहीं लिखना चाहते तो संपर्क पृष्ठ पर फ़ॉर्म मौजूद है।

यह क्यों बना

वेब पर मौजूद लगभग हर PDF-से-Markdown टूल एक ही तरीके से चलता है: आप अपना दस्तावेज़ किसी ऐसे सर्वर पर भेजते हैं जिसके बारे में आप कुछ नहीं जानते, प्रोसेसिंग वहीं होती है, और उसके बाद उस दस्तावेज़ का क्या हुआ, इस पर आपसे गोपनीयता नीति की एक पंक्ति पर भरोसा करने को कहा जाता है। किसी रेस्तराँ के मेन्यू के लिए यह ठीक है। हस्ताक्षरित अनुबंध, मेडिकल रिपोर्ट, बोर्ड मीटिंग की कार्यवाही या अप्रकाशित पांडुलिपि के लिए यह ऐसा सौदा नहीं है जो कोई समझ-बूझकर करेगा।

इस सौदे से बचने की तकनीक वर्षों से ब्राउज़रों में मौजूद है। Mozilla का PDF इंजन PDF.js पृष्ठ के भीतर ही चलता है और दस्तावेज़ को इस तरह पढ़ सकता है कि उसका कोई हिस्सा नेटवर्क पार न करे। कमी क्षमता की नहीं थी, उस क्षमता के इर्द-गिर्द बने टूल की थी। इसलिए यह टूल डिफ़ॉल्ट रूप से आपकी अपनी मशीन पर रूपांतरण करता है, और मुखपृष्ठ पर लिखा गोपनीयता का दावा हमारे आचरण का वादा नहीं, बल्कि इस बनावट का विवरण है।

इस निर्णय की एक कीमत है, और उसे साफ़ कहना चाहिए: ब्राउज़र टैब के पास सर्वर से कम मेमोरी और कम प्रोसेसिंग शक्ति होती है, इसलिए बहुत लंबे या बहुत जटिल दस्तावेज़ यहाँ किसी होस्टेड सेवा की तुलना में धीमे बदलते हैं। जिन दस्तावेज़ों को लेकर लोग सचमुच चिंतित होते हैं, उनके लिए हमें यही सौदा सही लगता है।

रूपांतरण असल में कैसे होता है

यही वह हिस्सा है जिसे ज़्यादातर कनवर्टर जादू बताकर टाल देते हैं, और इसे समझना उपयोगी है, क्योंकि यही टूल की गलतियों की व्याख्या करता है।

PDF में शीर्षक, अनुच्छेद, सूचियाँ या तालिकाएँ नहीं होतीं। उसमें निर्देशांकों पर रखे अक्षर-चिह्न होते हैं। जब कोई वर्ड प्रोसेसर PDF निर्यात करता है, तो मूल दस्तावेज़ की अर्थ-संरचना — यह पंक्ति दूसरे स्तर का शीर्षक है, ये पंक्तियाँ एक अनुच्छेद हैं, ये कोष्ठ मिलकर तालिका बनाते हैं — हटा दी जाती है और उसकी जगह पृष्ठ पर निशान बनाने के निर्देश रख दिए जाते हैं। PDF को Markdown में बदलने का अर्थ है उस संरचना को ज्यामिति से वापस अनुमानित करना, और अनुमान लगाना निकालना नहीं होता।

कनवर्टर सबसे पहले मुख्य पाठ की ऊँचाई तय करता है: दस्तावेज़ में सबसे अधिक बार आने वाली फ़ॉन्ट ऊँचाई, इस आधार पर तौली गई कि उसमें कितने अक्षर लिखे हैं। बाकी सब कुछ उसी इकाई के गुणकों में मापा जाता है, और इसी वजह से परिणाम इस बात से स्वतंत्र रहता है कि दस्तावेज़ 9pt में है या 14pt में।

इसके आगे नियम ज्यामितीय हैं। जिन पाठ-खंडों की आधार-रेखा मुख्य ऊँचाई के लगभग एक-तिहाई के भीतर साझा हो, वे एक ही पंक्ति हैं। लगातार पंक्तियाँ जिनके बीच डेढ़ गुना से अधिक अंतर न हो, एक अनुच्छेद हैं। मुख्य पाठ से स्पष्ट रूप से बड़ा खंड — लगभग 1.2 गुना और उससे ऊपर — शीर्षक है, और कितना बड़ा है यह तय करता है कि वह H1 बनेगा, H2 या H3। दो या अधिक लगातार पंक्तियाँ जिनके कोष्ठ कम से कम दो साझा क्षैतिज स्थितियों पर संरेखित हों, तालिका बनती हैं। पृष्ठ के बीच के पास खड़ी खाली पट्टी उसे स्तंभों में बाँट देती है, ताकि पढ़ने का क्रम इधर-उधर न भटके। पृष्ठ दर पृष्ठ एक ही स्थान पर दोहराए जाने वाले हेडर और फ़ुटर पहचानकर हटा दिए जाते हैं।

पंक्ति के भीतर की सज्जा अनुमान से नहीं, फ़ॉन्ट से ही पढ़ी जाती है: bold और italic फ़ॉन्ट के अपने भार और झुकाव से आते हैं, और monospace खंड code बन जाते हैं। PDF में अंतर्निहित लिंक Markdown लिंक के रूप में बने रहते हैं।

यह कहाँ चूक जाता है

चूँकि संरचना अनुमानित होती है, टूल की चूकें पहले से जानी जा सकती हैं, और हमें उन्हें गिना देना बेहतर लगता है, बजाय इसके कि आप उन्हें किसी महत्वपूर्ण दस्तावेज़ पर खोजें।

  • जो दस्तावेज़ शीर्षकों को केवल मोटाई से अलग करता है, आकार बदले बिना, वह शीर्षक-पहचान को कुछ नहीं देता — ऐसे शीर्षक साधारण अनुच्छेद बनकर निकलते हैं।
  • मिली हुई कोष्ठिकाओं वाली तालिकाएँ, तालिका के भीतर तालिका, या ऐसी कोष्ठिकाएँ जिनका पाठ कई पंक्तियों में लिपटता है — इनका संरेखण टूट जाता है, क्योंकि स्तंभ-पहचान क्षैतिज स्थितियों पर चलती है और मिली हुई कोष्ठिका उस जाली को तोड़ देती है।
  • साधारण दो-स्तंभ विभाजन से अधिक जटिल बहु-स्तंभ लेआउट — जैसे पत्रिका का पृष्ठ जिसमें उद्धरण-बक्से और साइडबार हों — पढ़ने का क्रम गड्डमड्ड कर सकते हैं।
  • गणितीय संकेतन LaTeX में नहीं बदला जाता। पाठ के रूप में लिखे सूत्र उन्हीं अक्षरों के रूप में आते हैं जिनसे वे बने हैं; चित्र के रूप में डाले गए सूत्र बिलकुल नहीं आते।
  • चित्र नहीं निकाले जाते। परिणाम में पाठ और संरचना मिलती है।
  • स्कैन किए गए दस्तावेज़ में चुनने योग्य पाठ होता ही नहीं, इसलिए ब्राउज़र में होने वाला रूपांतरण उससे कुछ नहीं निकाल पाता। वह स्थिति अलग से संभाली जाती है, नीचे बताई गई वैकल्पिक पहचान से।

जो एक चीज़ आपके डिवाइस से बाहर जाती है

स्कैन असल में पृष्ठ की तस्वीर है। उसके भीतर पढ़ने लायक कोई पाठ होता ही नहीं, इसलिए ब्राउज़र में कितना भी विश्लेषण हो, कुछ नहीं निकलेगा। उसे पढ़ने के लिए optical character recognition चाहिए, जिसे एक ब्राउज़र टैब की तुलना में कहीं अधिक गणना-शक्ति चाहिए।

केवल इसी स्थिति के लिए आप हमसे कह सकते हैं कि दस्तावेज़ को हमारे अपने सर्वर पर पहचाना जाए। यह कभी अपने आप नहीं होता। टूल पहचानता है कि फ़ाइल में चुनने योग्य पाठ नहीं है, यह बताता है, और पहचान को एक ऐसे विकल्प के रूप में सामने रखता है जिसकी पुष्टि आपको करनी होती है — कुछ भी भेजे जाने से पहले एक संवाद बताता है कि कितने पृष्ठ भेजे जाएँगे, वे कहाँ जाते हैं और कितने समय रखे जाते हैं।

पहचान हमारे अपने ढाँचे पर, हमारे अपने इंजन से चलती है। फ़ाइल काम चलने तक मेमोरी में रहती है और काम पूरा होते ही नष्ट कर दी जाती है; डिस्क पर कुछ नहीं लिखा जाता और कोई तीसरा पक्ष उसे नहीं पाता। हम जो रखते हैं वह उपयोग का एक अभिलेख है — पृष्ठ संख्या, समय, पहचान की भाषा, और या तो आपका खाता ID या आपके IP का salted hash — जो दैनिक सीमा लागू करने और दुरुपयोग पकड़ने के लिए है, आपके दस्तावेज़ का कोई अंश नहीं रखता, और तीस दिन बाद मिटा दिया जाता है।

पहचान का परिणाम एक अनुमान है, प्रतिलिपि नहीं। यह अक्षरों को गलत पढ़ता है, विशेषकर नामों, अंकों, तिथियों और संदर्भ कोड में, और जो शब्द यह पढ़ नहीं पाता उन्हें चिह्नित करने के बजाय छोड़ देता है। परिणाम पर उसी के अनुसार निशान लगता है, इंजन के अपने confidence स्कोर और उन पृष्ठों की सूची के साथ जिन पर वह सबसे कम आश्वस्त था। यह हस्तलिपि नहीं पढ़ता और गणितीय सूत्र नहीं बदलता।

मुफ़्त टूल का खर्च कैसे निकलता है

वेब कनवर्टर मुफ़्त है, इसमें साइन-अप नहीं है, और इस पर विज्ञापन दिखते हैं। हमें लगता है कि इसे पृष्ठ पर लिख देना ईमानदार है, बजाय इसके कि आप इसे खुद खोजें: यह साइट विज्ञापनों से कमाती है, और आपके दस्तावेज़ों से नहीं कमाती।

यह आपके दस्तावेज़ों से कमा भी नहीं सकती — यही इस बनावट का मक़सद है, कोई नीति नहीं जिस पर आपसे भरोसा करने को कहा जाए। आपके ब्राउज़र में बदली गई फ़ाइल हम तक पहुँचती ही नहीं। यहाँ अपलोड किए गए PDF का कोई भंडार नहीं है जिसे खंगाला, जिस पर मॉडल प्रशिक्षित किया या जिसे बेचा जा सके, क्योंकि अपलोड ही नहीं होता।

विज्ञापन तभी लोड होते हैं जब आप सहमति देते हैं। कुकी बैनर में विज्ञापन श्रेणी अस्वीकार कर दीजिए और कोई विज्ञापन स्क्रिप्ट लोड नहीं होगी — ऐसी स्क्रिप्ट नहीं जो कम विज्ञापन दिखाए, बल्कि कोई भी नहीं। यही बात एनालिटिक्स पर लागू होती है। दोनों श्रेणियाँ तब तक बंद हैं जब तक आप उन्हें चालू न करें, और फ़ुटर में बाद में मन बदलने का लिंक मौजूद है।

इस साइट का कोई पृष्ठ आपसे किसी चीज़ का भुगतान नहीं माँगता: खरीदने को कुछ नहीं है, अपग्रेड करने को कोई योजना नहीं, और बनाने को कोई खाता नहीं।

हम क्या नहीं करते

  • ब्राउज़र में बदले गए दस्तावेज़ हम अपलोड नहीं करते — ऐसा कोई कोड-पथ है ही नहीं जो यह कर सके।
  • वेब कनवर्टर के लिए हम खाता, ईमेल पता या साइन-इन नहीं माँगते।
  • हम किसी दस्तावेज़ या बदले गए परिणाम को न संग्रहीत करते हैं, न अनुक्रमित, न उस पर प्रशिक्षण देते हैं, न बेचते हैं।
  • उस श्रेणी की सहमति से पहले हम विज्ञापन या एनालिटिक्स लोड नहीं करते।
  • आपके बदले गए दस्तावेज़ों या आपको मिले Markdown पर हम कोई अधिकार नहीं जताते।

यह किस पर बना है

जिन्हें आश्वासन से अधिक तकनीकी ब्योरा चाहिए, उनके लिए:

PDF पठनPDF.js, आपके ब्राउज़र में Web Worker के भीतर
संरचना पहचानस्थिति-आधारित पाठ खंडों पर चलने वाला अपना spatial parser
आउटपुट प्रारूपGitHub Flavored Markdown, pipe तालिकाओं सहित
एप्लिकेशनNext.js (App Router), React और TypeScript
इंटरफ़ेस भाषाएँ10, अरबी के लिए दाएँ-से-बाएँ समर्थन सहित
अधिकतम फ़ाइल आकार50 MB
मूल्यमुफ़्त, विज्ञापन से संचालित, बिना खाते के
संचालकMyPDF2MD.com, Kozhikode, Kerala, India

सुधार

यदि इस साइट पर कुछ गलत है — किसी गाइड में तथ्य की चूक, कोई रूपांतरण जो ऐसे तरीके से विफल होता है जिसका हमने वर्णन नहीं किया, या इस पृष्ठ का कोई दावा जो टूल के व्यवहार से मेल नहीं खाता — तो support@mypdf2md.com पर बताइए; हम उसे ठीक करेंगे और बताएँगे कि क्या बदला। इस पृष्ठ के ऊपर दी गई तिथि वह है जब इसकी सामग्री अंतिम बार उत्पाद से मिलाकर जाँची गई थी।