स्कैन की गई PDF को Markdown में बदलें

स्कैन किया गया पृष्ठ अक्षरों की तस्वीर होता है, इसलिए साधारण कनवर्टर को उसमें बदलने लायक कुछ मिलता ही नहीं। यह उपकरण इसके बजाय तस्वीर में मौजूद शब्दों को पहचानता है। इस साइट की बाक़ी हर चीज़ से अलग, यह पृष्ठों को हमारे सर्वर पर भेजकर काम करता है — आपको ठीक-ठीक बताया जाता है कि क्या भेजा जाएगा, और आपकी पुष्टि से पहले कुछ भी आपके उपकरण से बाहर नहीं जाता।

23 रेटिंग के आधार पर 5 में से 5.0

अपनी PDF या Word फ़ाइल यहाँ छोड़ें

या अपने कंप्यूटर से कोई फ़ाइल चुनें

PDF या Word (.docx) · अधिकतम 50 MB

स्कैन की गई PDF को Markdown में कैसे बदलें?

स्कैन को इस पृष्ठ पर छोड़ें। पहले उसे आपके ब्राउज़र में जाँचा जाता है, और यदि उसमें पाठ परत नहीं है तभी आपको पहचान का विकल्प दिया जाता है। पुष्टि कीजिए, और पृष्ठ हमारे सर्वर पर पढ़कर Markdown के रूप में लौटा दिए जाते हैं।

क्या मेरी स्कैन की गई फ़ाइल अपलोड होती है?

हाँ, और ऐसा केवल यही उपकरण करता है। पृष्ठ हमारे अपने सर्वर पर जाते हैं, पढ़े जाने तक स्मृति में रहते हैं, और काम पूरा होते ही मिटा दिए जाते हैं। कुछ भी डिस्क पर नहीं लिखा जाता और कोई दूसरी कंपनी उन्हें नहीं पाती।

स्कैन की गई PDF को Markdown में बदलने के चरण

  1. 1

    अपनी स्कैन PDF जोड़ें

    फ़ाइल को ऊपर के बॉक्स पर खींचें या उपकरण से चुनें। पहले उसे ब्राउज़र में जाँचा जाता है, इसलिए जिस PDF में पहले से पाठ परत है वह यहीं बदल जाती है, कहीं भेजे बिना।

  2. 2

    भाषा चुनें

    वह भाषा चुनें जिसमें दस्तावेज़ लिखा है। पहचान की सटीकता इसी पर बहुत निर्भर करती है, और ग़लत चुनाव ख़राब परिणाम का सबसे आम कारण है।

  3. 3

    भेजने की पुष्टि करें

    आपको दिखाया जाता है कि क्या भेजा जाएगा, कहाँ जाएगा और कितनी देर रहेगा। बटन दबाने तक कुछ भी नहीं भेजा जाता, और मना करने पर आप जहाँ थे वहीं रहते हैं।

  4. 4

    परिणाम जाँचें

    Markdown संपादक में आ जाता है, साथ में पहचान के भरोसे का संकेत भी। नाम, अंक और तारीख़ें मूल से मिलाए बिना उन पर भरोसा न करें।

स्कैन की गई PDF होती क्या है

PDF दो तरह की होती हैं और स्क्रीन पर एक जैसी दिखती हैं। एक अक्षर सहेजती है, इसलिए पाठ चुना, खोजा और कॉपी किया जा सकता है। दूसरी पृष्ठ की तस्वीर सहेजती है — स्कैनर, फ़ोन कैमरे या फ़ैक्स से — और उसमें अक्षर होते ही नहीं।

हमारा साधारण कनवर्टर पहली क़िस्म को सीधे आपके ब्राउज़र में पढ़ता है और फ़ाइल कहीं नहीं भेजता। दूसरी क़िस्म में उसे ठीक ही कुछ नहीं मिलता, और इसीलिए स्कैन को उसी उपकरण के बेहतर रूप की नहीं, बल्कि एक अलग उपकरण की ज़रूरत होती है।

बिना किसी सॉफ़्टवेयर के भी पहचाना जा सकता है: PDF खोलिए और कर्सर से एक पंक्ति चुनने की कोशिश कीजिए। अगर कुछ भी हाइलाइट न हो, तो वह स्कैन है।

यही पृष्ठ अपलोड क्यों करता है, बाक़ी क्यों नहीं

पाठ पहचान के लिए हर पृष्ठ को उच्च रिज़ॉल्यूशन पर छवि में बदलना और फिर उस छवि पर पहचान इंजन चलाना पड़ता है। यह ब्राउज़र में संभव तो है, पर धीमा, स्मृति पर भारी और साफ़ तौर पर कम सटीक — और मध्यम श्रेणी के फ़ोन पर, जहाँ से अधिकतर फ़ोटो वाले दस्तावेज़ आते हैं, यह व्यावहारिक विकल्प ही नहीं।

इसलिए यही एक उपकरण पृष्ठ सर्वर पर भेजता है। हमने इसे बनाते हुए मूल वादे को यथासंभव बचाया है: पहचान हमारे अपने हार्डवेयर पर, हमारे अपने इंजन से चलती है, इसलिए कोई तीसरा पक्ष आपका दस्तावेज़ नहीं पाता; और इस सेवा के पास न डेटाबेस है, न ऑब्जेक्ट स्टोरेज, न लिखने योग्य डिस्क, जहाँ उसे रखा जा सके। पृष्ठ केवल काम की अवधि तक स्मृति में रहते हैं, फिर नहीं रहते।

हर फ़ाइल के लिए, हर बार अलग से अनुमति माँगी जाती है और वह कभी याद नहीं रखी जाती। आप मना कर दें तो कुछ भी नहीं भेजा जाता, और साइट का बाक़ी हिस्सा हमेशा की तरह ही चलता रहता है।

पहचान क्या अच्छा करती है और क्या नहीं

छपे हुए पाठ का साफ़ 300 DPI स्कैन बहुत सटीक पहचाना जाता है। टेढ़ा खींचा गया, कम रोशनी में लिया गया या फीका पड़ चुका फ़ैक्स काफ़ी ख़राब निकलता है — पहचान एक सांख्यिकीय अनुमान है, नक़ल नहीं।

दो तरह की चूकें जानने लायक हैं, क्योंकि वे परिणाम देखकर पकड़ में नहीं आतीं। एक, अक्षर ग़लत पढ़े जाते हैं — सबसे अधिक नामों, संदर्भ संख्याओं और लंबे अंकों में, जहाँ आसपास कोई शब्द सुधार के लिए नहीं होता। दूसरा, जो शब्द इंजन पढ़ ही नहीं पाता वे छूट जाते हैं, इसलिए पाठ ग़लत नहीं, अनुपस्थित हो सकता है। परिणाम में भरोसे का अंक और कम अंक वाले पृष्ठ बताए जाते हैं।

  • समर्थित भाषाओं का छपा पाठ — साफ़ स्कैन पर भरोसेमंद
  • शीर्षक, अनुच्छेद और सूचियाँ — पहचाने गए शब्दों की स्थिति और आकार से दोबारा बनाए जाते हैं
  • तालिकाएँ — प्रायः मिल जाती हैं, पर स्तंभ संरेखण जाँच लें
  • हस्तलेख — समर्थित नहीं
  • गणितीय सूत्र — समर्थित नहीं
  • छवियाँ और आरेख — नहीं निकाले जाते

बेहतर परिणाम कैसे पाएँ

विकल्प हो तो 150 के बजाय 300 DPI पर स्कैन करें; अच्छे और औसत परिणाम के बीच यही सबसे बड़ा अंतर है। पृष्ठ को टेढ़ा नहीं, समतल और समान रोशनी में खींचें। और भाषा सही सेट करें — अंग्रेज़ी इंजन से जर्मन दस्तावेज़ पढ़वाने पर आत्मविश्वास से भरी बकवास ही मिलेगी।

अक्सर पूछे जाने वाले प्रश्न

क्या मेरा स्कैन दस्तावेज़ आपके सर्वर पर सहेजा जाता है?
नहीं। पढ़े जाने तक वह स्मृति में रहता है और काम पूरा या विफल होते ही मिटा दिया जाता है। पहचान सेवा के पास न डेटाबेस है न फ़ाइल स्टोरेज, इसलिए उसे रखने की कोई जगह ही नहीं है।
क्या आप मेरा दस्तावेज़ Google या किसी और OCR सेवा को भेजते हैं?
नहीं। पहचान हमारे अपने सर्वर पर, हमारे अपने इंजन से चलती है। इस उपकरण के इस्तेमाल से हमारी गोपनीयता नीति में सूचीबद्ध प्रोसेसरों में कोई कंपनी नहीं जुड़ती।
यह कौन-कौन सी भाषाएँ पहचान सकता है?
अंग्रेज़ी, जर्मन, स्पेनिश, फ़्रेंच, पुर्तगाली, हिन्दी, जापानी, कोरियाई, सरलीकृत चीनी और अरबी। पुष्टि से पहले दस्तावेज़ की भाषा चुन लें, क्योंकि सटीकता उसी पर निर्भर है।
क्या यह हस्तलेख पढ़ सकता है?
नहीं। इंजन छपे हुए पाठ पर प्रशिक्षित है। हाथ से लिखे नोट, हस्ताक्षर और टिप्पणियाँ नहीं पहचानी जाएँगी, और हम यह पहले कह देना बेहतर समझते हैं।
मुफ़्त में कितने पृष्ठ पहचाने जा सकते हैं?
एक दैनिक पृष्ठ सीमा है और एक प्रति-दस्तावेज़ सीमा, दोनों पुष्टि से पहले दिखाई जाती हैं। ये इसलिए हैं क्योंकि पहचान में वास्तविक प्रोसेसिंग समय लगता है, ब्राउज़र कनवर्टर के उलट।
क्या बिना अपलोड किए स्कैन बदलने का कोई तरीक़ा है?
वेब पर नहीं। यदि आपकी PDF में असल में पाठ परत है, तो साधारण कनवर्टर उसे ब्राउज़र में ही संभाल लेगा; पर सच्चे स्कैन के लिए सर्वर पर पहचान ज़रूरी है।

संबंधित कन्वर्टर

Further reading