أدلة تحويل ملفات PDF على نحو جيد

تحويل ملف PDF سهل. أما الحصول على نتيجة يمكن الاعتماد عليها فيقتضي معرفة ما تسجّله هذه الصيغة وما لا تسجّله، وأين يضطر كل محوّل إلى التخمين، وما ينبغي فحصه قبل الوثوق بالمُخرَج. تتناول هذه الأدلة أكثر الأسئلة وروداً، ولا ينتهي أيٌّ منها إلى «فاستعمل محوّلنا إذن».

الفكرة الواحدة تحت الأدلة الأربعة

لا يحتوي ملف PDF على عناوين ولا فقرات ولا قوائم ولا جداول، بل على أشكال حرفية عند إحداثيات. أما البنية التي أنتجت الإخراج فاستُعملت في حساب تلك المواضع ثم أُلقيت، ومعنى ذلك أن تحويل PDF إلى Markdown ليس استخراجاً بل استنتاجاً: قراءة الهندسة رجوعاً واستنباط البنية التي كانت ستنتجها.

وكل محوّل يفعل هذا، ومحوّلنا منها، ولا يستطيع أي محوّل أكثر من الاستنتاج — إذ الجواب غير موجود في الملف حقاً. ومتى اتضح ذلك كفّت الأخطاء عن أن تبدو اعتباطية. فالعنوان الذي خرج فقرةً كان مميَّزاً بالتعريض لا بالحجم. والجدول الذي انهار كانت فيه خلايا مدموجة. والصفحة التي تُقرأ هذراً كانت من عمودين. كل إخفاق يرجع إلى قاعدة، والقاعدة التي تعرفها قاعدة يمكنك الالتفاف عليها.

لهذا وُجدت هذه الأدلة. الأول يشرح هذا الاستنتاج وأنماط إخفاقه شرحاً وافياً. والثاني عن الملف الذي تستلمه وعن التعديلات القليلة التي تستحق الإنجاز قبل حفظه. والثالث والرابع عن وجهتين بعينهما — خزانة ملاحظات ونظام استرجاع — تفرضان على Markdown نفسه مطالب مختلفة تماماً.