PDF en Markdown : comment ça marche et ce qui est conservé

Un PDF stocke des glyphes à des coordonnées. Il ne stocke ni titre, ni liste, ni tableau : toute la structure doit être déduite de cette géométrie. Cette page explique comment cette déduction fonctionne, ce qui y survit et les documents où elle échoue.

5.0 sur 5 pour 23 avis

Déposez votre PDF ou Word ici

ou choisissez un fichier sur votre ordinateur

PDF ou Word (.docx) · jusqu'à 50 Mo

Comment un convertisseur reconstitue-t-il les titres et les listes ?

Il mesure la hauteur de police la plus fréquente du document, la prend comme référence du texte courant et classe tout le reste par rapport à elle. Les blocs plus grands deviennent des titres ; puces et indentation deviennent des listes imbriquées.

Que perd-on en convertissant un PDF en Markdown ?

Les cellules fusionnées, les images, les annotations et les éléments de page n'ont pas d'équivalent en Markdown. Un document scanné ne contient aucun texte sélectionnable : il est détecté et signalé plutôt que converti en fichier vide.

Comment convertir un PDF en Markdown

  1. 1

    Ouvrez le convertisseur

    Rendez-vous sur mypdf2md.com. Rien à installer, aucun compte à créer.

  2. 2

    Ajoutez votre PDF

    Faites glisser le fichier sur la zone de dépôt, ou cliquez pour le choisir sur votre ordinateur. Les fichiers jusqu'à 50 Mo sont acceptés.

  3. 3

    Relisez le Markdown

    Le résultat s'affiche à côté d'un aperçu en direct. Modifiez-le directement si un titre ou un tableau demande un ajustement.

  4. 4

    Copiez ou téléchargez

    Copiez le Markdown dans le presse-papiers, ou téléchargez-le en fichier .md, prêt pour votre éditeur ou votre dépôt.

Ce que le convertisseur reconstruit

Un PDF ne stocke ni titre, ni liste, ni tableau. Il stocke des glyphes à des coordonnées sur une page. Toute la structure doit être déduite de cette géométrie, et c'est pourquoi tant d'outils PDF vers texte renvoient un mur de texte indifférencié.

Ce convertisseur mesure la hauteur de police la plus fréquente du document, la prend comme référence du corps de texte, puis classe tout le reste par rapport à elle.

  • Les titres, d'après la taille de police relative au corps de texte, répartis de H1 à H4
  • Les paragraphes, en fusionnant les lignes dont l'écart vertical correspond à un interligne plutôt qu'à une rupture
  • Les listes à puces et numérotées, imbrication comprise, déduite de la profondeur d'indentation
  • Les tableaux, lorsque les cellules s'alignent sur les mêmes colonnes sur des lignes consécutives, rendus en tableaux GFM
  • Le gras, l'italique et le monospace, d'après la police de chaque fragment
  • Les mises en page à deux colonnes, en lisant toute la colonne de gauche avant celle de droite, sans les entrelacer ligne à ligne

Ce qu'il ne sait pas faire

Un document scanné ne contient aucun texte sélectionnable, seulement une image du texte. La reconnaissance optique de caractères est un autre problème, que cet outil n'aborde pas. Si vous déposez un scan, vous obtiendrez un avertissement plutôt qu'un fichier vide sans explication.

Les mises en page très travaillées — magazines, infographies, pages où le texte contourne des images en biais — perdront une partie de l'ordre de lecture. Les documents classiques comme les rapports, articles, factures, manuels et livres numériques se convertissent bien.

Les images intégrées au PDF ne sont pas extraites. Le texte qui les entoure l'est.

Pourquoi convertir dans le navigateur change tout

La plupart des convertisseurs en ligne téléversent votre fichier sur leurs serveurs, le traitent là-bas et vous rendent un lien de téléchargement. Votre document a donc séjourné sur le disque de quelqu'un d'autre, si brièvement soit-il, sous une politique de confidentialité que vous n'avez pas lue.

Cet outil ne fait jamais cette requête. Le PDF est analysé par PDF.js dans un Web Worker sur votre propre machine. Vous pouvez le vérifier : ouvrez l'onglet réseau de votre navigateur pendant une conversion, vous ne verrez aucun téléversement. Même les fichiers du worker PDF.js sont servis depuis ce domaine et non depuis un CDN tiers, si bien qu'aucun acteur extérieur n'apprend que vous avez converti quoi que ce soit.

Questions fréquentes

Comment les mises en page à deux colonnes sont-elles traitées ?
La colonne de gauche est lue en entier avant celle de droite, au lieu d'entrelacer les deux ligne à ligne comme le ferait une extraction de texte brut.
Pourquoi mon tableau est-il devenu des paragraphes ?
La détection exige que les cellules s'alignent sur les mêmes colonnes sur des lignes consécutives. Quand la structure vient de rectangles dessinés et non de l'alignement du texte, le contenu reste en paragraphes : un tableau erroné est plus pénible à corriger que du texte brut.
Les en-têtes et pieds de page répétés sont-ils supprimés ?
Oui. Le texte qui se répète à la même position sur plusieurs pages est considéré comme un élément de page et retiré, pour ne pas interrompre le corps du document.
Les PDF protégés par mot de passe sont-ils pris en charge ?
Oui. Le mot de passe vous est demandé puis transmis directement au moteur local ; il n'est ni envoyé sur le réseau ni conservé.
Que se passe-t-il avec les très gros PDF ?
Les fichiers de plus de 50 Mo sont refusés avant analyse, et toute conversion dépassant 60 secondes est interrompue pour que l'onglet reste réactif.

Convertisseurs associés

Further reading