Guides pour bien convertir un PDF

Convertir un PDF est facile. Obtenir un résultat fiable suppose de savoir ce que le format enregistre et ce qu'il n'enregistre pas, où tout convertisseur est contraint de deviner, et quoi vérifier avant de faire confiance à la sortie. Ces guides traitent les questions qui reviennent le plus, et aucun ne se conclut par « utilisez donc notre convertisseur ».

L'idée commune aux quatre

Un PDF ne contient ni titres, ni paragraphes, ni listes, ni tableaux. Il contient des glyphes à des coordonnées. La structure qui a produit la mise en page a servi à calculer ces positions puis a été jetée, ce qui veut dire que convertir un PDF en Markdown n'est pas une extraction mais une déduction : relire la géométrie et en déduire quelle structure l'aurait produite.

Tous les convertisseurs procèdent ainsi, le nôtre compris, et aucun ne peut faire mieux que déduire — la réponse n'est véritablement pas dans le fichier. Une fois cela clair, les erreurs cessent de paraître arbitraires. Un titre sorti en paragraphe était distingué par la graisse et non par la taille. Un tableau qui s'est effondré avait des cellules fusionnées. Une page qui se lit comme du charabia avait deux colonnes. Chaque échec remonte à une règle, et une règle que l'on connaît est une règle que l'on peut contourner.

C'est à cela que servent ces guides. Le premier explique la déduction et ses modes de défaillance en entier. Le deuxième porte sur le fichier que vous récupérez et les quelques retouches à faire avant de le conserver. Les troisième et quatrième portent sur deux destinations précises — un coffre de notes et un pipeline de recherche — qui exigent des choses assez différentes du même Markdown.