Convertir un PDF numérisé en Markdown

Une page numérisée est une photographie du texte : un convertisseur ordinaire n'y trouve rien à convertir. Cet outil reconnaît les mots dans l'image. Contrairement à tout le reste de ce site, il fonctionne en envoyant les pages à notre serveur — on vous dit exactement ce qui sera envoyé et vous devez le confirmer avant que quoi que ce soit quitte votre appareil.

5.0 sur 5 pour 23 avis

Déposez votre PDF ou Word ici

ou choisissez un fichier sur votre ordinateur

PDF ou Word (.docx) · jusqu'à 50 Mo

Comment convertir un PDF numérisé en Markdown ?

Déposez le scan sur cette page. Il est d'abord vérifié dans votre navigateur et, s'il n'a pas de couche de texte, la reconnaissance vous est proposée. Après confirmation, les pages sont lues sur notre serveur et renvoyées en Markdown.

Mon fichier numérisé est-il envoyé ?

Oui, et seul cet outil le fait. Les pages vont sur notre propre serveur, restent en mémoire le temps de la lecture et sont détruites à la fin. Rien n'est écrit sur disque et aucune autre entreprise ne les reçoit.

Comment convertir un PDF numérisé en Markdown

  1. 1

    Ajoutez votre PDF numérisé

    Glissez le fichier dans le cadre ci-dessus, ou choisissez-le depuis votre appareil. Il est d'abord inspecté dans votre navigateur : un PDF qui possède déjà une couche de texte est converti ici sans être envoyé nulle part.

  2. 2

    Choisissez la langue

    Sélectionnez la langue dans laquelle le document est rédigé. La précision de la reconnaissance en dépend fortement, et un mauvais choix est la cause la plus fréquente d'un résultat médiocre.

  3. 3

    Confirmez l'envoi

    On vous montre ce qui va être envoyé, où cela va et combien de temps c'est conservé. Rien n'est transmis avant que vous n'appuyiez sur le bouton, et refuser vous laisse exactement où vous étiez.

  4. 4

    Vérifiez le résultat

    Le Markdown apparaît dans l'éditeur avec une note sur la confiance de la reconnaissance. Recoupez les noms, les chiffres et les dates avec l'original avant de vous y fier.

Ce qu'est réellement un PDF numérisé

Il existe deux sortes de PDF, identiques à l'écran. L'une stocke les caractères : le texte peut être sélectionné, cherché et copié. L'autre stocke une photographie de la page, issue d'un scanner à plat, d'un appareil photo de téléphone ou d'un fax, et ne contient aucun caractère.

Notre convertisseur ordinaire lit la première sorte directement dans votre navigateur et n'envoie le fichier nulle part. Face à la seconde, il ne trouve rien, et il a raison : c'est pourquoi les scans réclament un autre outil et non une meilleure version du même.

Vous pouvez les distinguer sans aucun logiciel : ouvrez le PDF et essayez de sélectionner une ligne de texte avec le curseur. Si rien ne se surligne, c'est un scan.

Pourquoi cette page envoie le fichier et pas les autres

La reconnaissance optique doit rastériser chaque page en haute résolution puis faire tourner un moteur de reconnaissance sur l'image. C'est possible dans un navigateur, mais lent, gourmand en mémoire et nettement moins précis ; sur un téléphone de milieu de gamme, d'où provient la plupart des documents photographiés, ce n'est pas une option réaliste.

C'est pourquoi ce seul outil envoie les pages à un serveur. Nous l'avons construit pour préserver le plus possible de la promesse initiale : la reconnaissance tourne sur notre propre matériel avec notre propre moteur, aucun tiers ne reçoit donc votre document, et le service n'a ni base de données, ni stockage d'objets, ni disque inscriptible où le garder. Les pages existent en mémoire le temps du traitement, puis disparaissent.

Le consentement est demandé pour chaque fichier, à chaque fois, et n'est jamais mémorisé. Si vous refusez, rien n'est envoyé et le reste du site se comporte exactement comme d'habitude.

Ce que la reconnaissance réussit et ce qu'elle rate

Un scan propre à 300 ppp de texte imprimé est reconnu très fidèlement. Une photo prise de biais, mal éclairée, ou d'un fax passé donne un résultat nettement moins bon : la reconnaissance est une estimation statistique, pas une transcription.

Deux modes d'échec méritent d'être connus car ils ne se voient pas dans le résultat. Des caractères sont mal lus, surtout dans les noms, les codes de référence et les longs nombres, là où aucun mot alentour ne vient corriger. Et les mots que le moteur ne parvient pas à lire sont abandonnés : le texte peut donc manquer plutôt qu'être faux. Le résultat indique le score de confiance et signale les pages les moins bien notées.

  • Texte imprimé dans les langues prises en charge : fiable sur un scan propre
  • Titres, paragraphes et listes : reconstruits à partir de la position et de la taille des mots reconnus
  • Tableaux : souvent récupérés, mais vérifiez l'alignement des colonnes
  • Écriture manuscrite : non prise en charge
  • Formules mathématiques : non prises en charge
  • Images et schémas : non extraits

Obtenir un meilleur résultat

Numérisez à 300 ppp plutôt qu'à 150 si vous avez le choix ; c'est le plus grand écart entre un bon résultat et un résultat moyen. Photographiez les pages à plat et sous un éclairage uniforme, pas de biais. Et réglez correctement la langue : un moteur anglais lisant un document allemand produira des absurdités avec assurance.

Questions fréquentes

Mon document numérisé est-il conservé sur votre serveur ?
Non. Il reste en mémoire pendant sa lecture et est détruit dès que le traitement se termine ou échoue. Le service de reconnaissance n'a ni base de données ni stockage de fichiers : il n'existe nulle part où le conserver.
Envoyez-vous mon document à Google ou à un autre service d'OCR ?
Non. La reconnaissance tourne sur notre propre serveur avec notre propre moteur. Utiliser cet outil n'ajoute aucune entreprise à la liste des sous-traitants de notre politique de confidentialité.
Quelles langues peut-il reconnaître ?
L'anglais, l'allemand, l'espagnol, le français, le portugais, l'hindi, le japonais, le coréen, le chinois simplifié et l'arabe. Choisissez la langue du document avant de confirmer, car la précision en dépend.
Peut-il lire l'écriture manuscrite ?
Non. Le moteur est entraîné sur du texte imprimé. Les notes manuscrites, les signatures et les annotations ne seront pas reconnues, et nous préférons le dire plutôt que vous laisser le découvrir dans le résultat.
Combien de pages puis-je reconnaître gratuitement ?
Il existe un quota quotidien de pages et une limite par document, tous deux affichés avant confirmation. Ils existent parce que la reconnaissance consomme du temps de calcul réel, contrairement au convertisseur du navigateur.
Puis-je convertir un scan sans l'envoyer du tout ?
Pas sur le web. Si votre PDF possède en réalité une couche de texte, le convertisseur ordinaire le traite dans le navigateur ; mais un vrai scan exige la reconnaissance sur le serveur.

Convertisseurs associés

Further reading