PDF zu Markdown: wie es funktioniert und was erhalten bleibt

Ein PDF speichert Glyphen an Koordinaten. Es speichert weder eine Überschrift noch eine Liste noch eine Tabelle, also muss die gesamte Struktur aus dieser Geometrie abgeleitet werden. Diese Seite erklärt, wie das geschieht, was dabei erhalten bleibt und an welchen Dokumenten es scheitert.

5.0 von 5 bei 23 Bewertungen

PDF oder Word hier ablegen

oder eine Datei von Ihrem Computer auswählen

PDF oder Word (.docx) · bis zu 50 MB

Wie werden Überschriften und Listen aus einem PDF rekonstruiert?

Gemessen wird die häufigste Schrifthöhe im Dokument; sie gilt als Fließtext, und alles andere wird relativ dazu eingeordnet. Größere Textblöcke werden Überschriften, Aufzählungszeichen und Einzugstiefe werden verschachtelte Listen.

Was geht bei der Umwandlung von PDF zu Markdown verloren?

Verbundene Zellen, Bilder, Anmerkungen und Seitenelemente haben in Markdown keine Entsprechung. Ein Scan enthält gar keinen auswählbaren Text und wird deshalb erkannt und gemeldet, statt als leere Datei zurückzukommen.

So wandeln Sie ein PDF in Markdown um

  1. 1

    Konverter öffnen

    Rufen Sie mypdf2md.com auf. Nichts zu installieren, kein Konto anzulegen.

  2. 2

    PDF hinzufügen

    Ziehen Sie die Datei auf das Ablagefeld oder wählen Sie sie per Klick von Ihrem Rechner. Dateien bis 50 MB werden angenommen.

  3. 3

    Markdown prüfen

    Das Ergebnis erscheint neben einer Live-Vorschau. Bessern Sie direkt nach, falls eine Überschrift oder Tabelle nicht sitzt.

  4. 4

    Kopieren oder herunterladen

    Kopieren Sie das Markdown in die Zwischenablage oder laden Sie es als .md-Datei herunter, fertig für Editor oder Repository.

Was der Konverter rekonstruiert

Ein PDF speichert weder Überschrift noch Liste noch Tabelle. Es speichert Glyphen an Koordinaten auf einer Seite. Sämtliche Struktur muss aus dieser Geometrie erschlossen werden, und genau deshalb liefern so viele PDF-zu-Text-Werkzeuge eine undifferenzierte Textwand.

Dieser Konverter ermittelt die häufigste Schrifthöhe im Dokument, nimmt sie als Maß für den Fließtext und ordnet alles Übrige relativ dazu ein.

  • Überschriften, aus der Schriftgröße im Verhältnis zum Fließtext, abgebildet auf H1 bis H4
  • Absätze, indem Zeilen zusammengeführt werden, deren vertikaler Abstand einem Zeilenabstand und keinem Umbruch entspricht
  • Aufzählungen und nummerierte Listen, samt Verschachtelung aus der Einrücktiefe
  • Tabellen, wenn Zellen über aufeinanderfolgende Zeilen an denselben Spalten ausgerichtet sind, ausgegeben als GFM-Tabellen
  • Fett, kursiv und dicktengleich, anhand der Schrift des jeweiligen Textstücks
  • Zweispaltige Layouts, wobei die linke Spalte vollständig vor der rechten gelesen wird statt Zeile für Zeile verschränkt

Was er nicht kann

Gescannte Dokumente enthalten keinen auswählbaren Text, sondern nur ein Bild davon. Texterkennung ist ein anderes Problem, das dieses Werkzeug nicht angeht. Wenn Sie einen Scan auswählen, erhalten Sie einen Hinweis statt einer leeren Datei ohne Erklärung.

Aufwendig gestaltete Layouts — Magazinseiten, Infografiken, Text der schräg um Bilder fließt — verlieren einen Teil der Lesereihenfolge. Gewöhnliche Dokumente wie Berichte, Fachaufsätze, Rechnungen, Handbücher und E-Books lassen sich gut umwandeln.

Im PDF eingebettete Bilder werden nicht extrahiert. Der Text um sie herum schon.

Warum die Umwandlung im Browser zählt

Die meisten Online-Konverter laden Ihre Datei auf ihre Server, verarbeiten sie dort und geben Ihnen einen Download-Link zurück. Ihr Dokument lag damit auf fremder Festplatte, wie kurz auch immer, unter einer Datenschutzerklärung, die Sie nicht gelesen haben.

Dieses Werkzeug stellt diese Anfrage nie. Das PDF wird von PDF.js in einem Web Worker auf Ihrem eigenen Rechner verarbeitet. Sie können es nachprüfen: Öffnen Sie während einer Umwandlung den Netzwerk-Tab Ihres Browsers, Sie werden keinen Upload sehen. Selbst die Worker-Dateien von PDF.js liefern wir von dieser Domain statt von einem fremden CDN aus, sodass kein Dritter überhaupt erfährt, dass Sie etwas umgewandelt haben.

Häufige Fragen

Wie werden zweispaltige Layouts behandelt?
Die linke Spalte wird vollständig gelesen, bevor die rechte folgt — statt beide Zeile für Zeile zu verschränken, wie es eine reine Textextraktion täte.
Warum wurde meine Tabelle zu Absätzen?
Die Erkennung verlangt, dass Zellen über aufeinanderfolgende Zeilen hinweg in denselben Spalten stehen. Wo die Struktur aus gezeichneten Rechtecken statt aus Textausrichtung entsteht, bleibt der Inhalt Fließtext: eine falsche Tabelle zu bereinigen kostet mehr Mühe als reiner Text.
Werden wiederholte Kopf- und Fußzeilen entfernt?
Ja. Text, der über mehrere Seiten an derselben Position wiederkehrt, gilt als Seitenelement und wird verworfen, damit er den Dokumentfluss nicht unterbricht.
Werden passwortgeschützte PDFs unterstützt?
Ja. Sie werden nach dem Passwort gefragt, das direkt an den lokalen Parser geht und weder übertragen noch gespeichert wird.
Was passiert mit sehr großen PDFs?
Dateien über 50 MB werden vor der Verarbeitung abgewiesen, und jede Umwandlung, die länger als 60 Sekunden dauert, wird abgebrochen, damit der Browser-Tab reaktionsfähig bleibt.

Verwandte Konverter

Further reading