Wie wandelt man ein PDF in Markdown um? Überschriften und Struktur bewahren
7 Min. Lesezeit
Sie haben ein PDF und müssen seinen Inhalt weiterverwenden: auf eine Website übertragen, in einer Versionskontrolle führen, aktualisieren und neu veröffentlichen oder in andere Formate umwandeln. Markdown ist dafür ein gutes Zwischenformat – es ist flexibel, weil es reiner Text ist, bewahrt aber Struktur wie Überschriften und Links.
Warum Markdown ein gutes Ziel ist
Es ist reiner Text. Es lässt sich in jedem Editor öffnen, in Versionskontrollsystemen zeilenweise vergleichen, und Suchen sowie Massenersetzungen sind einfach.
Es trägt Struktur. Überschriftenebenen, Listen, fette und kursive Hervorhebungen, Links, Codeblöcke und Tabellen – alles wird mit einfachen Zeichen ausgedrückt.
Es lässt sich leicht umwandeln. Für die Umwandlung von Markdown nach HTML, Word, PDF, Präsentationen und mehr gibt es ausgereifte Werkzeuge.
Es passt zu Generatoren statischer Websites. Die meisten Blog- und Dokumentationssysteme lesen Markdown unmittelbar.
Schritt 1: Prüfen Sie, ob Ihr PDF für die Umwandlung geeignet ist
Nicht jedes PDF lässt sich gleich gut umwandeln. Prüfen Sie zwei Dinge.
Gibt es eine Textebene?
Öffnen Sie das PDF und versuchen Sie, einen Absatz mit der Maus zu markieren. Lässt sich der Text markieren, gibt es eine Textebene; lässt er sich nicht markieren, besteht die Seite nur aus einem Bild.
Gescannte Dokumente haben keine Textebene, und es gibt nichts, was der Konverter extrahieren könnte. Sie müssen zuvor eine OCR anwenden.
Nach der OCR funktioniert die Umwandlung, doch halten Sie Ihre Erwartungen niedrig: In der per OCR ergänzten Textebene sind Schrift- und Größenangaben künstlich, weshalb strukturelle Ableitungen wie die Erkennung von Überschriften schwach ausfallen.
Wie komplex ist das Layout?
| Layout | Umwandlungsqualität | |---|---| | Einspaltig, einfacher Text | Sehr gut | | Bericht mit Überschriften | Gut | | Einfache Tabellen | Gut | | Zweispaltiges Layout | Schwach, die Reihenfolge kann durcheinandergeraten | | Randnotizen, Kästen | Schwach | | Komplexe Tabellen | Schwach | | Zeitschriften-/Broschürengestaltung | Schlecht |
Mehrspaltige Layouts sind das größte Problem: Der Konverter muss die Lesereihenfolge des Textes aus der Position schätzen, und auf einer zweispaltigen Seite kann er die Zeilen horizontal von links nach rechts lesen und den Text beider Spalten miteinander verschränken.
Schritt 2: Wandeln Sie um
Öffnen Sie das Werkzeug zur Umwandlung von PDF nach Markdown und laden Sie Ihre Datei hoch. Die Verarbeitung läuft in Ihrem Browser; Ihr Dokument wird nicht an einen Server gesendet.
Die Aufgabe des Konverters besteht darin, aus den Zeichenbefehlen des PDFs eine semantische Struktur abzuleiten:
- Er gruppiert Textbruchstücke zu Zeilen und Absätzen.
- Er schätzt anhand von Schriftgröße und Strichstärke die Überschriftenebenen.
- Er erkennt Aufzählungszeichen und Nummerierungen und bildet daraus Listen.
- Er wandelt Link-Anmerkungen in Markdown-Links um.
- Er versucht, Tabellenstrukturen zu erkennen.
Die meisten dieser Schritte sind Ableitungen, weshalb das Ergebnis kein fertiges Produkt, sondern ein "guter Ausgangspunkt" sein wird.
Schritt 3: Sehen Sie die Ausgabe durch
Öffnen Sie das erzeugte Markdown in einem Editor und prüfen Sie in dieser Reihenfolge.
Überschriftenhierarchie
Hier ist am häufigsten eine Korrektur nötig. Prüfen Sie:
- Stehen die Überschriften auf der richtigen Ebene? (
#für H1,##für H2,###für H3) - Wurden Ebenen übersprungen? (ein Sprung von H1 direkt zu H3)
- Wurden fett gesetzte Betonungssätze versehentlich zu Überschriften?
- Wurden echte Überschriften übersehen?
Die Korrektur ist einfach – Sie ändern nur die Anzahl der # –, doch zuvor ist ein vollständiges Durchlesen nötig.
Unversehrtheit der Absätze
In einem PDF ist ein Absatz auf mehrere Zeilen aufgeteilt, und der Konverter muss sie zusammenführen. Mögliche Probleme:
Trennstriche am Zeilenende. Im Seitenlayout mit Bindestrich getrennte Wörter ("Qua-lität") bleiben in Markdown womöglich getrennt. Suchen Sie im Text danach und korrigieren Sie es.
Vorzeitige Absatztrennung. Ein Absatz kann in der Mitte in zwei Teile zerfallen sein.
Seitenübergänge. Erstreckt sich ein Absatz über zwei Seiten, können dazwischen eine Seitenzahl oder ein Fußzeilentext eingeklemmt sein.
Kopf- und Fußzeilen sowie Seitenzahlen
In PDFs finden sich am oberen und unteren Rand jeder Seite wiederkehrende Elemente: Dokumenttitel, Kapitelname, Seitenzahl, Urheberrechtshinweis.
Der Konverter kann sie für Inhalt halten und in das Markdown übernehmen. Das Ergebnis sind alle paar Absätze wiederkehrende Zeilen wie "Jahresbericht 2025 | 47".
Aufräumen: Weil diese Zeilen regelmäßig wiederkehren, lassen sie sich in einem Texteditor per "Alle ersetzen" oder mit einem regulären Ausdruck im Stapel entfernen.
Listen
Aufzählungs- und nummerierte Listen werden meist gut übertragen. Zu prüfen:
- Stimmen die Einzugsebenen verschachtelter Listen?
- Beginnen nummerierte Listen mit den richtigen Nummern?
- Sind einzelne Punkte als Absatz herausgekommen?
Tabellen
Die Tabellensyntax von Markdown ist einfach und hat ihre Grenzen:
| Überschrift 1 | Überschrift 2 |
|---|---|
| Zelle | Zelle |
Diese Struktur setzt ein flaches Raster voraus. Sie kann Folgendes nicht ausdrücken:
- Verbundene Zellen (colspan/rowspan)
- Verschachtelte Tabellen
- Mehrzeilige Formatierung innerhalb einer Zelle
- Stile jenseits der Zellenausrichtung
Einfache Tabellen werden meist gut übertragen. Bei komplexen haben Sie zwei Möglichkeiten: sie von Hand vereinfachen oder diese Tabelle als HTML schreiben (die meisten Markdown-Prozessoren lassen HTML durch).
Links
Hyperlinks auf Webadressen bleiben meist erhalten:
[Linktext](https://beispiel.de)
Dokumentinterne Verweise verlieren dagegen ihre Bedeutung – in Markdown gibt es kein Seitenkonzept. Sie müssen in Überschriftenverweise (#zur-ueberschrift) umgewandelt werden.
Bilder
Das Verhalten bei Bildern hängt vom Werkzeug ab:
- Manche Werkzeuge extrahieren Bilder als eigene Dateien und referenzieren sie im Markdown.
- Manche überspringen Bilder und lassen nur einen Platzhalter zurück.
- Manche betten sie als base64 ein (was die Datei stark vergrößert).
Sind Bilder wichtig, müssen Sie sie womöglich in einem eigenen Extraktionsschritt gewinnen und von Hand platzieren.
Schritt 4: Aufräumen und bearbeiten
Die typische Aufräumliste nach der Umwandlung:
- Wiederholte Kopf- und Fußzeilen löschen. Geht per Massenersetzung schnell.
- Überschriftenebenen korrigieren. Bringen Sie die Hierarchie in eine sinnvolle Form.
- Getrennte Wörter zusammenfügen. "Qua-\nlität" → "Qualität".
- Überflüssige Zeilenumbrüche bereinigen. Trennungen innerhalb von Absätzen.
- Tabellen durchsehen.
- Links testen.
- Bildverweise korrigieren.
Es erleichtert die Arbeit, in einem Editor mit Vorschau zu arbeiten – die meisten Markdown-Editoren zeigen Quelltext und Vorschau nebeneinander.
Wann Markdown nicht das richtige Ziel ist
Wenn die grafische Gestaltung wichtig ist. Markdown trägt kein Layout und keine Gestaltung. Die visuelle Identität einer Broschüre oder Zeitschriftenseite geht vollständig verloren.
Wenn komplexe Tabellen im Mittelpunkt stehen. Die Tabellenunterstützung von Markdown ist begrenzt.
Wenn das Dokument nur gelesen werden soll. PDF ist bereits ein lesbares Format. Die Umwandlung ist sinnvoll, wenn Sie den Inhalt weiterverwenden wollen.
Wenn Formeln und Sondernotationen vorkommen. Mathematische Formeln liegen im PDF als Zeichnung vor; in Markdown kommen sie als reiner Text an und werden sinnlos. Nutzen Sie einen Markdown-Dialekt mit LaTeX-Unterstützung, müssen Sie die Formeln von Hand neu schreiben.
Verbreitete Einsatzszenarien
Dokumentation migrieren. Ein altes Benutzerhandbuch liegt als PDF vor und soll auf eine moderne Dokumentationsseite umziehen. Markdown ist das natürliche Format der Generatoren statischer Websites.
Inhalte neu veröffentlichen. Einen Bericht in einen Blogbeitrag verwandeln.
Unter Versionskontrolle stellen. Wollen Sie die Änderungen an einem Dokument verfolgen: PDF ist eine Binärdatei, bei der sich keine Unterschiede anzeigen lassen. Markdown ist reiner Text, und jede Änderung wird zeilenweise sichtbar.
Mehrere Formate erzeugen. Aus einer einzigen Markdown-Quelle können Sie HTML, PDF, Word und EPUB erzeugen.
Eingabe für KI-Werkzeuge. Weil Markdown reiner Text mit erhaltener Struktur ist, eignet es sich für die Arbeit mit Sprachmodellen besser als ein rohes PDF.
Zusammengefasst
Die Umwandlung von PDF nach Markdown besteht darin, aus Zeichenbefehlen eine semantische Struktur abzuleiten, und diese Ableitung beruht auf Schätzungen. Bei einspaltigen, gleichmäßigen Dokumenten ist das Ergebnis gut; bei mehrspaltigen Layouts, komplexen Tabellen und gestaltungslastigen Seiten wird es schwach. Bei gescannten PDFs ist zuvor eine OCR nötig. Betrachten Sie die Umwandlung nicht als Ende, sondern als Ausgangspunkt: Überschriftenebenen korrigieren, wiederkehrende Kopf- und Fußzeilen entfernen, getrennte Wörter zusammenfügen und Tabellen durchsehen sind die üblichen Aufräumschritte. Am Ende haben Sie eine flexible Quelle in der Hand, die sich unter Versionskontrolle stellen, leicht bearbeiten und in viele Formate umwandeln lässt.
Häufig gestellte Fragen
Kann ich ein gescanntes PDF nach Markdown umwandeln?
Nicht unmittelbar. In gescannten PDFs besteht die Seite nur aus einem Bild und enthält keine Textebene; es gibt also keinen Text, den der Konverter extrahieren könnte. Sie müssen zuvor eine OCR anwenden und eine Textebene hinzufügen. Nach der OCR funktioniert die Umwandlung, doch strukturelle Ableitungen wie die Erkennung von Überschriften fallen schwächer aus als bei PDFs mit natürlicher Textebene.
Warum landen Überschriften manchmal auf der falschen Ebene?
Weil in einem PDF meist nicht festgehalten ist, dass etwas 'eine Überschrift' ist. Der Konverter schätzt anhand von Schriftgröße, Strichstärke und Position. Gibt es im Dokument fünf verschiedene Schriftgrade, versucht er, diese auf H1 bis H5 abzubilden. Ein fett gesetzter Betonungssatz kann für eine Überschrift gehalten und eine kleiner gesetzte Zwischenüberschrift übersehen werden. In getaggten PDFs entfällt diese Schätzung, und das Ergebnis wird weit genauer.
Werden Tabellen sauber nach Markdown übertragen?
Einfache, gleichmäßige Tabellen meist ja. Verbundene Zellen, verschachtelte Tabellen und mehrzeilige Zellen finden in der Tabellensyntax von Markdown jedoch keine Entsprechung – Markdown-Tabellen setzen ein flaches Raster voraus. Bei komplexen Tabellen müssen Sie die Ausgabe von Hand korrigieren oder diese Tabelle als HTML schreiben.
Was bringt die Umwandlung nach Markdown?
Markdown ist reiner Text: In Versionskontrollsystemen lassen sich Unterschiede anzeigen, es lässt sich in jedem Texteditor bearbeiten, unmittelbar an Generatoren für statische Websites übergeben und leicht in zahlreiche Formate wie HTML, Word und PDF umwandeln. Wenn Sie den Inhalt eines PDFs weiterverwenden, aktualisieren oder auf eine Website übertragen wollen, bietet Markdown ein flexibles Zwischenformat.
Probieren Sie es gleich mit PDF → Markdown aus.
PDF → Markdown ausprobieren