Comment convertir un PDF en Markdown ? Préserver les titres et la structure
9 min de lecture
Vous avez un PDF et vous devez en réutiliser le contenu : le transférer vers un site web, le suivre en gestion de versions, le mettre à jour pour le republier ou le convertir vers d'autres formats. Le Markdown est un bon format intermédiaire pour cela — souple parce qu'il s'agit de texte brut, tout en préservant la structure comme les titres et les liens.
Pourquoi le Markdown est une bonne cible
C'est du texte brut. Il s'ouvre dans n'importe quel éditeur, se compare ligne à ligne dans un système de gestion de versions, et les recherches comme les remplacements en masse y sont faciles.
Il porte de la structure. Niveaux de titres, listes, gras et italique, liens, blocs de code et tableaux — tout s'exprime par des marques simples.
Il se convertit facilement. Des outils matures permettent de passer du Markdown au HTML, à Word, au PDF, à des présentations et bien plus encore.
Il est compatible avec les générateurs de sites statiques. La plupart des systèmes de blog et de documentation lisent directement le Markdown.
Étape 1 : vérifiez que votre PDF se prête à la conversion
Tous les PDF ne se convertissent pas aussi bien. Contrôlez deux choses.
Y a-t-il une couche de texte ?
Ouvrez le PDF et essayez de sélectionner un paragraphe à la souris. Si le texte est sélectionnable, il y a une couche de texte ; sinon, la page n'est qu'une image.
Les documents scannés n'ont pas de couche de texte et le convertisseur n'a rien à extraire. Vous devez d'abord appliquer une OCR.
Après l'OCR, la conversion fonctionne, mais gardez des attentes modestes : dans la couche de texte ajoutée par l'OCR, les informations de police et de taille sont artificielles, les déductions structurelles comme la détection de titres s'en trouvent donc affaiblies.
Quelle est la complexité de la mise en page ?
| Mise en page | Qualité de conversion | |---|---| | Une colonne, texte simple | Très bonne | | Rapport avec titres | Bonne | | Tableaux simples | Bonne | | Mise en page à deux colonnes | Faible, l'ordre peut s'embrouiller | | Notes en marge, encadrés | Faible | | Tableaux complexes | Faible | | Maquette de magazine/brochure | Mauvaise |
Les mises en page multicolonnes constituent le plus gros problème : le convertisseur doit deviner l'ordre de lecture à partir des positions, et sur une page à deux colonnes il peut lire les lignes horizontalement de gauche à droite et entremêler le texte des deux colonnes.
Étape 2 : lancez la conversion
Ouvrez l'outil de conversion de PDF en Markdown et téléversez votre fichier. Le traitement s'exécute dans votre navigateur ; votre document ne part pas vers un serveur.
Le travail du convertisseur consiste à extraire une structure sémantique des instructions de dessin du PDF :
- Il regroupe les fragments de texte en lignes et en paragraphes.
- Il devine les niveaux de titres en observant la taille et la graisse des polices.
- Il détecte les puces et les numéros pour en faire des listes.
- Il transforme les annotations de lien en liens Markdown.
- Il tente de détecter les structures de tableau.
La plupart de ces étapes sont des déductions : le résultat ne sera donc pas parfait mais constituera « un bon point de départ ».
Étape 3 : relisez le résultat
Ouvrez le Markdown converti dans un éditeur et contrôlez-le dans cet ordre.
La hiérarchie des titres
C'est ce qui demande le plus souvent des corrections. Vérifiez :
- Les titres sont-ils au bon niveau ? (
#pour H1,##pour H2,###pour H3) - Des niveaux ont-ils été sautés ? (passage direct de H1 à H3)
- Des phrases mises en gras sont-elles devenues des titres par erreur ?
- De vrais titres ont-ils été oubliés ?
La correction est facile — il suffit de changer le nombre de # — mais elle suppose d'abord une lecture de bout en bout.
L'intégrité des paragraphes
Dans un PDF, un paragraphe est réparti sur plusieurs lignes et le convertisseur doit les réunir. Les problèmes :
La césure en fin de ligne. Les mots coupés par un tiret dans la mise en page (« qua-lité ») peuvent rester disjoints en Markdown. Cherchez-les dans le texte et corrigez.
Des paragraphes coupés prématurément. Un paragraphe peut se retrouver scindé en deux.
Les changements de page. Si un paragraphe s'étend sur deux pages, un numéro de page ou un texte de pied de page peut s'être glissé au milieu.
En-têtes, pieds de page et numéros de page
Dans les PDF, des éléments se répètent en haut et en bas de chaque page : titre du document, nom de la section, numéro de page, mention de copyright.
Le convertisseur peut les prendre pour du contenu et les inclure dans le Markdown. Le résultat est une ligne du type « Rapport annuel 2025 | 47 » revenant tous les quelques paragraphes.
Nettoyage : comme ces lignes se répètent régulièrement, elles peuvent être supprimées en masse avec un « remplacer tout » ou une expression régulière dans un éditeur de texte.
Les listes
Les listes à puces et numérotées sont généralement bien transférées. À vérifier :
- Les niveaux d'indentation des listes imbriquées sont-ils corrects ?
- Les listes numérotées commencent-elles aux bons numéros ?
- Certains éléments sont-ils sortis sous forme de paragraphes ?
Les tableaux
La syntaxe de tableau de Markdown est simple et a ses limites :
| Titre 1 | Titre 2 |
|---|---|
| Cellule | Cellule |
Cette structure suppose une grille plate. Elle ne peut pas exprimer :
- Les cellules fusionnées (colspan/rowspan)
- Les tableaux imbriqués
- Une mise en forme multiligne à l'intérieur d'une cellule
- Un style autre que l'alignement des cellules
Les tableaux simples passent généralement bien. Pour les tableaux complexes, vous avez deux options : les simplifier à la main, ou écrire ce tableau en HTML (la plupart des moteurs Markdown laissent passer le HTML).
Les liens
Les hyperliens vers des adresses web sont généralement préservés :
[texte du lien](https://exemple.com)
Les liens internes au document perdent en revanche leur sens — la notion de page n'existe pas en Markdown. Il faut les convertir en liens vers des titres (#aller-au-titre).
Les images
Le comportement vis-à-vis des images varie selon l'outil :
- Certains outils extraient les images dans des fichiers séparés et y font référence dans le Markdown.
- Certains les ignorent et ne laissent qu'un espace réservé.
- Certains les intègrent en base64 (ce qui alourdit énormément le fichier).
Si les images comptent, il vous faudra peut-être effectuer une extraction d'images séparée et les placer à la main.
Étape 4 : nettoyage et mise en forme
Liste de nettoyage typique après conversion :
- Supprimez les répétitions d'en-têtes et de pieds de page. Un remplacement en masse le fait rapidement.
- Corrigez les niveaux de titres. Rendez la hiérarchie logique.
- Réunissez les mots coupés. « qua-\nlité » → « qualité ».
- Nettoyez les retours à la ligne superflus. Les coupures à l'intérieur des paragraphes.
- Relisez les tableaux.
- Testez les liens.
- Corrigez les références d'images.
Travailler avec un aperçu dans un éditeur facilite la tâche — la plupart des éditeurs Markdown affichent la source et l'aperçu côte à côte.
Quand le Markdown n'est pas la bonne cible
Si le design visuel compte. Le Markdown ne transporte ni mise en page ni design. L'identité visuelle d'une brochure ou d'une page de magazine est entièrement perdue.
Si des tableaux complexes sont au cœur du document. La prise en charge des tableaux par Markdown est limitée.
Si le document doit seulement être lu. Le PDF est déjà un format lisible. La conversion n'a de sens que si vous voulez réutiliser le contenu.
S'il y a des formules et des notations particulières. Les formules mathématiques existent dans un PDF sous forme de dessins ; elles arrivent en Markdown comme du texte brut et perdent leur sens. Si vous utilisez un dialecte Markdown prenant en charge LaTeX, il faudra réécrire les formules à la main.
Cas d'usage fréquents
Migration de documentation. Un vieux manuel d'utilisation existe en PDF et doit être transféré vers un site de documentation moderne. Le Markdown est le format naturel des générateurs de sites statiques.
Republication de contenu. Transformer un rapport en article de blog.
Mise en gestion de versions. Si vous voulez suivre les modifications d'un document, le PDF est un fichier binaire dont on ne peut pas faire de diff. Le Markdown est du texte brut et chaque modification apparaît ligne à ligne.
Production multiformat. À partir d'une seule source Markdown, vous pouvez produire du HTML, du PDF, du Word et de l'EPUB.
Alimentation d'outils d'intelligence artificielle. Le Markdown étant du texte brut à structure préservée, il constitue une meilleure entrée qu'un PDF brut lorsqu'on travaille avec des modèles de langage.
En résumé
La conversion d'un PDF en Markdown consiste à extraire une structure sémantique d'instructions de dessin, et cette extraction repose sur des déductions. Sur les documents réguliers à une colonne, le résultat est bon ; sur les mises en page multicolonnes, les tableaux complexes et les pages très graphiques, il s'affaiblit. Sur les PDF scannés, une OCR est nécessaire au préalable. Considérez la conversion non comme une fin mais comme un point de départ : corriger les niveaux de titres, nettoyer les lignes d'en-tête et de pied de page répétées, réunir les mots coupés et relire les tableaux sont les étapes de nettoyage standard. Vous obtenez au bout du compte une source souple, versionnable, facile à modifier et convertible vers de nombreux formats.
Questions fréquentes
Puis-je convertir un PDF scanné en Markdown ?
Pas directement. Dans un PDF scanné, la page n'est qu'une image et il n'existe pas de couche de texte ; le convertisseur n'a rien à extraire. Vous devez d'abord appliquer une OCR pour ajouter une couche de texte. Après l'OCR, la conversion fonctionne, mais les déductions structurelles comme la détection des titres sont plus faibles que sur un PDF disposant d'une couche de texte native.
Pourquoi les titres ressortent-ils parfois au mauvais niveau ?
Parce que l'information « ceci est un titre » n'est le plus souvent pas écrite dans le PDF. Le convertisseur devine en se fondant sur la taille de police, la graisse et la position. Si le document comporte cinq tailles de caractères différentes, il tente de les faire correspondre à H1 jusqu'à H5. Une phrase mise en gras pour l'accentuer peut être prise pour un titre, ou un sous-titre en petits caractères être ignoré. Dans les PDF balisés (tagged), cette nécessité de deviner disparaît et le résultat est bien plus juste.
Les tableaux sont-ils correctement transférés en Markdown ?
Les tableaux simples et réguliers le sont généralement. Mais les cellules fusionnées, les tableaux imbriqués et les cellules multilignes n'ont pas d'équivalent dans la syntaxe de tableau de Markdown — celle-ci suppose une grille plate. Sur les tableaux complexes, vous devrez corriger la sortie à la main ou écrire ce tableau en HTML.
Quel est l'intérêt de convertir en Markdown ?
Le Markdown est du texte brut : on peut en faire des diffs dans un système de gestion de versions, l'éditer dans n'importe quel éditeur de texte, l'alimenter directement dans un générateur de site statique et le convertir facilement vers de nombreux formats comme HTML, Word ou PDF. Quand vous voulez réutiliser, mettre à jour ou transférer vers un site web le contenu d'un PDF, le Markdown offre un format intermédiaire souple.
Essayez dès maintenant avec PDF → Markdown.
Essayer PDF → Markdown